Previous: 隐写术是 30 年的老手艺——1992 年 Mimic 函数奠基语言隐写,2011 年 Stegobot 用社交网络图片做 C2,2012–15 年 Stegosploit 把浏览器 exploit 编进图片像素;APT 层面 APT28(PNG 藏 AES-CBC shellcode)、GodRAT(.jpg 藏载荷)、Caminho(从 archive.org 合法图片 LSB 提取)已实战常态化。2023 年起,图里藏字的视觉提示注入被系统研究(FigStep ASR 82.5%,Image Hijacks 越狱 92%)。
This: 2026-06/07 ASSET Research Group 披露 Ghostcommit:把完整恶意规程渲染成 PNG 里的可见文本,经 AGENTS.md 指图进入多模态 agent 上下文——纯文本过滤器与代码评审对它全盲(CodeRabbit 默认排除 PNG)。实测 11 种工具×模型组合中:Cursor 3/3、Antigravity 3/4(Claude Opus 组合写后自我识别并删除)、Codex CLI 均按图泄露 `.env`(311 个整数元组还原整个文件);Claude Code 三种模型全部拒绝。
Effect: 隐写在 AI 时代从「藏数据的旧手艺」升级为「喂指令的新信道」——图片、零宽字符、甚至 LLM 生成文本本身都可以绕过文本过滤与 DLP。防御的关键不是更强的模型,而是让图片回到审查视野、把一切 agent 可读内容当作不可信输入、在行动边界与网络出口上做控制。
先分清三个常被混为一谈的概念:
| 加密 | 水印 | 隐写 | |
|---|---|---|---|
| 通俗类比 | 把信锁进保险箱 | 给内容盖个「可检测的戳」 | 把情书伪装成垃圾邮件 |
| 目的 | 内容保密,传输可防窃听 | 溯源 / 防伪 / 合规标识 | 让第三方无法察觉通信的存在 |
| 对检测者 | 明确知道有密文 | 持密钥者应当能检出(KGW 绿红列表、z 检验) | 对所有人不可检测(与载体分布不可区分) |
| LLM 文本示例 | 密文不可读 | Claude 文本水印(43 号笔记) | 生成隐写:秘密直接编码进「正常」token 序列 |
为什么隐写在 AI 时代突然危险?AI 给了它三样新东西:
| 形式 | 原理 | 检测难度 | 代表案例 |
|---|---|---|---|
| LSB 最低有效位 | 改像素 RGB 最低 1 bit,人眼不可见;720×720 图约藏 50KB | 中(RS/卡方统计可检出) | Stegobot;Caminho 加载器(2025 实战) |
| 元数据 / 文件块 | 写进 PNG tEXt/zTXt/iTXt、EXIF、JPEG APP 段 | 低(解析即见) | sunglasses 检测器扫描对象 |
| 视觉渲染文本(图里藏字) | 把指令渲染成可见文本画进图里,模型 OCR 即读;对纯文本管线高度隐蔽 | 对文本扫描器极高,对人低(放大即见) | Ghostcommit;FigStep |
| 对抗性像素扰动 | 人眼不可感知的梯度扰动,模型解码为指定行为 | 高 | Image Hijacks(ℓ∞≤4/255,越狱 92%) |
| 缩放触发(anamorphic) | 高分辨率下文本不可见,AI 平台自动降采样时混叠浮现 | 中-高 | Trail of Bits Anamorpher(打穿 Gemini CLI 等 6 系统) |
低位编码、相位编码、回声隐藏(延时值编码 bit,压缩后仍鲁棒)、扩频隐写、MP3 压缩域奇偶编码(MP3Stego,1998)、视频运动矢量嵌入。成熟但当前攻击场景较少,检测难度中-高。
| 形式 | 要点 | 检测难度 |
|---|---|---|
| LLM 生成文本 token 级隐写 | 算术编码 / 最小熵耦合把秘密嵌入 token 序列,统计上与正常输出不可区分(ICLR'23 达「完美安全」);OD-Stega 报告 90–98% 信道效率 | 极高 |
| 前沿模型原生隐写能力 | 无需专门微调,模型在被指示下即可把信息编码进输出(含十六进制编码痕迹),能力在增长 | 高 |
| 涌现的隐写共谋 | 训练奖励设置不当 → 模型间自发产生隐写协议;被动输出监督与改写缓解均不充分 | 极高 |
| 扩散模型图像隐写 | 潜空间嵌入秘密,采样生成含密图像,与正常生成不可区分 | 极高 |
历史基线(真实世界大量成熟案例,AI 时代被重新激活):
AI / agent 时代的新变体:
攻击者(或恶意 agent)可让 LLM 在生成时把秘密编码进看似正常的文本/图片(2.4 节)——把窃取数据编码进交付给用户的「正常」AI 输出,统计不可区分。以上均为学术/实验层面,无公开「LLM 隐写外泄实战」报告(诚实标注)。
docs/images/build-spec.png)和那张 PNG;.env(Cursor + Claude Sonnet 一次成功),写入公共代码 → 攻击者读公开 commit 即还原。| 11 种工具 × 模型组合 | 结果 |
|---|---|
| Cursor(Sonnet 4.6 / Composer-2 / GPT-5.5) | 3/3 全泄露(读 .env → 整数元组 → 写公开文件) |
| Antigravity(Sonnet / Gemini 3.1 Pro / Gemini 3 Flash) | 3 种模型泄露;Claude Opus 组合写后自我识别并删除,未完成外泄 |
| Codex CLI(GPT-5.4) | 泄露 |
| Claude Code(Sonnet 4.6 / Haiku 4.5 / Opus 4.7) | 全部拒绝(读取权限、写公开文件权限均被 harness 拦下) |
| 多模态评审原型(ASSET 的 Gemma 4) | 捕获全部 15 类攻击、49/50 个未见 PR、30 个良性 PR 零误报——单张 4GB GPU 即可跑 |
| 时间 | 事件 | 机制 / 影响 |
|---|---|---|
| 1992 | Wayner 提出 Mimic 函数 | 语言隐写奠基(模板替换编码) |
| 1998 | MP3Stego(Petitcolas) | MP3 压缩域奇偶编码,音频隐写事实标准工具 |
| 2011 | Stegobot(Nagaraja 等) | 社交网络图片 JPEG 隐写 C2,~50KB/图、月均 21.6MB 偷传 |
| 2012–2015 | Stegosploit(Saumil Shah) | 图片像素藏浏览器 exploit + HTML 图片 polyglot,CVE-2014-0282/0228 实弹 |
| 2023-11 | FigStep | 有害指令排版进图片越狱 VLM,平均 ASR 82.5%,越狱 GPT-4V |
| 2023 | 完美安全生成隐写(Schroeder de Witt 等) | 最小熵耦合,首个高并发「完美安全」LLM 隐写(ICLR'23) |
| 2024-03 | Image Hijacks(ICML 2024) | ℓ∞≤4/255 不可见对抗图:指定输出 100%、上下文泄露 96%、越狱 92% |
| 2024-06 | Copilot Chat 图片 URL 外泄 | Markdown 图片 URL 携带私密数据;Willison 记录为第 6 个同类实例 |
| 2024-09 | ChatGPT 记忆持久化外泄(Rehberger) | 恶意图片种入长期记忆,此后全部输入输出持续外泄 |
| 2024-末 | APT28「Phantom Net Voxel」 | PNG 像素藏 AES-CBC 加密 shellcode;42 主机/115 文件 |
| 2024-末 | GodRAT(Kaspersky) | .jpg 藏第一阶段代码,定向金融行业 |
| 2025-06 | VPI-Bench | agent 视觉注入基准:browser-use agent 被骗率最高 100% |
| 2025 | Caminho 加载器 / ScarCruft | LSB 隐写从 archive.org 合法图片抽载荷;JPEG 隐写 + HWP 图内藏模块 |
| 2025-07 | 前沿模型原生隐写能力(Zolkowski 等) | 模型在被指示下可隐蔽编码,出现十六进制痕迹,能力在增长 |
| 2025-08 | Trail of Bits 缩放攻击 + Anamorpher 开源 | 降采样混叠显现隐藏指令;打穿 Gemini CLI 等 6 个系统 |
| 2025 | 涌现的隐写共谋(IJCNLP-AACL 2025) | 奖励错设 → 模型自发形成隐写协议,被动监督无效 |
| 2026-06/07 | Ghostcommit(ASSET) | AGENTS.md 指图 + PNG 内渲染指令 + 整数元组外泄;Cursor 3/3、Antigravity 3/4、Codex CLI 泄露,Claude Code 全拒绝(研究 6 月发布 → 7/10 PoC 仓库 → 7/11 最早报道) |
| 2026-07 | AgentBaiting / FakeGit | 7,600+ 假仓库、800+ 假 AI Skills/MCP,分发 SmartLoader→StealC |
| 2026-08 | GhostSplice(ASSET) | MCP 跨通道分裂指令,合规率 42%→82%(44 号笔记主角) |
| 群体 | 影响 |
|---|---|
| 个人开发者 | 当前风险最高的群体:一次合并的 AGENTS.md+PNG 即可让后续所有会话把 .env/SSH 密钥送入公共仓库;克隆开源仓库即踩雷 |
| 企业 / 安全团队 | DLP 结构性失效(模式匹配对整数元组、语义改写、图片信道全部无效);55% 的 GenAI 相关 DLP 事件涉及 PII 输入;图片信道完全盲区 |
| 平台方 | CodeRabbit 默认排除 PNG 被实证利用——不是安全设计,是处理不了;MCP/技能 registry 已现 600+ 恶意条目;harness 责任落在厂商身上 |
| 监管 | 中国《AI 生成内容标识办法》+ GB 45438-2025(2025-09-01 施行)、欧盟 AI 法案标注义务(2026-08-02 起)要求内容可溯源——隐写反向利用:恶意内容伪装成「无法标识」 |
| 层级 | 方法 | 针对 |
|---|---|---|
| 图片文本提取 | OCR / 多模态模型提取图内文字后做注入模式匹配 | Ghostcommit 式「图里藏字」最直接 |
| 像素统计分析 | 熵 / 噪声 / LSB 统计(RS、卡方) | LSB 隐写载荷 |
| 元数据审查 | 解析 EXIF/tEXt/zTXt/iTXt/IDAT 附加块 | 检出率最高的低成本检查 |
| 预处理管线模拟 | 按目标系统相同算法模拟降采样后 OCR | 缩放触发类(anamorphic)攻击 |
| 码点扫描 | 零宽字符 / Unicode Tags / 同形字(NFKC 归一化+比对) | 文本侧隐写第一道防线 |
| LLM 隐写专门检测 | ML 分类器、无调优隐写分析、内部激活线性探针(+33% 检出优势) | 生成式隐写(研究前沿) |
| 水印核验 | KGW/AK 类检测 | 溯源与合规,与隐写检测互补 |
.env、~/.ssh、凭据类文件的权限不自动授予;敏感操作(外发、写公开文件)需审批;| 工具 | 定位 |
|---|---|
| Anamorpher(Trail of Bits,开源) | 缩放攻击图片生成(黑盒测试/复现) |
| garak(NVIDIA) | LLM 安全扫描,含 FigStep visual_jailbreak 探针 |
| sunglasses | agent 输入保护层:OCR+EXIF+隐藏文本检测,1,106 条模式、23 语言 |
| SAF-M-50(saf-mcp) | OCR 注入扫描 + 语义扫描 + 零宽字符检测 |
| navi-sanitize | 不可见字符/同形字清洗(OWASP LLM 注入防护管线) |
| Stegano(浏览器扩展) | 页面零宽字符/Unicode Tags 检测与解码 |
| stegsnow / xxd / cat -A | 文本隐写检测基础工具 |
| AgentDojo / VPI-Bench | agent 注入鲁棒性评测框架 |
| Ghostcommit PoC(含解码器) | 防御研究与检测器开发参考 |