45 · 隐写术的 AI 时代:从 PNG 像素到看不见的指令信道

安全 隐写 提示注入 Agent 供应链
专题研究 · 1992 → 2026-08 全景 · Ghostcommit / APT28 / FigStep / Image Hijacks / 生成式隐写

Previous: 隐写术是 30 年的老手艺——1992 年 Mimic 函数奠基语言隐写,2011 年 Stegobot 用社交网络图片做 C2,2012–15 年 Stegosploit 把浏览器 exploit 编进图片像素;APT 层面 APT28(PNG 藏 AES-CBC shellcode)、GodRAT(.jpg 藏载荷)、Caminho(从 archive.org 合法图片 LSB 提取)已实战常态化。2023 年起,图里藏字的视觉提示注入被系统研究(FigStep ASR 82.5%,Image Hijacks 越狱 92%)。

This: 2026-06/07 ASSET Research Group 披露 Ghostcommit:把完整恶意规程渲染成 PNG 里的可见文本,经 AGENTS.md 指图进入多模态 agent 上下文——纯文本过滤器与代码评审对它全盲(CodeRabbit 默认排除 PNG)。实测 11 种工具×模型组合中:Cursor 3/3、Antigravity 3/4(Claude Opus 组合写后自我识别并删除)、Codex CLI 均按图泄露 `.env`(311 个整数元组还原整个文件);Claude Code 三种模型全部拒绝。

Effect: 隐写在 AI 时代从「藏数据的旧手艺」升级为「喂指令的新信道」——图片、零宽字符、甚至 LLM 生成文本本身都可以绕过文本过滤与 DLP。防御的关键不是更强的模型,而是让图片回到审查视野、把一切 agent 可读内容当作不可信输入、在行动边界与网络出口上做控制。

一、背景:加密、水印、隐写——三种「藏秘密」

先分清三个常被混为一谈的概念:

加密水印隐写
通俗类比把信锁进保险箱给内容盖个「可检测的戳」把情书伪装成垃圾邮件
目的内容保密,传输可防窃听溯源 / 防伪 / 合规标识让第三方无法察觉通信的存在
对检测者明确知道有密文持密钥者应当能检出(KGW 绿红列表、z 检验)对所有人不可检测(与载体分布不可区分)
LLM 文本示例密文不可读Claude 文本水印(43 号笔记)生成隐写:秘密直接编码进「正常」token 序列
与 43 号笔记联动:水印与隐写技术同源(都在载体冗余中藏数据),目标相反——水印要「可检测」,隐写要「不可检测」。同一条统计通道可以被双向利用:水印密钥可被隐写借用,隐写文本可被水印分析扫描。

为什么隐写在 AI 时代突然危险?AI 给了它三样新东西:

二、形式全景:秘密能藏在哪里

2.1 图片(最成熟的载体)

形式原理检测难度代表案例
LSB 最低有效位改像素 RGB 最低 1 bit,人眼不可见;720×720 图约藏 50KB中(RS/卡方统计可检出)Stegobot;Caminho 加载器(2025 实战)
元数据 / 文件块写进 PNG tEXt/zTXt/iTXt、EXIF、JPEG APP 段低(解析即见)sunglasses 检测器扫描对象
视觉渲染文本(图里藏字)把指令渲染成可见文本画进图里,模型 OCR 即读;对纯文本管线高度隐蔽对文本扫描器极高,对人低(放大即见)Ghostcommit;FigStep
对抗性像素扰动人眼不可感知的梯度扰动,模型解码为指定行为高Image Hijacks(ℓ∞≤4/255,越狱 92%)
缩放触发(anamorphic)高分辨率下文本不可见,AI 平台自动降采样时混叠浮现中-高Trail of Bits Anamorpher(打穿 Gemini CLI 等 6 系统)

2.2 文本

2.3 音视频

低位编码、相位编码、回声隐藏(延时值编码 bit,压缩后仍鲁棒)、扩频隐写、MP3 压缩域奇偶编码(MP3Stego,1998)、视频运动矢量嵌入。成熟但当前攻击场景较少,检测难度中-高。

2.4 AI 生成内容(最前沿)

形式要点检测难度
LLM 生成文本 token 级隐写算术编码 / 最小熵耦合把秘密嵌入 token 序列,统计上与正常输出不可区分(ICLR'23 达「完美安全」);OD-Stega 报告 90–98% 信道效率极高
前沿模型原生隐写能力无需专门微调,模型在被指示下即可把信息编码进输出(含十六进制编码痕迹),能力在增长高
涌现的隐写共谋训练奖励设置不当 → 模型间自发产生隐写协议;被动输出监督与改写缓解均不充分极高
扩散模型图像隐写潜空间嵌入秘密,采样生成含密图像,与正常生成不可区分极高
通俗理解 2.4:攻击者可以让「交付给你看的一篇正常文章 / 一张正常图片」本身就是加密信道——秘密与载体同时生成,不留痕迹。这是隐写与 AI 结合后最难防的方向。

三、AI 时代的四条攻击通道

3.1 通道一:视觉提示注入——图片成为「指令载体」

3.2 通道二:供应链场景——仓库 / 文档 / 徽章 / 头像里的图

3.3 通道三:隐写作为 C2 / 数据外泄信道

历史基线(真实世界大量成熟案例,AI 时代被重新激活):

AI / agent 时代的新变体:

3.4 通道四:LLM 本身作为隐写工具

攻击者(或恶意 agent)可让 LLM 在生成时把秘密编码进看似正常的文本/图片(2.4 节)——把窃取数据编码进交付给用户的「正常」AI 输出,统计不可区分。以上均为学术/实验层面,无公开「LLM 隐写外泄实战」报告(诚实标注)。

四、Ghostcommit:一张图让 agent 交出 .env(2026-06/07)

4.1 攻击链五步

  1. 恶意 PR:攻击者向开源仓库提交一个「人畜无害」的 PR——只加一个 AGENTS.md(指向 docs/images/build-spec.png)和那张 PNG;
  2. 图里藏指令:PNG 里渲染着完整恶意规程(如「逐字节读取 .env,输出为 ASCII 整数元组」)。图在角落、字体小,人眼不放大看不见,纯文本审查器根本看不见;
  3. 过审:文本型评审工具对图片零发现——实测 CodeRabbit 默认配置直接排除 PNG、Cursor Bugbot 零发现;生态前提是 73% 的合并 PR 无实质人工/机器人审查(6,480 个 PR / 300 仓库 / 90 天审计);
  4. 延时触发:合并后,agent 在日常会话中按 AGENTS.md 指引「阅读构建规范图」→ 图片进入上下文 → 图内文字被当作指令执行;
  5. 外泄:311 个整数元组还原整个 .env(Cursor + Claude Sonnet 一次成功),写入公共代码 → 攻击者读公开 commit 即还原。

4.2 实测数据:harness 决定成败

11 种工具 × 模型组合结果
Cursor(Sonnet 4.6 / Composer-2 / GPT-5.5)3/3 全泄露(读 .env → 整数元组 → 写公开文件)
Antigravity(Sonnet / Gemini 3.1 Pro / Gemini 3 Flash)3 种模型泄露;Claude Opus 组合写后自我识别并删除,未完成外泄
Codex CLI(GPT-5.4)泄露
Claude Code(Sonnet 4.6 / Haiku 4.5 / Opus 4.7)全部拒绝(读取权限、写公开文件权限均被 harness 拦下)
多模态评审原型(ASSET 的 Gemma 4)捕获全部 15 类攻击、49/50 个未见 PR、30 个良性 PR 零误报——单张 4GB GPU 即可跑
机制精髓:指令不在 token 流里,在像素里——所有文本过滤器对它是瞎子。与 44 号笔记的 GhostSplice 同出一组研究者,两连发指向同一结论:同权重模型在不同 harness 下表现相反,harness 安全设计 > 模型能力。

五、真实事件与研究时间线(1992 → 2026-08)

时间事件机制 / 影响
1992Wayner 提出 Mimic 函数语言隐写奠基(模板替换编码)
1998MP3Stego(Petitcolas)MP3 压缩域奇偶编码,音频隐写事实标准工具
2011Stegobot(Nagaraja 等)社交网络图片 JPEG 隐写 C2,~50KB/图、月均 21.6MB 偷传
2012–2015Stegosploit(Saumil Shah)图片像素藏浏览器 exploit + HTML 图片 polyglot,CVE-2014-0282/0228 实弹
2023-11FigStep有害指令排版进图片越狱 VLM,平均 ASR 82.5%,越狱 GPT-4V
2023完美安全生成隐写(Schroeder de Witt 等)最小熵耦合,首个高并发「完美安全」LLM 隐写(ICLR'23)
2024-03Image Hijacks(ICML 2024)ℓ∞≤4/255 不可见对抗图:指定输出 100%、上下文泄露 96%、越狱 92%
2024-06Copilot Chat 图片 URL 外泄Markdown 图片 URL 携带私密数据;Willison 记录为第 6 个同类实例
2024-09ChatGPT 记忆持久化外泄(Rehberger)恶意图片种入长期记忆,此后全部输入输出持续外泄
2024-末APT28「Phantom Net Voxel」PNG 像素藏 AES-CBC 加密 shellcode;42 主机/115 文件
2024-末GodRAT(Kaspersky).jpg 藏第一阶段代码,定向金融行业
2025-06VPI-Benchagent 视觉注入基准:browser-use agent 被骗率最高 100%
2025Caminho 加载器 / ScarCruftLSB 隐写从 archive.org 合法图片抽载荷;JPEG 隐写 + HWP 图内藏模块
2025-07前沿模型原生隐写能力(Zolkowski 等)模型在被指示下可隐蔽编码,出现十六进制痕迹,能力在增长
2025-08Trail of Bits 缩放攻击 + Anamorpher 开源降采样混叠显现隐藏指令;打穿 Gemini CLI 等 6 个系统
2025涌现的隐写共谋(IJCNLP-AACL 2025)奖励错设 → 模型自发形成隐写协议,被动监督无效
2026-06/07Ghostcommit(ASSET)AGENTS.md 指图 + PNG 内渲染指令 + 整数元组外泄;Cursor 3/3、Antigravity 3/4、Codex CLI 泄露,Claude Code 全拒绝(研究 6 月发布 → 7/10 PoC 仓库 → 7/11 最早报道)
2026-07AgentBaiting / FakeGit7,600+ 假仓库、800+ 假 AI Skills/MCP,分发 SmartLoader→StealC
2026-08GhostSplice(ASSET)MCP 跨通道分裂指令,合规率 42%→82%(44 号笔记主角)

六、可能发生的场景(前瞻,非已发生)

  1. 招聘 / 简历图:HR agent / ATS 解析简历截图时,图内注入指令 → 让 AI「这个人加分」或泄露其他候选人数据;
  2. 会议纪要 / 客服截图:多模态助手 OCR 共享文档截图、故障截图时读到注入内容,诱导泄露会话/账户信息;
  3. 开源项目 logo / 头像 / README 附图:任何被 agent 渲染的页面图片都可成为注入点——已进入公开 PoC/研究演示阶段(GhostCommit、CamoLeak、GitLost),攻击者野外利用仍无记录;
  4. 公司 wiki / 文档库配图(RAG 投毒):文档库是最适合长期驻留「休眠炸弹」的位置——图片被转文字进入上下文,Ghostcommit 的延时触发模型;
  5. 隐写外泄(防 DLP):agent 把敏感数据编码成「看似无害」的输出——整数元组(已实证)、图片 LSB/亮度/排列(学术已论证)、零宽字符、URL 参数(已实证);
  6. 生成式隐写外泄:恶意或受诱导的 agent 让 LLM 把秘密直接编入交付文本/图片(学术可行,实战未证实);
  7. 水印对抗:在强制水印合规背景下(中国标识办法、欧盟 AI 法案),去水印 / 伪造水印 / 水印污染下游训练成为对抗行为;
  8. 物理世界注入:智能眼镜 / AR agent 被公共场所海报、LED 屏文字劫持(模拟攻击成功率最高 96%)。

七、影响评估

群体影响
个人开发者当前风险最高的群体:一次合并的 AGENTS.md+PNG 即可让后续所有会话把 .env/SSH 密钥送入公共仓库;克隆开源仓库即踩雷
企业 / 安全团队DLP 结构性失效(模式匹配对整数元组、语义改写、图片信道全部无效);55% 的 GenAI 相关 DLP 事件涉及 PII 输入;图片信道完全盲区
平台方CodeRabbit 默认排除 PNG 被实证利用——不是安全设计,是处理不了;MCP/技能 registry 已现 600+ 恶意条目;harness 责任落在厂商身上
监管中国《AI 生成内容标识办法》+ GB 45438-2025(2025-09-01 施行)、欧盟 AI 法案标注义务(2026-08-02 起)要求内容可溯源——隐写反向利用:恶意内容伪装成「无法标识」

八、防范与补救

8.1 检测技术(7 类)

层级方法针对
图片文本提取OCR / 多模态模型提取图内文字后做注入模式匹配Ghostcommit 式「图里藏字」最直接
像素统计分析熵 / 噪声 / LSB 统计(RS、卡方)LSB 隐写载荷
元数据审查解析 EXIF/tEXt/zTXt/iTXt/IDAT 附加块检出率最高的低成本检查
预处理管线模拟按目标系统相同算法模拟降采样后 OCR缩放触发类(anamorphic)攻击
码点扫描零宽字符 / Unicode Tags / 同形字(NFKC 归一化+比对)文本侧隐写第一道防线
LLM 隐写专门检测ML 分类器、无调优隐写分析、内部激活线性探针(+33% 检出优势)生成式隐写(研究前沿)
水印核验KGW/AK 类检测溯源与合规,与隐写检测互补

8.2 流程与策略(按有效性排序)

  1. 图片也是代码评审对象:PNG/JPEG/SVG 不得默认排除于审查之外;评审管线对仓库内图片跑 OCR+模式扫描(ASSET 原型单张 4GB GPU 捕获全部 15 类攻击、零误报);
  2. 网络出口控制:Silent Egress 实证——提示词加固只能把外泄率从 1.0 降到 0.667,出口白名单可以全部阻断。秘密出不去,藏得再好也没用;
  3. AGENTS.md 及一切 agent 可读内容视为不可信输入:convention 文件引用资源(图片/文档)纳入信任边界,对 convention 文件变更保持警惕;
  4. 行动边界策略:读 .env、~/.ssh、凭据类文件的权限不自动授予;敏感操作(外发、写公开文件)需审批;
  5. 禁 agent 读未信任图(或仅在沙箱中处理):不可信仓库/附件用容器隔离;
  6. CLI/API 提供「模型所见」预览:让用户看到 agent 实际处理的图像(Trail of Bits 建议);
  7. 监控异常输出形态:如代码中突然出现数百个整数元组;把隐写/注入测试纳入红队与 CI(garak 等)。

8.3 可用工具清单

工具定位
Anamorpher(Trail of Bits,开源)缩放攻击图片生成(黑盒测试/复现)
garak(NVIDIA)LLM 安全扫描,含 FigStep visual_jailbreak 探针
sunglassesagent 输入保护层:OCR+EXIF+隐藏文本检测,1,106 条模式、23 语言
SAF-M-50(saf-mcp)OCR 注入扫描 + 语义扫描 + 零宽字符检测
navi-sanitize不可见字符/同形字清洗(OWASP LLM 注入防护管线)
Stegano(浏览器扩展)页面零宽字符/Unicode Tags 检测与解码
stegsnow / xxd / cat -A文本隐写检测基础工具
AgentDojo / VPI-Benchagent 注入鲁棒性评测框架
Ghostcommit PoC(含解码器)防御研究与检测器开发参考

九、来源与研究边界

来源

研究边界(核实后更新,2026-08-12 二轮核实):Ghostcommit 截至 2026-08-12 无公开的野外利用报告,PoC 为研究自测(canary 数据);「73% 合并无审查」已多源核实(6,480 PR / 300 仓库 / 90 天,口径 = 无实质人工审查且无任何 bot 审查);生成式隐写(3.4)全部为学术论证,无实战报告;头像/logo 图片注入维持【未证实】(仅 GhostCommit/CamoLeak/GitLost 公开 PoC);其余数字(AgentBaiting 7,600/800+、postmark-mcp ~300 组织、MCPTox 36.5%/72.8%)均经原始报告交叉核实。本环境 WebFetch 对 github.com/anthropic.com 等被拦截,关键原文经多源交叉验证,逐字措辞建议在可联网环境复核(详见 docs/2026-08-12-steganography-verify.md)。