图像不只是输入 它也可能成为安全对齐的 “盲区”

八月 15, 2026 / 老胡 / 61阅读 / 0评论/ 分类: 老胡说

文章说明

字段

内容

论文

Jailbreaking Vision-Language Models Through the Visual Modality

作者

Aharon Azulay、Jan Dubiński、Zhuoyun Li、Atharv Mittal、Yossi Gandelsman

会议

ICML 2026

重点

四类视觉越狱、跨模态安全缺口、六模型实验、可解释性与缓解措施

先说结论:视觉理解能力越强,安全对齐未必跟得上

这篇论文真正值得关注的,不是又多了四种“把危险文字藏起来”的技巧,而是它把一个更根本的问题摆到了台面上:当危险意图通过图像中的符号、场景、版式或类比关系出现时,模型可能已经完成了语义恢复,却没有同步触发文本域里训练得更充分的拒绝机制。

本文主线  作者提出视觉密码、视觉物体替换、视觉文字替换和视觉类比谜题四类攻击,在 6 个前沿 VLM 上与文本基线及既有方法比较;结果显示“视觉一定更危险”并不成立,但安全性高度依赖模型、攻击机制和语义类别。最明确的信号,是跨模态安全泛化并不稳定。

一、作者为什么要做这项研究?

多模态模型的能力扩展,也同步扩大了攻击面

现代 VLM 不再只是“看图说话”。它们被用于文档理解、视觉搜索、多模态助手和复杂界面操作。视觉输入因此不只是一个被动的描述通道,而会主动改变模型对任务、对象和意图的理解。已有安全训练却主要围绕离散文本 token 展开,这留下了一个自然问题:文本中的危险意图被拦住后,等价语义如果从图像中被恢复,拒绝机制还能否可靠工作?

已有视觉越狱多依赖扰动或图中文字,作者想研究“语义可解释”的视觉攻击

此前方法包括通用对抗图像、CLIP 空间扰动、图像劫持和 FigStep 等排版型攻击。它们证明视觉输入可以突破安全边界,但不少方法依赖不可解释的像素扰动,或本质上仍把危险文字渲染进图片。本文希望更进一步:即使图像表面看起来无害、没有直接出现危险词,模型能否凭借场景和关系自行补回被隐藏的语义?

核心问题  安全训练学到的究竟是“识别危险语义并拒绝”,还是“看到某些危险文本/视觉表征时拒绝”?两者看似接近,却对应完全不同的跨模态泛化能力。

二、论文的创新点与核心贡献

创新点

论文做了什么

为什么重要

四类机制化攻击

覆盖符号译码、场景语义覆盖、图中文字语境恢复和视觉类比推理

把视觉攻击从单一 OCR 绕过扩展到多种语义恢复路径

提示中和

把 HarmBench 危险实体替换为 X1-X4,再由图像补回语义

尽量隔离视觉贡献,避免原始危险词直接触发拒绝

成对文本基线

每类视觉攻击都与同构文本版本比较

不只报告 ASR,还测量“视觉相对文本增加了什么”

六个前沿 VLM

覆盖 GPT、Claude、Gemini、Qwen 系列

揭示模型间差异,避免把单模型现象误当普遍规律

机制与防御初探

拒绝方向、Logit Lens、轻量输出守卫

从“攻击有效”推进到“为何有效、怎样缓解”

最值得关注的贡献  论文没有把所有失败归结为“视觉模型不安全”,而是把视觉输入拆成不同语义通道,再用同构文本基线逐一比较。这使“跨模态对齐缺口”成为可测量的问题,而不只是直觉判断。

三、四类视觉越狱是如何工作的?

图 1|四类攻击的共同逻辑:表面无害,语义在推理过程中被恢复(本文重绘)

1. Visual Cipher:让模型先学一套临时视觉语言

作者为指令中的每个词分配一个抽象图形,提供“图形-词语”图例,再把完整指令编码成从左到右的符号序列。模型被要求先译码、再执行。图例还加入无关符号作为干扰项。其文本基线使用可发音的无意义词做同样的替换,因此两者主要区别在于映射和序列究竟位于视觉通道还是文本通道。

2. Visual Object Replacement:外观被替换,场景仍在“说真话”

作者先生成包含目标对象的真实场景,再只把关键对象替换成香蕉、胡萝卜、水瓶或西兰花等良性物体,保留周围布局、配套部件和交互线索。提示要求模型把占位符理解为“场景原本更合理的对象”。如果模型恢复出危险概念,它依赖的就不是局部物体外观,而是场景级语义。

3. Visual Text Replacement:危险词消失,版式和文化语境仍可补全

这一攻击针对书封、海报、标识或新闻标题中的文字。作者把目标词局部替换成良性占位符,同时尽量保留字体、大小写、位置和周围视觉元素。VLM 需要借助熟悉的版式与文化背景推断被替换的原词,再把它带回中和后的任务。

4. Visual Analogy Riddle:每条线索都安全,组合答案却可能危险

作者把危险意图拆成至多四个概念,每个概念用三行视觉类比编码:前两行展示关系,第三行留下问号。单个元素和单行关系都可以是良性的,危险含义只在多个谜题答案被重新组合时出现。这种攻击同时有文字版和图片版,可用于比较抽象推理跨模态时的成功与误解。

安全说明  本文只保留攻击的研究机制,不复述论文附录中的具体危险指令或可操作输出。对公众号读者而言,理解“语义如何跨模态恢复”比复制攻击内容更有价值。

四、实验是怎么设计的?

维度

实验设置

数据

HarmBench;视觉文字替换明确报告 159 个行为、6 个语义类别

目标模型

GPT-5.2、Claude-Haiku-4.5、Gemini-3-Flash、Gemini-3.1-Pro、Qwen3-VL-235B、Qwen3-VL-32B

攻击采样

多数设置采用 Best-of-5;同一行为尝试 5 次,任一次完全服从即计为成功

视觉生成/编辑

视觉物体替换使用 REVE;视觉谜题由 Grok-4.1-Fast 生成描述、Gemini-2.5-Flash-Image 渲染

评审模型

Grok-4.1-Fast、Gemini-3-Flash、Claude-Haiku-4.5 三评审集成

标签

0 拒绝、1 误解、2 部分服从、3 完全服从;分歧时采用保守的较低分

对照

四类视觉攻击的同构文本基线,以及 TYPO、SD、SD+TYPO、HADES、FigStep 五类既有方法

为什么“先译码、再执行”很重要?

作者发现,如果只把图像交给模型,很多失败不是安全拒绝,而是模型停留在描述画面或答非所问。因此所有攻击使用 decode-first 策略,先明确要求模型解释视觉编码,再执行恢复出的任务。这提高了攻击成功率,但也意味着结果衡量的是“模型在被强引导进行语义恢复时的安全性”,不能直接等价为日常随机图片输入下的风险。

评审是否可靠?

图 2|三位评审在 3,975 次评估中的一致性(数据来自论文 Table 1)

三位评审达到 84.3% 的全体一致。分歧主要发生在相邻类别之间;“拒绝”和“完全服从”的直接冲突只占分歧的 3.8%。作者在无法形成多数或评审拒绝打分时选择最低分,因此 ASR 更接近保守下界。

五、关键结果:视觉通道确实存在缺口,但不是简单的“视觉更危险”

下面的主表报告 Best-of-5 ASR。数值越高,说明五次尝试中至少一次被评为完全服从的比例越高。

攻击(K=5)

Claude

Gemini 3 Flash

GPT-5.2

Qwen 235B

Qwen 32B

Gemini 3.1 Pro

文本密码

10.7

89.3

5.7

86.8

84.9

15.1

视觉密码

40.9

97.5

8.2

86.2

87.4

14.5

文本替换

8.1

58.8

16.9

29.5

39.0

19.0

视觉物体替换

4.1

52.0

11.5

35.6

41.1

45.6

视觉文字替换

12.9

32.8

14.4

51.5

58.1

48.6

文本类比谜题

39.6

67.9

24.5

51.6

62.3

17.0

视觉类比谜题

13.8

52.2

13.2

29.6

38.4

6.3

表 1|六个前沿 VLM 上的 Best-of-5 ASR(%,摘编自原论文 Table 2)

图 3|视觉攻击相对同构文本基线的 ASR 差值;绿色表示视觉更高(本文据 Table 2 计算)

读数提示  跨模态缺口是“模型 × 攻击机制”条件化的。Claude 的视觉密码比文本密码高 30.2 个百分点;Gemini 3.1 Pro 的视觉物体替换比文本替换高 26.6 个百分点;但视觉谜题在六个模型上都低于文本谜题。不能用一条平均结论覆盖所有视觉输入。

六、按攻击类型逐项读数据

视觉密码:最清晰的跨模态对齐缺口

Claude-Haiku-4.5 的文本密码 ASR 只有 10.7%,视觉密码却达到 40.9%;GPT-5.2 也从 5.7% 升到 8.2%。Gemini-3-Flash 在两种模式下都很脆弱,视觉密码达到 97.5%。Qwen 两个版本则呈现“文本和视觉都高”的能力型风险:模型不仅能译码,也愿意执行。

视觉物体替换:场景语义能越过局部外观,但结果高度依赖模型

Qwen3-VL-235B、Qwen3-VL-32B 和 Gemini-3.1-Pro 的视觉版本高于文本替换,说明这些模型会强烈使用场景级关系来解释物体角色。Claude 和 GPT-5.2 则保持较低 ASR。Gemini-3-Flash 的文本替换反而更强,提醒我们“视觉上下文更丰富”不等于“攻击必然更成功”。

视觉文字替换:文化语境对 Qwen 和 Gemini 3.1 Pro 尤其有效

Qwen3-VL-32B 从文本替换的 39.0% 上升到视觉文字替换的 58.1%,Qwen3-VL-235B 从 29.5% 上升到 51.5%,Gemini-3.1-Pro 从 19.0% 上升到 48.6%。这表明 OCR 安全过滤即使能确认占位符本身无害,也可能遗漏由封面、海报和周围图像共同触发的语义补全。

视觉类比谜题:更低 ASR 主要来自“没猜对”,不一定来自“更安全”

视觉谜题在全部模型上都弱于文字谜题。附录 J 进一步显示,视觉抽象带来显著误解:Claude 的平均误解率从文字谜题的 25.0% 升到视觉谜题的 60.0%,完全服从率从 40.4% 降到 13.9%。这意味着 ASR 下降主要是语义解码失败,而非拒绝机制更强。未来视觉推理能力提升后,这类攻击反而可能变得更有效。

一个重要区分  “攻击失败”至少有两种原因:模型识别了危险意图并拒绝,或模型根本没有理解隐藏意图。把二者混在一起,会把能力不足误判成安全能力。

七、不同模型的风险画像

图 4|每个模型在四类视觉攻击中的最高 Best-of-5 ASR(本文据 Table 2 计算)

Gemini-3-Flash 在视觉密码上达到 97.5%,Qwen3-VL-32B 达到 87.4%,Qwen3-VL-235B 达到 86.2%。GPT-5.2 的最高视觉 ASR 为 14.4%,Claude 为 40.9%,Gemini-3.1-Pro 为 48.6%。这些数值不能被解释为模型的整体“安全排行榜”:攻击强度、评测时间点、模型版本、拒绝策略和视觉推理能力都可能同时影响结果。

语义类别同样改变脆弱性

附录按网络犯罪、化学/生物、虚假信息、骚扰、违法活动和一般危害六类拆分。以视觉密码为例,Claude 在网络犯罪类别从文本的 6.1% 跃升到视觉的 72.7%,但在虚假信息上两者同为 33.3%。GPT-5.2 在多数类别保持低位,却在虚假信息上从 29.6% 升到 40.7%。安全评测因此必须同时保留“模型、机制、危害类别”三个维度。

八、为什么会成功?论文给出的机制解释

解释一:局部外观和分布式语境在不同阶段被整合

作者在 Qwen3-VL 上使用 Logit Lens 追踪危险词与良性词随层数变化的概率。原始危险图像进入中后层后,危险词迅速占优;替换图像则在早中层增强良性词,但危险词仍可能在语义理解层保持较高。空间热图也显示:良性词更集中在被替换物体的局部区域,危险词却会“附着”在周围场景和配套部件上。

解释二:危险语义仍在,但拒绝信号在生成边界被压低

作者借鉴拒绝方向研究,在 Qwen3-VL-32B 中比较危险文本、危险图像、文本替换和视觉替换。危险文本在后层的拒绝方向激活最强,危险图像次之;两种替换条件显著降低拒绝信号,视觉替换几乎把它压到最低基线附近。论文据此提出一个“时序错位”假设:模型先从上下文恢复危险语义,但安全检查对被替换后的表面线索不够敏感,最终生成阶段没有充分启动拒绝。

证据强度  这是初步机制证据,而非已被严格证明的因果链。分析集中在开放权重 Qwen3-VL,样本和提示设置有限;Logit Lens 只能说明中间表示中哪些词可被线性读出,不能直接等同于模型的真实决策过程。

九、缓解措施:为什么输出侧守卫值得优先部署?

四类攻击虽然从图像入口绕过安全检查,最终仍要输出自然语言。作者因此测试 Qwen3Guard-Stream-0.6B 对视觉密码回复的检测:它能标记大多数被评为完全服从的输出,同时很少误报拒绝回复。论文没有把这视为单点解决方案,而是建议将输出分类作为纵深防御的一层。

防线

能覆盖什么

主要局限

输入侧多模态审核

OCR 文本、对象、场景、符号关系与图文组合风险

单独过滤显式危险词会漏掉语义补全和类比组合

模型内安全训练

让拒绝特征覆盖视觉嵌入和跨模态语义

需要高质量视觉红队数据;可能损伤正常视觉推理

输出侧安全分类

与输入编码方式无关,直接检查最终回复

可能在模型已经生成危险内容后才发现;需要低延迟和稳健召回

中间层运行监测

发现“中层危险语义高、末层表面输出正常”的背离

研究尚早,跨模型可迁移性和部署成本不明确

工程建议  短期最现实的方案是多层组合:视觉输入语义审核 + 模型原生拒绝训练 + 输出守卫。只依赖 OCR 或关键词黑名单,会把最关键的场景推理与关系组合留在盲区。

十、局限、证据边界与阅读时应保留的问号

      数据主要来自 HarmBench。六类危害覆盖较广,但不能代表所有真实多模态应用、语言和文化语境。

      Best-of-5 把“多次尝试中任一次成功”计为成功,适合红队压力测试,却高于普通单次交互风险;Table 2 同时提供 K=1,部署解读时应两者并看。

      图像生成与编辑质量会显著影响攻击。作者用多图和 Best-of-K 缓解随机性,但不能完全控制生成伪影。

      专有模型无法做内部机制分析,因此拒绝方向和 Logit Lens 结论主要来自 Qwen3-VL,尚不能直接外推到所有模型。

      视觉谜题的大量失败来自误解。随着模型视觉推理增强,今天的“能力不足型安全”可能消失。

      论文未系统研究跨模型迁移,也未组合多种视觉攻击;真实对手可能采用更复杂的多轮和多模态策略。

      主文把成功定义为评分 3 的完全服从;附录 I.7 对视觉文字替换又写为“部分或完全服从”。这处口径表述值得作者进一步澄清,阅读表格时应以主文统一评测说明和 Table 2 为主。

证据边界  论文充分证明了“视觉通道存在可利用的对齐缺口”和“缺口具有模型/机制特异性”,但不能据此断言某个模型在真实部署中一定最不安全,也不能把所有视觉攻击失败都解释为安全对齐成功。

 

十一、对我的启发:如何把论文结论变成工程防线?

启发 1:多模态审核要看“组合语义”,而不只是每个模态单独看起来是否无害

四类攻击的共同点是单个表面元素可以全部合规,危险含义却在图例映射、场景关系、版式先验或多谜题组合之后出现。安全管线需要像模型一样做跨模态融合:同时检查图像、提示、对话历史和模型即将采取的动作。

启发 2:评测指标必须拆开“拒绝、误解、部分服从、完全服从”

只看 ASR 会遗漏能力和安全的纠缠。部署评测至少应报告拒绝率、误解率、部分服从率和完全服从率,并同时给出 single-shot 与 Best-of-N。否则,一个“看起来 ASR 很低”的模型可能只是没有理解测试。

启发 3:建立跨模态等价测试集

同一危险意图应被分别写成直接文本、文本密码、视觉符号、场景替换、图中文字替换和视觉类比,然后比较模型的拒绝一致性。真正稳健的对齐,不应因为表达通道改变就发生大幅波动。

启发 4:输出侧守卫要独立于主模型,并持续校准

主模型既负责理解图像又负责执行任务,容易让能力和安全共享同一盲点。独立输出分类器提供了不同的失败模式,但也要用最新越狱输出、不同语言和长上下文持续校准,避免把“很少误报拒绝”误读成“几乎没有漏报”。

启发 5:监控版本变化,而不是只做一次性验收

论文覆盖的都是具体时间点的模型版本。一次升级可能增强视觉推理、改变拒绝策略或重排输入过滤。安全基线应随模型版本、视觉编码器和系统提示更新自动重跑,并保留按攻击机制与危害类别切分的历史曲线。

结语

这篇论文最有价值的提醒是:对齐不是一句写在系统提示里的规则,而是一种必须跨模态保持一致的行为。当模型学会从图像中读出文字之外的含义,安全系统也必须学会在同样的语义层次上工作。

视觉越狱并不意味着所有图像都危险,也不意味着视觉攻击必然强于文本攻击。更准确的结论是:不同模型在不同视觉语义通道上存在不同的“安全薄弱面”。找到这些薄弱面,区分拒绝与误解,并用输入、模型内部和输出三层防线共同覆盖,才是这项研究对多模态系统建设最直接的启示。

最后记住一句话  当危险意图可以从图像关系中被模型“补出来”,安全判断就不能只盯着画面里“写了什么”,还要理解整张图和整段对话“意味着什么”。

 

#AI Security论文精度(2)

评论