图像不只是输入 它也可能成为安全对齐的 “盲区”
文章说明
先说结论:视觉理解能力越强,安全对齐未必跟得上
这篇论文真正值得关注的,不是又多了四种“把危险文字藏起来”的技巧,而是它把一个更根本的问题摆到了台面上:当危险意图通过图像中的符号、场景、版式或类比关系出现时,模型可能已经完成了语义恢复,却没有同步触发文本域里训练得更充分的拒绝机制。
一、作者为什么要做这项研究?
多模态模型的能力扩展,也同步扩大了攻击面
现代 VLM 不再只是“看图说话”。它们被用于文档理解、视觉搜索、多模态助手和复杂界面操作。视觉输入因此不只是一个被动的描述通道,而会主动改变模型对任务、对象和意图的理解。已有安全训练却主要围绕离散文本 token 展开,这留下了一个自然问题:文本中的危险意图被拦住后,等价语义如果从图像中被恢复,拒绝机制还能否可靠工作?
已有视觉越狱多依赖扰动或图中文字,作者想研究“语义可解释”的视觉攻击
此前方法包括通用对抗图像、CLIP 空间扰动、图像劫持和 FigStep 等排版型攻击。它们证明视觉输入可以突破安全边界,但不少方法依赖不可解释的像素扰动,或本质上仍把危险文字渲染进图片。本文希望更进一步:即使图像表面看起来无害、没有直接出现危险词,模型能否凭借场景和关系自行补回被隐藏的语义?
二、论文的创新点与核心贡献
三、四类视觉越狱是如何工作的?

图 1|四类攻击的共同逻辑:表面无害,语义在推理过程中被恢复(本文重绘)
1. Visual Cipher:让模型先学一套临时视觉语言
作者为指令中的每个词分配一个抽象图形,提供“图形-词语”图例,再把完整指令编码成从左到右的符号序列。模型被要求先译码、再执行。图例还加入无关符号作为干扰项。其文本基线使用可发音的无意义词做同样的替换,因此两者主要区别在于映射和序列究竟位于视觉通道还是文本通道。
2. Visual Object Replacement:外观被替换,场景仍在“说真话”
作者先生成包含目标对象的真实场景,再只把关键对象替换成香蕉、胡萝卜、水瓶或西兰花等良性物体,保留周围布局、配套部件和交互线索。提示要求模型把占位符理解为“场景原本更合理的对象”。如果模型恢复出危险概念,它依赖的就不是局部物体外观,而是场景级语义。
3. Visual Text Replacement:危险词消失,版式和文化语境仍可补全
这一攻击针对书封、海报、标识或新闻标题中的文字。作者把目标词局部替换成良性占位符,同时尽量保留字体、大小写、位置和周围视觉元素。VLM 需要借助熟悉的版式与文化背景推断被替换的原词,再把它带回中和后的任务。
4. Visual Analogy Riddle:每条线索都安全,组合答案却可能危险
作者把危险意图拆成至多四个概念,每个概念用三行视觉类比编码:前两行展示关系,第三行留下问号。单个元素和单行关系都可以是良性的,危险含义只在多个谜题答案被重新组合时出现。这种攻击同时有文字版和图片版,可用于比较抽象推理跨模态时的成功与误解。
四、实验是怎么设计的?
为什么“先译码、再执行”很重要?
作者发现,如果只把图像交给模型,很多失败不是安全拒绝,而是模型停留在描述画面或答非所问。因此所有攻击使用 decode-first 策略,先明确要求模型解释视觉编码,再执行恢复出的任务。这提高了攻击成功率,但也意味着结果衡量的是“模型在被强引导进行语义恢复时的安全性”,不能直接等价为日常随机图片输入下的风险。
评审是否可靠?

图 2|三位评审在 3,975 次评估中的一致性(数据来自论文 Table 1)
三位评审达到 84.3% 的全体一致。分歧主要发生在相邻类别之间;“拒绝”和“完全服从”的直接冲突只占分歧的 3.8%。作者在无法形成多数或评审拒绝打分时选择最低分,因此 ASR 更接近保守下界。
五、关键结果:视觉通道确实存在缺口,但不是简单的“视觉更危险”
下面的主表报告 Best-of-5 ASR。数值越高,说明五次尝试中至少一次被评为完全服从的比例越高。
表 1|六个前沿 VLM 上的 Best-of-5 ASR(%,摘编自原论文 Table 2)

图 3|视觉攻击相对同构文本基线的 ASR 差值;绿色表示视觉更高(本文据 Table 2 计算)
六、按攻击类型逐项读数据
视觉密码:最清晰的跨模态对齐缺口
Claude-Haiku-4.5 的文本密码 ASR 只有 10.7%,视觉密码却达到 40.9%;GPT-5.2 也从 5.7% 升到 8.2%。Gemini-3-Flash 在两种模式下都很脆弱,视觉密码达到 97.5%。Qwen 两个版本则呈现“文本和视觉都高”的能力型风险:模型不仅能译码,也愿意执行。
视觉物体替换:场景语义能越过局部外观,但结果高度依赖模型
Qwen3-VL-235B、Qwen3-VL-32B 和 Gemini-3.1-Pro 的视觉版本高于文本替换,说明这些模型会强烈使用场景级关系来解释物体角色。Claude 和 GPT-5.2 则保持较低 ASR。Gemini-3-Flash 的文本替换反而更强,提醒我们“视觉上下文更丰富”不等于“攻击必然更成功”。
视觉文字替换:文化语境对 Qwen 和 Gemini 3.1 Pro 尤其有效
Qwen3-VL-32B 从文本替换的 39.0% 上升到视觉文字替换的 58.1%,Qwen3-VL-235B 从 29.5% 上升到 51.5%,Gemini-3.1-Pro 从 19.0% 上升到 48.6%。这表明 OCR 安全过滤即使能确认占位符本身无害,也可能遗漏由封面、海报和周围图像共同触发的语义补全。
视觉类比谜题:更低 ASR 主要来自“没猜对”,不一定来自“更安全”
视觉谜题在全部模型上都弱于文字谜题。附录 J 进一步显示,视觉抽象带来显著误解:Claude 的平均误解率从文字谜题的 25.0% 升到视觉谜题的 60.0%,完全服从率从 40.4% 降到 13.9%。这意味着 ASR 下降主要是语义解码失败,而非拒绝机制更强。未来视觉推理能力提升后,这类攻击反而可能变得更有效。
七、不同模型的风险画像

图 4|每个模型在四类视觉攻击中的最高 Best-of-5 ASR(本文据 Table 2 计算)
Gemini-3-Flash 在视觉密码上达到 97.5%,Qwen3-VL-32B 达到 87.4%,Qwen3-VL-235B 达到 86.2%。GPT-5.2 的最高视觉 ASR 为 14.4%,Claude 为 40.9%,Gemini-3.1-Pro 为 48.6%。这些数值不能被解释为模型的整体“安全排行榜”:攻击强度、评测时间点、模型版本、拒绝策略和视觉推理能力都可能同时影响结果。
语义类别同样改变脆弱性
附录按网络犯罪、化学/生物、虚假信息、骚扰、违法活动和一般危害六类拆分。以视觉密码为例,Claude 在网络犯罪类别从文本的 6.1% 跃升到视觉的 72.7%,但在虚假信息上两者同为 33.3%。GPT-5.2 在多数类别保持低位,却在虚假信息上从 29.6% 升到 40.7%。安全评测因此必须同时保留“模型、机制、危害类别”三个维度。
八、为什么会成功?论文给出的机制解释
解释一:局部外观和分布式语境在不同阶段被整合
作者在 Qwen3-VL 上使用 Logit Lens 追踪危险词与良性词随层数变化的概率。原始危险图像进入中后层后,危险词迅速占优;替换图像则在早中层增强良性词,但危险词仍可能在语义理解层保持较高。空间热图也显示:良性词更集中在被替换物体的局部区域,危险词却会“附着”在周围场景和配套部件上。
解释二:危险语义仍在,但拒绝信号在生成边界被压低
作者借鉴拒绝方向研究,在 Qwen3-VL-32B 中比较危险文本、危险图像、文本替换和视觉替换。危险文本在后层的拒绝方向激活最强,危险图像次之;两种替换条件显著降低拒绝信号,视觉替换几乎把它压到最低基线附近。论文据此提出一个“时序错位”假设:模型先从上下文恢复危险语义,但安全检查对被替换后的表面线索不够敏感,最终生成阶段没有充分启动拒绝。
九、缓解措施:为什么输出侧守卫值得优先部署?
四类攻击虽然从图像入口绕过安全检查,最终仍要输出自然语言。作者因此测试 Qwen3Guard-Stream-0.6B 对视觉密码回复的检测:它能标记大多数被评为完全服从的输出,同时很少误报拒绝回复。论文没有把这视为单点解决方案,而是建议将输出分类作为纵深防御的一层。
十、局限、证据边界与阅读时应保留的问号
• 数据主要来自 HarmBench。六类危害覆盖较广,但不能代表所有真实多模态应用、语言和文化语境。
• Best-of-5 把“多次尝试中任一次成功”计为成功,适合红队压力测试,却高于普通单次交互风险;Table 2 同时提供 K=1,部署解读时应两者并看。
• 图像生成与编辑质量会显著影响攻击。作者用多图和 Best-of-K 缓解随机性,但不能完全控制生成伪影。
• 专有模型无法做内部机制分析,因此拒绝方向和 Logit Lens 结论主要来自 Qwen3-VL,尚不能直接外推到所有模型。
• 视觉谜题的大量失败来自误解。随着模型视觉推理增强,今天的“能力不足型安全”可能消失。
• 论文未系统研究跨模型迁移,也未组合多种视觉攻击;真实对手可能采用更复杂的多轮和多模态策略。
• 主文把成功定义为评分 3 的完全服从;附录 I.7 对视觉文字替换又写为“部分或完全服从”。这处口径表述值得作者进一步澄清,阅读表格时应以主文统一评测说明和 Table 2 为主。
十一、对我的启发:如何把论文结论变成工程防线?
启发 1:多模态审核要看“组合语义”,而不只是每个模态单独看起来是否无害
四类攻击的共同点是单个表面元素可以全部合规,危险含义却在图例映射、场景关系、版式先验或多谜题组合之后出现。安全管线需要像模型一样做跨模态融合:同时检查图像、提示、对话历史和模型即将采取的动作。
启发 2:评测指标必须拆开“拒绝、误解、部分服从、完全服从”
只看 ASR 会遗漏能力和安全的纠缠。部署评测至少应报告拒绝率、误解率、部分服从率和完全服从率,并同时给出 single-shot 与 Best-of-N。否则,一个“看起来 ASR 很低”的模型可能只是没有理解测试。
启发 3:建立跨模态等价测试集
同一危险意图应被分别写成直接文本、文本密码、视觉符号、场景替换、图中文字替换和视觉类比,然后比较模型的拒绝一致性。真正稳健的对齐,不应因为表达通道改变就发生大幅波动。
启发 4:输出侧守卫要独立于主模型,并持续校准
主模型既负责理解图像又负责执行任务,容易让能力和安全共享同一盲点。独立输出分类器提供了不同的失败模式,但也要用最新越狱输出、不同语言和长上下文持续校准,避免把“很少误报拒绝”误读成“几乎没有漏报”。
启发 5:监控版本变化,而不是只做一次性验收
论文覆盖的都是具体时间点的模型版本。一次升级可能增强视觉推理、改变拒绝策略或重排输入过滤。安全基线应随模型版本、视觉编码器和系统提示更新自动重跑,并保留按攻击机制与危害类别切分的历史曲线。
结语
这篇论文最有价值的提醒是:对齐不是一句写在系统提示里的规则,而是一种必须跨模态保持一致的行为。当模型学会从图像中读出文字之外的含义,安全系统也必须学会在同样的语义层次上工作。
视觉越狱并不意味着所有图像都危险,也不意味着视觉攻击必然强于文本攻击。更准确的结论是:不同模型在不同视觉语义通道上存在不同的“安全薄弱面”。找到这些薄弱面,区分拒绝与误解,并用输入、模型内部和输出三层防线共同覆盖,才是这项研究对多模态系统建设最直接的启示。
#AI Security论文精度(2)
评论