AI-Workshop 文献分享 2026-06-13 22:00

AI-Workshop 文献分享 #4 — CC-BOS:利用文言文盲区自动搜索越狱提示

ltw 分享 ICLR 2026 论文——通过八维策略空间 + 果蝇优化算法自动生成文言文越狱提示,揭示大模型在古典语言场景下存在语言理解与安全对齐之间的盲区。

AI-Workshop 文献分享 LLM安全 越狱攻击 文言文

AI-Workshop 文献分享 #4 -- CC-BOS:利用文言文盲区自动搜索越狱提示

分享人:ltw | 日期:2026-06-13

论文:Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search 会议:ICLR 2026


一、一句话概括

本文提出 CC-BOS,用文言文作为特殊语言语境,将越狱提示构造建模为一个 八维策略空间搜索问题, 再通过果蝇优化算法自动寻找高成功率提示,从而揭示当前大模型在古典语言场景下存在 "能理解但未充分安全对齐"的盲区。


二、论文信息

项目 内容
论文标题 Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
方法名称 CC-BOS
会议 ICLR 2026
研究方向 LLM Security / Jailbreak / Black-box Attack
代码 github.com/xunhuang123/CC-BOS

三、研究背景:文言文安全盲区

现有大模型具备较强的多语言理解能力,也经过安全对齐训练,能够拒绝明显有害的现代语言请求。 但论文指出,安全对齐在不同语言环境下并不均衡

文言文不是简单的低资源语言。它有完整的语言系统、大量历史语料和高度成熟的表达体系。 问题在于:

  • 文言文表达高度压缩
  • 语义常通过典故、借代、隐喻表达
  • 表面文本可能不包含现代危险关键词
  • 现代语言安全规则难以直接覆盖古典表达
  • 模型可以理解文言文,但安全护栏不一定能同步识别其真实意图

论文将这种现象定义为 Classical Chinese safety blind spot(文言文安全盲区)。


四、核心问题

论文主要回答四个问题:

  1. 文言文是否会改变大模型的安全响应行为? -- 同样的有害意图,在文言文表达下是否更容易绕过拒答机制
  2. 越狱提示能否系统化生成? -- 不依赖人工写 prompt,建立结构化策略空间
  3. 黑盒场景下能否高效搜索? -- 仅通过模型输入输出交互优化提示
  4. 如何可靠评估文言文输出? -- 需先翻译显影,再判断是否真正产生有害内容

五、方法总览:CC-BOS

完整流程:

原始评测问题 -> 八维策略空间编码 -> 生成文言文候选提示
    -> 查询目标大模型 -> 获得模型响应
    -> 文言文 -> 现代汉语 -> 英文(双阶段翻译)
    -> 关键词匹配 + 语义一致性评估 -> 评分反馈给搜索算法
    -> 迭代寻找最优策略组合

核心不是"把英文翻译成文言文",而是把文言文的表达机制、隐喻结构、上下文身份和触发方式都纳入搜索空间。


六、八维策略空间

论文将文言文越狱提示拆成八个策略维度:

维度 含义
Role Identity 角色身份(学者、官职、典籍人物等)
Behavioral Guidance 行为引导(论证、推演、解释等)
Mechanism 机制设计(归谬、兵法、变爻、谶纬等)
Metaphor Mapping 隐喻映射(现代概念映射为古代器物、天象、典故)
Expression Style 表达风格(奏对、注疏、分条陈述、问答等)
Knowledge Relation 知识关系(因果、规则、符号、跨域推理)
Contextual Setting 上下文场景(历史情境、学术论辩、仪式场景)
Trigger Pattern 触发模式(一次性、递进、延迟触发等)

这个设计将原本依靠经验和灵感的 prompt 构造,变成了一个可枚举、可搜索、可消融的策略组合问题。


七、生物启发式搜索

使用基于果蝇觅食行为的优化算法探索策略空间:

搜索动作 作用
Smell Search 在当前策略附近随机探索,发现潜在高分区域
Vision Search 向当前最优策略靠近,加速收敛
Cauchy Mutation 搜索停滞时较大跳跃,避免局部最优

这种设计适合黑盒攻击场景:不需要目标模型的梯度、权重或内部安全策略。


八、双阶段翻译评估

由于文言文输出存在语义压缩、隐喻表达、古代概念映射等问题,论文设计了双阶段翻译:

文言文响应 -> 现代汉语释义 -> 英文规范化表达 -> 安全评估模型判断

两个作用:1)提高评估可靠性,避免误判为安全内容;2)提供防御启发。


九、实验设置

目标模型:Gemini-2.5-flash、Claude-3.7、GPT-4o、DeepSeek-Reasoner、Qwen3、Grok-3

数据集:AdvBench、StrongREJECT、CLAS

评估指标:ASR(攻击成功率)、Avg.Score、Avg.Q(平均查询次数)


十、主要实验结果

  1. 主实验:CC-BOS 在 AdvBench 上对 6 个目标模型均达到 100% ASR
  2. 优于 PAIR、TAP、GPTFUZZER、AutoDAN 等基线方法
  3. 查询成本较低 -- 搜索效率高
  4. 防御下仍有残余穿透能力 -- Llama-Guard 防御后仍保持较高 ASR
  5. 跨模型迁移明显 -- 一个模型生成的策略在其他模型上仍有效
  6. 消融实验揭示各模块贡献(Claude-3.7 / AdvBench):
设置 ASR
仅文言文语境 18%
+ 策略空间 60%
+ 生物启发优化 100%
去掉翻译评估模块 90%
加入完整翻译评估 100%

文言文本身有效,但真正显著提升成功率的是结构化策略空间和自动搜索。


十一、论文贡献

  1. 首次系统研究文言文语境下的大模型越狱问题
  2. 提出八维策略空间 -- 角色、行为、机制、隐喻、表达等统一建模
  3. 提出基于果蝇优化的黑盒搜索框架 -- 自动化提示优化
  4. 提出双阶段翻译评估模块 -- 缓解文言文压缩、隐喻对评估的影响

十二、对防御的启示

模型能力覆盖到哪里,安全评测就必须覆盖到哪里。

  1. 不应只做关键词过滤 -- 文言文可通过典故、借代、隐喻绕开现代关键词
  2. 不应简单拒绝古文输入 -- 会误伤古文教学、文学研究、古籍翻译等正常场景
  3. 需要跨语境安全评测 -- 覆盖古典语言、低资源语言、混合语体、隐喻表达
  4. 可考虑"翻译显影 + 安全审查"防御链路

输入:语言识别 -> 现代语义释义 -> 意图审查 -> 安全响应 输出:隐喻/古文检测 -> 现代语义还原 -> 安全审查 -> 最终返回


十三、局限与讨论

  1. ASR 是否高估真实危害?依赖评估模型、阈值、翻译质量
  2. 双阶段翻译可能改变语义细节
  3. 类似风险可能存在于 Latin、Sanskrit、古希腊语、低资源语言中
  4. 防御如何兼顾低误伤?不能破坏正常教育和研究场景

十四、总结

这篇论文揭示了一个重要事实:大模型并不是不懂文言文,而是当前安全对齐机制没有充分覆盖文言文这种古典语境。 CC-BOS 通过八维策略空间、生物启发式搜索和双阶段翻译评估,系统展示了文言文语境下的安全盲区。

三个要点:

  1. 文言文盲区真实存在 -- 模型能理解但安全护栏跟不上
  2. 搜索自动化 -- 八维策略空间 + 果蝇优化实现黑盒自动化越狱
  3. 防御需升级 -- 从表层文本匹配升级为跨语言、跨语体的意图级安全审查

参考文献

  • Huang, X. et al. Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search. ICLR 2026.
  • arXiv: 2602.22983v3