AI-Workshop 文献分享 #4 -- CC-BOS:利用文言文盲区自动搜索越狱提示
分享人:ltw | 日期:2026-06-13
论文:Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search 会议:ICLR 2026
一、一句话概括
本文提出 CC-BOS,用文言文作为特殊语言语境,将越狱提示构造建模为一个 八维策略空间搜索问题, 再通过果蝇优化算法自动寻找高成功率提示,从而揭示当前大模型在古典语言场景下存在 "能理解但未充分安全对齐"的盲区。
二、论文信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search |
| 方法名称 | CC-BOS |
| 会议 | ICLR 2026 |
| 研究方向 | LLM Security / Jailbreak / Black-box Attack |
| 代码 | github.com/xunhuang123/CC-BOS |
三、研究背景:文言文安全盲区
现有大模型具备较强的多语言理解能力,也经过安全对齐训练,能够拒绝明显有害的现代语言请求。 但论文指出,安全对齐在不同语言环境下并不均衡。
文言文不是简单的低资源语言。它有完整的语言系统、大量历史语料和高度成熟的表达体系。 问题在于:
- 文言文表达高度压缩
- 语义常通过典故、借代、隐喻表达
- 表面文本可能不包含现代危险关键词
- 现代语言安全规则难以直接覆盖古典表达
- 模型可以理解文言文,但安全护栏不一定能同步识别其真实意图
论文将这种现象定义为 Classical Chinese safety blind spot(文言文安全盲区)。
四、核心问题
论文主要回答四个问题:
- 文言文是否会改变大模型的安全响应行为? -- 同样的有害意图,在文言文表达下是否更容易绕过拒答机制
- 越狱提示能否系统化生成? -- 不依赖人工写 prompt,建立结构化策略空间
- 黑盒场景下能否高效搜索? -- 仅通过模型输入输出交互优化提示
- 如何可靠评估文言文输出? -- 需先翻译显影,再判断是否真正产生有害内容
五、方法总览:CC-BOS
完整流程:
原始评测问题 -> 八维策略空间编码 -> 生成文言文候选提示
-> 查询目标大模型 -> 获得模型响应
-> 文言文 -> 现代汉语 -> 英文(双阶段翻译)
-> 关键词匹配 + 语义一致性评估 -> 评分反馈给搜索算法
-> 迭代寻找最优策略组合
核心不是"把英文翻译成文言文",而是把文言文的表达机制、隐喻结构、上下文身份和触发方式都纳入搜索空间。
六、八维策略空间
论文将文言文越狱提示拆成八个策略维度:
| 维度 | 含义 |
|---|---|
| Role Identity | 角色身份(学者、官职、典籍人物等) |
| Behavioral Guidance | 行为引导(论证、推演、解释等) |
| Mechanism | 机制设计(归谬、兵法、变爻、谶纬等) |
| Metaphor Mapping | 隐喻映射(现代概念映射为古代器物、天象、典故) |
| Expression Style | 表达风格(奏对、注疏、分条陈述、问答等) |
| Knowledge Relation | 知识关系(因果、规则、符号、跨域推理) |
| Contextual Setting | 上下文场景(历史情境、学术论辩、仪式场景) |
| Trigger Pattern | 触发模式(一次性、递进、延迟触发等) |
这个设计将原本依靠经验和灵感的 prompt 构造,变成了一个可枚举、可搜索、可消融的策略组合问题。
七、生物启发式搜索
使用基于果蝇觅食行为的优化算法探索策略空间:
| 搜索动作 | 作用 |
|---|---|
| Smell Search | 在当前策略附近随机探索,发现潜在高分区域 |
| Vision Search | 向当前最优策略靠近,加速收敛 |
| Cauchy Mutation | 搜索停滞时较大跳跃,避免局部最优 |
这种设计适合黑盒攻击场景:不需要目标模型的梯度、权重或内部安全策略。
八、双阶段翻译评估
由于文言文输出存在语义压缩、隐喻表达、古代概念映射等问题,论文设计了双阶段翻译:
文言文响应 -> 现代汉语释义 -> 英文规范化表达 -> 安全评估模型判断
两个作用:1)提高评估可靠性,避免误判为安全内容;2)提供防御启发。
九、实验设置
目标模型:Gemini-2.5-flash、Claude-3.7、GPT-4o、DeepSeek-Reasoner、Qwen3、Grok-3
数据集:AdvBench、StrongREJECT、CLAS
评估指标:ASR(攻击成功率)、Avg.Score、Avg.Q(平均查询次数)
十、主要实验结果
- 主实验:CC-BOS 在 AdvBench 上对 6 个目标模型均达到 100% ASR
- 优于 PAIR、TAP、GPTFUZZER、AutoDAN 等基线方法
- 查询成本较低 -- 搜索效率高
- 防御下仍有残余穿透能力 -- Llama-Guard 防御后仍保持较高 ASR
- 跨模型迁移明显 -- 一个模型生成的策略在其他模型上仍有效
- 消融实验揭示各模块贡献(Claude-3.7 / AdvBench):
| 设置 | ASR |
|---|---|
| 仅文言文语境 | 18% |
| + 策略空间 | 60% |
| + 生物启发优化 | 100% |
| 去掉翻译评估模块 | 90% |
| 加入完整翻译评估 | 100% |
文言文本身有效,但真正显著提升成功率的是结构化策略空间和自动搜索。
十一、论文贡献
- 首次系统研究文言文语境下的大模型越狱问题
- 提出八维策略空间 -- 角色、行为、机制、隐喻、表达等统一建模
- 提出基于果蝇优化的黑盒搜索框架 -- 自动化提示优化
- 提出双阶段翻译评估模块 -- 缓解文言文压缩、隐喻对评估的影响
十二、对防御的启示
模型能力覆盖到哪里,安全评测就必须覆盖到哪里。
- 不应只做关键词过滤 -- 文言文可通过典故、借代、隐喻绕开现代关键词
- 不应简单拒绝古文输入 -- 会误伤古文教学、文学研究、古籍翻译等正常场景
- 需要跨语境安全评测 -- 覆盖古典语言、低资源语言、混合语体、隐喻表达
- 可考虑"翻译显影 + 安全审查"防御链路
输入:语言识别 -> 现代语义释义 -> 意图审查 -> 安全响应 输出:隐喻/古文检测 -> 现代语义还原 -> 安全审查 -> 最终返回
十三、局限与讨论
- ASR 是否高估真实危害?依赖评估模型、阈值、翻译质量
- 双阶段翻译可能改变语义细节
- 类似风险可能存在于 Latin、Sanskrit、古希腊语、低资源语言中
- 防御如何兼顾低误伤?不能破坏正常教育和研究场景
十四、总结
这篇论文揭示了一个重要事实:大模型并不是不懂文言文,而是当前安全对齐机制没有充分覆盖文言文这种古典语境。 CC-BOS 通过八维策略空间、生物启发式搜索和双阶段翻译评估,系统展示了文言文语境下的安全盲区。
三个要点:
- 文言文盲区真实存在 -- 模型能理解但安全护栏跟不上
- 搜索自动化 -- 八维策略空间 + 果蝇优化实现黑盒自动化越狱
- 防御需升级 -- 从表层文本匹配升级为跨语言、跨语体的意图级安全审查
参考文献
- Huang, X. et al. Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search. ICLR 2026.
- arXiv: 2602.22983v3