AI-Workshop 文献分享 #1 — Old n-grams Never Die
分享人:ltw | 日期:2026-06-06
论文:Old n-grams Never Die: Towards Identifying LLM-Generated Text using Antique n-grams 方法:GramGuard
一、论文解决的问题
这篇论文想解决的,不只是"能不能检测 AI 文本",而是:
在文本被改写、润色、降重之后,检测器还能不能稳住。
现实里很多 AI 文本检测器都有一个共性问题:原始 AI 文本可能能检测出来,但只要再让另一个模型改写一遍,效果就会明显下降;如果再换模型、换领域,表现会更不稳定。
作者换了一个角度:不只看"这段文本像不像 AI 写的",而看"这段文本在被改写之后,统计特征会怎么变化"。
二、核心思想
作者的直觉很有意思:
- 传统的大模型检测器,本身可能已经被现代生成文本"污染"
- 早期的 old n-gram 模型,训练时主要见到的是人类旧语料
- 因此它们反而更像一个"纯人类写作分布的参考系"
通俗一点讲:不是找一个最时髦的老师来评分,而是拿一把很老、但标准没被现代生成套路带偏的尺子来量。
三、GramGuard 工作流程
1. 输入一段待检测文本
2. 让 LLM 对这段文本做多次改写
生成多个 paraphrase 版本——意思差不多、表达不同的改写文本。
3. 用 old n-gram 模型分别给原文和改写文打分
关注的不是单个分数,而是:
- 原文的统计特征是什么
- 改写之后这些统计特征怎么变了
- 这个"变化轨迹"更像人类文本,还是更像 AI 文本
4. 把变化量交给轻量分类器做最终判断
- KenLM:做 n-gram 统计评分
- XGBoost:做最终二分类
四、核心特征
GramGuard 抓的是三类"变化量",不是简单看一句话顺不顺:
| 特征 | 含义 |
|---|---|
| Log-likelihood 变化 | 改写之后,文字在"人类参考模型"里还顺不顺 |
| Entropy 变化 | 改写之后,文本的不确定性有没有明显变化 |
| Frequency variance 变化 | 改写之后,词频分布和重复习惯有没有暴露 AI 风格 |
关键不在于这些值本身,而在于它们从原文到改写文的偏移量。
五、"行为检测"而非"外观检测"
这是这篇论文最值得讲的一点。
传统 detector 更像:看一眼这个人现在长什么样,然后猜他是不是 AI。
GramGuard 更像:先推它一下,再看它受力之后往哪边倒,根据这个反应来判断它更像谁。
它不只看到"这段话像不像 AI",而看到"这段话被改写之后,像不像 AI 的变化方式"。
六、实验设置
| 项目 | 内容 |
|---|---|
| 数据集 | PubMed(专业文本)、Writing(一般写作)、XSum(摘要) |
| 改写模型 | GPT-4.1-mini,温度 τ = 0.1 |
| 改写数量 | 每段文本生成 10 个改写版本 |
| 打分模块 | KenLM |
| 分类模块 | XGBoost |
一个很实在的工程结论:这套方案里,真正更花成本的不是最终分类,而是前面的多次改写。判别本身比较轻,成本主要在扰动生成阶段。
七、主要实验结果
最重要的结论不是"分数高",而是它在面对 paraphrase 攻击时更稳。
- 在多个数据集上达到或超过强基线
- 在文本被改写之后,性能下降更慢
- 在抗"润色攻击"方面更有优势
典型结果:在 XSum + GPT-4 场景下,AUC 接近 0.9990。
作者真正希望读者记住的是——别人一改写就掉,我还能撑住。
八、泛化能力
| 场景 | 平均 AUC | 解读 |
|---|---|---|
| Generator-OOD(没见过生成模型) | 0.8381 | 跨模型更稳 |
| Dataset-OOD(没见过文本领域) | 0.7753 | 跨领域难度更大 |
总结:这套方法对"谁生成的"没那么敏感,但对"写的是什么领域"更敏感。
九、论文优点
- 思路新 — 用 old n-gram 作为人类分布基准,不沿着"更大的模型查更大的模型"走
- 可解释性强 — 不是黑盒端到端打分,能解释统计变化及其含义
- 对改写攻击更稳 — 把 paraphrase 本身变成了检测线索
- 结构轻量 — KenLM + XGBoost,工程可落地
十、局限
- 依赖核心前提:old human distribution 和 modern AI distribution 之间仍存在稳定差异。如果未来 AI 越来越像人,这个差异会被压缩。
- 跨领域泛化不如跨模型泛化稳。
- 成本不在判别器本体,而在前面的多次改写扰动。
- 更适合理解为一种新的检测视角,而非"一劳永逸的终极方案"。
十一、延伸讨论
Q:为什么不用更大的模型直接判?
这篇论文的价值就在于不把检测完全绑定到大模型本身,而是保留了一个更稳定、可解释的人类统计参考系。
Q:成本是不是很高?
成本主要来自多次改写,而不是 antique n-gram 打分本身。贵在前处理,不贵在判别器本体。
Q:如果未来 AI 更像人,这个方法会不会失效?
它的优势空间可能会被压缩,但研究价值仍然成立——它提供的是一种"行为轨迹检测"的框架,而不只是一个一次性的分数模型。
十二、总结
这篇论文最重要的贡献,不是又做了一个 detector,而是提出了一种更聪明的看法:判断一段文本,不只看它现在像谁,更看它被改写之后会怎么变。
三个要点:
- 用 old n-gram 模型作为"纯人类写作参考尺"
- 不看静态分数,而看改写前后的统计偏移
- 这个思路既轻量、可解释,又对改写攻击更稳
参考文献
- Zhang, Y. et al. Old n-grams Never Die: Towards Identifying LLM-Generated Text using Antique n-grams.
- Mitchell, E. et al. DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature.
- Bao, G. et al. Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature.
- Su, J. et al. NPR-Based Language Model Detection under Paraphrase Perturbation.