AI-Workshop 文献分享 2026-06-06 21:30

AI-Workshop 文献分享 #1 — Old n-grams Never Die:利用 Antique n-gram 检测 LLM 生成文本

ltw 在首次 AI-Workshop 中分享 GramGuard——一种利用 antique n-gram 统计特征检测 LLM 生成文本的新方法。核心思路:不只看文本静态特征,而分析改写后的统计偏移轨迹。

AI-Workshop 文献分享 LLM检测 GramGuard n-gram

AI-Workshop 文献分享 #1 — Old n-grams Never Die

分享人:ltw | 日期:2026-06-06

论文:Old n-grams Never Die: Towards Identifying LLM-Generated Text using Antique n-grams 方法:GramGuard


一、论文解决的问题

这篇论文想解决的,不只是"能不能检测 AI 文本",而是:

在文本被改写、润色、降重之后,检测器还能不能稳住。

现实里很多 AI 文本检测器都有一个共性问题:原始 AI 文本可能能检测出来,但只要再让另一个模型改写一遍,效果就会明显下降;如果再换模型、换领域,表现会更不稳定。

作者换了一个角度:不只看"这段文本像不像 AI 写的",而看"这段文本在被改写之后,统计特征会怎么变化"。


二、核心思想

作者的直觉很有意思:

  • 传统的大模型检测器,本身可能已经被现代生成文本"污染"
  • 早期的 old n-gram 模型,训练时主要见到的是人类旧语料
  • 因此它们反而更像一个"纯人类写作分布的参考系"

通俗一点讲:不是找一个最时髦的老师来评分,而是拿一把很老、但标准没被现代生成套路带偏的尺子来量。


三、GramGuard 工作流程

1. 输入一段待检测文本

2. 让 LLM 对这段文本做多次改写

生成多个 paraphrase 版本——意思差不多、表达不同的改写文本。

3. 用 old n-gram 模型分别给原文和改写文打分

关注的不是单个分数,而是:

  • 原文的统计特征是什么
  • 改写之后这些统计特征怎么变了
  • 这个"变化轨迹"更像人类文本,还是更像 AI 文本

4. 把变化量交给轻量分类器做最终判断

  • KenLM:做 n-gram 统计评分
  • XGBoost:做最终二分类

四、核心特征

GramGuard 抓的是三类"变化量",不是简单看一句话顺不顺:

特征 含义
Log-likelihood 变化 改写之后,文字在"人类参考模型"里还顺不顺
Entropy 变化 改写之后,文本的不确定性有没有明显变化
Frequency variance 变化 改写之后,词频分布和重复习惯有没有暴露 AI 风格

关键不在于这些值本身,而在于它们从原文到改写文的偏移量


五、"行为检测"而非"外观检测"

这是这篇论文最值得讲的一点。

传统 detector 更像:看一眼这个人现在长什么样,然后猜他是不是 AI。

GramGuard 更像:先推它一下,再看它受力之后往哪边倒,根据这个反应来判断它更像谁。

它不只看到"这段话像不像 AI",而看到"这段话被改写之后,像不像 AI 的变化方式"


六、实验设置

项目 内容
数据集 PubMed(专业文本)、Writing(一般写作)、XSum(摘要)
改写模型 GPT-4.1-mini,温度 τ = 0.1
改写数量 每段文本生成 10 个改写版本
打分模块 KenLM
分类模块 XGBoost

一个很实在的工程结论:这套方案里,真正更花成本的不是最终分类,而是前面的多次改写。判别本身比较轻,成本主要在扰动生成阶段。


七、主要实验结果

最重要的结论不是"分数高",而是它在面对 paraphrase 攻击时更稳

  • 在多个数据集上达到或超过强基线
  • 在文本被改写之后,性能下降更慢
  • 在抗"润色攻击"方面更有优势

典型结果:在 XSum + GPT-4 场景下,AUC 接近 0.9990

作者真正希望读者记住的是——别人一改写就掉,我还能撑住


八、泛化能力

场景 平均 AUC 解读
Generator-OOD(没见过生成模型) 0.8381 跨模型更稳
Dataset-OOD(没见过文本领域) 0.7753 跨领域难度更大

总结:这套方法对"谁生成的"没那么敏感,但对"写的是什么领域"更敏感。


九、论文优点

  1. 思路新 — 用 old n-gram 作为人类分布基准,不沿着"更大的模型查更大的模型"走
  2. 可解释性强 — 不是黑盒端到端打分,能解释统计变化及其含义
  3. 对改写攻击更稳 — 把 paraphrase 本身变成了检测线索
  4. 结构轻量 — KenLM + XGBoost,工程可落地

十、局限

  1. 依赖核心前提:old human distribution 和 modern AI distribution 之间仍存在稳定差异。如果未来 AI 越来越像人,这个差异会被压缩。
  2. 跨领域泛化不如跨模型泛化稳。
  3. 成本不在判别器本体,而在前面的多次改写扰动。
  4. 更适合理解为一种新的检测视角,而非"一劳永逸的终极方案"。

十一、延伸讨论

Q:为什么不用更大的模型直接判?

这篇论文的价值就在于不把检测完全绑定到大模型本身,而是保留了一个更稳定、可解释的人类统计参考系。

Q:成本是不是很高?

成本主要来自多次改写,而不是 antique n-gram 打分本身。贵在前处理,不贵在判别器本体。

Q:如果未来 AI 更像人,这个方法会不会失效?

它的优势空间可能会被压缩,但研究价值仍然成立——它提供的是一种"行为轨迹检测"的框架,而不只是一个一次性的分数模型。


十二、总结

这篇论文最重要的贡献,不是又做了一个 detector,而是提出了一种更聪明的看法:判断一段文本,不只看它现在像谁,更看它被改写之后会怎么变。

三个要点:

  1. 用 old n-gram 模型作为"纯人类写作参考尺"
  2. 不看静态分数,而看改写前后的统计偏移
  3. 这个思路既轻量、可解释,又对改写攻击更稳

参考文献

  1. Zhang, Y. et al. Old n-grams Never Die: Towards Identifying LLM-Generated Text using Antique n-grams.
  2. Mitchell, E. et al. DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature.
  3. Bao, G. et al. Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature.
  4. Su, J. et al. NPR-Based Language Model Detection under Paraphrase Perturbation.