对照人类新闻与模型文本后,AI文风线索与常见印象并不相同。
大型语言模型能模仿诗歌、新闻、公司公文和不同作家风格,每分钟生成数千字。AI文字已经进入邮件、LinkedIn、网站、学生论文和科研文章。识别它并不能依赖某一个词或标点,因为人类作家也有强烈习惯,不同模型之间也没有统一风格。
检测公司Pangram声称准确率达到99.98%,并与Substack合作,但检测器通常是不给出理由的黑箱,也会产生误报。简单统计可疑词,或比较大型语言模型普及前后的论文,同样难以把模型偏好与人类语言趋势分开。
为建立更可靠的比较,研究让OpenAI的ChatGPT、Anthropic的Claude、Google的Gemini和xAI的Grok根据摘要改写同一批新闻,不允许访问网络。人类基线采用确定由编辑撰写的新闻,再与CNN、New York Times、Washington Post以及1950到2022年畅销小说节选交叉比较。语料总计55940个句子和120万词。
结果显示,AI文本确实能从词汇、标点、句子和段落结构上区分,但线索会随模型更新变化。过去常见的delve和rich tapestry已减少,当前模型更爱使用significant、increasingly和consequences等多音节词,也偏好interdependence、reindustrialisation等罕见词,以及parameter、methodology等科学术语。它们还常把动词名词化,用expansion代替expand。Gemini和Claude尤其明显。
这些词接近George Orwell批评的“矫饰用语”,即用复杂、源自拉丁语或希腊语的词包装简单意思。常见印象还认为AI滥用长破折号,但最新模型中只有Claude比人类用得更多,ChatGPT反而明显更少。更有效的线索可能是标点整体偏少。模型少用逗号、分号和括号,也较少引用专家。
AI句子通常更长,短促句很少单独打断段落。为了制造生动感,模型偏爱“不是甲而是乙”“不但而且”和三项并列。ChatGPT和Claude每1000句使用这些结构的频率高于其他模型与人类。长句与and的高频使用也相互关联。
这些指纹不是永久规则。模型从人类写作和反馈中学习,会迅速放弃被批评的习惯。Pangram目前能识别实验文本,未来可能更困难。因此,单凭一个delve或一道破折号指控作者使用AI并不可靠。更合理的方法是寻找多项统计特征,并承认检测结论始终存在不确定性。
原文:https://www.economist.com/culture/2026/07/30/how-to-spot-ai-writing