研究表明网络内容正被AI快速占据。人们在阅读AI文本的同时,也在日常表达中悄然模仿AI用词,双方语言正走向融合。

当我们说话越来越像AI,究竟谁在模仿谁

网络上的文字正在悄然发生改变。皮尤研究中心近期进行了一项调查,随机抽取了过去5年中发布的10000个英文网页,并使用AI检测工具Open Pangram进行分析。结果令人吃惊,约10%的网页带有明显的AI写作痕迹。如果只看2022年年底ChatGPT发布之后新建的网页,这一比例更是高达35%,意味着超过三分之一的网络新内容出自AI之手。

为什么AI写出来的文字能被识别出来?因为大型语言模型的训练素材大量来自学术论文和新闻报道,导致生成的文本偏向正式。研究人员分析了自2023年以来的490000个网页,总结出AI文本的几大显著特征,包括经常使用牛津逗号、偏爱否定平行结构,以及特定词汇使用频率的激增。自2023年以来,包括crucial、enhance、garner、intricate、meticulous、significant和tapestry在内的近30个词语,出现频率增长了一倍以上。

不过,这并不单单意味着AI正迅速吞噬网络世界,还有另一种可能,即人类的说话和写作方式正在被聊天机器人悄悄改变。这种现象在语言学中被称为“词汇同化”,也就是人们会不自觉地模仿长期接触对象的语言习惯,无论对方是朋友、同事还是AI。

马克斯·普朗克人类发展研究所的Hiromu Yakura及其团队对此进行了深入研究。他们分析了超过820000集播客节目中总时长达730000小时的即兴对话,发现有20个ChatGPT偏爱的词汇在人类自发口语中的使用率突然暴增,其中包括boast、bolster、delve、intricate、meticulous、showcase和underscore等。为了确认因果关系,研究人员还开展了一项对照实验,结果表明,仅需与聊天机器人进行短暂互动,受试者就会在接下来的图像描述任务中主动使用AI刚才用过的词汇。这证实了聊天机器人确实在直接塑造人类的表达方式。

这种语言同化现象在2023年至2024年年中经历了一段快速增长期,但随后趋于平稳甚至略有下降。这可能是因为人们开始意识到某些过度使用的“AI招牌词”(例如delve)显得过于机械,从而在日常表达中主动加以回避。

与此同时,OpenAI和Anthropic等公司开发的大型语言模型也在持续迭代。更新后的模型不断吸收最新的网络文本,而这些文本本身就已经融入了人类模仿AI之后的语言习惯。在这种双向互动的共同演化下,人类与AI的语言界限正在变得越来越模糊,未来或许将再难区分彼此。

原文:https://www.psychologytoday.com/us/blog/small-talk-and-big-questions/202609/are-we-beginning-to-sound-like-the-chatbots-we-talk-to