最危险的 AI 未来也许不是机器突然拥有意志,而是它变得极其流畅、极其平均,同时悄悄忘掉世界原本那些罕见、古怪和不合群的部分。
一台复印机复印另一台复印机
想象一张细节丰富的旧照片。第一次复印时,看起来几乎没有区别;第二十次之后,暗部糊成一片,细小纹理消失,边缘只剩下高对比度的轮廓。生成式模型反复学习生成式内容,可能经历类似的统计损耗。
2024 年发表于《Nature》的研究把这种退化称为“模型坍塌”。实验和理论分析显示,如果后续模型不加区分地学习前代模型生成的数据,原始分布的长尾会率先消失;反复迭代后,模型对现实的理解可能越来越窄。
先消失的,往往是小概率的人
“长尾”听起来像抽象的统计术语,其实对应着具体的世界:少数语言、不常见的表达、地方经验、罕见疾病、非主流审美,以及一个人只有在真正生活过之后才会写出的句子。
模型倾向生成高概率内容,而高概率内容再次成为训练材料时,主流模式获得更多复制机会。平均值越来越稳定,边缘越来越安静。问题不只是模型会不会胡说,而是它可能再也不知道某些真实事物曾经存在。
研究讨论的是“不加区分地递归训练”,并不意味着使用合成数据必然有害。经过验证、带有明确任务目标的合成数据仍然很有价值;危险来自来源不明、比例失控和没有真实数据锚点。
互联网不会立刻变成废墟
把这项研究解释成“AI 马上会把互联网毁掉”同样过度。现实训练流程会去重、过滤、标注来源,也会混入新的真实数据。论文中的一个实验还发现,每代保留一部分原始数据,退化可以明显减轻。
更准确的结论是:数据谱系将成为模型能力的一部分。未来最有价值的资产可能不是“更多文本”,而是能够证明由谁、在什么情境下、为何产生的真实记录。
人类写作因此变得更值钱
当廉价的正确句子随处可得,写作的价值会从“把话说通顺”迁移到另外几件事:亲自观察、承担判断、保留出处、说出少数经验,以及愿意承认不知道。
- 记录一手过程,而不只总结别人已经总结过的结论。
- 保留失败、犹豫和例外,它们往往正是长尾所在。
- 标明哪些段落由 AI 协助,哪些判断来自作者本人。
- 引用可追溯的来源,让文字重新连接现实。
真正稀缺的不是内容,而是接触现实
AI 可以帮助我们写得更快,却不能替我们度过一个下午、照顾一个人、调试一次事故、走进一条陌生街道。未来网络中最难伪造的东西,可能就是一个人确实在那里,并且认真看过。
资料来源
- Shumailov 等,AI models collapse when trained on recursively generated data,《Nature》(2024)
- Zhou 等,Larger and more instructable language models become less reliable,《Nature》(2024)