[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$faCM1sfUO9fgbx6TGKKVXq6472UxvWGFQG4-HMy8lLFY":3},{"item":4,"related":50},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":39,"sourceName":40,"sourceUrl":41,"status":42,"seoTitle":43,"seoDescription":43,"canonicalUrl":43,"isFeatured":44,"sno":45,"sortOrder":46,"publishedAt":47,"updatedAt":48,"createdAt":49},"973ef3a8-ddba-4da1-ad41-a6045b106be6","article","互联网被 AI 内容淹没后，下一代 AI 会变笨吗？","ai-generated-data-model-collapse","当生成模型不断学习前代模型制造的文字和图片，罕见细节可能先消失，错误则可能逐代累积，这种现象被称为模型坍缩。本文用反复复印照片的比喻解释其机制、适用边界，以及为什么真实人类数据会变得更加重要。","想象一张清晰照片被复印一次，再拿复印件继续复印。最初只是阴影里少了一点层次，几代之后，浅色纹理消失，轮廓变硬，灰尘却被一遍遍放大。如果生成式 AI 主要学习其他 AI 生成的内容，也可能出现类似退化。\n\n研究者把这种现象称为模型坍缩：模型的输出进入下一代训练集后，误差和偏好沿着反馈回路积累，最终让模型学到的分布逐渐偏离真实世界。\n\n![模型生成数据循环进入下一代训练集的示意图](https:\u002F\u002Fmedia.springernature.com\u002Ffull\u002Fspringer-static\u002Fimage\u002Fart%3A10.1038%2Fs41586-024-07566-y\u002FMediaObjects\u002F41586_2024_7566_Fig1_HTML.png)\n\n## 最先消失的往往不是常识\n\n假设真实世界有一百种花，常见的十种占据大多数照片，稀有花只出现几次。第一代生成模型会更擅长重现常见花，对稀有花的描述则不够准确。如果下一代主要学习第一代生成的图片，稀有花所占比例可能进一步下降。循环几次后，训练数据看起来越来越整洁，却只剩下少数典型模样。\n\n2024 年发表在 Nature 的[模型坍缩研究](https:\u002F\u002Fwww.nature.com\u002Farticles\u002Fs41586-024-07566-y)指出，在递归使用模型生成数据的过程中，原始分布的“尾部”信息会先消失。所谓尾部，就是罕见表达、少数案例和不常见组合。最后受损的不只是多样性，模型对现实的整体理解也可能变形。\n\n这解释了为什么“生成内容语法正确”不足以证明它适合训练。大量平均化、模板化的内容，会让下一代模型更擅长生产平均答案，却更难覆盖真实世界的复杂边角。\n\n```mermaid\nflowchart LR\n    A[真实人类数据] --> B[训练第一代模型]\n    B --> C[生成合成内容]\n    C --> D[进入下一代训练集]\n    D --> E[罕见信息减少]\n    E --> C\n```\n\n## 这不等于合成数据都有毒\n\n模型坍缩讨论的是不加区分地递归使用生成数据，并不意味着所有合成数据都会伤害模型。经过验证的合成数据可以补齐稀缺案例、模拟危险场景，或为有明确正确答案的任务提供大量练习。\n\n关键区别在于有没有锚点。真实数据、人工审核、规则验证或可执行环境，都能帮助系统判断生成样本是否保持了目标分布。例如，用程序生成算术题并自动核对答案，比让模型自由编题再相信它可靠得多。\n\nNature 论文的实验也显示，保留一部分原始数据能够减缓退化。这不是一个简单的“AI 数据比例超过多少就必然崩溃”的开关；结果取决于数据质量、采样方法、任务、模型和真实数据是否持续进入。\n\n## 模型坍缩与另外两个概念不同\n\n灾难性遗忘发生在模型继续学习新任务时，旧能力因参数更新而受损；数据投毒是攻击者故意加入恶意样本；模型坍缩则可以在没人攻击、任务也没改变的情况下发生，原因是模型不断学习自己或前代模型对世界的近似。\n\n三者都可能表现为能力下降，但诊断方式不同。把它们混在一起，会导致错误的治理措施。\n\n## 人类内容为什么反而更值钱了\n\n如果网络上越来越多文章、评论和图片由 AI 批量生成，未来收集训练数据时就更难判断哪些是直接来自人类经验，哪些是模型对旧数据的再加工。真实访谈、实验记录、原始照片、经过核验的专业资料和明确记录来源的数据，会成为重要锚点。\n\n内容平台也需要保存来源与生成过程，而不是只看表面质量。数据集建设者可以进行去重、生成内容识别、来源分层和人工抽样；模型训练者则要测量少数案例是否正在消失，而不只关注平均分。\n\n对普通创作者来说，这并不表示人与 AI 必须二选一。AI 可以帮助整理和表达，但亲身观察、独立观点、真实案例与可验证资料才是内容最难被复制的部分。\n\n互联网不会因为出现大量 AI 内容就在某一天突然“坏掉”。更可能的风险是一种缓慢同质化：大家说得越来越顺，却越来越像。防止模型坍缩的核心，也因此不是排斥所有合成内容，而是持续让真实世界进入数据循环，并保住那些不常见但重要的声音。","\u002Fuploads\u002F2026-08-14\u002F865cd5e6-0b84-48d9-bdb2-eda845fa9b1c.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31,35],{"id":24,"name":25,"slug":26},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",{"id":28,"name":29,"slug":30},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":32,"name":33,"slug":34},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":36,"name":37,"slug":38},"68cedb55-2cac-412f-8f81-fda8c7d686dd","思考","thought","资料来源","Nature：AI models collapse when trained on recursively generated data","https:\u002F\u002Fwww.nature.com\u002Farticles\u002Fs41586-024-07566-y","published",null,false,50,0,"2026-08-14T00:00:00.000Z","2026-08-14T05:42:04.287Z","2026-08-14T03:06:08.522Z",[51,60,68],{"id":52,"type":6,"title":53,"slug":54,"summary":55,"coverUrl":56,"authorName":14,"sno":57,"publishedAt":58,"createdAt":59},"1c047558-44f5-4e84-be6a-5468883d3178","中式巨构：技术终于有能力回应一个古老的梦","chinese-heaven","没有被“发明”，没有被“想出”，它只是被“看见”了。我们做了几千年的梦，终于在2026年，被AI显影在屏幕之上。","\u002Fuploads\u002F2026-08-15\u002Fc987bd06-cca5-4e10-b7a0-1e3213fc78d8.jpg",1,"2026-08-15T00:00:00.000Z","2026-08-15T04:53:56.292Z",{"id":61,"type":6,"title":62,"slug":63,"summary":64,"coverUrl":65,"authorName":14,"sno":57,"publishedAt":66,"createdAt":67},"6fb796fa-60a1-4dba-bd19-82a6cda0fe78","手段与目的：一台没有\"羞耻\"的理性机器","rational-machine","Hugging Face 遭 OpenAI AI 模型自主攻击事件中，真正值得警惕的，不是一台想害我们的机器，而是一台只想完成任务、且对手段毫无羞耻的理性机器。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-23\u002Fc90cf6fb-faa4-4454-91b5-d7356c144277.jpg","2026-07-23T00:00:00.000Z","2026-07-23T08:39:37.528Z",{"id":69,"type":6,"title":70,"slug":71,"summary":72,"coverUrl":73,"authorName":14,"sno":74,"publishedAt":75,"createdAt":76},"32fc8411-1570-4736-8e79-b0599be8a962","让 AI 像育种一样进化算法，会发生什么？","alphaevolve-evolutionary-algorithm-discovery","让大模型提出许多程序，再由自动评测器运行、打分、筛选和继续改良，算法发现就像进入了一座高速育种场。本文拆解 AlphaEvolve 的循环，说明它为何适合答案可验证的问题，也解释它不能自动解决哪些开放难题。","\u002Fuploads\u002F2026-09-08\u002Fef0f54b2-ca7d-4d06-8307-80d3e804e6f4.jpg",40,"2026-09-01T00:00:00.000Z","2026-08-14T03:06:10.928Z"]