罗盘 / 合成数据引发的模型崩溃
暗星档案 · 未点亮的星合成数据引发的模型崩溃
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
合成数据引发的模型崩溃T5 量级 · 新星
AI训练AI会不会把整个知识生态越训越窄
暗星编号DS-0762
轴R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
随着互联网上AI生成内容占比上升,未来的模型越来越可能训练在部分由AI生成的数据上;研究证实反复用模型自己的输出训练自己会导致「模型崩溃」——生成分布逐渐偏离真实分布、多样性坍缩、罕见但重要的信息被系统性遗忘。攻破意味着:找到可靠的合成数据检测与过滤机制、或让模型在混合真实/合成数据下依然保持分布保真,避免整个AI生态的知识多样性因递归自我训练而退化。
卡在哪 · 机制级卡点
即使很小比例的未过滤合成数据也会损害性能,且这种漂移是渐进且不易察觉的(污染发生在训练当下,症状要几代之后才明显);现有缓解方法(持续累积真实数据、定期混入真实样本)依赖持续获取足量真实数据,但互联网上真实数据的比例正在被合成内容稀释,形成结构性矛盾。
谁在攻
剑桥大学、牛津大学等联合团队(Shumailov等2024年Nature论文首次系统论证);后续学术界持续在arXiv发表缓解方法研究
怎么参与
读 Shumailov 等《AI Models Collapse When Trained on Recursively Generated Data》原始论文,在小模型上复现递归训练实验观察崩溃过程