罗盘 / 机器学习实验可复现性危机
暗星档案 · 未点亮的星

机器学习实验可复现性危机

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

机器学习实验可复现性危机T4 量级 · 亮星
论文说效果很好,换个人跑却复现不出来
暗星编号DS-0775
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

机器学习研究普遍存在论文结果无法被独立复现的问题——原因包括代码或数据不公开、训练条件(随机种子、硬件、超参数)对结果敏感、验证方法论术语混乱等。攻破意味着:建立起让顶会论文结果能被独立第三方稳定复现的工程与制度规范,让科学进展真正建立在可验证的基础上,而不是「谁的论文写得漂亮就先信」。

卡在哪 · 机制级卡点

对于最前沿的大模型研究,复现的障碍已不只是「代码没公开」,而是训练所需的算力和数据规模本身就让绝大多数团队无法复现(哪怕代码全公开)——这是结构性的资源门槛问题;此外硬件和软件层面的不确定性(GPU并行计算的非确定性)让「完全比特级复现」在理论上就很难实现,学界对「多大误差范围内算复现成功」也无共识。

谁在攻

普林斯顿大学(2025年8月举办Machine Learning Reproducibility Challenge会议);学术界持续在AI Magazine等期刊发表复现性综述研究

怎么参与

参与 ML Reproducibility Challenge,选一篇近期论文尝试独立复现其核心实验结果