罗盘 / 涌现能力可预测性框架
暗星档案 · 未点亮的星

涌现能力可预测性框架

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

涌现能力可预测性框架T6 量级 · 行星
提前算出模型规模化后会长出什么新能力,而非训完才发现
暗星编号DS-0994
E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

大模型在跨过某个规模阈值后会'突然'出现小模型不具备的能力(如多步推理),传统scaling law只能预测loss等连续指标,对这类跳变式能力基本失灵。研究者正尝试用proxy task(小规模代理任务)、高分辨率指标(如PassUntil)、观测性scaling law等方法,把'涌现是否可预测'从哲学争论变成可验证的工程问题。攻破意味着实验室能在投入千万美元训练前,较准确预判新模型会解锁哪些能力、在哪个规模出现,大幅降低盲目扩规模的浪费与风险(也包括危险能力的提前预警)。

卡在哪 · 机制级卡点

涌现现象本身是否'真实存在'尚有争议(部分学者认为是评价指标的非线性伪影,换成连续指标涌现就消失);现有代理任务与真实大规模能力的相关性未经充分验证;缺乏跨架构、跨模态通用的预测方法论。

谁在攻

斯坦福大学(Sanmi Koyejo等'涌现是海市蜃楼'论文团队)、UC伯克利、以及OpenAI/Anthropic内部scaling law研究团队(公开论文可查,具体内部进展不可查证)

怎么参与

读arXiv《Predicting Emergent Capabilities by Finetuning》复现小规模代理任务实验