罗盘 / 数据墙
暗星档案 · 未点亮的星

样本效率 · 数据墙

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

样本效率 · 数据墙T5 量级 · 新星
高质量人类文本临近耗尽,而人类儿童用百万分之一的数据就学会语言——当前 AI 范式的样本效率差着数量级。
暗星编号DS-0302
E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

今天的大模型靠吞下几乎全部高质量人类文本获得能力,而这类数据正临近耗尽。与此对照,一个人类儿童只用极少的语言输入就掌握了母语——说明存在一种样本效率高出数个数量级的学习方式,只是我们还不掌握。这是 AI 能力前沿的文明级方向:突破它意味着智能不再受制于人类历史积累的数据总量,学习从「靠海量」转向「靠会学」。攻破它解锁的是可持续、且不依赖数据规模的智能增长路径。

卡在哪 · 机制级卡点

卡在算法本身:没有一种可扩展的学习范式能像生物那样从少量经验中提炼出同等泛化能力;用合成数据补墙又面临模型自噬——反复用自己生成的数据训练会导致分布退化、质量崩塌。低数据高泛化的学习原理仍是未解之谜。

谁在攻

Epoch AI(数据耗尽测算)、BabyLM 挑战赛(学界低数据学习)、OpenAI/Anthropic/微软 Phi 系列(合成数据路线)

怎么参与

读机器学习理论/认知科学交叉方向,参与 BabyLM 一类的低数据学习挑战赛,或进做样本效率与合成数据退化的研究组。子问题切入:在严格受限的数据预算下,什么样的归纳偏置或自监督目标能逼近人类的学习效率——这是学界可小规模验证、不必拼算力的切口。

谁在攻这颗暗星 · 攻关者名录7 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研3
亚历克斯·沃斯塔特Alex Warstadt计算语言学研究者
加州大学圣地亚哥分校 / 原苏黎世联邦理工(BabyLM 联合发起人)
BabyLM 挑战赛联合发起人,推动在儿童量级数据预算下训练语言模型,直击样本效率差数量级的问题。
列舍姆·乔申Leshem Choshen研究员
MIT-IBM Watson AI Lab(BabyLM 组织者)
BabyLM 挑战赛联合组织者,聚焦低数据、高泛化的预训练方法与评测。
塔尔·林岑Tal Linzen语言与认知计算副教授
纽约大学(NYU)
研究语言模型学习与人类语言习得的对照,参与 BabyLM 方向,攻样本效率的认知科学切口。
INDUSTRY业界 · 创业与工程2
塞巴斯蒂安·布贝克Sébastien BubeckAI 研究者
OpenAI(原微软 Phi 系列负责人)
主导微软 Phi 小模型系列与《Textbooks Are All You Need》,探索用高质量/合成数据提升样本效率的路线。
伊利亚·舒迈洛夫Ilia Shumailov研究员
Google DeepMind
「模型自噬 / 递归诅咒」(model collapse)论文主要作者,揭示反复用合成数据训练导致分布退化,界定了以合成数据补数据墙的核心风险。
THIRD PARTY第三方 · 政策/资助/倡导2
海梅·塞维利亚Jaime Sevilla主任
Epoch AI
领导 Epoch AI 对高质量训练数据耗尽时点的定量测算,界定并量化了「数据墙」这一文明级问题。
巴勃罗·维拉洛沃斯Pablo Villalobos研究员
Epoch AI
《Will we run out of data?》数据耗尽测算论文主要作者,给出高质量人类文本枯竭的时间线预测。

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 3

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

DatologyAI初创
2023 创 · A 轮(累计约 $57.6M,Amplify Partners 领投) · 红木城,美国
自动化训练数据的筛选与整备(data curation),让模型用更少、更对的数据训得更快更小更好,直击样本效率
↗ 创始人 Ari Morcos 系 DeepMind/Meta FAIR 前研究员的明星团队;其 BeyondWeb 合成数据研究把万亿级预训练做出显著增益,是撞数据墙的正面解之一
Collinear AI初创
融资未披露 · 美国
用小型专用评审模型为前沿推理模型逐样本打分(正确性/推理质量/复杂度/可读性),做高质量后训练数据整备
↗ 创始人 Nazneen Rajani 系 HuggingFace 前研究主管;专攻「后训练数据整备」这块被称为企业级 AI 秘密武器的窄切口
Lightly初创
苏黎世,瑞士(ETH 背景)
自监督驱动的数据整备工具 LightlyOne,从海量数据自动挑出多样、有代表性的样本、降冗余
↗ ETH 苏黎世背景的欧洲数据整备公司,把「用更少但更有价值的数据训练」产品化——欧洲这条线上不那么出名却对口的玩家
BabyLM Challenge科研实验室
学界挑战赛 · 国际
在严格受限(儿童级)数据预算下比拼样本效率学习,逼问什么归纳偏置能逼近人类学习效率
↗ 低数据高泛化研究的开放入口,小规模可验证、不拼算力——个人研究者切入样本效率的最现实闸门
Epoch AI非营利
研究机构 · 美国/远程
测算全球高质量文本数据总量(约 300 万亿 token)与耗尽时间线(约 2028 年前枯竭),量化「数据墙」
↗ 「数据墙」这一概念的权威测量来源,给全行业定坐标——判断该方向临界性的必读锚点

来源 · 可查证