AI 评估科学 · 能力预测
本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
飞机上天前先进风洞,桥梁通车前先做载荷试验,而今天最强的 AI 系统在部署前,没有人能可靠预测它会涌现什么能力、藏着什么危险——评估基本靠事后踩坑。AI 评估科学要做的,是建立从训练配方到能力边界的可预测映射:给定算力、数据和架构,部署前就能给出能力与风险的定量预报。这是所有 AI 治理决策的测量地基——没有可信的测量,任何监管红线、国际协议、部署门槛都是在沙地上画线。攻破它,AI 发展就从「先上线再灭火」变成有仪表盘可依的工程学科。
能力涌现难以从小模型外推,缩放曲线在关键能力上会突然拐弯;评测基准发布即饱和,且极易通过训练数据污染失效;「模型考试得分」与「真实世界危险能力」之间的效度鸿沟至今没有严格方法学。整个领域更像早期心理测量学,缺一套自己的统计与实验范式。
METR、英国 AI 安全研究所(AISI)、Epoch AI、美国 CAISI,以及各前沿实验室内部的评估团队
读方向:机器学习 + 统计学/心理测量学,重点补缩放律与实验设计。切入点:做一个抗污染、抗饱和的窄域危险能力评测,并验证其对更大模型的预测效度——这类工作 METR、AISI、Epoch 都在公开招人,且不需要巨额算力,是年轻人杠杆最高的 AI 安全入口之一。
谁在攻这颗暗星 · 攻关者名录7 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
去哪家 · 机构与公司名录6 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。