罗盘 / AI评估科学
暗星档案 · 未点亮的星

AI 评估科学 · 能力预测

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

AI 评估科学 · 能力预测T6 量级 · 行星
把「这个模型会什么、危险在哪」从事后发现变成部署前可预测的科学——AI 时代的风洞试验。
暗星编号DS-0312
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

飞机上天前先进风洞,桥梁通车前先做载荷试验,而今天最强的 AI 系统在部署前,没有人能可靠预测它会涌现什么能力、藏着什么危险——评估基本靠事后踩坑。AI 评估科学要做的,是建立从训练配方到能力边界的可预测映射:给定算力、数据和架构,部署前就能给出能力与风险的定量预报。这是所有 AI 治理决策的测量地基——没有可信的测量,任何监管红线、国际协议、部署门槛都是在沙地上画线。攻破它,AI 发展就从「先上线再灭火」变成有仪表盘可依的工程学科。

卡在哪 · 机制级卡点

能力涌现难以从小模型外推,缩放曲线在关键能力上会突然拐弯;评测基准发布即饱和,且极易通过训练数据污染失效;「模型考试得分」与「真实世界危险能力」之间的效度鸿沟至今没有严格方法学。整个领域更像早期心理测量学,缺一套自己的统计与实验范式。

谁在攻

METR、英国 AI 安全研究所(AISI)、Epoch AI、美国 CAISI,以及各前沿实验室内部的评估团队

怎么参与

读方向:机器学习 + 统计学/心理测量学,重点补缩放律与实验设计。切入点:做一个抗污染、抗饱和的窄域危险能力评测,并验证其对更大模型的预测效度——这类工作 METR、AISI、Epoch 都在公开招人,且不需要巨额算力,是年轻人杠杆最高的 AI 安全入口之一。

谁在攻这颗暗星 · 攻关者名录7 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研1
梁培(Percy Liang)Percy Liang副教授、基础模型研究中心(CRFM)主任
斯坦福大学
主持 HELM(语言模型整体评估)框架,把「模型会什么」的测量从零散基准推向系统化、多维度的评估科学。
INDUSTRY业界 · 创业与工程2
贾里德·卡普兰Jared Kaplan联合创始人 / 首席科学家
Anthropic
神经网络缩放律奠基论文的核心作者,为「从算力/数据预测能力」这一评估科学地基提供了最早的定量映射。
杰森·魏Jason Wei研究员
OpenAI(曾在 Google Brain)
「涌现能力」(Emergent Abilities of LLMs)论文一作,直接定义了本暗星最硬的科学问题——能力涌现为何难以从小模型外推。
THIRD PARTY第三方 · 政策/资助/倡导4
贝丝·巴恩斯Beth Barnes创始人兼 CEO
METR(Model Evaluation & Threat Research)
创立并领导 METR,专攻前沿模型危险能力(自主性、自我复制等)的部署前评测,是 attackers 名单中 METR 的核心人物。
海梅·塞维利亚Jaime Sevilla主任
Epoch AI
领导 Epoch AI 对算力、数据、缩放趋势与模型能力的定量研究,为「从训练配方外推能力边界」提供实证与基准。
伊恩·霍加斯Ian Hogarth主席
英国 AI 安全研究所(AISI)
创建并主持英国 AISI,把政府级前沿模型评测建成建制化机构,是 attackers 名单中 AISI 的领衔者。
丹·亨德里克斯Dan Hendrycks主任 / 基准作者
Center for AI Safety(CAIS)
MMLU、MATH 等广泛使用的能力基准的作者,持续构造抗饱和的危险能力评测,是评估方法学的高产推动者。

去哪家 · 机构与公司名录6 家 · 其中初创/成长期 2

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Haize Labs初创
2023 创 · 种子轮(约 $100M 估值) · 美国纽约
用机器学习自动对 AI 模型做压力测试/红队,发现越狱与有害输出漏洞
↗ 哈佛班底(Leonard Tang 等);系统被 Anthropic、AI21、OpenAI 用于越狱测试其 o1 模型——把「充分能力引诱」(避免因引诱不足而低报风险)做成自动化产品
Gray Swan AI初创
2023 创 · A 轮 $40M · 美国(CMU 分拆)
AI 安全评估平台,持续探测模型的越狱、提示注入、有害输出等对抗性弱点
↗ CMU 分拆,成果被 Anthropic/OpenAI/Meta 报告引用;靠公开对抗竞技场(arena)众包越狱数据,把危险能力评估变成持续、规模化的红队流水线
METR (Model Evaluation & Threat Research)非营利
2023 创 · 独立非营利 · 美国加州伯克利
做前沿模型的自主性/危险能力评估,提出「任务时间跨度」等可外推的能力度量
↗ 第三方独立评估的标杆机构,Anthropic/OpenAI 部署前评估的外部方;把「模型能独立完成多长的人类任务」做成可预测的缩放曲线,是评估科学化最有影响力的一步
Apollo Research非营利
2023 创 · 非营利(Rethink Priorities 财政托管) · 英国伦敦
专攻「欺骗性对齐」的行为评估与可解释性,审计真实模型是否会策略性欺骗
↗ 把「模型会不会骗评估者」做成可测试的方法学——直击评估科学最难的效度鸿沟(考试得分 vs 真实危险能力),已发现前沿模型在测试中隐藏能力的证据
Transluce非营利
2024 创 · 非营利研究实验室(募资目标 $11M) · 美国旧金山
做自动化 AI 监督工具,其 Docent 框架用于大规模分析 AI 智能体行为
↗ Jacob Steinhardt(伯克利)+ Sarah Schwettmann(MIT CSAIL)创立;Docent 已被 25+ 机构使用(含 Anthropic/DeepMind/METR/政府评估方)——把评估从人工踩坑升级为可扩展的自动化监督基础设施
Epoch AI非营利
2022 创 · 独立非营利(捐赠支持) · 分布式(总部美国)
追踪与预测 AI 进展,建 FrontierMath 等抗饱和基准,做算力/数据缩放趋势分析
↗ FrontierMath(60+ 数学家含 14 位 IMO 金牌、1 位菲尔兹奖参与)专治「基准发布即饱和」——顶级模型只解出不到 2%,是少数没被刷爆的评估,直接支撑能力预测这门科学

来源 · 可查证