← 罗盘

可扩展监督 / 对齐理论根本未解

R 红线理论杠杆 极高·顶格证据 ★★★★☆
当 AI 能力超人、它的输出人类已无法验证(没有 ground truth)时,我们靠什么持续判断它是否对齐?监督一旦不可扩展,上层所有控制、评测都建在沙上。
更强 AI 的复杂输出经分解与互审后交由人类裁决,并形成仍待验证的监督反馈回路

为什么是文明级瓶颈

为什么高杠杆(R 轴总闸·顶格)

谁在攻 (已核实到一手源 · 2026-06)

Anthropic · Alignment Science前沿实验室

系统攻可扩展监督、对抗鲁棒性、AI control、model organisms、机制可解释性、model welfare。Anthropic Fellows Program 2026 年 5 月、7 月两批开放:周 stipend + 约 $15k/月算力 + 研究员一对一带。

Redwood Research非营利 · AI Control 议程

2023 ICML《AI Control: Improving Safety Despite Intentional Subversion》开创"AI 控制"框架:用受信任模型监控、有限人工审计、不受信任模型交叉监控——即便模型有意颠覆也能压低风险。已被业界与学界当作缓解灾难风险的 bedrock 路径。

UK AISI · The Alignment Project英国政府主导 · 全球基金

全球最大的政府主导对齐研究基金之一:2025-7 启动,首轮 £27M 投 60+ 项目(每项目至多 £1M),OpenAI / Microsoft 加入国际联盟。第二轮预计 2026 夏重开,经 AISI 官网在开放窗口申请。

MATS(ML Alignment & Theory Scholars)人才主管道

把有志者系统导入对齐领域的主管道:10 周(Berkeley / London)+ 可申 6-12 月资助延期,导师来自 Anthropic / OpenAI / DeepMind / Redwood / ARC 等。录取率约 4-7%、高度竞争——年轻人进对齐的第一台阶。

如何参与

  • 投身 / 求职(年轻人首选):MATS(主管道)→ Anthropic Fellows / Redwood / UK AISI 资助项目。
  • 资助:UK AISI Alignment Project(政府)、Open Philanthropy / Coefficient Giving 的技术 AI 安全 RFP。
  • 关注 / 了解:Anthropic Alignment Science 博客、AI Alignment Forum、International AI Safety Report(Bengio)。
诚实标注:对齐理论本身是地基级开放缺口——"监督超人系统的正确目标函数与泛化保证应长什么样",前人也没答(debate/IDA 全未大规模实证)。这里"谁在攻"高度可核实(★★★★☆),但"问题能否解、何时解"是真未知。⚠️ 别被"现在的模型挺乖"误导:当前对齐不能外推到 long-horizon RL 训练的超人 agent。

来源:Redwood AI Control(ICML 2023)/ UK AISI The Alignment Project / MATS / Anthropic Alignment Science · 2026-06 核实 · 待红蓝过证据 + 验收

谁在攻这颗暗星 · 攻关者名录9 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。含科研、创业与第三方三类关键角色,初评待核实

ACADEMIA学界 · 科研2
斯图尔特·罗素Stuart Russell教授 / CHAI 主任
加州大学伯克利分校(人本兼容 AI 中心 CHAI)
以《Human Compatible》提出'辅助博弈/不确定目标'对齐范式,是把对齐作为独立学术领域确立起来的代表人物。
雅各布·斯坦哈特Jacob Steinhardt副教授
加州大学伯克利分校
研究模型可预测性、涌现失控与可扩展监督的实证基础,是把对齐理论落到可测量实验的一线学者。
THIRD PARTY第三方 · 政策/资助/倡导4
保罗·克里斯蒂亚诺Paul Christiano对齐理论奠基者 / AI 安全研究主管
美国 AI 安全研究所(US AI Safety Institute)/ 曾创办 ARC
提出 RLHF、迭代放大(IDA)与 AI 辩论等可扩展监督核心范式,是'当 AI 超出人类可验证范围后如何持续监督'这一问题的主要理论奠基人。
杰弗里·欧文Geoffrey Irving首席科学家
英国 AI 安全研究所(UK AI Safety Institute)
'AI 辩论'(AI safety via debate)方法的提出者之一,专攻用博弈式对抗让人类在无法直接验证时仍能判断 AI 输出是否可信。
巴克·施莱格里斯Buck ShlegerisCEO
Redwood Research
主攻'AI 控制'(AI control)——即便模型未必对齐也要设计能防其暗中作恶的监督与红队机制,是可扩展监督的工程化补充路线。
埃利泽·尤德科夫斯基Eliezer Yudkowsky联合创始人 / 研究员
机器智能研究所(MIRI)
最早系统提出超人类 AI 对齐难题与'一次做对'风险论证,长期从纯理论层面推动对齐问题被严肃对待。

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2

给求职者和投资人的信息增量——更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先,初评待核实)。

Goodfire初创
B轮($150M,估值$12.5亿) · 美国 旧金山
用可解释性(interpretability)去理解、学习并'设计'AI 模型,做可读懂模型内部的 Ember 平台
↗ 2026 年 $150M B 轮、估值 $12.5 亿;团队集齐 DeepMind 可解释性团队联创 Tom McGrath、稀疏自编码器先驱 Lee Sharkey、OpenAI 可解释性团队开创者 Nick Cammarata——可解释性赛道唯一独角兽
Haize Labs初创
自动化红队/对抗测试,系统性地'压力测试'并暴露大模型的失效与不安全输出
把红队做成可规模化产品,是 Goodfire Ember 平台的合作方之一——从对抗面切入可扩展监督的年轻初创
Apollo Research非营利
英国 伦敦
专攻 AI 欺骗性行为的评测与可解释性研究,为前沿模型做'是否在策略性欺骗/对齐造假'的独立评估
↗ 在'模型会不会阴奉阳违'这个可扩展监督核心难题上是最被引用的独立评测机构之一,多次给前沿实验室做部署前 deception 评估
Transluce非营利
开源、公益的 AI 可解释性与监督工具研究,做能自动揭示模型内部行为、帮人类监督更强模型的工具
↗ 由 Jacob Steinhardt 等发起的非营利实验室,主攻'当 AI 太强、人看不过来时怎么监督'——正对这颗暗星的 R 轴总闸问题
Redwood Research非营利
美国 伯克利(CA)
专注 AI 控制(AI control)与对齐的应用型研究,研究即使模型不完全对齐也能安全使用它的机制
把'可扩展监督'具体化为'AI control'议程(假设模型可能不对齐,仍设计防线),在技术 AI 安全圈是方向定义者之一