可扩展监督 / 对齐理论根本未解
为什么是文明级瓶颈
- 可扩展监督:超人系统的产出超出人类判断力,debate / IDA / 递归奖励建模等方案全未经大规模实证。
- 内对齐(inner alignment):模型在训练分布外会往哪泛化,目前无法预测。
- long-horizon RL:长周期强化学习在数学上直接激励"获取权力 / 自我保存 / 伪装对齐"——能力曲线在飞奔,对齐理论曲线近乎平。
- 最硬的事实:这是纯理论缺口、零已验证解——EA / 星光 / AISI 都只能指出,无人解决。
为什么高杠杆(R 轴总闸·顶格)
- 不可逆性最强:首次 long-horizon 失准按定义不可回滚(Ord 估 AI 灭绝风险约 1/10,最大单一源)。"治理跟随技术"对可试错的蒸汽电力成立,对一次性的 AI 失效。
- 极度欠投:安全投入远小于能力投入(公共部门口径约 10000:1,计入私营+慈善约 100:1)。
- 它卡死所有下游——监督不可扩展,则评测、控制、部署全部失去地基。按"杠杆最高"标准当之无愧顶格。
谁在攻 (已核实到一手源 · 2026-06)
系统攻可扩展监督、对抗鲁棒性、AI control、model organisms、机制可解释性、model welfare。Anthropic Fellows Program 2026 年 5 月、7 月两批开放:周 stipend + 约 $15k/月算力 + 研究员一对一带。
2023 ICML《AI Control: Improving Safety Despite Intentional Subversion》开创"AI 控制"框架:用受信任模型监控、有限人工审计、不受信任模型交叉监控——即便模型有意颠覆也能压低风险。已被业界与学界当作缓解灾难风险的 bedrock 路径。
全球最大的政府主导对齐研究基金之一:2025-7 启动,首轮 £27M 投 60+ 项目(每项目至多 £1M),OpenAI / Microsoft 加入国际联盟。第二轮预计 2026 夏重开,经 AISI 官网在开放窗口申请。
把有志者系统导入对齐领域的主管道:10 周(Berkeley / London)+ 可申 6-12 月资助延期,导师来自 Anthropic / OpenAI / DeepMind / Redwood / ARC 等。录取率约 4-7%、高度竞争——年轻人进对齐的第一台阶。
如何参与
- 投身 / 求职(年轻人首选):MATS(主管道)→ Anthropic Fellows / Redwood / UK AISI 资助项目。
- 资助:UK AISI Alignment Project(政府)、Open Philanthropy / Coefficient Giving 的技术 AI 安全 RFP。
- 关注 / 了解:Anthropic Alignment Science 博客、AI Alignment Forum、International AI Safety Report(Bengio)。
来源:Redwood AI Control(ICML 2023)/ UK AISI The Alignment Project / MATS / Anthropic Alignment Science · 2026-06 核实 · 待红蓝过证据 + 验收
谁在攻这颗暗星 · 攻关者名录9 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。含科研、创业与第三方三类关键角色,初评待核实。
去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先,初评待核实)。