罗盘 / AI控制协议
暗星档案 · 未点亮的星不可信AI控制协议
不可信AI控制协议潜能 T7
即使模型目标不可信,也用权限、监控和抽查把灾难动作压到门槛内。
暗星编号DS-0243
轴R · 风险与文明安全
领域civilization-safety
状态初步评估
这是什么 · 为什么难
真实,和“让模型想做对事”的对齐不同;控制研究假设强模型不可信,靠监控、延迟、抽查、编辑和权限边界阻止灾难动作。 2024 年 ICML 论文在编程任务上比较 GPT-4 不可信执行者、GPT-3.5 可信模型和有限人工;此后 SHADE-Arena 等扩展到长时代理破坏。仍是评测场/沙箱证据,不是通用部署保证。
卡在哪 · 机制级卡点
监控模型可能与执行模型共享盲点或被串谋;协议公开后攻击者适应;评测环境遗漏真实工具和供应链。把实验中的“没有成功后门”当安全证明是统计误读。
谁在攻
Redwood Research 的 Greenblatt、Shlegeris、Sachan、Roger 开创实证 AI control;Anthropic Fellows、Redwood 等继续研究模块化红队。
怎么参与
读 Redwood Research 的 AI control 系列工作作为起点,建立"控制评估(control evaluations)"的心智模型。技能栈=ML 工程 + 安全/红队思维 + 博弈式威胁建模。从一个具体子问题切入,比如"如何设计一个可信监控器来审查一个更强模型的代码提交而不被其规避"。进 Redwood 这类专攻控制的小团队,或大实验室的 control/safeguards 组。
谁在攻这颗暗星 · 攻关者名录3 人
这里列出正在探索这一问题的研究者、创业者与支持者。人物资料仍在核对,欢迎补充与纠正。
INDUSTRY业界 · 创业与工程1
法比安·罗热Fabien Roger对齐/控制研究员
Anthropic(前 Redwood Research)
AI 控制系列早期论文的共同作者,研究可信监控器如何审查更强模型而不被规避,把控制协议从概念推向可实现。
THIRD PARTY第三方 · 政策/资助/倡导2
巴克·施莱格里斯Buck Shlegeris首席执行官
Redwood Research
领导 Redwood Research 的 AI 控制研究纲领,系统提出'即便模型不对齐也用外部机制防作恶'的控制评估框架,是这颗暗星的核心开创者。
瑞安·格林布拉特Ryan Greenblatt首席科学家
Redwood Research
《AI Control: Improving Safety Despite Intentional Subversion》主要作者,把控制协议做成可压力测试的评估方法(control evaluations),几乎定义了这个方向。
去哪家 · 机构与公司名录3 家 · 其中初创/成长期 0
了解正在研究或开发相关技术的团队,寻找工作与合作机会。机构资料仍在核对。
Redwood Research非营利
AI 控制研究纲领的开创者,系统研究「假设模型不对齐、如何靠监控/权限限制让它无法造成灾难」,并定义了「控制评估(control evaluations)」这一压力测试范式。
↗ 这颗暗星的原点团队——AI control 这个词和方法学基本是它立起来的;2025 年与英国 AISI 联合产出首个「AI 控制安全论证草图」,把控制从理念推进到可论证的工程框架。
FAR.AI非营利
既做技术安全研究也做领域建设,主办 ControlConf(AI 控制专题会议),把分散在各机构的控制研究者聚成一个正在成形的学科社区。
↗ 是把「AI 控制」从 Redwood 一家扩成一个领域的关键组织者——候选说这是极年轻、在攻者稀少的研究纲领,FAR.AI 正在解决「人太少、没社区」这个瓶颈本身。
METR非营利
评估前沿模型的自主与危险能力,已放出原型控制评估:测「监控器能不能抓住 AI 智能体偷偷执行副任务」以及「智能体能不能绕过监控」。
↗ 把评估科学延伸到控制层,正面做候选说的「监控器 vs 会找盲区的智能体」这个核心博弈的可量化实验,是少数同时握有能力评估与控制评估两套方法的机构。