罗盘 / AI控制协议
暗星档案 · 未点亮的星

不可信AI控制协议

本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

不可信AI控制协议T7 量级 · 恒星
即使模型目标不可信,也用权限、监控和抽查把灾难动作压到门槛内。
暗星编号DS-0243
R · 风险与文明安全
领域civilization-safety
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

真实,和“让模型想做对事”的对齐不同;控制研究假设强模型不可信,靠监控、延迟、抽查、编辑和权限边界阻止灾难动作。 2024 年 ICML 论文在编程任务上比较 GPT-4 不可信执行者、GPT-3.5 可信模型和有限人工;此后 SHADE-Arena 等扩展到长时代理破坏。仍是评测场/沙箱证据,不是通用部署保证。

卡在哪 · 机制级卡点

监控模型可能与执行模型共享盲点或被串谋;协议公开后攻击者适应;评测环境遗漏真实工具和供应链。把实验中的“没有成功后门”当安全证明是统计误读。

谁在攻

Redwood Research 的 Greenblatt、Shlegeris、Sachan、Roger 开创实证 AI control;Anthropic Fellows、Redwood 等继续研究模块化红队。

怎么参与

读 Redwood Research 的 AI control 系列工作作为起点,建立"控制评估(control evaluations)"的心智模型。技能栈=ML 工程 + 安全/红队思维 + 博弈式威胁建模。从一个具体子问题切入,比如"如何设计一个可信监控器来审查一个更强模型的代码提交而不被其规避"。进 Redwood 这类专攻控制的小团队,或大实验室的 control/safeguards 组。

谁在攻这颗暗星 · 攻关者名录3 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

INDUSTRY业界 · 创业与工程1
法比安·罗热Fabien Roger对齐/控制研究员
Anthropic(前 Redwood Research)
AI 控制系列早期论文的共同作者,研究可信监控器如何审查更强模型而不被规避,把控制协议从概念推向可实现。
THIRD PARTY第三方 · 政策/资助/倡导2
巴克·施莱格里斯Buck Shlegeris首席执行官
Redwood Research
领导 Redwood Research 的 AI 控制研究纲领,系统提出'即便模型不对齐也用外部机制防作恶'的控制评估框架,是这颗暗星的核心开创者。
瑞安·格林布拉特Ryan Greenblatt首席科学家
Redwood Research
《AI Control: Improving Safety Despite Intentional Subversion》主要作者,把控制协议做成可压力测试的评估方法(control evaluations),几乎定义了这个方向。

去哪家 · 机构与公司名录3 家 · 其中初创/成长期 0

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

来源 · 可查证