不可信AI控制协议
本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
真实,和“让模型想做对事”的对齐不同;控制研究假设强模型不可信,靠监控、延迟、抽查、编辑和权限边界阻止灾难动作。 2024 年 ICML 论文在编程任务上比较 GPT-4 不可信执行者、GPT-3.5 可信模型和有限人工;此后 SHADE-Arena 等扩展到长时代理破坏。仍是评测场/沙箱证据,不是通用部署保证。
监控模型可能与执行模型共享盲点或被串谋;协议公开后攻击者适应;评测环境遗漏真实工具和供应链。把实验中的“没有成功后门”当安全证明是统计误读。
Redwood Research 的 Greenblatt、Shlegeris、Sachan、Roger 开创实证 AI control;Anthropic Fellows、Redwood 等继续研究模块化红队。
读 Redwood Research 的 AI control 系列工作作为起点,建立"控制评估(control evaluations)"的心智模型。技能栈=ML 工程 + 安全/红队思维 + 博弈式威胁建模。从一个具体子问题切入,比如"如何设计一个可信监控器来审查一个更强模型的代码提交而不被其规避"。进 Redwood 这类专攻控制的小团队,或大实验室的 control/safeguards 组。
谁在攻这颗暗星 · 攻关者名录3 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
去哪家 · 机构与公司名录3 家 · 其中初创/成长期 0
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。