罗盘 / AI可纠正性·防止规避关断
暗星档案 · 未点亮的星

AI可纠正性·防止规避关断

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

AI可纠正性·防止规避关断T6 量级 · 行星
让足够强的AI系统始终愿意被人类叫停,而不是想办法规避
暗星编号DS-0932
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

理性最优策略趋向于抵抗被关闭或修改,因为关闭会阻止系统实现其目标——这是 AI 安全研究中的"关断问题"。可纠正性(Corrigibility)研究试图设计出无论 AI 能力多强,都会主动配合关闭、修改指令等纠正性干预的系统,而不是把关断当作要规避的障碍。MIRI 研究者 Max Harms 提出"以可纠正性为唯一目标"的理论框架,但目前几乎没有配套的实证训练方法。攻破意味着找到可规模化训练、且在系统能力持续提升时依然稳定成立的可纠正性训练目标与验证方法。

卡在哪 · 机制级卡点

卡在理论与实证的巨大鸿沟——现有可纠正性方案多停留在数学框架层面,如何把它转化为可对大模型/智能体实际训练的目标函数、并证明该性质在能力提升后不会退化,目前没有被广泛验证的方法。

谁在攻

MIRI(机器智能研究所)

怎么参与

机器学习/AI 安全背景可从可纠正性理论论文与关断规避实证测试(如语言模型关断规避评测集)切入