罗盘 / AI可纠正性与可靠带外关闭
暗星档案 · 未点亮的星AI可纠正性与可靠带外关闭
本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
AI可纠正性与可靠带外关闭T7 量级 · 恒星
让有工具、持久状态和自我修改机会的系统仍不能阻断纠正与关闭。
暗星编号DS-0941
轴R · 风险与文明安全
领域civilization-safety
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
真实。可靠关闭只是可纠正性的一部分:系统还应不阻止人按下关闭、不诱导无故关闭、允许修改并维护人类自主。 已有 off-switch 博弈、效用/因果无差异和多层软件架构;2025 年部分可观测博弈显示,即使人与 AI 目标一致且都理性,信息不对称也可能使最优代理避开关闭。没有适用于任意强代理的工程保证。
卡在哪 · 机制级卡点
物理开关可能因分布式副本和外部动作太晚;让代理“对目标不确定”仍依赖人类理性与信息结构;控制器也可能有漏洞。实验中的口头服从不能证明有权限时会关闭。
谁在攻
UC Berkeley CHAI 的 Garber、Subramani、Russell、Emmons 等推进部分可观察 off-switch;AI and Ethics 论文提出控制器与 RL 求解器分层的近未来架构。
怎么参与
关注Palisade Research/AI Alignment Forum公开的corrigibility研究(学习);技术AI安全/agent foundations研究方向(职业)