罗盘 / 可证明安全
暗星档案 · 未点亮的星

可证明安全 AI · 形式化保障

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

可证明安全 AI · 形式化保障T6 量级 · 行星
用数学证明而非经验测试来约束 AI 在关键基础设施中的行为——把「大概安全」升级为「可证安全」。
暗星编号DS-0314
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

今天说一个 AI 系统「安全」,依据是它在测试里没出事——这和上世纪凭经验造桥没有本质区别。可证明安全 AI 路线(如英国 ARIA 的 Safeguarded AI 计划)要给 AI 套上数学可证明的安全包络:先为目标环境建立可验证的世界模型,再形式化地证明 AI 的输出永远不会把系统推出安全边界。如果成功,电网调度、药物设计、自主实验室这类高风险场景就能放心接入强 AI 能力,而不是因不敢用而白白锁死收益。这是「AI 安全」从红队测试的手艺升级为土木工程式学科的那一跃。

卡在哪 · 机制级卡点

最硬的卡点是为开放物理世界建立既足够忠实、又可被形式化验证的世界模型——真实世界不是芯片电路,没有干净的规格说明书;证明的规模化路径完全未知,现有形式化验证在千万行代码级别就已吃力,遑论前沿模型。批评者认为该路线在通用场景根本不可行,这本身说明它是一个值得判定的开放问题。

谁在攻

英国 ARIA(davidad 主持的 Safeguarded AI 计划)、学界的可证明安全路线(Tegmark、Omohundro 等人的倡议与合作者)

怎么参与

读方向:形式化验证/定理证明(Lean、Coq 一类工具)+ 概率世界模型,两边都懂的人全球屈指可数。切入点:挑一个封闭度高的真实场景(如某类电网控制或化学合成约束),做出第一个「带机器可查证安全证明的 AI 控制器」端到端 demo;ARIA Safeguarded AI 的资助项目群是当下最集中的入口。

谁在攻这颗暗星 · 攻关者名录6 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

INDUSTRY业界 · 创业与工程1
史蒂夫·奥莫亨德罗Steve Omohundro研究者
Beneficial AI Research
与泰格马克合著《Provably Safe Systems》,主张为 AI 套上数学可证明的安全包络,是该路线最早的系统提出者之一。
THIRD PARTY第三方 · 政策/资助/倡导1
大卫·达尔林普尔(davidad)David "davidad" Dalrymple项目主任(Programme Director)
英国 ARIA
主持 ARIA 的 Safeguarded AI 计划,是可证明安全 AI 路线全球最集中的资助与工程组织者,attackers 名单中的领衔人。

去哪家 · 机构与公司名录2 家 · 其中初创/成长期 0

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

来源 · 可查证