罗盘 / 前沿AI治理
暗星档案 · 未点亮的星

前沿 AI 国际治理机制 · 让能力曲线跑不过护栏

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

前沿 AI 国际治理机制 · 让能力曲线跑不过护栏T6 量级 · 行星
前沿模型的跨国评测、报告与事故通报制度尚未建立,治理速度追不上能力曲线——这是当代最紧迫的文明级减风险方向之一。
暗星编号DS-0166
R · 风险与文明安全
领域governance-institutions
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

前沿 AI 国际治理指对最强大 AI 模型的跨国评测、能力与风险报告、以及事故通报的制度安排。目前各国刚冒出 AI 安全研究所,但彼此的测试标准、信息共享和事故上报还没有形成有约束力的国际机制。它是文明级方向,因为前沿 AI 的能力增长比任何治理机制的建立速度都快,一旦出现跨国级失控或滥用,缺乏统一的预警与响应通道。攻破它,等于在能力爆发前把护栏先建起来。

卡在哪 · 机制级卡点

机制级卡点:一是大国竞争——AI 被视为国家竞争力核心,谁都不愿把能力细节交给国际核查,treaty 级约束几乎无从谈起;二是能力核查难——模型能力难以从外部客观测量和验证,评测方法学本身还在早期,导致“可核查的治理”缺乏技术基础。治理速度结构性地落后于能力曲线。

谁在攻

各国 AI 安全研究所网络(英国 AISI、美国、新加坡等)、《国际 AI 安全报告》(Bengio 主持);跨国有约束力的评测与通报机制仍未成形

怎么参与

适合机器学习 + 政策交叉背景的年轻人,尤其懂模型评测(evals)的稀缺。可从“可核查的能力评测方法”这一子问题切入——这是整个治理的技术瓶颈,进某国 AI 安全研究所或参与国际 AI 安全报告的研究网络,把评测做成可跨国互认的底座。

谁在攻这颗暗星 · 攻关者名录7 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研4
约书亚·本吉奥Yoshua Bengio深度学习先驱 / 国际报告主席
蒙特利尔大学 · Mila
受英国政府与联合国等委托,主持编写《国际 AI 安全报告》(首份于 2025 年发布),协调约 30 国专家对前沿 AI 风险做统一科学评估,是国际治理证据基础的牵头人。
杰弗里·欧文Geoffrey Irving首席科学家
英国 AI 安全研究所(AISI)
英国 AISI 首席科学家(前 DeepMind、OpenAI 安全研究者),主导跨国可复用的前沿模型评测技术。
曾毅Yi ZengAI 伦理与治理研究者
中国科学院自动化研究所
联合国 AI 高级别咨询机构成员、《国际 AI 安全报告》专家组中方专家,是前沿 AI 全球治理中少数深度参与的中国科研代表。
斯图尔特·罗素Stuart RussellAI 教授 / 治理倡导者
加州大学伯克利分校
长期倡导前沿 AI 具约束力的国际治理机制,参与国际 AI 安全科学评估与多国政策咨询。
THIRD PARTY第三方 · 政策/资助/倡导3
伊恩·霍加斯Ian HogarthAI 安全研究所主席
英国 AI 安全研究所(AISI)
英国 AISI 首任主席,推动全球首个国家级前沿模型评测机构成立,牵头 Bletchley/首尔 AI 安全峰会的评测与承诺框架。
梁洁Jade Leung首席技术官
英国 AI 安全研究所(AISI)
英国 AISI 首席技术官(曾任 OpenAI 治理团队负责人),主持前沿模型能力与风险的实测方法学建设。
伊丽莎白·凯利Elizabeth Kelly研究所首任所长
美国 AI 安全研究所(US AISI, NIST)
美国 AISI 首任所长,牵头美英 AISI 联合测试协议与国际 AI 安全研究所网络的美方对接。

去哪家 · 机构与公司名录6 家 · 其中初创/成长期 3

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Gray Swan AI初创
早期创业 · 美国
为前沿模型做商业化红队/对抗测试与自动化越狱攻防,把「攻击面评测」产品化。
↗ 商业红队赛道势头最猛的新公司之一,把学界的对抗测试变成可持续运营的评测基础设施。
Goodfire初创
2024 创 · B 轮 · 估值约 12.5 亿美元 · 美国
做机制可解释性(mechanistic interpretability),试图打开模型内部、让能力与风险从「外部黑箱测量」变成「内部可读」。
↗ 2026 年 2 月完成 1.5 亿美元 B 轮、估值 12.5 亿——可解释性是让评测从行为测试升级为「可验证核查」的关键一跳,明星资本重注方向。
Patronus AI初创
2023 创 · A 轮 · 美国 旧金山
面向企业的 LLM 评测、安全与对抗测试平台,把评测工程化成可持续调用的服务。
↗ 商业化评测赛道代表,验证了「模型评测」本身能长成独立生意,为跨国互认的评测底座积累工程实践。
METR (Model Evaluation & Threat Research)非营利
2023 创 · 非营利研究机构 · 美国 伯克利
独立于各大 AI 实验室之外,对前沿模型做自主危险能力(自主复制、网络攻击等)评测,是「可核查评测」的一线开拓者。
↗ 从 ARC Evals 独立出来的中立第三方,OpenAI/Anthropic 发布前会请它做外部评测,是当前少数被前沿实验室真正接纳的独立评测机构。
Apollo Research非营利
2023 创 · 非营利/研究组织 · 英国 伦敦
专攻前沿模型的「欺骗性对齐」与 agent 行为评测,研究模型是否会策略性隐瞒、规避监督。
↗ 把「模型会不会骗评测者」做成可测项目,其 scheming 评测被前沿实验室与英国 AISI 引用,是治理技术底座里最稀缺的一类工作。
AVERI (AI Verification and Evaluation Research Institute)非营利
2026 创 · 新成立非营利 · 美国
推动对前沿模型建立「基于机密访问的独立审计」制度,提出 AI Assurance Levels(AAL)分级审计框架。
↗ 2026 年 1 月由前 OpenAI 政策负责人 Miles Brundage 发起,联合 30+ 治理专家发论文——正是这颗暗星「可核查治理」缺技术底座的直接攻坚者。

来源 · 可查证