罗盘 / 危险能力评估
暗星档案 · 未点亮的星前沿AI危险能力与保障评估
本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
前沿AI危险能力与保障评估T6 量级 · 行星
把危险能力、现实伤害路径与绑定缓解动作变成可复测门槛。
暗星编号DS-0242
轴R · 风险与文明安全
领域civilization-safety
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
真实,涵盖生物、网络、自治代理、操纵与绕过防护等能力,以及这些能力通向现实伤害的路径。 英美安全机构和企业已有预部署评估、开放工具与风险框架,但统一阈值、外部访问、现实效度和对策略性隐藏能力的鲁棒性仍不足。
卡在哪 · 机制级卡点
代理指标可能与现实危害脱节;发布基准会被训练污染;模型可故意降表现;危险测试本身可能扩散知识。阈值若由企业单方定义,会有利益冲突和口径漂移。
谁在攻
英国 AI Security Institute 自 2023 年起评估前沿系统,并与 OpenAI、Google DeepMind、Anthropic 等合作;国际科学报告与首尔峰会形成政府协调背景。
怎么参与
选"危险能力评估/dangerous capability evaluations"作为方向,补齐 ML 工程 + 红队 + 特定领域(生物或网络)知识。切入点从一个窄子问题起步:比如"如何设计一个无法被简单微调绕过的生物能力基准"。进 METR、英美 AISI 这类专做前沿模型评估的团队,或大模型实验室的 dangerous-capabilities 评估组。
谁在攻这颗暗星 · 攻关者名录10 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
ACADEMIA学界 · 科研1
INDUSTRY业界 · 创业与工程2
亚历山大·马德里Aleksander MadryPreparedness 团队负责人 / MIT 教授
OpenAI / 麻省理工学院
领导 OpenAI Preparedness 团队,建立前沿模型生物/网络/自主性危险能力的分级测量与红线框架(Preparedness Framework)。
洛根·格雷厄姆Logan Graham前沿红队负责人
Anthropic
领导 Anthropic Frontier Red Team,在模型部署前测量其生物/网络等危险能力,支撑负责任扩展政策(RSP)的红线判定。
THIRD PARTY第三方 · 政策/资助/倡导7
贝丝·巴恩斯Beth Barnes创始人兼 CEO
METR(前 ARC Evals)
创立并领导 METR,专做前沿模型自主性/危险能力的第三方评估,是候选点名的核心攻坚机构负责人。
马吕斯·霍布汉Marius Hobbhahn联合创始人兼 CEO
Apollo Research
创立 Apollo Research,专攻前沿模型危险能力与欺骗评估,是这颗暗星的关键在攻团队负责人。
杰弗里·欧文Geoffrey Irving首席科学家
英国 AI 安全研究所(UK AISI)
从 DeepMind 转任英国 AISI 首席科学家,主持国家级前沿模型危险能力评估的科学方法建设。
伊恩·霍加斯Ian Hogarth主席
英国 AI 安全研究所(UK AISI)
创立并主持英国 AISI,把'部署前测量危险能力'确立为国家治理抓手,推动多国安全承诺以能力测量为前提。
保罗·克里斯蒂亚诺Paul ChristianoAI 安全负责人 / ARC 创始人
美国 CAISI(原 US AISI, NIST)
创立 ARC(METR 前身),后任美国 AI 安全研究所安全负责人,是危险能力评估科学范式的主要奠基者之一。
伊丽莎白·凯利Elizabeth Kelly首任主任
美国 AI 安全研究所(US AISI, NIST)
出任美国 AISI 首任主任,推动前沿模型部署前评估的政府机制落地与厂商协作。
丹·亨德里克斯Dan Hendrycks主任
AI 安全中心(CAIS)
主导 WMDP 基准(测量生物/化学/网络等大规模杀伤相关危险知识),把'危险能力'做成可复算的公开基准。
去哪家 · 机构与公司名录4 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。
Gray Swan AI初创
为前沿模型做持续对抗测试与红队即服务:Shade 做持续对抗测试、Arena 是一支上万人的全球红队社区,专门压测 Claude、GPT-5、Gemini 等模型的危险行为与越狱。
↗ 由 CMU 的 Matt Fredrikson 与 Zico Kolter(后者兼任 OpenAI 董事/安全委员)创立,被称「每家前沿实验室都信任的 AI 安全公司」,把危险能力测量做成了规模化众包红队——直接对冲候选说的「一次静态测试测不到上限」。
Haize Labs初创
自动化大规模 LLM 压力测试与红队,在部署前系统性地「haize」出模型的失效模式和漏洞,已与 Anthropic、Scale AI、AI21 签约。
↗ 把红队从人工手动变成自动化流水线,正面攻候选点出的「评估易被诱导/微调放大绕过」;年轻团队却已拿下多家前沿实验室订单,是评估科学工程化的代表新兵。
SecureBio非营利
生物安全非营利,AI 团队专做生物类危险能力基准与评估(如 ABC-Bench 智能体生物能力基准),衡量模型是否降低了重建危险病原体的门槛,并研究预训练数据过滤等缓解手段。
↗ 把候选里最难、最敏感的「生物武器合成路径」这一格补上,是少数敢做 bio 域专门基准的独立机构;同时是 AI Evaluator Forum 创始成员,在推动第三方评估透明化标准。
Transluce非营利
构建自动化、可规模化的 AI 监督工具,交到评估方、企业、政府手里,让独立评估在多领域里做得又快又深;核心是用 AI 智能体去理解和审查另一个 AI。
↗ 由伯克利 Jacob Steinhardt 与 MIT CSAIL 的 Sarah Schwettmann(MAIA 可解释性智能体作者)联合创立,专攻「评估本身能不能规模化」这个元问题,与 METR、RAND、SecureBio 同为 AI Evaluator Forum 创始成员。