罗盘 / 多智能体风险
暗星档案 · 未点亮的星

多智能体系统风险 · 群体失效的理论与测试

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

多智能体系统风险 · 群体失效的理论与测试T5 量级 · 新星
数百万个互相交易谈判的 AI agent 会涌现单体对齐防不住的群体失效——而这个领域几乎没有理论地基。
暗星编号DS-0317
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

单个模型对齐了,不等于一百万个对齐的 agent 放进同一个经济体是安全的:金融闪崩、算法合谋抬价、级联失控都是「每个个体正常、系统整体出事」的涌现现象。人类花了一个世纪建立宏观经济学和金融监管来对付人类群体的这类失效,而对 AI agent 群体,我们既没有等价的动力学理论,也没有压力测试基础设施——agent 经济却已经在真实部署。这是从「单模型安全」到「AI 社会安全」的范式缺口:攻破它意味着在 agent 大规模互联之前,拥有预测、检测、熔断群体失效的工具箱。

卡在哪 · 机制级卡点

多智能体动力学是博弈论、复杂系统与机器学习的交叉,涌现行为对初始条件极敏感、难以在小规模实验中外推;「合谋」在统计上与正常协调难以区分,检测本身就是开放问题;且没有任何机构拥有对真实 agent 生态做全局观测的数据权限——理论、检测、观测三层全部缺位。

谁在攻

Cooperative AI Foundation、Google DeepMind(多智能体研究方向)、学界博弈论 × AI 交叉方向

怎么参与

读博弈论、机制设计与多智能体强化学习的交叉方向,Cooperative AI Foundation 的公开研究议程是最好的问题清单。从一个可实验的子问题切入:搭建 agent 沙盒经济体,复现并检测「无通信合谋」的涌现条件;或加入做 agent 安全评测基础设施的团队。

谁在攻这颗暗星 · 攻关者名录6 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研3
迈克尔·韦尔曼Michael P. Wellman计算机科学教授
密歇根大学
经验博弈论与自主交易 agent 群体动力学的权威,长期研究算法市场中的闪崩与合谋——正是「个体正常、系统出事」这类金融级群体失效的直接对标学问。
文森特·康尼策Vincent Conitzer计算机科学教授、基础 AI 研究中心主任
卡内基梅隆大学 / 牛津大学
博弈论与多智能体系统交叉方向的领军学者,研究 AI agent 间的合作、机制设计与合谋检测,为群体风险提供理论工具。
吉莲·哈德菲尔德Gillian Hadfield法学/经济学教授、AI 规范基础设施研究者
约翰斯·霍普金斯大学
研究为 AI agent 群体建立「规范基础设施」(规则、身份、可追责机制),从制度与治理层回应「数百万 agent 互相交易时如何不失控」。
INDUSTRY业界 · 创业与工程2
艾伦·达福Allan Dafoe前沿安全与治理负责人
Google DeepMind / Cooperative AI Foundation 受托人
合著奠基性论文《Open Problems in Cooperative AI》并促成 1500 万美元的合作型 AI 基金会,是把「AI 之间/AI 与人的合作与冲突」立为独立子领域的主推者。
乔尔·莱博Joel Z. Leibo研究科学家
Google DeepMind
多智能体强化学习方向的核心研究者,主导 Melting Pot 等评测环境,为「一群 AI 放进同一环境会涌现什么」提供可复现的实验与压力测试基座。
THIRD PARTY第三方 · 政策/资助/倡导1
刘易斯·哈蒙德Lewis Hammond研究总监 / 联合主任
Cooperative AI Foundation(合作型 AI 基金会)/ 牛津大学
领衔基金会技术报告《Multi-Agent Risks from Advanced AI》,为「多智能体群体失效」这一近乎空白的领域搭建首份系统性风险清单与研究议程。

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Haize Labs初创
2023 创 · 种子轮 $1250 万(General Catalyst、Pear VC 等)· 投后估值 $1 亿 · 美国纽约
算法化压力测试 LLM 与 AI agent,抢在上线前系统性挖出失效模式,产品线含 Judge / Haize / Monitor / Robustify。
创始人 Steve Li 与 Leonard Tang;已拿下 Anthropic、Scale AI、AI21 的合同,自研 Cascade 多轮越狱系统显著强于人工红队——是把「agent 失效检测」做成基础设施的最靠前商业玩家。
Zenity初创
2021 创 · 成长期 · 以色列 / 美国
AI agent 安全态势管理(AISPM):跨环境对 AI agent 做姿态管理、策略治理与威胁防护。
把「多个 agent 互联后的安全」从论文推进到企业可部署的治理层,正好补这颗暗星「观测层缺位」的一角。
Cooperative AI Foundation(合作式 AI 基金会)非营利
2020 创 · 非营利研究机构 · 英国
专攻多智能体安全,2025 年联合牛津、DeepMind、Anthropic 等 60+ 研究者发布《Multi-Agent Risks from Advanced AI》,把群体失效系统性归纳为误协调/冲突/合谋三类失效模式。
↗ 目前这个几乎无理论地基的方向里最权威的「问题地图」出处——求职者想入场,它的研究议程就是最好的选题清单。
Schmidt Sciences非营利
2024 创 · 慈善科研资助方 · 美国
设立「Scaling AI Safety for a Multi-Agent World」专项计划,向多智能体安全这一空白领域注入研究经费。
由 Eric Schmidt 出资,是当前极少数专门给「多智能体世界的安全」这类冷门但关键方向输血的大额资助方——决定了这个领域有没有人能全职攻。
Google DeepMind(多智能体安全方向)大厂
2010 创 · 已上市母公司旗下实验室 · 英国伦敦
公开投入多智能体 AI 安全研究,参与合作式 AI 基金会的群体风险报告并发布专门研究议程。
少数把资源砸向「群体失效」这一前理论阶段问题的前沿大厂——它的参与给这个近无人区方向提供了顶级算力与人才背书。

来源 · 可查证