暗星档案 · 未点亮的星多智能体系统风险 · 群体失效的理论与测试
本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
多智能体系统风险 · 群体失效的理论与测试T5 量级 · 新星
数百万个互相交易谈判的 AI agent 会涌现单体对齐防不住的群体失效——而这个领域几乎没有理论地基。
暗星编号DS-0317
轴R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难单个模型对齐了,不等于一百万个对齐的 agent 放进同一个经济体是安全的:金融闪崩、算法合谋抬价、级联失控都是「每个个体正常、系统整体出事」的涌现现象。人类花了一个世纪建立宏观经济学和金融监管来对付人类群体的这类失效,而对 AI agent 群体,我们既没有等价的动力学理论,也没有压力测试基础设施——agent 经济却已经在真实部署。这是从「单模型安全」到「AI 社会安全」的范式缺口:攻破它意味着在 agent 大规模互联之前,拥有预测、检测、熔断群体失效的工具箱。
卡在哪 · 机制级卡点多智能体动力学是博弈论、复杂系统与机器学习的交叉,涌现行为对初始条件极敏感、难以在小规模实验中外推;「合谋」在统计上与正常协调难以区分,检测本身就是开放问题;且没有任何机构拥有对真实 agent 生态做全局观测的数据权限——理论、检测、观测三层全部缺位。
谁在攻Cooperative AI Foundation、Google DeepMind(多智能体研究方向)、学界博弈论 × AI 交叉方向
怎么参与读博弈论、机制设计与多智能体强化学习的交叉方向,Cooperative AI Foundation 的公开研究议程是最好的问题清单。从一个可实验的子问题切入:搭建 agent 沙盒经济体,复现并检测「无通信合谋」的涌现条件;或加入做 agent 安全评测基础设施的团队。
谁在攻这颗暗星 · 攻关者名录6 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
ACADEMIA学界 · 科研3
迈克尔·韦尔曼Michael P. Wellman计算机科学教授
密歇根大学
经验博弈论与自主交易 agent 群体动力学的权威,长期研究算法市场中的闪崩与合谋——正是「个体正常、系统出事」这类金融级群体失效的直接对标学问。
文森特·康尼策Vincent Conitzer计算机科学教授、基础 AI 研究中心主任
卡内基梅隆大学 / 牛津大学
博弈论与多智能体系统交叉方向的领军学者,研究 AI agent 间的合作、机制设计与合谋检测,为群体风险提供理论工具。
吉莲·哈德菲尔德Gillian Hadfield法学/经济学教授、AI 规范基础设施研究者
约翰斯·霍普金斯大学
研究为 AI agent 群体建立「规范基础设施」(规则、身份、可追责机制),从制度与治理层回应「数百万 agent 互相交易时如何不失控」。
INDUSTRY业界 · 创业与工程2
艾伦·达福Allan Dafoe前沿安全与治理负责人
Google DeepMind / Cooperative AI Foundation 受托人
合著奠基性论文《Open Problems in Cooperative AI》并促成 1500 万美元的合作型 AI 基金会,是把「AI 之间/AI 与人的合作与冲突」立为独立子领域的主推者。
乔尔·莱博Joel Z. Leibo研究科学家
Google DeepMind
多智能体强化学习方向的核心研究者,主导 Melting Pot 等评测环境,为「一群 AI 放进同一环境会涌现什么」提供可复现的实验与压力测试基座。
THIRD PARTY第三方 · 政策/资助/倡导1
刘易斯·哈蒙德Lewis Hammond研究总监 / 联合主任
Cooperative AI Foundation(合作型 AI 基金会)/ 牛津大学
领衔基金会技术报告《Multi-Agent Risks from Advanced AI》,为「多智能体群体失效」这一近乎空白的领域搭建首份系统性风险清单与研究议程。
去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。
来源 · 可查证