罗盘 / 机制可解释性
暗星档案 · 未点亮的星

机制可解释性

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

机制可解释性T5 量级 · 新星
打开神经网络这个黑箱,看清它内部到底在算什么——对齐的地基工具
暗星编号DS-0011
R · 风险与文明安全
领域ai-computing
状态占位 · 待初评
这是什么 · 为什么难

神经网络能给出正确答案,但没人真正知道它内部在算什么——这套黑箱不透明性是 AI 对齐问题的地基级障碍:如果看不清模型内部的推理过程,就无法可靠判断它是否在说谎、是否隐藏了危险意图。机制可解释性试图把黑箱拆开,用电路、特征、概念向量的语言重新描述模型的计算过程,是少数几个能把「对齐」从信念变成可检验工程的技术路径。

卡在哪 · 机制级卡点

技术上极难:现代大模型有数十亿到万亿参数,把每一个「概念」映射到可解释的电路目前只能覆盖模型能力的一小部分,规模化到全模型级别的可解释性仍是未解难题,且解释本身可能是不完整或有误导性的。

谁在攻

Anthropic(率先将机制可解释性纳入模型部署前的安全评估流程,发布情绪向量、欺骗倾向检测等研究,目标是 2027 年前能可靠检测大多数模型问题);Google DeepMind(发布 Gemma Scope 2,最大规模的开源可解释性工具包,覆盖全系列 Gemma 模型,推动社区研究);OpenAI(使用类似技术尝试解释模型的意外行为,包括模型为何会表现出欺骗倾向)

怎么参与

Anthropic《Open Problems in Mechanistic Interpretability》论文、Gemma Scope 2 开源工具包教程(学习);参与 Gemma Scope 相关的社区可解释性研究(GitHub 公开代码)(研究);AI 安全/可解释性研究员(学术实验室或 AI 实验室内部安全团队)(职业);Anthropic、DeepMind 可解释性团队定期发布的研究博客(关注)

谁在攻这颗暗星 · 攻关者名录16 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研6
大卫·鲍David Bau计算机科学助理教授
美国东北大学 (Northeastern University)
网络解剖(Network Dissection)与模型编辑 ROME 的作者,定位并直接改写大模型中存储事实的具体权重
雅各布·安德烈亚斯Jacob Andreas副教授
麻省理工学院 (MIT)
研究语言模型内部表示与自然语言解释,做自动化可解释性(如用语言描述神经元功能)方向的核心工作
约纳坦·贝林科夫Yonatan Belinkov助理教授
以色列理工学院 (Technion)
NLP 探针(probing)与因果可解释性的代表学者,研究模型各层到底编码了什么语言信息
马丁·瓦滕伯格Martin Wattenberg教授(可视化/可解释性)
哈佛大学 (Harvard University)
与 Viégas 共建 Insight+Interaction 实验室,做激活图谱、Othello-GPT 世界模型探测等可视化+机制可解释性工作
费尔南达·维埃加斯Fernanda Viégas教授(可视化/可解释性)
哈佛大学 (Harvard University)
机器学习可视化与可解释性研究者,与 Wattenberg 合作探测语言模型内部是否形成世界模型/表征
雅各布·斯坦哈特Jacob Steinhardt助理教授/Transluce 联合创始人
加州大学伯克利分校 (UC Berkeley)
AI 安全与理解模型行为的核心学者,联合创办非营利实验室 Transluce 专攻可扩展的模型内部理解
INDUSTRY业界 · 创业与工程6
克里斯·奥拉Chris Olah机制可解释性奠基人/团队负责人
Anthropic
开创神经网络「电路(circuits)」研究范式与 Distill,主导 Anthropic 可解释性团队,是把「打开黑箱看内部计算」变成独立学科的第一人
尼尔·南达Neel Nanda机制可解释性团队负责人
Google DeepMind
领导 DeepMind 机制可解释性团队,开源 TransformerLens 工具,做 grokking、稀疏自编码器等逆向工程模型内部机制的核心工作
Been KimBeen Kim可解释性研究员
Google DeepMind
提出 TCAV 等基于概念的可解释性方法,长期推动「模型内部表示如何对应人类概念」的研究
特伦顿·布里肯Trenton Bricken可解释性研究员
Anthropic
《Towards Monosemanticity》核心作者,用字典学习/稀疏自编码器把叠加(superposition)的神经元拆成单义特征
凯瑟琳·奥尔森Catherine Olsson可解释性研究员
Anthropic
《In-context Learning and Induction Heads》核心作者,发现并刻画了 Transformer 中的「归纳头」机制
纳尔逊·埃尔哈格Nelson Elhage可解释性研究员
Anthropic
《A Mathematical Framework for Transformer Circuits》核心作者,建立了逆向工程 Transformer 的数学框架
THIRD PARTY第三方 · 政策/资助/倡导4
莎拉·施韦特曼Sarah Schwettmann联合创始人/首席科学家
Transluce(非营利 AI 实验室)
MILAN/MAIA 等自动化可解释性智能体的作者,推动用 AI 自动审问 AI 的可扩展可解释性
斯特拉·比德曼Stella Biderman执行董事
EleutherAI(非营利研究机构)
主持 Pythia 等专为可解释性研究设计的开放模型套件,为学界提供可复现的机制研究底座
巴克·施莱格里斯Buck ShlegerisCEO
Redwood Research(非营利)
带队做可解释性与 AI 控制研究,推动用内部机制理解来防范模型欺骗与失控
马里乌斯·霍布哈恩Marius HobbhahnCEO
Apollo Research(非营利)
用可解释性方法检测模型的欺骗与「阴谋(scheming)」行为,把内部机制研究接到安全评估上

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Goodfire初创
2024 创 · Series B $150M @ $1.25B 估值 · 旧金山, 美国
把机制可解释性商业化——'打开黑箱',直接读取和编辑神经网络内部的概念特征
↗ 团队出自 OpenAI/DeepMind/Stanford/Harvard,Anthropic 参投;2026 年 $150M B 轮成为该赛道最大独立公司,已用可解释性技术发现疾病生物标志物、降低模型幻觉
Leap Labs初创
美国/英国
构建 model-agnostic 的'通用可解释性引擎',端到端解释任意模型
少数把可解释性直接做成商用产品化引擎的独立营利公司,走与大厂研究部门不同的产品路线
Transluce非营利
2024 创 · 伯克利, 美国
做可扩展的 AI 监督与内部解释工具(自然语言神经元描述、Monitor 界面、让模型口头说出内部激活)
↗ UC Berkeley 教授 Jacob Steinhardt 与 MIT CSAIL 的 Sarah Schwettmann 联合创立的非营利实验室,专攻 sycophancy / reward hacking 等行为的内部溯源
Apollo Research非营利
2023 创 · 伦敦, 英国
可解释性 + 行为评估结合,专攻检测 AI 的'欺骗性对齐'(deceptive alignment)
↗ 为英国 AI 安全峰会做出'LLM 在压力下会战略性欺骗用户'的演示,被政策界与媒体引用;把评估切到 deception/情境意识这一细分
EleutherAI非营利
2020 创 · 美国(分布式)
开源 AI 研究组织,2023 年正式转向可解释性、对齐与科学研究
↗ 从 Discord 起步复现 GPT-3 的开源团队,2023 年注册为非营利研究院,是开源可解释性工具生态的重要一极