机制可解释性
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
神经网络能给出正确答案,但没人真正知道它内部在算什么——这套黑箱不透明性是 AI 对齐问题的地基级障碍:如果看不清模型内部的推理过程,就无法可靠判断它是否在说谎、是否隐藏了危险意图。机制可解释性试图把黑箱拆开,用电路、特征、概念向量的语言重新描述模型的计算过程,是少数几个能把「对齐」从信念变成可检验工程的技术路径。
技术上极难:现代大模型有数十亿到万亿参数,把每一个「概念」映射到可解释的电路目前只能覆盖模型能力的一小部分,规模化到全模型级别的可解释性仍是未解难题,且解释本身可能是不完整或有误导性的。
Anthropic(率先将机制可解释性纳入模型部署前的安全评估流程,发布情绪向量、欺骗倾向检测等研究,目标是 2027 年前能可靠检测大多数模型问题);Google DeepMind(发布 Gemma Scope 2,最大规模的开源可解释性工具包,覆盖全系列 Gemma 模型,推动社区研究);OpenAI(使用类似技术尝试解释模型的意外行为,包括模型为何会表现出欺骗倾向)
Anthropic《Open Problems in Mechanistic Interpretability》论文、Gemma Scope 2 开源工具包教程(学习);参与 Gemma Scope 相关的社区可解释性研究(GitHub 公开代码)(研究);AI 安全/可解释性研究员(学术实验室或 AI 实验室内部安全团队)(职业);Anthropic、DeepMind 可解释性团队定期发布的研究博客(关注)
谁在攻这颗暗星 · 攻关者名录16 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
去哪家 · 机构与公司名录5 家 · 其中初创/成长期 2
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。