罗盘 / 跨模型可解释性基准
暗星档案 · 未点亮的星跨模型可解释性基准
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
跨模型可解释性基准T5 量级 · 新星
给"读懂AI在想什么"定一套统一考卷
所属星云打开黑箱·读懂AI的心活下去
暗星编号DS-0907
轴E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
机制可解释性领域长期各家自说自话——不同团队用不同模型、不同任务、不同指标宣称自己的方法"更好",但彼此不可比。2025年MIB(Mechanistic Interpretability Benchmark)首次给出跨四个任务、五个模型的标准评测套件,分电路定位和因果变量对齐两条赛道,统一了反事实输入和评测指标。攻破意味着可解释性方法的进步能被客观、可复现地测量,而不是靠案例展示说服人,这是让这个领域从"手艺活"变成可积累科学的基础设施。
卡在哪 · 机制级卡点
现有基准覆盖的模型规模和任务类型仍有限,前沿超大模型(千亿参数以上)上的可解释性方法尚缺乏同等严格的标准化评测;稀疏自编码器等热门方法在基准上的表现并不稳定优于朴素基线,说明评测本身还需要持续打磨。
谁在攻
MIB(Mechanistic Interpretability Benchmark)项目团队(ICML 2025发表,四任务五模型标准评测集)
怎么参与
在HuggingFace mib-bench上跑一遍现成方法,对比自己方法的分数