罗盘 / 特征叠加解耦·稀疏自编码器
暗星档案 · 未点亮的星特征叠加解耦·稀疏自编码器
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
特征叠加解耦·稀疏自编码器T5 量级 · 新星
把一个神经元'身兼数职'拆成一个特征一件事
所属星云打开黑箱·读懂AI的心活下去
暗星编号DS-1060
轴R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
大模型的单个神经元往往对多个不相关概念都会激活(多义性),根源是网络用'叠加'方式把远多于神经元数量的特征塞进有限维度空间。稀疏自编码器(SAE)通过在激活上训练一个更宽、更稀疏的字典,试图把叠加的特征解压成人类可理解的单义方向。Anthropic在Claude 3 Sonnet上的规模化SAE实验、OpenAI在GPT-4上的对应工作,是当前把'黑箱内部'变成可读电路图的最主流技术路线。
卡在哪 · 机制级卡点
SAE规模化到千亿参数级模型时训练成本极高、且提取出的特征仍只能解释部分激活方差;特征的'完备性'(是否找全了模型真正用到的所有概念)与'因果性'(该特征是否真的驱动了模型行为而非只是相关)都未解决,业界尚无公认的评测基准衡量'解释覆盖率'。
谁在攻
Anthropic可解释性团队(Scaling Monosemanticity项目,Claude 3 Sonnet)、OpenAI(GPT-4 SAE工作)、EleutherAI
怎么参与
读Anthropic的Transformer Circuits系列论文(transformer-circuits.pub),动手复现开源SAE在小模型上的训练