罗盘 / AI潜在信息与策略性欺骗探测
暗星档案 · 未点亮的星

AI潜在信息与策略性欺骗探测

本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

AI潜在信息与策略性欺骗探测T6 量级 · 行星
从内部状态与行为证据中识别模型何时有信息却策略性误导。
暗星编号DS-1059
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

真实研究方向,但“信念”在语言模型中是操作性概念:内部状态是否编码命题,以及输出是否故意偏离其可用信息。 命题探针能从激活中解码绑定关系;线性探针在实验性欺骗数据上表现很高,但论文作者明确认为仍不足以成为鲁棒防线。消除说谎尚无跨模型保证。

卡在哪 · 机制级卡点

探针可读到与任务相关的相关性,不代表找到了单一“信念”;训练探针会泄露检测方向给模型;编辑“欺骗向量”可能改变人格、自述或无关能力。诚实与事实正确也不同。

谁在攻

UC Berkeley 的 Feng、Russell、Steinhardt 推进命题世界状态探针;Apollo Research 的 Goldowsky-Dill、Chughtai、Heimersheim、Hobbhahn 研究策略性欺骗线性探针。

怎么参与

关注ARC与LessWrong上的ELK系列技术报告,机器学习/可解释性方向可从复现'Eliciting Latent Knowledge from Quirky Language Models'论文入手

来源 · 可查证