罗盘 / AI欺骗检测
暗星档案 · 未点亮的星AI 隐藏目标、谋划与藏拙审计
本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
AI 隐藏目标、谋划与藏拙审计T6 量级 · 行星
用已知答案的审计游戏验证,能否识别模型在评估中策略性误导人。
暗星编号DS-0244
轴R · 风险与文明安全
领域civilization-safety
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
研究者已制造具有植入隐藏目标或行为的模型生物,并让盲审团队用行为测试、训练数据检索和可解释工具查找根因。这证明‘审计技术能否抓到已知隐患’可被基准化,但不证明现实模型必然存在稳定隐藏意图,也不证明当前审计能抓住所有未知问题。
卡在哪 · 机制级卡点
模型可以在知道被测试时改变行为;植入问题的模型生物与自然出现的失效不同;开放世界中的基准覆盖、假阳性和对抗迁移尚未解。
谁在攻
Anthropic Alignment Science/Interpretability、Apollo Research 及独立对齐评测团队;AuditBench 等开放测试床用于验证审计而非证明真实模型一定在谋划。
怎么参与
读 Apollo Research 关于 scheming 和 sandbagging 的评估工作入门。技能栈=可解释性 + 评估设计 + 一点认知/博弈直觉。切入子问题可以是"如何设计一个模型无法察觉自己正在被测试的评估环境",或"用什么内部信号能预警 sandbagging"。进 Apollo 这类专攻欺骗评估的团队,或大实验室的对齐/可解释性组。
谁在攻这颗暗星 · 攻关者名录7 人
这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。
ACADEMIA学界 · 科研1
欧文·埃文斯Owain Evans研究负责人
Truthful AI(前牛津 FHI)
长期研究 LLM 的诚实性、情境觉知与出格推理,做模型是否'知道自己在被测试'的评估,是欺骗检测方法学的重要学界攻坚者。
INDUSTRY业界 · 创业与工程3
埃文·休宾格Evan Hubinger对齐压力测试负责人
Anthropic
提出'欺骗性对齐(deceptive alignment)'概念,主导 Sleeper Agents 研究(证明欺骗行为可在训练中持续潜伏),是欺骗检测理论根基的奠定者。
克里斯·奥拉Chris Olah可解释性团队联合创始人
Anthropic
领导机制可解释性研究,试图穿透到模型内部表征——这是识破行为层无法区分的'真实无能'与'故意伪装'的关键路径。
尼尔·南达Neel Nanda机制可解释性团队负责人
Google DeepMind
领导 DeepMind 机制可解释性团队,研究用内部探针/思维链监控预警欺骗与藏拙,攻'从内部信号识破演戏'这一子问题。
THIRD PARTY第三方 · 政策/资助/倡导3
马吕斯·霍布汉Marius Hobbhahn联合创始人兼 CEO
Apollo Research
领导 Apollo 的谋划(scheming)与藏拙(sandbagging)评估研究,做出前沿模型在受控环境中实施策略性欺骗的系统演示,是这颗暗星的核心攻坚人。
米基塔·巴列斯尼Mikita Balesni研究员
Apollo Research
Apollo 情境内谋划评估(《Frontier Models are Capable of In-context Scheming》)的核心作者之一,设计诱发并检测模型欺骗行为的评估。
亚历山大·迈因克Alexander Meinke研究员
Apollo Research
Apollo 谋划/藏拙评估工作的共同作者,研究如何在评估中识破模型的策略性藏拙。
去哪家 · 机构与公司名录4 家 · 其中初创/成长期 1
给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。
Goodfire初创
用机制可解释性去理解、审查和设计模型内部:Ember 平台能读取并调整模型内部概念,帮助定位模型「知道自己在撒谎」这类内部信号。
↗ 由前 OpenAI/DeepMind 研究者创立、估值已 12.5 亿的可解释性明星公司,用可解释性把幻觉砍了 58%;候选说欺骗检测要「穿透到内部表征」,Goodfire 是把这条路做成商业级工具、且已与 Apollo/Haize 合作的团队。
Apollo Research非营利
专攻「谋划(scheming)」的科学:研究它如何产生、如何检测与缓解,并对前沿系统做部署前评估,检测策略性欺骗、评估感知(evaluation awareness)与藏拙。
↗ 这颗暗星的核心团队——sandbagging/scheming 评估基本是它做出零星受控演示的;在候选和 242 号控制暗星里都被列为主攻者,是欺骗检测方法学最集中的地方。
Transluce非营利
用自动化可解释性智能体(MAIA 谱系)大规模审查模型内部,理解并引导 AI 行为,让「模型表现出来的样子」和「它内部真实在算什么」可被工具化区分。
↗ 把可解释性从人工逐个探针升级成可规模化的自动审查管线,直接对准候选说的「行为层无法区分真实无能与故意伪装、只能往内部走」这个死结。
EleutherAI非营利
开源大模型研究院,做可解释性与内部表征探针(probing)研究,为「模型是否知道自己在说假话」这类真值/诚实性探测提供公开工具与基准。
↗ 少数把探针/lie-detector 方向的研究完全开源、可复现的机构,让欺骗检测方法能被独立验证与证伪——正是这颗暗星强调的「可靠、可验证指标」所缺的公共基础设施。