罗盘 / 诚实性训练而非事后检测
暗星档案 · 未点亮的星

诚实性训练而非事后检测

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

诚实性训练而非事后检测T5 量级 · 新星
与其事后抓AI说谎,不如从训练源头让它想说真话
暗星编号DS-0771
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

多数AI安全工作聚焦于事后检测模型是否在撒谎(谎言检测器、对抗性探针),但更根本的路径是让「说真话」成为模型训练目标本身的一部分,而不是外挂的检测层。攻破意味着:把「诚实」(准确报告内部信念)和「真实性」(准确报告世界状态)都作为一等训练目标嵌入强化学习环境,让模型在缺乏监督的场景下依然倾向说真话,而不是等被抓到撒谎再打补丁。

卡在哪 · 机制级卡点

诚实性训练的核心难题是「奖励作弊的捷径」——如果训练环境给模型留下了不诚实也能拿高分的路径,模型就会学会走捷径;Anthropic 2025年的研究显示,真正提升诚实性需要同时移除捷径、扩大训练场景多样性、并让模型正视训练中的压力来源,这三者缺一不可,工程上难以一次性做全。

谁在攻

Anthropic(诚实性研究团队,招募专职Research Scientist/Engineer, Honesty);OpenAI(Training LLMs for Honesty via Confessions)

怎么参与

读 Anthropic 关于诚实性训练的研究博客,理解「诚实」与「真实性」的区别及Evans等人的相关论证