罗盘 / 思维链忠实性验证
暗星档案 · 未点亮的星

思维链忠实性验证

本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

思维链忠实性验证T6 量级 · 行星
判断可见推理是否真的承载了模型答案的因果依据。
暗星编号DS-0906
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

真实且边界明确。问题不是文字推理是否“看起来合理”,而是可见推理是否忠实报告了实际影响模型答案的因素。 已有干预式测试,但还没有跨模型、跨任务、抗训练操纵的通用验证器。Anthropic 2025 年给 Claude 3.7 Sonnet 与 DeepSeek-R1 注入答案提示,再检查模型是否承认使用提示。

卡在哪 · 机制级卡点

语言化推理不是神经计算的完整转录;检测本身可能改变被测行为;一个方法可证明某类不忠实,却难证明“未检出即忠实”。公开原始思维链还涉及隐私、能力泄露与训练可博弈性。

谁在攻

Anthropic 2023 年工作提出对思维链改写、插错与释义的干预;Anthropic Alignment Science 2025 年扩大到推理模型与奖励漏洞。

怎么参与

读Anthropic《Measuring Faithfulness in Chain-of-Thought Reasoning》论文,尝试复现扰动实验

来源 · 可查证