罗盘 / 幻觉根治
暗星档案 · 未点亮的星

生成式AI不确定性校准与可靠弃答

本条为初评草案(AI 辅助编目 · 评于 2026-07-16):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

生成式AI不确定性校准与可靠弃答T6 量级 · 行星
让系统在界定任务上给出可验证的覆盖—错误权衡。
暗星编号DS-0306
E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

真实,但“根治”应拆为检测、校准、弃答/检索和生成约束;语言模型在开放世界不可能仅靠一个置信数消灭所有错误。 语义熵可识别同义表述下的任意编造;保形弃答能在指定数据分布与假设下给错误率保证。跨分布、长链代理任务和对抗问题仍未获得通用保证。

卡在哪 · 机制级卡点

低熵可以稳定地产生同一个错误;检索源也会错;闭卷短答上的校准不能直接外推到代理系统。弃答减少错误同时牺牲覆盖,不能隐藏为“准确率提高”。

谁在攻

Oxford 团队 Farquhar、Kossen、Kuhn、Gal 等提出语义熵;保形预测社区把有限样本覆盖保证用于弃答。

怎么参与

读概率机器学习、校准(calibration)与可解释性方向;最好的切入子问题是「从模型内部激活中提取真实性信号」——用探针在开源模型上复现并改进「模型知道自己在撒谎」的检测。进各实验室的对齐/可解释性团队,或从开源 UQ 基准建设入手。

谁在攻这颗暗星 · 攻关者名录9 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

ACADEMIA学界 · 科研5
亚林·加尔Yarin Gal机器学习教授 / 研究总监
牛津大学 / 英国 AI 安全研究所(AISI)
贝叶斯深度学习与不确定性量化(UQ)领军者,其团队将语义熵等方法用于 LLM 幻觉检测(Nature 2024),直攻「让模型知道自己不知道」。
巴拉吉·拉克什米纳拉亚南Balaji Lakshminarayanan研究科学家
Google DeepMind
深度集成(Deep Ensembles)不确定性估计经典方法作者,是神经网络置信度校准与 UQ 方向的核心推动者。
欧文·埃文斯Owain Evans创始人 / 研究负责人
Truthful AI(原牛津 FHI)
TruthfulQA 基准共同作者,长期研究 LLM 的诚实性与真实性评测,直攻评测层「正确率-置信度校准」的测量标准问题。
雅各布·斯坦哈特Jacob Steinhardt统计与 EECS 副教授
UC Berkeley
ML 安全与「引出潜在知识」(ELK)方向的核心研究者,指导从模型内部提取真值信号的一系列工作。
基利安·温伯格Kilian Weinberger计算机科学教授
康奈尔大学
《On Calibration of Modern Neural Networks》作者之一,奠定现代神经网络置信度校准(温度缩放等)的基础工作。
INDUSTRY业界 · 创业与工程4
克里斯·奥拉Chris Olah可解释性研究负责人/联合创始人
Anthropic
领导 Anthropic 机制可解释性团队,试图从模型内部电路层面理解模型「何时在编造」,是用可解释性根治幻觉这条路线的旗手。
尼尔·南达Neel Nanda机制可解释性团队负责人
Google DeepMind
领导 DeepMind 机制可解释性团队,推动从激活中提取「真实性/知情」信号的探针方法,正对应这颗暗星的表征层子问题。
科林·伯恩斯Collin Burns研究员
OpenAI(原 UC Berkeley)
CCS 方法(Discovering Latent Knowledge in Language Models Without Supervision)作者,开创从内部激活无监督提取真值方向——正是「入口」里点名的切入子问题。
亚当·陶曼·卡莱Adam Tauman Kalai研究员
OpenAI
2025 年论文《Why Language Models Hallucinate》主要作者,从训练目标函数层面论证幻觉的机制性来源(弃权零分、猜测有分),对应训练层卡点。

去哪家 · 机构与公司名录5 家 · 其中初创/成长期 5

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

Patronus AI初创
2023 创 · 已融 $17M · 旧金山,美国
做 LLM 幻觉检测与评测基础设施,旗舰 Lynx 是开源幻觉检测模型(据称在医疗事实性上超 GPT-4 8.3%),并推出业界首个自助式幻觉检测 API
↗ 把「模型输出是否被检索上下文支撑」做成可调用的评测器(Lynx/CopyrightCatcher/FinanceBench),是最早把幻觉治理产品化、面向企业高风险场景的独立第三方之一
Cleanlab初创
2021 创 · 累计约 $30M(种子 $5M + A 轮 $25M),2026-01 被 Handshake AI 收购(acqui-hire) · 旧金山,美国
从 MIT 开源库起家,旗舰 Trustworthy Language Model (TLM) 给任意 LLM 回答打「可信度分」,用不确定性估计做 RAG 场景的实时幻觉检测
↗ 三位创始人均为 MIT CS 博士(Curtis Northcutt 等),把学术界的不确定性量化做成可落地的信任分层;被 MIT Tech Review 专文报道,2026 初被收编进 Handshake 研究团队——是这条暗星「表征层信号提取」路线最纯正的学院派创业
Galileo初创
LLM 评测与可观测性平台,含 groundedness/context adherence 专有指标,用自研 Luna-2 微调评测器做亚 200ms 的运行时护栏(对高风险回复内联拦截)
↗ 把「校准/接地」从离线评测推进到生产环境实时闸门(sub-200ms inline blocking),代表幻觉治理从「事后打分」转向「发生前拦截」的工程化方向
Vectara初创
推出 HHEM(Hughes Hallucination Evaluation Model)开源权重交叉编码器,专门检测 RAG 接地性,并维护公开的模型幻觉率排行榜
HHEM 开源榜单成了业界横比各大模型幻觉率的事实标准之一(如实测 DeepSeek/Gemini 的接地幻觉率),把「校准可测量」这件事公共化
Fiddler AI初创
企业 LLM 护栏,用自研微调的 Fiddler 评分模型在 100ms 内拦截超出阈值的幻觉/越狱/安全违规输入输出
↗ 从 ML 可观测性老兵切入 LLM 护栏,主打「低延迟实时评分」,代表把传统 MLOps 监控能力迁移到生成式场景的一路玩家

来源 · 可查证