罗盘 / 检索增强生成的事实性瓶颈
暗星档案 · 未点亮的星检索增强生成的事实性瓶颈
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
检索增强生成的事实性瓶颈T5 量级 · 新星
给了模型正确资料,它还是可能编造答案
所属星云打开黑箱·读懂AI的心活下去
暗星编号DS-0763
轴A · 可及性与成员福祉
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
检索增强生成(RAG)本意是让大模型基于检索到的真实文档回答问题以减少幻觉,但实践发现即使提供了正确文档,模型依然会编造、曲解或忽略检索内容——尤其在多跳推理、证据冲突场景下更严重。攻破意味着:医疗、法律、金融等高风险领域的AI问答系统能做到「有据必依、无据不答」,让检索到的证据真正约束生成内容而不只是摆设。
卡在哪 · 机制级卡点
现有幻觉检测方法(语义级内部推理图、稀疏自编码器忠实性分析)能识别部分幻觉,但缺乏统一的幻觉分类标准和评估框架;根本卡点在于模型的生成机制本身不是「先查证据再回答」,而是端到端的概率生成,检索内容只是提示的一部分而非硬约束。
谁在攻
IBM Research(Granite Guardian幻觉检测模型);学术界在RAG忠实性上持续发表方法论文(如HalluGuard),暂未核实到统一权威主导团队
怎么参与
用开源RAG框架(如LlamaIndex)搭建一个问答系统,故意构造证据冲突场景测试模型的幻觉行为