罗盘 / 检索增强生成的事实性瓶颈
暗星档案 · 未点亮的星检索增强生成的事实性瓶颈
这是什么 · 为什么难
检索增强生成(RAG)本意是让大模型基于检索到的真实文档回答问题以减少幻觉,但实践发现即使提供了正确文档,模型依然会编造、曲解或忽略检索内容——尤其在多跳推理、证据冲突场景下更严重。攻破意味着:医疗、法律、金融等高风险领域的AI问答系统能做到「有据必依、无据不答」,让检索到的证据真正约束生成内容而不只是摆设。
卡在哪 · 机制级卡点
现有幻觉检测方法(语义级内部推理图、稀疏自编码器忠实性分析)能识别部分幻觉,但缺乏统一的幻觉分类标准和评估框架;根本卡点在于模型的生成机制本身不是「先查证据再回答」,而是端到端的概率生成,检索内容只是提示的一部分而非硬约束。
谁在攻
IBM Research(Granite Guardian幻觉检测模型);学术界在RAG忠实性上持续发表方法论文(如HalluGuard),暂未核实到统一权威主导团队
怎么参与
用开源RAG框架(如LlamaIndex)搭建一个问答系统,故意构造证据冲突场景测试模型的幻觉行为