罗盘 / 高风险翻译幻觉检测与人工升级
暗星档案 · 未点亮的星

高风险翻译幻觉检测与人工升级

本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

高风险翻译幻觉检测与人工升级T5 量级 · 新星
在医疗、法律等场景,系统必须知道什么时候不能自己翻
暗星编号DS-1178
R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

机器翻译会产生看似流畅却增删或扭曲关键信息的幻觉。高风险场景需要句段级风险估计、证据提示、可校准置信度和明确的人工升级机制,而不只是平均翻译质量更高。

卡在哪 · 机制级卡点

幻觉稀少但后果严重,常规自动指标难发现;不同语言和领域缺少带错误类型的真实数据。质量估计模型也可能在分布外文本中过度自信,人工升级阈值还涉及成本与责任分配。

谁在攻

WMT 质量估计任务共同体、COMET/COMETKiwi 与多语翻译可靠性研究团队

怎么参与

可从多语高风险数据集、错误类型标注、选择性预测、人工协同界面或部署后审计切入。

来源 · 可查证