NB-0089ⅩⅣ · 活下去 · 免于毁灭的渴望
打开黑箱读懂AI的心
把神经网络从不透明黑箱变成能像读代码一样读懂的白箱。
11颗暗星在攻
8.2潜能光度
4个方向
RAI 隐藏目标、谋划与藏拙审计用已知答案的审计游戏验证,能否识别模型在评估中策略性误导人。T6 · 行星E生成式AI不确定性校准与可靠弃答让系统在界定任务上给出可验证的覆盖—错误权衡。T6 · 行星R可证明安全 AI · 形式化保障用数学证明而非经验测试来约束 AI 在关键基础设施中的行为——把「大概安全」升级为「可证安全」。T6 · 行星R思维链忠实性验证判断可见推理是否真的承载了模型答案的因果依据。T6 · 行星RAI潜在信息与策略性欺骗探测从内部状态与行为证据中识别模型何时有信息却策略性误导。T6 · 行星R机制可解释性打开神经网络这个黑箱,看清它内部到底在算什么——对齐的地基工具T5 · 新星R大模型知识编辑与增量更新让大模型学会「精准改一条事实」而不遗忘别的T5 · 新星A检索增强生成的事实性瓶颈给了模型正确资料,它还是可能编造答案T5 · 新星R诚实性训练而非事后检测与其事后抓AI说谎,不如从训练源头让它想说真话T5 · 新星E跨模型可解释性基准给"读懂AI在想什么"定一套统一考卷T5 · 新星R特征叠加解耦·稀疏自编码器把一个神经元'身兼数职'拆成一个特征一件事T5 · 新星