NB-0088ⅩⅣ · 活下去 · 免于毁灭的渴望
驯服超级智能对齐比人聪明的心智
在造出比自己聪明的智能之前,先学会怎么让它心甘情愿对我们好——文明能否活过这个世纪的必答题。
16颗暗星在攻
8.9潜能光度
5个方向
R可扩展监督 · 对齐理论当 AI 输出人类已无法验证,怎么持续判断它是否对齐——R 轴总闸T8 · 巨星R不可信AI控制协议即使模型目标不可信,也用权限、监控和抽查把灾难动作压到门槛内。T7 · 恒星RAI可纠正性与可靠带外关闭让有工具、持久状态和自我修改机会的系统仍不能阻断纠正与关闭。T7 · 恒星R前沿AI危险能力与保障评估把危险能力、现实伤害路径与绑定缓解动作变成可复测门槛。T6 · 行星RAI 隐藏目标、谋划与藏拙审计用已知答案的审计游戏验证,能否识别模型在评估中策略性误导人。T6 · 行星RAI 算力的硬件辅助核验用防篡改认证核验高端 AI 加速器的状态、用量和合规声明。T6 · 行星R可证明安全 AI · 形式化保障用数学证明而非经验测试来约束 AI 在关键基础设施中的行为——把「大概安全」升级为「可证安全」。T6 · 行星R思维链忠实性验证判断可见推理是否真的承载了模型答案的因果依据。T6 · 行星RAI价值聚合的社会选择难题把'人类想要什么'变成一个AI能遵循的规则,谁说了算T6 · 行星RAI潜在信息与策略性欺骗探测从内部状态与行为证据中识别模型何时有信息却策略性误导。T6 · 行星RAIxBio · 红线交点AI 拉低工程化大流行门槛——少数纯防御投入即可大幅降险的极不对称节点T5 · 新星R机制可解释性打开神经网络这个黑箱,看清它内部到底在算什么——对齐的地基工具T5 · 新星R元伦理收敛 · 价值不确定性不同价值体系能否收敛、道德没有确定答案时该如何行动——AI 对齐与文明间冲突共同的上游难题。T5 · 新星R模型权重与算法机密安全让前沿 AI 模型权重扛得住国家级攻击者的窃取——AI 风险链条中最脆、也最被低估的一环。T5 · 新星R多智能体系统风险 · 群体失效的理论与测试数百万个互相交易谈判的 AI agent 会涌现单体对齐防不住的群体失效——而这个领域几乎没有理论地基。T5 · 新星RAI生物设计工具风险评估 · 给AI划CBRN红线的度量衡在AI真能设计病原体之前,先把'多危险'量出个数