AI价值聚合的社会选择难题
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
当AI要对齐'人类价值观'时,现实中人类偏好千差万别、甚至相互冲突——用社会选择理论(social choice theory)研究如何把多元、分歧的人类偏好聚合成AI能遵循的单一规则或宪法,这既是技术问题也是政治哲学问题。Anthropic的'集体宪法AI'(Collective Constitutional AI)实验证明公众共同起草的宪法可以达到不逊于研发者自己起草的合法性,OpenAI的'民主输入'(Democratic Inputs)项目资助了12个国家的10个团队探索可扩展的公众参与机制。攻破意味着AI的价值取向不再由单一公司或工程师团队暗中决定,而有可验证、可问责的合法性来源。
卡在数学与政治的双重根本限制:阿罗不可能定理等社会选择理论结果证明不存在同时满足所有'合理'公平性要求的通用偏好聚合规则,2025年研究进一步证明在RLHF框架下不存在唯一、普遍满意的民主对齐方式;实践上大规模公众参与机制的代表性、操纵风险和文化差异跨国协调仍无成熟方案。
Anthropic(Collective Constitutional AI实验,用公众共创宪法训练Claude);OpenAI(Democratic Inputs项目,资助12国10个团队探索可扩展参与机制);社会选择与AI对齐交叉研究学者(如提出'代表性社会选择'理论框架的学术团队)
阅读Anthropic Collective Constitutional AI报告与相关arXiv论文(学习);社会选择理论/AI治理交叉研究方向(研究)