罗盘 / 大模型训练能效墙
暗星档案 · 未点亮的星大模型训练能效墙
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
大模型训练能效墙T5 量级 · 新星
训一个前沿模型耗的电够一座城市用三天
暗星编号DS-0772
轴R · 风险与文明安全
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
训练前沿大模型的能耗已达到骇人量级——2025年估算一次大模型训练消耗50吉瓦时电力,足够旧金山用三天;全球数据中心电力消耗预计到2030年翻倍到1065太瓦时。攻破意味着:找到大幅降低单位算力能耗的训练方法(架构、算法、硬件协同优化),让AI能力提升不再与电网扩张、碳排放线性绑定,避免算力增长撞上能源供给的物理天花板。
卡在哪 · 机制级卡点
密歇根大学2025年研究显示当前训练流程有多达30%的电力被浪费在低效的资源调度上,说明工程层面还有明显优化空间;但更根本的卡点是Scaling Law驱动下模型规模和训练数据量的增长速度远超硬件能效提升速度(能效提升遵循类摩尔定律的渐进曲线,而模型规模是指数级增长),二者的增长率差距是结构性矛盾。
谁在攻
密歇根大学(训练能效优化研究);英伟达、AMD等硬件厂商持续推进单位能耗算力提升;DeepSeek团队证明架构创新可大幅降低训练能耗
怎么参与
读密歇根大学「30%训练电力被浪费」研究,了解DeepSeek通过架构创新降低训练能耗的具体技术路径