罗盘 / 推理时计算的效率天花板
暗星档案 · 未点亮的星推理时计算的效率天花板
本条为初评草案(AI 辅助编目):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。
推理时计算的效率天花板T5 量级 · 新星
让模型多想一会儿变聪明,但别想太久变浪费
暗星编号DS-0764
轴A · 可及性与成员福祉
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难
OpenAI o1、DeepSeek R1等推理模型证明了「用推理时的额外计算换取更强推理能力」这一新扩展范式,但这类模型普遍存在「过度思考」问题——在简单算术题上也生成远超必要长度的推理链,浪费大量算力和延迟。攻破意味着:模型能按问题难度自适应分配思考量,简单问题秒答、难题才深度推理,让推理时计算的边际收益真正对齐边际成本。
卡在哪 · 机制级卡点
长度可控的策略优化等方法能部分控制推理链长度,但模型缺乏对「这道题到底需不需要深度思考」的可靠自我判断能力,现有方法多是外部施加长度惩罚而非模型习得的内在校准,在分布外难题上容易失准。
谁在攻
OpenAI(o1系列);DeepSeek(R1,公开验证纯强化学习可达到同等推理能力);学术界持续产出效率优化方法(如length-controlled policy optimization)
怎么参与
在开源推理模型(如DeepSeek R1蒸馏版)上对比不同难度题目的思考token数,尝试实现简单的长度惩罚微调