罗盘 / 长时程可靠性
暗星档案 · 未点亮的星长时程智能体可靠性 · 让 AI 可托付数月任务
长时程智能体可靠性 · 让 AI 可托付数月任务潜能 T5
AI 能连续可靠工作多久,决定它是工具还是可托付的劳动力——这是 agent 时代的最后一道闸门。
暗星编号DS-0303
轴E · 能量与能力前沿
领域ai-computing
状态初步评估
这是什么 · 为什么难
今天的 AI 在几分钟的任务上已接近人类,但任务一拉长到数小时、数天乃至数月,错误就开始复利式累积:一步走偏、后面全歪,且模型自己察觉不到。METR 的测量显示 AI 能完成的任务时长约每几个月翻一倍,但每翻一倍成功率都要重新爬坡。攻破这颗暗星,AI 才能真正承接科研项目、工程建设、企业运营这类跨月尺度的连续工作,等于把全球劳动力供给的上限重新定义。它是几乎所有 agent 应用的公共地基,不是某家公司的产品问题。
卡在哪 · 机制级卡点
机制卡点在三处:一是误差累积没有天然的纠错回路——语言模型每步都是概率采样,长链条上小偏差指数放大;二是状态一致性——上下文窗口有限,长任务的目标、约束与中间结论无法无损保持,压缩即失真;三是模型缺乏对自身进度的可靠元认知,不知道自己已经跑偏,无法主动回滚。目前的 scaffolding(检查点、反思、多 agent 互查)都是工程补丁,尚无架构级解法。
谁在攻
METR(任务时程翻倍律的独立测量)、OpenAI、Anthropic、Google DeepMind(各家 agent 产品线均在正面攻)
怎么参与
读强化学习、程序验证与 agent 评测方向;最可切入的子问题是「长任务的失败模式分类学」——复现并系统标注 agent 在 4 小时以上任务中到底怎么死的,这类基础测量工作严重供不应求。进 METR 这类独立评测机构或各大实验室的 agent 可靠性团队都是正路。
谁在攻这颗暗星 · 攻关者名录4 人
这里列出正在探索这一问题的研究者、创业者与支持者。人物资料仍在核对,欢迎补充与纠正。
INDUSTRY业界 · 创业与工程1
诺姆·布朗Noam Brown研究员
OpenAI
主攻多步推理(o 系列 test-time reasoning),提升模型在长链条任务上的可靠推理深度,是长时程可靠性的核心攻方之一。
THIRD PARTY第三方 · 政策/资助/倡导3
贝丝·巴恩斯Beth Barnes创始人 / CEO
METR
创立 METR,建立对 AI 自主完成长任务能力的独立评测,提出并推广任务时程「每几个月翻一倍」的度量。
托马斯·卡Thomas Kwa研究员
METR
《Measuring AI Ability to Complete Long Tasks》论文主要作者,量化 AI 能可靠完成的任务时间跨度与其翻倍规律。
本·韦斯特Ben West研究员
METR
任务时程翻倍律研究共同主要作者,参与构建长任务评测方法与数据。
去哪家 · 机构与公司名录4 家 · 其中初创/成长期 3
了解正在研究或开发相关技术的团队,寻找工作与合作机会。机构资料仍在核对。
Bespoke Labs初创
构建高质量、复杂、真实的 RL 训练环境,通过后训练提升 agent 长时程可靠性,配套数据整备
↗ 创始人 Mahesh Sathiamoorthy 与 UT Austin 教授 Alex Dimakis;把「可靠 agent 靠环境训出来」直接做成公司,踩中 2025 环境新赛道
Mechanize初创
为 AI 编码 agent 造 RL 环境,起步目标是自动化软件工程任务
由 Epoch AI 前研究员 Tamay Besiroglu、Ege Erdil、Matthew Barnett 创立,与 Anthropic 合作环境、开 $50 万年薪抢人——研究者转身做公司的典型
Prime Intellect成长期
做 RL 环境的「Hugging Face」(Environments Hub)+ 训练与部署自我改进 agent 的全栈
↗ Karpathy、Founders Fund 背书;$130M 押注开放超智能栈,是环境赛道里规模最大、最具平台野心的一家
METR (Model Evaluation & Threat Research)非营利
独立测量前沿 AI 的「任务时程」——能以给定成功率完成多长的人类任务,发现约每 7 个月翻倍的规律
↗ 长时程可靠性的权威独立标尺(Time Horizon 系列),全行业引用;非某家产品的中立评测机构,是切入「失败模式分类学」的正路