罗盘 / 长时程可靠性
暗星档案 · 未点亮的星

长时程智能体可靠性 · 让 AI 可托付数月任务

本条为初评草案(AI 辅助编目 · 评于 2026-07):T 阶为三问初评(撬动面 × 停滞度 × 临界性),双评过 σ 门并红蓝复核后才升"已建档"。查不到的字段留空不编。点亮者会进入亮星候选流程,其贡献与星阶按 HCF 独立重评,不从暗星自动继承。

长时程智能体可靠性 · 让 AI 可托付数月任务T5 量级 · 新星
AI 能连续可靠工作多久,决定它是工具还是可托付的劳动力——这是 agent 时代的最后一道闸门。
暗星编号DS-0303
E · 能量与能力前沿
领域ai-computing
状态初评草案 · 待双评与红蓝复核
这是什么 · 为什么难

今天的 AI 在几分钟的任务上已接近人类,但任务一拉长到数小时、数天乃至数月,错误就开始复利式累积:一步走偏、后面全歪,且模型自己察觉不到。METR 的测量显示 AI 能完成的任务时长约每几个月翻一倍,但每翻一倍成功率都要重新爬坡。攻破这颗暗星,AI 才能真正承接科研项目、工程建设、企业运营这类跨月尺度的连续工作,等于把全球劳动力供给的上限重新定义。它是几乎所有 agent 应用的公共地基,不是某家公司的产品问题。

卡在哪 · 机制级卡点

机制卡点在三处:一是误差累积没有天然的纠错回路——语言模型每步都是概率采样,长链条上小偏差指数放大;二是状态一致性——上下文窗口有限,长任务的目标、约束与中间结论无法无损保持,压缩即失真;三是模型缺乏对自身进度的可靠元认知,不知道自己已经跑偏,无法主动回滚。目前的 scaffolding(检查点、反思、多 agent 互查)都是工程补丁,尚无架构级解法。

谁在攻

METR(任务时程翻倍律的独立测量)、OpenAI、Anthropic、Google DeepMind(各家 agent 产品线均在正面攻)

怎么参与

读强化学习、程序验证与 agent 评测方向;最可切入的子问题是「长任务的失败模式分类学」——复现并系统标注 agent 在 4 小时以上任务中到底怎么死的,这类基础测量工作严重供不应求。进 METR 这类独立评测机构或各大实验室的 agent 可靠性团队都是正路。

谁在攻这颗暗星 · 攻关者名录4 人

这不是终点站——今天在这颗暗星上攻坚的人,就是明天点亮它、登上星光榜的候选。名录含科研、创业与第三方三类关键角色,初评待核实,欢迎补充与纠正。

INDUSTRY业界 · 创业与工程1
诺姆·布朗Noam Brown研究员
OpenAI
主攻多步推理(o 系列 test-time reasoning),提升模型在长链条任务上的可靠推理深度,是长时程可靠性的核心攻方之一。
THIRD PARTY第三方 · 政策/资助/倡导3
贝丝·巴恩斯Beth Barnes创始人 / CEO
METR
创立 METR,建立对 AI 自主完成长任务能力的独立评测,提出并推广任务时程「每几个月翻一倍」的度量。
托马斯·卡Thomas Kwa研究员
METR
《Measuring AI Ability to Complete Long Tasks》论文主要作者,量化 AI 能可靠完成的任务时间跨度与其翻倍规律。
本·韦斯特Ben West研究员
METR
任务时程翻倍律研究共同主要作者,参与构建长任务评测方法与数据。

去哪家 · 机构与公司名录4 家 · 其中初创/成长期 3

给求职者和投资人的信息增量——不只是听过的大机构,更多是正在攻这颗暗星的初创与新公司(联网实搜、初创优先排序,初评待核实)。

来源 · 可查证