AI 自主完成任务的时间跨度正在延长
METR 提议用 Agent 在明确成功率下能够完成、且对应人类工作时长的任务来衡量能力。其纵向结果显示,前沿系统在测试条件下可完成的软件任务长度快速增长。
FUURAA 原创概念视觉现有证据说明什么
《AI完成长任务能力测量》的核心主张
METR 提议用 Agent 在明确成功率下能够完成、且对应人类工作时长的任务来衡量能力。其纵向结果显示,前沿系统在测试条件下可完成的软件任务长度快速增长。
FUURAA 编辑解读
解读《AI完成长任务能力测量》:Agent时间跨度究竟测量什么?
METR提出的时间跨度方法,把抽象基准分数转化成一个更容易理解的问题:如果用相关人类专家完成任务所需时间近似任务难度,AI Agent在某个明确成功概率下,能够完成多难的任务?这个指标的价值在于把能力、可靠性与多步骤工作连接起来;它也非常容易被误读。所谓“两小时时间跨度”,不代表Agent会连续无人监管运行两小时,也不代表它能替代任何职业的两小时工作,更不代表所有更短的现实任务都会成功。
一、《AI完成长任务能力测量》的核心主张
2025年3月发布的研究,为软件工程、机器学习、网络安全与推理任务估算人类完成时间,再把每个Agent的成功概率与这些时间拟合成曲线。曲线与选定成功率相交的位置,就是该Agent的任务时间跨度。原始分析报告,前沿系统的百分之五十成功时间跨度在此前约六年呈指数增长,估算翻倍时间约为七个月。这个方法让基准结果获得了分钟、小时这类可解释单位,但结论始终取决于任务集合、Agent脚手架、人类时间估计、评分规则与历史区间。METR在2026年1月发布Time Horizon 1.1,扩充并修订任务;当前方法页面还明确提醒,现有任务集对超过十六小时的估计并不可靠。因此这里是一手资料支持的编辑分析,不视为独立验证,更不能把历史拟合写成AI进步的普遍定律。
二、人类用时是难度代理,不是Agent实际运行时间
任务标注的时长,是具备相应技能的人在评估条件下通常需要多少时间,并不是模型生成Token或操作工具的墙上时钟。一个被标记为“人类两小时”的任务,Agent可能在更短时间完成,也可能几分钟后就失败。这个区别非常重要,因为指标真正想排列的是连续工作难度:理解要求、寻找相关信息、在环境中操作、作出多次决定、识别错误并恢复。与抽象分数相比,人们更容易理解分钟、小时和天,因此人类用时是有用的沟通尺度;但时间并不等于纯粹复杂度。对仓库是否熟悉、是否掌握工具、说明是否完整、是否已经拥有组织背景,都会改变人类用时。同一任务在熟悉系统的内部工程师与首次接触环境的评估者之间,可能存在明显差距,所以不能把时间标签当成客观不变的物理量。
三、为什么这个指标能看到短基准看不到的失败
许多Agent已经具备完成单个步骤的局部技能,却无法在更长序列中稳定连接这些技能。它可能选错文件,忘记早先约束,把表面通过的测试误判为完成,重复无效操作,或在集成工作结束前提前停止。时间跨度曲线通过不同长度任务与多次尝试,让这种累积失败显现出来,也能在短问答基准接近饱和时继续区分系统。对产品团队而言,最值得采用的不是某个漂亮数字,而是一套方法:定义端到端任务,估计相应人类难度,使用真实Agent配置重复运行,并公布完整成功的概率。这样,评价重点就从“模型能不能展示一个令人信服的步骤”,转向“整个工作流能不能到达可核验结果”。还应分别报告百分之五十与更高成功阈值,因为可试错的个人任务与高后果生产操作,对可靠性的要求完全不同。
四、能否外推到真实世界,是最重要的边界
METR当前任务主要集中在边界明确、自包含、可以清楚判分的技术工作,包括软件、机器学习和网络安全。真实组织却充满模糊请求、遗留系统、权限缺口、优先级变化、社会协商、未记录例外以及无法用单元测试表达的后果。日常工作中的专家还携带长期积累的背景,而受邀评估者和Agent可能没有这些信息;METR也说明,这可能使测得的人类时长高于熟悉业务的专业人员实际所需时间。另一方面,受控基准可能省略现实中的中断、安全审核、跨部门依赖和责任判断。因而,这个指标应被理解为特定任务类别上的校准信号,不是把模型名称直接换算成岗位替代比例的表格。若要外推到法律、医疗、公共管理或物理世界,必须建立新的行业任务、风险分级与后果适配评分,不能只沿用软件基准。
五、什么证据会加强或削弱这一判断
如果由不同机构维护的任务集能在多个领域复现相近趋势,若任务、脚手架与人类基线变化后估计仍较稳定,而且测得的提升能够预测后来未参与基准设计的真实项目成功率,那么指标可信度会提高。相反,如果表现严重依赖少数任务家族,Agent能够欺骗自动评分却交付不可使用的工作,或所谓更长跨度在独立复核、陌生仓库与真实权限控制下消失,就应降低信心。Time Horizon 1.1本身说明测量必须持续演进:METR把任务从170个增至228个,把八小时以上任务从14个增至31个,修正或移除定义含混、容易利用评分漏洞或评分器有错误的项目,并更换评估基础设施。读者应期待版本号、置信区间与可比较记录,而不是把一次发布的数字永久固定。
FUURAA 将来源报告的事实与编辑判断分开。合作方公布的结果不视为独立验证;结论仅适用于具名来源、日期、系统及已披露运行场景,不向其他机器人、行业或部署条件自动外推。
如何理解本条信息
已有公开依据的发展
相关事件、报告或研究结论已经公开,但其未来影响仍可能存在不确定性。



