冻结任务与初始状态
- 判断问题
- 哪一项准确用户意图、账户、权限、网站状态、软件版本与评估时间共同定义了任务?
- 最低证据
- 任务说明、起始 URL 与状态快照、账户角色、预置记录、语言区域、浏览器与网站版本、时间戳及重置流程。
- 停止条件
- 缓存会话、既有记录或无法复现的实时状态可能让任务在 Agent 行动前就显得已完成时停止。
把任务成功还原成状态变化
一项可解释的网页 Agent 主张至少要连接:用户意图、初始状态、实际观察、获准行动、独立核验的最终状态,以及所有残余与副作用。缺少其中任何一环,任务成功率就可能把预置状态、隐藏协助、错误目标或重复后果计算为能力。
适用边界本页是公共研究方法,不代表 FUURAA 产品能力,也不评价任何具体 Agent、模型、供应商或基准;不是采购建议、性能保证、安全认证、审计意见或法律与合规结论。
六道可拒绝的证据门
最低失效矩阵
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
记录受影响任务、实际与预期状态差异、权限边界、评判器是否捕获、可保留的最窄结论,以及修复后必须重跑的范围。
最低网页 Agent 评估记录
统一证据状态
准确任务、状态、观察、权限、行动预算与独立核验结果均可重建,并包含副作用与重复运行。
结果只在明确网站、版本、账户、观察通道、权限、任务或评估窗口内可信。
任务完成、副作用、语言、网站、重复运行或恢复测试指向不同方向。
缺少初始状态、观察、权限、协助、评判器或结果证据;仅有成功轨迹不构成证据。
FUURAA 分析网页 Agent 评估最容易丢失的不是某一次点击,而是从意图到后果之间的证据链。FUURAA 建议把能力主张保留为“任务与初态 × 观察界面 × 权限与预算 × 独立结果 × 日期”,并把副作用、人工协助、恢复与到期写进结论。任务完成率可以描述结果,但只有这条链能说明结果是否来自获准、可复核且可迁移的行动。
一手来源与不可外推边界
来源于 2026 年 8 月 22 日重新核对。每项保留发布日期、在本方法中的作用与不可外推边界。
提供可复现且具完整功能的网站环境,并以端到端任务正确性评估 Agent,而非只预测单个动作。
边界其任务、网站与模型结果是特定日期的研究快照,不证明当前系统在任意公开网站上的表现。
打开一手来源 ↗2024 年 1 月 24 日VisualWebArena — Evaluating Multimodal Agents on Realistic Visual Web Tasks把真实网页评估扩展到依赖视觉信息的任务,说明只观察文本或 DOM 可能遗漏完成任务所需的关键证据。
边界视觉定位结果受论文所用基准网站、观察设置、模型与评判器限制。
打开一手来源 ↗2024 年 4 月 11 日OSWorld — Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments使用真实计算机环境与基于执行的评判器,检查最终应用状态是否满足任务,而不只判断轨迹看起来是否合理。
边界桌面任务覆盖与历史结果不证明系统在其他操作系统、应用或工作流中的安全性、可靠性或适用性。
打开一手来源 ↗2024 年 2 月 8 日WebLINX — Real-World Website Navigation with Multi-Turn Dialogue提供跨真实网站的大规模专家示范,并揭示网页导航迁移到未见网站时的困难。
边界示范数据只测量指定导航设置,不核验实时交易结果,也不授权在第三方服务上采取行动。
打开一手来源 ↗2024 年 3 月 12 日WorkArena — How Capable Are Web Agents at Solving Common Knowledge Work Tasks?围绕可复现的知识工作任务,以及完整企业平台中的规则、页面与流程构建浏览器 Agent 评估。
边界该基准平台与任务集的结果不能直接迁移到所有企业系统、角色或权限模型。
打开一手来源 ↗2024 年 7 月 7 日WorkArena++ — Towards Compositional Planning and Reasoning-based Common Knowledge Work Tasks增加需要跨多个应用步骤、规划与推理的真实组合任务,而非只完成单页交互。
边界组合任务难度受基准设计限制,本身不测量权限控制、副作用、恢复能力或生产就绪程度。
打开一手来源 ↗继续核对