定义决策与任务分布
- 核心问题
- 本次评估服务于哪项部署决定,样本代表哪些真实任务?
- 应保留证据
- 预期用户、工作流、任务分类、出现比例、后果及非 Agent 基线。
- 阻断条件
- 若只是用方便取得的基准替代真实决策语境,应停止。
评估对象
同一个模型在不同工具、权限、记忆、提示、环境和人工控制下,会成为不同的 Agent 系统。公开基准可以提供信号,却不能替代与具体部署决定一致的系统级测试。
适用边界本页是公共评估设计方法,不是安全认证、合规结论、法律意见、采购建议或 FUURAA 产品能力声明。涉及高影响、金融、医疗、公共服务或物理行动时,仍需用途特定的专业责任、当地要求与独立验证。
先冻结八部分系统身份
七道评估门
最低测试矩阵
每类测试都要保存逐次轨迹、失败分类与运行配置;关键门按用途单独判定,不以综合分数相互抵消。
| 层 | 测试什么 | 最低通过证据 |
|---|---|---|
| 正常任务 | 在记录条件下执行具有代表性的任务 | 任务成功、质量、成本、延迟与完整轨迹 |
| 边界任务 | 稀有、含混与高后果案例 | 安全拒绝、澄清与正确升级 |
| 故障任务 | 工具不可用、超时、部分写入与陈旧状态 | 无重复后果;可见地恢复或停止 |
| 对抗任务 | 提示注入、恶意技术资料与授权混淆 | 隔离、拒绝、保存证据与升级 |
| 迁移任务 | 新用户、新语言、新数据与运行环境 | 报告退化并保留原主张边界 |
| 回归任务 | 每次重要系统变化后运行冻结的关键测试集 | 相对获批发布基线没有静默退化 |
发布语言
在一个有边界、受监测的用途内,全部关键门达到明确门槛。
已有有用证据,但必须明确补偿控制或尚缺覆盖。
即使其他方面表现良好,关键安全、授权、可靠性或交接门仍失败。
被评估系统、环境或决策边界发生重大变化,旧结果不再支持发布。
FUURAA 分析Agent 评估最常见的错误,是把“某模型在某基准得分较高”直接翻译为“这个 Agent 可以可靠完成工作”。模型能力只是系统输入之一;工具副作用、权限边界、环境状态、长程错误累积、人工接管和运行监测共同决定部署证据。
最低评估运行记录
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
填写可检查的标识、值、路径或责任人。
一手来源与边界
来源于 2026 年 8 月 4 日核对。每项来源均保留发布时间、作用与不可外推范围。
把语境、测量、治理与持续风险管理连接到 AI 生命周期。
边界自愿且不限定场景;它没有规定本页评估门,也不认证 Agent。
打开一手来源 ↗Living resource · checked 4 August 2026NIST AI Metrology Center组织面向测试、评估、验证与核验的指标、方法和工具。
边界NIST 明确说明收录不代表背书、验证或适用性判断。
打开一手来源 ↗Published 26 July 2024 · updated 8 April 2026NIST AI 600-1 · Generative AI Profile补充生成式 AI 在测量、来源、人类监督与信息完整性方面的风险。
边界跨行业指导仍需根据实际 Agent 与决策语境确定优先级。
打开一手来源 ↗Open-source framework · released May 2024UK AI Security Institute · Inspect提供可组合的任务、数据集、Agent、工具、评分器、沙箱、日志与分析。
边界框架能提高运行可复现性,但不能让薄弱任务集自动具代表性,也不能保证评分器正确。
打开一手来源 ↗Last updated 8 May 2026METR · Task-Completion Time Horizons 1.1把 Agent 成功概率与人类专家完成连贯软件任务所需时间联系起来。
边界METR 明确说明该指标不是实际自主运行时长、全部任务覆盖或整份工作可自动化的证据。
打开一手来源 ↗v1.0 released 4 December 2024MLCommons · AILuminate区分演示、练习与正式安全测试,并记录结果发布条件。
边界其公开基准聚焦已定义的语言模型危害,不是完整的 Agent 部署评估。
打开一手来源 ↗继续使用