FUURAA™ 赋睐™ AI 知识图书馆 · Agent 评估协议

如何在部署前评估一个 AI Agent

一份面向真实行动系统的双语协议:不只看最终答案,而是冻结模型、工具、权限、环境与人工控制,测量任务结果、执行过程、波动、恢复、安全、迁移和交接。

发布2026 年 8 月 4 日证据状态基于一手框架与测量研究的 FUURAA 方法综合适用范围具备工具、记忆或外部行动能力的 AI Agent

评估对象

评估的是整个行动系统,不只是底层模型。

同一个模型在不同工具、权限、记忆、提示、环境和人工控制下,会成为不同的 Agent 系统。公开基准可以提供信号,却不能替代与具体部署决定一致的系统级测试。

适用边界本页是公共评估设计方法,不是安全认证、合规结论、法律意见、采购建议或 FUURAA 产品能力声明。涉及高影响、金融、医疗、公共服务或物理行动时,仍需用途特定的专业责任、当地要求与独立验证。

先冻结八部分系统身份

版本不清楚,分数就不可比较。

  • 01
    Agent 发布版本
    准确的 Agent 软件包、编排循环与配置摘要
  • 02
    模型组合
    提供方、模型、快照、推理设置与回退顺序
  • 03
    工具
    模式、版本、外部后果、凭证与批准规则
  • 04
    环境
    沙箱、网络、文件、服务、固定数据与重置方法
  • 05
    记忆
    读写范围、保留期限、检索策略与初始状态
  • 06
    授权
    允许行动、预算、排除项、到期与撤销
  • 07
    人工控制
    批准节点、介入通道、升级负责人及停止路径
  • 08
    评估构建
    数据集、评分器、评估器、随机种子、重复次数与运行时间

七道评估门

每一道门都保留问题、证据与阻断条件。

01

定义决策与任务分布

核心问题
本次评估服务于哪项部署决定,样本代表哪些真实任务?
应保留证据
预期用户、工作流、任务分类、出现比例、后果及非 Agent 基线。
阻断条件
若只是用方便取得的基准替代真实决策语境,应停止。
02

冻结系统与可用条件

核心问题
另一团队能否重建 Agent 当时能看到、记住、调用和改变的全部条件?
应保留证据
八部分系统身份、依赖锁定、固定数据、权限与环境重置证据。
阻断条件
模型、工具、权限或隐藏环境状态发生静默变化时,不得比较运行结果。
03

分别评估结果与过程

核心问题
任务是否正确完成,执行路径是否遵守授权、安全、成本与证据要求?
应保留证据
最终状态、部分得分、工具轨迹、策略决策、无依据主张、成本、延迟与人工介入。
阻断条件
看似合理的最终答案不能掩盖禁止行动、隐藏重试或无法重建的轨迹。
04

测量波动、恢复与长任务表现

核心问题
在重复运行、更长任务、部分故障与初始条件变化时,Agent 多常成功?
应保留证据
逐次结果、置信区间、失败聚类、检查点、恢复尝试及人类用时基线。
阻断条件
不得把一次成功轨迹或 50% 任务时域解释为可靠性或通用自主能力。
05

挑战工具、指令与授权

核心问题
遭遇提示注入、欺骗内容、工具不可用、凭证过期与指令冲突时会怎样?
应保留证据
对抗案例、隔离证据、被拒绝行动、升级记录与剩余风险负责人。
阻断条件
若 Agent 能在缺少独立控制或可见记录时跨越重大边界,必须阻断发布。
06

检验迁移与人工交接

核心问题
面对新用户、新语言、新数据、新环境与真实升级压力时,表现是否仍成立?
应保留证据
保留集与现场结果、分组切片、拒答、操作员负担、交接质量及受影响方反馈。
阻断条件
不得把实验室、仅英文或专家操作结果迁移为更广泛的运行主张。
07

形成有范围的发布决定

核心问题
哪项具体用途属于可试用、有条件、阻断或已失效,什么证据会重新启动决定?
应保留证据
决策负责人、门槛表、已接受不确定性、监测、回滚、到期与重新评估触发条件。
阻断条件
任何综合分数都不得覆盖关键门失败,也不得支持超出测试边界的用途。

最低测试矩阵

平均成功率无法替代分层测试。

每类测试都要保存逐次轨迹、失败分类与运行配置;关键门按用途单独判定,不以综合分数相互抵消。

测试什么最低通过证据
正常任务在记录条件下执行具有代表性的任务任务成功、质量、成本、延迟与完整轨迹
边界任务稀有、含混与高后果案例安全拒绝、澄清与正确升级
故障任务工具不可用、超时、部分写入与陈旧状态无重复后果;可见地恢复或停止
对抗任务提示注入、恶意技术资料与授权混淆隔离、拒绝、保存证据与升级
迁移任务新用户、新语言、新数据与运行环境报告退化并保留原主张边界
回归任务每次重要系统变化后运行冻结的关键测试集相对获批发布基线没有静默退化

发布语言

发布状态必须绑定具体用途、版本和时间。

supported

可进行有限试用

在一个有边界、受监测的用途内,全部关键门达到明确门槛。

developing

有条件

已有有用证据,但必须明确补偿控制或尚缺覆盖。

mixed

阻断

即使其他方面表现良好,关键安全、授权、可靠性或交接门仍失败。

insufficient

已失效

被评估系统、环境或决策边界发生重大变化,旧结果不再支持发布。

FUURAA 分析Agent 评估最常见的错误,是把“某模型在某基准得分较高”直接翻译为“这个 Agent 可以可靠完成工作”。模型能力只是系统输入之一;工具副作用、权限边界、环境状态、长程错误累积、人工接管和运行监测共同决定部署证据。

最低评估运行记录

十二个字段,让每次结果可以重建、比较和失效。

  1. 01评估编号与决策

    填写可检查的标识、值、路径或责任人。

  2. 02系统身份

    填写可检查的标识、值、路径或责任人。

  3. 03任务分布

    填写可检查的标识、值、路径或责任人。

  4. 04基线

    填写可检查的标识、值、路径或责任人。

  5. 05数据集与固定数据

    填写可检查的标识、值、路径或责任人。

  6. 06评分器与门槛

    填写可检查的标识、值、路径或责任人。

  7. 07重复次数与随机种子

    填写可检查的标识、值、路径或责任人。

  8. 08逐次运行轨迹

    填写可检查的标识、值、路径或责任人。

  9. 09失败与人工介入

    填写可检查的标识、值、路径或责任人。

  10. 10边界与排除用途

    填写可检查的标识、值、路径或责任人。

  11. 11发布状态与负责人

    填写可检查的标识、值、路径或责任人。

  12. 12到期与重跑触发条件

    填写可检查的标识、值、路径或责任人。

一手来源与边界

把框架与研究用于方法设计,不把它们冒充部署批准。

来源于 2026 年 8 月 4 日核对。每项来源均保留发布时间、作用与不可外推范围。

Published 26 January 2023NIST AI RMF 1.0

把语境、测量、治理与持续风险管理连接到 AI 生命周期。

边界自愿且不限定场景;它没有规定本页评估门,也不认证 Agent。

打开一手来源 ↗
Living resource · checked 4 August 2026NIST AI Metrology Center

组织面向测试、评估、验证与核验的指标、方法和工具。

边界NIST 明确说明收录不代表背书、验证或适用性判断。

打开一手来源 ↗
Published 26 July 2024 · updated 8 April 2026NIST AI 600-1 · Generative AI Profile

补充生成式 AI 在测量、来源、人类监督与信息完整性方面的风险。

边界跨行业指导仍需根据实际 Agent 与决策语境确定优先级。

打开一手来源 ↗
Open-source framework · released May 2024UK AI Security Institute · Inspect

提供可组合的任务、数据集、Agent、工具、评分器、沙箱、日志与分析。

边界框架能提高运行可复现性,但不能让薄弱任务集自动具代表性,也不能保证评分器正确。

打开一手来源 ↗
Last updated 8 May 2026METR · Task-Completion Time Horizons 1.1

把 Agent 成功概率与人类专家完成连贯软件任务所需时间联系起来。

边界METR 明确说明该指标不是实际自主运行时长、全部任务覆盖或整份工作可自动化的证据。

打开一手来源 ↗
v1.0 released 4 December 2024MLCommons · AILuminate

区分演示、练习与正式安全测试,并记录结果发布条件。

边界其公开基准聚焦已定义的语言模型危害,不是完整的 Agent 部署评估。

打开一手来源 ↗