FUURAA™ 赋睐™ AI 知识图书馆 · 浏览器本地工具

AI Agent 评估运行记录器

把一次 Agent 系统评估整理为可重建、可比较、可到期的 JSON 记录。所有填写内容仅在当前浏览器页面处理,除非你主动下载或复制。

工具状态公开可用 · 浏览器本地记录规则ai-agent-evaluation-run-record/v1来源核对2026 年 8 月 4 日

运行记录工作区

六部分记录,把系统身份、运行证据与有限发布决定连接起来。

从空白开始,或载入明确标注的虚构示例。完成度只检查字段是否存在,不判断测试设计、证据真实性或部署安全。

0%仍有 38 个字段未填写。

01

决策与系统身份

冻结具体部署问题与完整行动系统。

0/9
02

任务分布与基线

说明抽样工作、受影响对象与让结果有意义的比较基线。

0/5
03

评估设计

预先声明数据、固定条件、评分器、阈值、重复次数与责任评估者。

0/6
04

结果与过程证据

把结果与轨迹一起保留,避免平均值掩盖关键失败。

0/6
05

迁移与适用边界

说明已测试语境,以及仍缺乏支持的迁移。

0/5
06

有限发布决定

把决定绑定到责任人、监测、回滚、到期与重跑触发条件。

0/7

JSON

机器可读运行记录预览

导出采用 RFC 8259 JSON。字段结构是 FUURAA 公共方法,不是国际标准、审计或认证格式。

{
  "schema": "fuuraa.ai-agent-evaluation-run-record/v1",
  "record_id": "",
  "deployment_decision": "",
  "system_identity": {
    "agent_release": "",
    "model_stack": "",
    "tools_and_connectors": "",
    "execution_environment": "",
    "memory": "",
    "authority_boundary": "",
    "human_controls": ""
  },
  "task_context": {
    "intended_users": "",
    "workflow": "",
    "task_distribution": "",
    "failure_consequence": "",
    "frozen_baseline": ""
  },
  "evaluation_design": {
    "dataset_or_task_set": "",
    "fixtures_and_initial_state": "",
    "scorers_and_rubrics": "",
    "thresholds": "",
    "repetitions_and_seeds": "",
    "evaluation_owner": ""
  },
  "results_and_process": {
    "per_task_outcomes": "",
    "process_trace": "",
    "variance_and_uncertainty": "",
    "recovery_and_handoff": "",
    "cost_and_latency": "",
    "critical_failures": ""
  },
  "transfer_and_boundary": {
    "languages": "",
    "geographies_and_domains": "",
    "operators": "",
    "excluded_uses": "",
    "residual_risks_and_unknowns": ""
  },
  "release_decision": {
    "state": "",
    "decision_owner": "",
    "monitoring_plan": "",
    "rollback_and_stop_plan": "",
    "expires_at": "",
    "rerun_trigger": "",
    "rationale": ""
  }
}

适用边界

结构完整,不代表 Agent 已经适合部署。

工具可以做什么

  • 冻结一次评估对应的系统、权限、任务与比较基线
  • 把逐次结果、过程轨迹、关键失败与迁移边界放进同一记录
  • 在浏览器本地导入、复制和下载可交接 JSON

工具不能证明什么

  • 运行真实发生、日志未被篡改或责任人身份有效
  • 任务分布具有代表性、评分器有效或结论可迁移
  • 系统安全、合法、合规、通过审计或获得认证

FUURAA 分析一份有用的 Agent 运行记录必须服务于一个具体部署决定,并让第三方能够重建当时的模型、工具、权限、环境、任务与失败。任何综合分数都不能抵消越权、不可恢复副作用或其他关键失败。

一手来源与边界

用框架设计可检查记录,不把框架名称冒充发布批准。

2023 年 1 月 26 日

NIST AI RMF 1.0

把系统语境、测量、治理与持续风险管理连接到 AI 全生命周期。

边界属于自愿性、用途无关框架;它不规定本记录,也不认证任何部署。

打开一手来源 ↗
2024 年 7 月 26 日发布 · 页面于 2026 年 4 月 8 日更新

NIST AI 600-1 · Generative AI Profile

补充生成式 AI 在测量、来源、信息完整性与人类监督方面的风险与行动。

边界其中行动仍需结合实际系统、受影响人群与部署语境确定优先级。

打开一手来源 ↗
2024 年 5 月发布 · 文档于 2026 年 8 月 4 日核对

UK AI Security Institute · Inspect

提供围绕任务、数据集、Agent、工具、评分器、沙箱与日志组织的开放评估框架。

边界框架可以让运行可检查,却不能让薄弱任务分布自动具有代表性,也不能证明评分器有效。

打开一手来源 ↗
1.1 版 · 最后更新于 2026 年 5 月 8 日

METR · Task-Completion Time Horizons 1.1

展示如何以可复核方法把成功概率关联到连贯软件任务的时长。

边界METR 说明目前 16 小时以上测量并不可靠;该指标不是实际自主运行时长或通用部署证据。

打开一手来源 ↗
互联网标准 · 2017 年 12 月

IETF RFC 8259 · JSON

定义本工具导出运行记录所使用的可移植结构化数据交换格式。

边界JSON 语法有效不能证明运行真实发生、轨迹可信或发布决定合理。

打开一手来源 ↗