冻结任务、权限与验收决定
- 判断问题
- 系统可追求哪个准确用户结果,可使用哪些工具、凭证、副作用与后果?
- 最低证据
- 逐字主张与日期;准确 Agent、模型、提示与编排版本;用户任务与起始状态;合格工具;读取、写入、付费、发送与删除权限;批准节点;成功、安全、时延与成本阈值。
- 停止条件
- 通用工具使用分数或演示替代明确任务、权限边界、目标状态与验收决定时停止。
合法调用不是完成;流畅自述不是状态证据
函数名正确或 JSON 合法只回答调用是否成形。真正的判断还要说明工具是否适合、参数来自哪里、调用是否执行、世界状态是否按预期变化、规则是否被遵守,以及失败是否安全停止或恢复。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、Agent、工具、API、数据集或排行榜;不构成任务完成、安全、权限或可靠性保证。
六道可拒绝的证据门
最低工具使用主张失效矩阵
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
记录受影响的任务、工具、权限、状态、副作用、用户与决定;保留仍成立的最窄结论,并明确需要补测试、重跑、回滚、人工接管、限制权限还是撤回主张。
最低工具使用能力评估记录
统一证据状态
准确系统在代表性任务中达到权限、最终状态、可靠性、副作用、人工工作、时延与成本阈值,并有当前复核日期。
支持仅在明确工具、模式版本、任务、权限、环境、用户群体或运行控制下成立。
选择、参数、执行、最终状态、政策遵循、恢复、多次运行可靠性、时延或成本在不同分层间存在实质差异。
缺少工具界面、权限、初始状态、可执行轨迹、独立结果检查、完整分母、目标迁移或到期边界。
FUURAA 分析工具使用与函数调用能力主张的最小判断单位是“准确 Agent、模型、提示与工具链版本 × 用户任务、权限、后果与目标状态 × 工具注册表、模式、文档、凭证、沙箱与初始状态 × 发现、选择、参数、顺序与执行 × 最终状态、返回值溯源、规则遵循与任务完成 × 全部调用、失败、重试、回滚、干预、时延与成本 × 目标流程边界和截止日期”。生成一个格式正确的调用只是候选动作的起点,而不是完成证据。
一手来源与不可外推边界
来源于 2026 年 8 月 29 日重新核对。每项保留发布日期、方法作用与不可外推边界。
研究模型如何学习何时调用简单 API、传入哪些参数,以及如何把返回结果纳入后续生成。
边界少量固定且偏读取型的工具与下游语言任务不能证明权限处理、状态变更执行、失败恢复或生产任务完成。
打开一手来源 ↗2023 年 4 月 14 日发布API-Bank — A Comprehensive Benchmark for Tool-Augmented LLMs中国团队主导的研究提供可运行系统,通过标注的工具使用对话评估 API 规划、检索与调用。
边界其选定 API、合成训练数据与对话任务不能覆盖所有模式、语言、权限模型、在线服务或不可逆操作。
打开一手来源 ↗2023 年 5 月 24 日发布Gorilla — Large Language Model Connected with Massive APIs提出 APIBench,并测试 API 调用生成、文档检索及对文档变化的适应。
边界面向模型库 API 的正确外观调用不能证明执行成功、目标状态正确、安全授权或端到端任务完成。
打开一手来源 ↗2023 年 7 月 31 日发布ToolLLM and ToolBench — Mastering 16,000+ Real-world APIs中国团队主导的框架覆盖大量 REST API 的采集、指令生成、多工具解题路径、检索与自动评估。
边界API 数量与自动评估器不能保证在线端点稳定、返回语义、访问控制、副作用安全或人工验收。
打开一手来源 ↗2024 年 2 月发布;2024 年 8 月 19 日更新Berkeley Function-Calling Leaderboard测试函数相关性判断,以及跨多种编程与 API 格式的简单、多函数、并行及可执行调用。
边界函数选择、AST 与执行类别本身不能证明用户最终状态、政策遵循、多次运行可靠性或部署控制。
打开一手来源 ↗2024 年 6 月 17 日发布τ-bench — Tool-Agent-User Interaction in Real-World Domains评估动态用户交互、领域规则、API 工具、最终数据库状态及多次试验可靠性。
边界模拟用户、两个领域与标注目标状态不能代表所有人员、政策、工具界面、例外或真实运行后果。
打开一手来源 ↗继续核对