冻结问答任务与答案契约
- 判断问题
- 主张覆盖哪些准确问题、来源、答案形式、用户与验收决定?
- 最低证据
- 逐字主张与日期;准确系统、模型、提示、检索与工具版本;闭卷、给定上下文、开放域或对话任务;答案类型、语言、用户群体、后果、评分与拒答阈值。
- 停止条件
- 单个基准分数或演示答案替代明确任务、来源条件、答案契约与决定阈值时停止。
流畅回答不是支持;一个分数不是完整能力
抽取片段、开放域答案、选择题与多轮问答的任务和错误并不相同。只有先固定问题与答案契约,再核对来源、过程、完整分母及真实用途,才可以形成可复核的能力判断。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、语言、数据集或排行榜;不构成答案准确性、完整性或适用性保证。
六道可拒绝的证据门
最低问答主张失效矩阵
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
记录受影响的问题、来源、答案类型、语言、用户与决定;保留仍成立的最窄结论,并明确需要补来源、重标、重跑、人工复核、限制用途还是撤回主张。
最低问答能力评估记录
统一证据状态
准确系统在代表性目标问题上达到答案支持、完整性、拒答、可靠性、子群、人工工作、时延与成本阈值,并有当前复核日期。
支持仅在明确问题类型、来源、语料版本、语言、领域、答案形式或运行控制下成立。
检索、支持、完整性、拒答、关键错误、多次运行可靠性、时延或成本在不同分层间存在实质差异。
缺少问题或来源溯源、答案契约、参考答案流程、支持检查、完整分母、目标迁移或到期边界。
FUURAA 分析AI 问答能力主张的最小判断单位是“准确系统、模型、提示、检索与工具版本 × 问答任务、问题分布、语言、用户与答案契约 × 来源溯源、语料快照、权限、新鲜度与参考答案流程 × 访问、检索、上下文、阅读、推理与证据定位 × 答案支持、完整性、关键错误、不确定性与拒答 × 全部问题、失败、方差、人工修正、时延与成本 × 目标流程边界和截止日期”。答对一道题只是一个观察,不是可迁移的能力证明。
一手来源与不可外推边界
来源于 2026 年 8 月 29 日重新核对。每项保留发布日期、方法作用与不可外推边界。
建立基于英文维基百科段落的大规模抽取式阅读理解任务,并使用答案片段评分。
边界众包问题、维基百科段落与抽取片段不能证明开放域检索、综合、多语言使用、拒答或生产答案质量。
打开一手来源 ↗2018 年 6 月 11 日发布SQuAD 2.0 — Know What You Do Not Know加入对抗式不可回答问题,要求系统在有依据时回答,在段落缺少答案时拒答。
边界固定数据集中的段落级拒答不能证明面对开放且变化信息时的不确定性校准、安全拒答或证据处理。
打开一手来源 ↗2019 年 7 月发布Natural Questions — A Benchmark for Question Answering Research使用真实匿名搜索查询,并在检索到的维基百科页面上标注长答案、短答案或空答案。
边界搜索查询与单个选定维基百科页面的组合不能代表所有信息需求、来源集合、新鲜度要求、用户群体或高后果决定。
打开一手来源 ↗2019 年 3 月 1 日发布DROP — Discrete Reasoning Over Paragraphs测试英文段落上的指代消解,以及计数、加法、排序等离散操作。
边界段落算术与精确答案评分不能证明广泛推理、事实新鲜度、来源选择或可靠的多步工作流完成。
打开一手来源 ↗2020 年 3 月 10 日发布TyDi QA — Information-Seeking QA in Typologically Diverse Languages直接以十一种类型差异显著的语言收集真实求知问题,而不是翻译英文任务。
边界十一种语言与基于维基百科的标注不能覆盖所有语言变体、文化、领域、来源格式或生产交互。
打开一手来源 ↗2017 年 11 月 14 日发布DuReader — Chinese Machine Reading Comprehension from Real-world Applications中国团队主导的开放域资源使用百度搜索与百度知道的问题和文档,并提供人工答案,包括是非题与观点题。
边界其平台、中文数据分布与参考答案流程不能代表所有华文变体、地区、来源权威性、当前事实或已部署问答工作流。
打开一手来源 ↗继续核对