FUURAA™ 赋睐™ AI 知识图书馆 · 摘要能力评估

如何评估 AI 文本摘要能力主张

用六道证据门把“摘要得好”还原为准确任务、来源群体、完整链路、原文支持、重点覆盖、关键遗漏、压缩与表达质量、全部失败、人工修正、时延、成本和有日期的目标流程边界。

发布28 August 2026证据状态基于一手摘要研究与评估基准的方法综合适用范围抽取式、生成式、单文档与多文档摘要研究

短、顺、像人写,不等于有据、完整或适用

摘要能力必须把原文支持、重点覆盖、关键遗漏、冲突、失败和人工修正保留在同一证据链中。

高 ROUGE、流畅语气或单一裁判分数可能同时掩盖错误归属、关键条件遗漏与来源截断。先把事实支持、覆盖、压缩和表达质量分开验证,再回到目标用户与决定检查。

适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、摘要、机构、数据集或排行榜;不构成准确性、完整性、适用性或决策质量保证。

六道可拒绝的证据门

每道门都回答一个判断问题、要求最低证据,并在关键未知时停止外推或缩小结论。

01

冻结摘要任务与验收决定

判断问题
主张针对抽取式或生成式摘要、单文档或多文档、标题、简报、会议纪要、更新、比较,还是决定支持?
最低证据
逐字主张与日期;来源类型与数量;目标受众与决定;必需长度、格式、语言、视角与引用;纳入、排除、拒答与验收规则。
停止条件
“摘要做得好”或单个精美示例替代明确来源群体、输出约定与后果时停止。
02

复现完整的原文到摘要链路

判断问题
哪些准确模型、提示、上下文、检索、分块、排序、合并、后处理与人工步骤生成了验收摘要?
最低证据
供应商、模型与 API 版本;系统与用户提示;来源顺序与截断;上下文窗口;分块与重叠规则;检索与重排;工具;解码;重试;模板;编辑与复核指令。
停止条件
遗漏原文段落、隐藏检索、模板规则或人工重写被归功于摘要系统时停止。
03

定义原文溯源、覆盖与挑战分层

判断问题
覆盖哪些语言、领域、长度、结构、日期、冲突、冗余与来源质量?
最低证据
来源集与哈希;出处、日期、许可与抽样框;去重;训练或基准重合;语言、类型、长度、时间顺序、文档数量、表格、对话、矛盾、更新与低质量输入分层。
停止条件
英文短新闻未经直接证据就被外推到长报告、会议、科学材料、中文内容或多来源综合时停止。
04

分开有据性、覆盖、压缩与表达质量

判断问题
评估是否把原文支持与重点覆盖、遗漏、矛盾、重复、连贯、可读性、格式和受众适配分开?
最低证据
原子摘要主张与原文片段连接;实体、数字、日期、否定与归属检查;必需主题覆盖;关键遗漏与矛盾复核;压缩率;重复;结构;人工量表;复核者一致性与不确定性。
停止条件
ROUGE、单一参考摘要、单一大模型裁判或流畅度被当作事实有据、完整与实用的证明时停止。
05

计入每份来源、输出、失败与修正

判断问题
验收前,哪些来源或段落被遗漏、截断、忽略、错误综合、猜测、拒答、重试或修正?
最低证据
完整来源与运行分母;无依据与矛盾主张;关键遗漏;重复或过期来源;拒答;空输出与格式错误;超时;重试;筛选;编辑;复核时间;时延与成本分布。
停止条件
失败运行、遗漏文档或人工修正从报告的成功、质量与成本分母中消失时停止。
06

测试目标流程、变更触发器与到期

判断问题
结果能否在目标来源、用户、时限、复核程序、更新与下游决定中成立,而不超出证据?
最低证据
目标流程样本;关键内容地图;复核与升级规则;引用与打开原文程序;监测;模型、提示、来源与规则变更触发器;降级;负责人;复核日期与到期。
停止条件
基准或演示证据未经目标来源验证及连接原文的人工复核就用于重要决定时停止。

最低摘要能力主张失效矩阵

主动检查这些情形,避免把重合分、流畅度或单一参考摘要外推为真实摘要能力。

  • 01
    流畅摘要虚构原文没有的原因、引语、数字、日期、主体或关系

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 02
    摘要虽有原文支持,却遗漏会改变决定的例外、不确定性、异议或条件

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 03
    一个错误否定、单位、分母或归属逆转含义,但平均重合分仍然很高

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 04
    开头或检索到的段落占主导,后段、低排名、表格或跨文档证据消失

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 05
    相互冲突的来源被静默合并为一个自信结论,而没有保留分歧与日期

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 06
    标题式结果被当作长篇、会议、科学或多语言摘要的证据

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 07
    失败生成、拒答、截断、重试、候选筛选与人工重写从分母中消失

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

  • 08
    自动指标或大模型裁判给出高风格分,却漏掉无依据主张或关键遗漏

    记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。

最低文本摘要能力评估记录

让下一位复核者能够用同一来源、链路、版本、分层指标、完整运行、人工协议与目标边界重建结论。

  1. 01准确主张、日期、摘要任务、来源群体、受众、决定与验收量表
  2. 02供应商、模型、API、提示、工具、检索、重排、后处理与人工版本
  3. 03来源顺序、上下文限制、截断、分块、重叠、合并、解码、重试与输出设置
  4. 04来源集、溯源、日期、许可、哈希、抽样、去重与基准重合
  5. 05语言、领域、类型、长度、时间顺序、来源数量、冲突与输入质量分层
  6. 06原子原文支持、实体、数字、日期、否定、归属与矛盾结果
  7. 07必需主题覆盖、关键遗漏、压缩、重复、连贯、格式与受众适配
  8. 08全部来源与运行、截断、遗漏、拒答、格式错误、重试、筛选与编辑
  9. 09人工量表、打开原文协议、复核者一致性、修正时间、时延、成本与不确定性
  10. 10目标边界、监测、升级、降级、变更触发器、负责人、复核日期与到期

统一证据状态

把结论绑定到准确链路、来源群体、摘要约定、完整分母、人工复核、目标流程与日期。

有支持

证据支持准确链路、来源群体、摘要约定、连接原文的主张、关键覆盖、完整分母、人工复核与有日期目标边界。

有条件

证据仅支持更窄的语言、领域、来源长度、摘要格式、压缩目标、复核过程或下游用途。

结果混合

结果在事实支持、覆盖、来源位置、长度、语言、领域、冲突、复核者、时延或成本之间存在实质差异。

证据不足

缺少链路身份、代表性来源、连接原文的复核、关键遗漏检查、完整分母、修正、成本或目标迁移证据。

FUURAA 分析AI 文本摘要能力主张的最小判断单位是“准确链路与版本 × 摘要任务、来源群体、受众与决定 × 来源溯源、语言、领域、长度、结构、时间与冲突 × 提示、上下文、分块、检索、排序、合并与后处理 × 原文支持、重点覆盖、关键遗漏、矛盾、压缩与表达质量 × 全部来源、运行、失败、拒答、人工修正、时延与成本 × 目标流程边界和截止日期”。ROUGE、LCSTS、XSum、SummEval、FRANK 与 AGGREFACT 分别照亮重合、中文短文本、极端摘要、综合评估与事实性;任何单项都不能独立代表真实摘要能力。

一手来源与不可外推边界

这些来源分别约束重合度、中文短文本、单句新闻、人工评价与事实性检测;没有任何单项能独立证明真实流程能力。

来源于 2026 年 8 月 28 日重新核对。每项保留发布日期、方法作用与不可外推边界。

2004 年 7 月发布ROUGE — A Package for Automatic Evaluation of Summaries

定义以召回为导向的摘要重合度指标,成为比较系统摘要与参考摘要的常用基线。

边界N-gram 或序列重合不能独立证明事实有据、关键内容覆盖、连贯性、实用性或安全性。

打开一手来源 ↗
2015 年 6 月 19 日首次提交LCSTS — Large-Scale Chinese Short Text Summarization

从新浪微博建立超过 200 万组真实中文短文本与摘要,并对 10,666 组文本—摘要相关性进行人工标注。

边界中文社交媒体短文本不能证明长报告、会议、专业领域、所有中文变体或生产复核流程上的表现。

打开一手来源 ↗
2018 年 8 月 27 日首次提交XSum — Extreme Summarization

以 BBC 文章与短摘要建立单句、高抽象度的新闻摘要任务。

边界BBC 单句新闻摘要不能证明多文档综合、长篇忠实压缩、会议纪要、科学摘要或目标流程质量。

打开一手来源 ↗
2020 年 7 月 24 日首次提交;2021 年 2 月 1 日修订SummEval — Re-evaluating Summarization Evaluation

在 CNN/DailyMail 输出上,以专家与众包人工判断比较 14 项自动指标和 23 个摘要模型。

边界英文新闻与固定模型集合上的指标相关性,不能保证其适用于新系统、语言、领域、摘要长度或高影响用途。

打开一手来源 ↗
2021 年 4 月 27 日首次提交FRANK — Factuality in Abstractive Summarization

为 CNN/DailyMail 与 XSum 模型摘要建立事实错误类型体系与人工标注,可按错误类型比较指标。

边界新闻领域的事实性标注不能衡量显著性、完整性、受众适配、决定用途,也不能覆盖新模型与新领域的所有错误模式。

打开一手来源 ↗
2022 年 5 月 25 日首次提交;2023 年 5 月 26 日修订AGGREFACT — Understanding Factual Errors in Summarization

汇总九个带标注的事实性数据集,并按摘要系统代际与错误类型分层,显示检测器表现存在实质差异。

边界事实性检测器基准不能证明总体摘要质量、覆盖所有当前生成器、替代连接原文的人工复核,或自动迁移到目标领域。

打开一手来源 ↗

继续核对

从摘要进入事实性、长上下文、多语言、文档理解与完整馆藏。

进入 AI 知识图书馆评估事实性评估长上下文评估多语言能力评估文档理解进入 AI 溯源图谱