冻结摘要任务与验收决定
- 判断问题
- 主张针对抽取式或生成式摘要、单文档或多文档、标题、简报、会议纪要、更新、比较,还是决定支持?
- 最低证据
- 逐字主张与日期;来源类型与数量;目标受众与决定;必需长度、格式、语言、视角与引用;纳入、排除、拒答与验收规则。
- 停止条件
- “摘要做得好”或单个精美示例替代明确来源群体、输出约定与后果时停止。
短、顺、像人写,不等于有据、完整或适用
高 ROUGE、流畅语气或单一裁判分数可能同时掩盖错误归属、关键条件遗漏与来源截断。先把事实支持、覆盖、压缩和表达质量分开验证,再回到目标用户与决定检查。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、摘要、机构、数据集或排行榜;不构成准确性、完整性、适用性或决策质量保证。
六道可拒绝的证据门
最低摘要能力主张失效矩阵
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
记录受影响的主张、原文、语言、位置、摘要层与下游决定;保留仍成立的最窄结论,并明确需要补采来源、重跑、打开原文复核、人工修正还是撤回主张。
最低文本摘要能力评估记录
统一证据状态
证据支持准确链路、来源群体、摘要约定、连接原文的主张、关键覆盖、完整分母、人工复核与有日期目标边界。
证据仅支持更窄的语言、领域、来源长度、摘要格式、压缩目标、复核过程或下游用途。
结果在事实支持、覆盖、来源位置、长度、语言、领域、冲突、复核者、时延或成本之间存在实质差异。
缺少链路身份、代表性来源、连接原文的复核、关键遗漏检查、完整分母、修正、成本或目标迁移证据。
FUURAA 分析AI 文本摘要能力主张的最小判断单位是“准确链路与版本 × 摘要任务、来源群体、受众与决定 × 来源溯源、语言、领域、长度、结构、时间与冲突 × 提示、上下文、分块、检索、排序、合并与后处理 × 原文支持、重点覆盖、关键遗漏、矛盾、压缩与表达质量 × 全部来源、运行、失败、拒答、人工修正、时延与成本 × 目标流程边界和截止日期”。ROUGE、LCSTS、XSum、SummEval、FRANK 与 AGGREFACT 分别照亮重合、中文短文本、极端摘要、综合评估与事实性;任何单项都不能独立代表真实摘要能力。
一手来源与不可外推边界
来源于 2026 年 8 月 28 日重新核对。每项保留发布日期、方法作用与不可外推边界。
定义以召回为导向的摘要重合度指标,成为比较系统摘要与参考摘要的常用基线。
边界N-gram 或序列重合不能独立证明事实有据、关键内容覆盖、连贯性、实用性或安全性。
打开一手来源 ↗2015 年 6 月 19 日首次提交LCSTS — Large-Scale Chinese Short Text Summarization从新浪微博建立超过 200 万组真实中文短文本与摘要,并对 10,666 组文本—摘要相关性进行人工标注。
边界中文社交媒体短文本不能证明长报告、会议、专业领域、所有中文变体或生产复核流程上的表现。
打开一手来源 ↗2018 年 8 月 27 日首次提交XSum — Extreme Summarization以 BBC 文章与短摘要建立单句、高抽象度的新闻摘要任务。
边界BBC 单句新闻摘要不能证明多文档综合、长篇忠实压缩、会议纪要、科学摘要或目标流程质量。
打开一手来源 ↗2020 年 7 月 24 日首次提交;2021 年 2 月 1 日修订SummEval — Re-evaluating Summarization Evaluation在 CNN/DailyMail 输出上,以专家与众包人工判断比较 14 项自动指标和 23 个摘要模型。
边界英文新闻与固定模型集合上的指标相关性,不能保证其适用于新系统、语言、领域、摘要长度或高影响用途。
打开一手来源 ↗2021 年 4 月 27 日首次提交FRANK — Factuality in Abstractive Summarization为 CNN/DailyMail 与 XSum 模型摘要建立事实错误类型体系与人工标注,可按错误类型比较指标。
边界新闻领域的事实性标注不能衡量显著性、完整性、受众适配、决定用途,也不能覆盖新模型与新领域的所有错误模式。
打开一手来源 ↗2022 年 5 月 25 日首次提交;2023 年 5 月 26 日修订AGGREFACT — Understanding Factual Errors in Summarization汇总九个带标注的事实性数据集,并按摘要系统代际与错误类型分层,显示检测器表现存在实质差异。
边界事实性检测器基准不能证明总体摘要质量、覆盖所有当前生成器、替代连接原文的人工复核,或自动迁移到目标领域。
打开一手来源 ↗继续核对