冻结准确事实性主张与决定
- 判断问题
- “事实可靠”指来源有据、符合现实、内部一致、信息当前、内容完整,还是能恰当表达不确定性;面向哪些用户、任务与后果?
- 最低证据
- 逐字主张、主张者与日期;模型和系统版本;任务、领域与语言;事实性定义、分析单位、质量底线、允许证据与决定情境。
- 停止条件
- 流畅度、自信语气、引用数量或单一汇总分数被当作事实性的通用定义时停止。
可信语气不是事实证据
“幻觉”可能指与给定来源冲突、与现实事实冲突、无法核实、引用错配、时间过期或无依据推断。不同定义会产生不同分数,因此必须先定义主张,再决定证据和指标。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、事实核查服务、数据集、基准或评判器;不构成准确性保证、认证、审计、医疗、法律、投资、采购或合规意见。
六道可拒绝的证据门
最低事实性主张失效矩阵
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。
最低事实性评估记录
统一证据状态
准确系统与范围在可复现协议下达到声明的事实精确率、覆盖率、拒答与新鲜度阈值。
证据只支持指定领域、问题类型、来源、语言、日期或后果等级;迁移仍有边界。
受支持与不受支持主张、新鲜度结果、评判者或子群显著分化,须拆分报告。
流畅度、引用、单个基准、自洽性或无记录演示无法建立事实可靠性。
FUURAA 分析AI 事实性与幻觉主张的最小判断单位是“准确系统与版本 × 问题、领域、语言与时间 × 原子主张及限定语 × 来源版本与支持关系 × 精确率、覆盖率、拒答和不确定性 × 截止日期”。引用核验回答某个来源是否支持某句话;事实性评估还必须说明问题如何抽样、事实如何更新、所有主张如何进入分母,以及系统何时应当承认不知道。
一手来源与不可外推边界
来源于 2026 年 8 月 25 日重新核对。每项保留发布日期、在本方法中的作用与不可外推边界。
将虚构识别为生成式 AI 风险,并把测量、溯源、人工复核与部署后监测连接到风险管理。
边界该文件是自愿采用的跨行业指南;不定义单一通用幻觉指标,也不认证任何系统具备事实可靠性。
打开一手来源 ↗2021 年 9 月 8 日首次提交TruthfulQA — Measuring How Models Mimic Human Falsehoods以 817 个问题和 38 个类别测试模型是否复现常见误解,从而把真实性与简单模仿区分开。
边界其精选问题与被测模型快照不能证明当前世界信息新鲜度、长文本事实性、所有语言或部署领域。
打开一手来源 ↗2023 年 5 月 23 日首次提交FActScore — Fine-grained Atomic Evaluation of Factual Precision把长文本生成拆分为原子事实,并测量其中被指定知识来源支持的比例。
边界原子事实支持度取决于所选来源、检索和评判者;事实精确率本身不测量完整性、相关性或决策适用性。
打开一手来源 ↗2023 年 5 月 19 日首次提交Renmin University of China and collaborators — HaluEval为问答、对话、摘要与幻觉识别提供生成样本及人工标注样本。
边界合成生成与标注选择会塑造难度;识别已标注幻觉不等于系统能在真实使用中避免幻觉。
打开一手来源 ↗2023 年 10 月 5 日首次提交Google Research and collaborators — FreshQA / FreshLLMs以动态问题、快速变化知识与错误前提,在现实事实变化条件下区分正确性与幻觉。
边界搜索增强取决于证据新鲜度、排序与提示顺序;基准提升不能证明所有检索答案都当前且有支持。
打开一手来源 ↗2024 年 3 月 27 日首次提交Google DeepMind and collaborators — Long-form Factuality / SAFE提出 LongFact 与搜索增强评判器,把回答拆分、检索证据并判断各项事实是否得到支持。
边界自动一致性取决于搜索结果、拆分、评判模型与提示;不能替代对高后果主张的专家复核。
打开一手来源 ↗继续核对