FUURAA™ 赋睐™ AI 知识图书馆 · 事实性与幻觉主张评估

如何评估 AI 事实性与幻觉主张

用六道证据门把“更少幻觉”还原为准确任务、版本化参考事实、原子主张、独立支持关系、完整分母、不确定性与有日期的结论。适用于模型报告、产品文档、研究、媒体核验、尽调与工程评审。

发布25 August 2026证据状态基于一手风险框架与事实性评估研究的方法综合适用范围模型报告、产品文档、研究、媒体核验、尽调与工程评审

可信语气不是事实证据

事实性必须回到可核对主张、适用来源、完整分母、时间边界与不确定性,而不是回答听起来多像真的。

“幻觉”可能指与给定来源冲突、与现实事实冲突、无法核实、引用错配、时间过期或无依据推断。不同定义会产生不同分数,因此必须先定义主张,再决定证据和指标。

适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、事实核查服务、数据集、基准或评判器;不构成准确性保证、认证、审计、医疗、法律、投资、采购或合规意见。

六道可拒绝的证据门

每道门都回答一个判断问题、要求最低证据,并在关键未知时停止外推或缩小结论。

01

冻结准确事实性主张与决定

判断问题
“事实可靠”指来源有据、符合现实、内部一致、信息当前、内容完整,还是能恰当表达不确定性;面向哪些用户、任务与后果?
最低证据
逐字主张、主张者与日期;模型和系统版本;任务、领域与语言;事实性定义、分析单位、质量底线、允许证据与决定情境。
停止条件
流畅度、自信语气、引用数量或单一汇总分数被当作事实性的通用定义时停止。
02

明确问题、参考事实、时间与可回答性

判断问题
哪些问题答案稳定、哪些会随时间变化、哪些含错误前提、哪些无法由允许证据解决?
最低证据
提示集与抽样框架、参考答案及来源版本、证据截止时间、司法辖区与地域、错误前提案例、不可回答案例、歧义政策与更新计划。
停止条件
过时答案键为当前事实评分、有争议主张被视为定论,或强制回答把证据缺失造成的错误只归因于模型时停止。
03

把输出拆分为可核对主张

判断问题
最小可独立核验主张是什么;如何保留限定语、日期、数量、实体、关系、因果语言与隐含事实?
最低证据
原子主张协议、拆分示例、纳入规则、归因与引文处理、主张标识、遗漏内容复核、标注者培训、一致性与裁决。
停止条件
一个受支持句子隐藏不受支持分句、限定条件被剥离,或段落级标签掩盖混合事实性时停止。
04

让每项主张匹配独立证据

判断问题
可访问证据是直接支持、反驳还是无法解决准确主张;证据对相应日期、人群与范围是否权威且适用?
最低证据
准确来源、版本与位置;检索词与结果集;出版状态;支持关系;冲突来源;独立性;复核理由与核对日期。
停止条件
可解析网址被当作支持、搜索摘要代替原始来源、模型为自身核验,或证据支持相近但不同的主张时停止。
05

在完整分母上测量错误、拒答与不确定性

判断问题
主张得到支持、被反驳、无法核实、被遗漏或过度限定的频率如何;系统何时拒答;表达的置信度是否对应实际正确率?
最低证据
主张级精确率与覆盖率、回答级成功率、反驳及不可核实率、拒答与过度拒答、逐置信区间校准、不确定性、子群结果与所有失败输出。
停止条件
不受支持主张被移出分母、较短回答因少说而取胜却未披露,或拒答无论是否有用都被计为事实成功时停止。
06

测试真实使用、变化与到期

判断问题
证据能否经受真实提示、当前事件、检索中断、对抗性表达、多种语言与系统变化;何种变化要求重新验证?
最低证据
类生产任务分布、新鲜事实与错误前提探针、来源和检索日志、事件样本、用户纠正路径、重大变更记录、监测窗口、到期与责任人。
停止条件
静态基准变成永久部署主张、证据索引或模型变化后未重测,或用户无法质疑和纠正高后果错误时停止。

最低事实性主张失效矩阵

主动检查这些情形,才能发现可信语气、真实链接与漂亮分数背后的来源错配、时间过期和分母错误。

  • 01
    流畅回答附有真实引用,但核心主张仍不受支持

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 02
    过时答案键把当前事实判错,或把过时模型答案判对

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 03
    一个受支持分句隐藏虚构日期、数量或因果关系

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 04
    评判器与生成器共享同一误解或来源

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 05
    未打开准确来源与段落便接受搜索摘要

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 06
    不受支持主张在过滤后从分母中消失

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 07
    拒绝所有困难问题却得到看似完美的分数

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

  • 08
    模型、检索索引、提示或现实事实变化后未复核

    记录受影响的主张、来源、日期、用户、任务与决定;保留仍成立的最窄陈述,并明确需要补证据、重新标注、拆分结果、重测还是撤回结论。

最低事实性评估记录

让下一位复核者能够重建同一系统、问题、参考事实、来源、评判与分母边界下的结论。

  1. 01准确主张、主张者、任务、决定、核对日期与到期
  2. 02模型、端点、提示、工具、检索与系统版本
  3. 03提示样本、领域、语言、人群与后果等级
  4. 04参考来源、版本、位置与证据截止时间
  5. 05稳定、新鲜、有争议、错误前提与不可回答标签
  6. 06原子主张、限定语、遗漏、归因与标识
  7. 07支持、反驳与无法解决判断及理由
  8. 08精确率、覆盖率、拒答、校准、失败与不确定性
  9. 09复核者适配、独立性、一致性与裁决
  10. 10最窄有支持结论、重大未知与复核责任人

统一证据状态

把结论绑定到准确系统、问题分布、参考事实、支持协议、分母与日期,而不是笼统的“幻觉率”。

有支持

准确系统与范围在可复现协议下达到声明的事实精确率、覆盖率、拒答与新鲜度阈值。

有条件

证据只支持指定领域、问题类型、来源、语言、日期或后果等级;迁移仍有边界。

结果混合

受支持与不受支持主张、新鲜度结果、评判者或子群显著分化,须拆分报告。

证据不足

流畅度、引用、单个基准、自洽性或无记录演示无法建立事实可靠性。

FUURAA 分析AI 事实性与幻觉主张的最小判断单位是“准确系统与版本 × 问题、领域、语言与时间 × 原子主张及限定语 × 来源版本与支持关系 × 精确率、覆盖率、拒答和不确定性 × 截止日期”。引用核验回答某个来源是否支持某句话;事实性评估还必须说明问题如何抽样、事实如何更新、所有主张如何进入分母,以及系统何时应当承认不知道。

一手来源与不可外推边界

这些来源分别约束生成式 AI 风险、常见误解、原子事实、幻觉识别、动态知识与搜索增强评判;没有任何单项能独立证明普遍事实可靠性。

来源于 2026 年 8 月 25 日重新核对。每项保留发布日期、在本方法中的作用与不可外推边界。

2024 年 7 月 26 日发布;2026 年 4 月 8 日更新NIST AI 600-1 — Generative AI Profile

将虚构识别为生成式 AI 风险,并把测量、溯源、人工复核与部署后监测连接到风险管理。

边界该文件是自愿采用的跨行业指南;不定义单一通用幻觉指标,也不认证任何系统具备事实可靠性。

打开一手来源 ↗
2021 年 9 月 8 日首次提交TruthfulQA — Measuring How Models Mimic Human Falsehoods

以 817 个问题和 38 个类别测试模型是否复现常见误解,从而把真实性与简单模仿区分开。

边界其精选问题与被测模型快照不能证明当前世界信息新鲜度、长文本事实性、所有语言或部署领域。

打开一手来源 ↗
2023 年 5 月 23 日首次提交FActScore — Fine-grained Atomic Evaluation of Factual Precision

把长文本生成拆分为原子事实,并测量其中被指定知识来源支持的比例。

边界原子事实支持度取决于所选来源、检索和评判者;事实精确率本身不测量完整性、相关性或决策适用性。

打开一手来源 ↗
2023 年 5 月 19 日首次提交Renmin University of China and collaborators — HaluEval

为问答、对话、摘要与幻觉识别提供生成样本及人工标注样本。

边界合成生成与标注选择会塑造难度;识别已标注幻觉不等于系统能在真实使用中避免幻觉。

打开一手来源 ↗
2023 年 10 月 5 日首次提交Google Research and collaborators — FreshQA / FreshLLMs

以动态问题、快速变化知识与错误前提,在现实事实变化条件下区分正确性与幻觉。

边界搜索增强取决于证据新鲜度、排序与提示顺序;基准提升不能证明所有检索答案都当前且有支持。

打开一手来源 ↗
2024 年 3 月 27 日首次提交Google DeepMind and collaborators — Long-form Factuality / SAFE

提出 LongFact 与搜索增强评判器,把回答拆分、检索证据并判断各项事实是否得到支持。

边界自动一致性取决于搜索结果、拆分、评判模型与提示;不能替代对高后果主张的专家复核。

打开一手来源 ↗

继续核对

从事实性进入引用核验、研究综述复核与基准主张阅读。

核验 AI 引用复核研究综述阅读基准主张进入 AI 溯源图谱