冻结主张、任务与决定
- 判断问题
- “RAG 有效”究竟指找到段落、回答、引用、更新、摘要,还是支持某项具体决定?
- 最低证据
- 逐字主张与日期;链路、模型、向量模型与 API 版本;用户、任务、语言与后果;检索、答案支持、拒答、时延与成本阈值。
- 停止条件
- 演示、单一基准分数或“带引用”替代准确任务与决定边界时停止。
检索到,不等于用对;带引用,不等于有据
最终答案可以因模型记忆而看似正确,也可以在检索失败时仍附上格式完整的引用。先独立验证检索,再逐项连接答案主张与证据,并把无答案、冲突、过期和权限泄漏纳入分母。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、搜索引擎、知识库、组织、数据集或排行榜;不构成准确性、完整性、访问控制、安全或决定质量保证。
六道可拒绝的证据门
最低 RAG 主张失效矩阵
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
记录受影响的语料、查询、检索层、答案主张、用户与决定;保留仍成立的最窄结论,并明确需要重新摄取、改权限、重跑检索、人工核验、拒答还是撤回主张。
最低 RAG 能力评估记录
统一证据状态
准确链路在代表性证据上达到检索、支持、权限、失败、成本与目标流程阈值,并有当前复核日期。
支持仅在明确语料、任务、语言、查询类别、来源日期、权限模型或运行控制下成立。
检索、答案支持、引用完整性、拒答、语言、新鲜度、时延或成本在不同分层间存在实质差异。
缺少链路身份、语料溯源、权限、独立检索测试、主张级支持、完整分母、目标迁移或到期边界。
FUURAA 分析RAG 能力主张的最小判断单位是“准确链路与版本 × 用户、任务、语言与决定 × 语料溯源、覆盖、新鲜度、分块、元数据与权限 × 查询、向量、检索、重排、过滤与 top-k × 原子主张支持、引用完整、冲突处理与拒答 × 全部运行、失败、修正、时延与成本 × 目标流程边界和截止日期”。RAG、BEIR、ALCE、RGB、C-MTEB 与 CRUD-RAG 分别照亮生成架构、检索泛化、引用、鲁棒性、中文向量与完整链路;任何单项都不能独立证明生产 RAG 能力。
一手来源与不可外推边界
来源于 2026 年 8 月 28 日重新核对。每项保留发布日期、方法作用与不可外推边界。
提出把参数记忆与稠密、非参数化的维基百科索引结合的生成架构,并在知识密集型任务上评估。
边界固定维基百科索引、检索器与研究任务集上的结果,不能证明另一套部署链路的质量、新鲜度、溯源、访问控制或安全性。
打开一手来源 ↗2021 年 4 月 17 日首次提交;2021 年 10 月 21 日修订BEIR — Heterogeneous Zero-Shot Information Retrieval在 18 个多样检索数据集上比较词法、稀疏、稠密、后期交互与重排系统,揭示依赖领域的泛化与成本权衡。
边界公开文本集合上的检索排序不能独立证明答案有据、生成质量、权限正确性、新鲜度或目标流程表现。
打开一手来源 ↗2023 年 5 月 24 日首次提交;2023 年 10 月 31 日修订ALCE — Automatic Evaluation of LLMs' Citation Quality建立端到端检索与生成任务,并分别评估流畅度、答案正确性、引用正确性与引用完整性。
边界引用基准与自动蕴含指标不能证明每项实质主张都有支持、来源具权威性,或目标用户能够完成核验。
打开一手来源 ↗2023 年 9 月 4 日首次提交;2023 年 12 月 20 日修订RGB — Benchmarking LLMs in Retrieval-Augmented Generation中国团队主导的双语基准,分别检验 RAG 系统的噪声鲁棒性、负向拒绝、信息整合与反事实鲁棒性。
边界受控中英文测试集不能覆盖所有语料、语言变体、冲突来源、时间更新、模型版本或部署后果。
打开一手来源 ↗2023 年 9 月 14 日首次提交;2024 年 9 月 24 日修订C-Pack / C-MTEB — General Chinese Embedding Resources把中文向量训练资源与覆盖六类任务、35 个数据集的 C-MTEB 带入国际检索评估。
边界向量模型在基准数据集上的结果不能证明分块质量、语料覆盖、访问控制、重排、答案支持或端到端 RAG 实用性。
打开一手来源 ↗2024 年 1 月 30 日首次提交;2024 年 7 月 15 日修订CRUD-RAG — A Comprehensive Chinese RAG Benchmark中国团队主导的基准,在创建、读取、更新与删除场景中评估检索器、知识库、上下文长度与生成器,而不只评估问答。
边界源于中文新闻的任务与基准配置不能证明所有企业语料、权限模型、更新周期、语言、领域或高影响决定中的表现。
打开一手来源 ↗继续核对