冻结准确模态、任务与用户结果
- 判断问题
- 主张涉及图像识别、OCR、图表阅读、视觉问答、音频理解、视频时序、具身对话、生成还是组合能力;面向谁并产生何种后果?
- 最低证据
- 逐字主张与日期;准确模型、适配器与工具版本;输入输出模态;任务、语言、人群与用户旅程;质量、安全、时延及无障碍阈值。
- 停止条件
- “多模态”一个标签无说明地合并感知、推理、生成与行动,或仅由精选演示推断时停止。
接收多种媒体不等于理解它们
界面能够上传图片、音频或视频,只能证明输入通道存在。系统可能依赖文字先验、字幕、OCR、稀疏帧或外部工具;图像分类、开放视觉问答、视频时序、音频理解和跨模态生成需要不同证据。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、国家、文化、数据集或排行榜;不构成能力保证、认证、审计、采购、投资、法律或合规意见。
六道可拒绝的证据门
最低多模态主张失效矩阵
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
记录受影响的模态、输入、任务、语言、人群、用户与决定;保留仍成立的最窄结论,并明确需要重做预处理、增加对照、拆分结果、人工复核、重测还是撤回主张。
最低多模态能力评估记录
统一证据状态
准确系统针对指定模态及可复现、有代表性的任务分布,达到声明的感知、具身对齐、推理、安全和资源阈值。
证据只支持指定模态、输入质量、语言、任务、预处理、裁判、工具及运行控制;迁移仍有边界。
结果在模态、质量等级、语言、内容群体、裁判或资源状态上显著分化,须拆分报告。
演示、模态标签、总分、精选输出或无记录裁判无法建立多模态能力。
FUURAA 分析多模态 AI 能力主张的最小判断单位是“准确系统与版本 × 输入输出模态、任务、人群及后果 × 原始媒体、质量与预处理 × 感知、具身对齐、推理及工具依赖 × 指标、裁判、完整失败与子群结果 × 真实运行边界和截止日期”。CMMMU 把中文大学层级图表、地图、乐谱与科学图像推理带入国际评估,但任何单项基准都不能替代对输入保真、文化适用性、真实工作流和到期变化的验证。
一手来源与不可外推边界
来源于 2026 年 8 月 26 日重新核对。每项保留发布日期、在本方法中的作用与不可外推边界。
区分固定基准准确率与广义准确率,要求明确测量目标、假设、重复试验与不确定性。
边界统计建模改善结果解释;不会自动使选定的多模态数据集代表真实人群、媒体或部署环境。
打开一手来源 ↗2021 年 2 月 26 日首次提交OpenAI — Learning Transferable Visual Models From Natural Language Supervision / CLIP展示图文预训练及在三十多个视觉数据集上的零样本迁移,使任务与分布迁移能够被测量。
边界图文对齐与零样本分类不能证明具身对话、OCR 保真度、时序理解、音频理解或真实环境中的安全使用。
打开一手来源 ↗2023 年 11 月 27 日首次提交MMMU collaboration — Massive Multi-discipline Multimodal Understanding and Reasoning使用图表、地图、表格、科学图像等异构材料,测试六大领域、三十个学科中的大学层级知识与推理。
边界考试型问题不代表所有视觉人群、开放交互、视频、音频、无障碍需求或生产后果。
打开一手来源 ↗2024 年 1 月 22 日首次提交CMMMU collaboration — A Chinese Massive Multi-discipline Multimodal Understanding Benchmark通过一万二千道问题、三十个学科与三十九类图像,把中文大学层级多模态知识和推理带入国际评估。
边界中文学术题不证明模型在方言、文化情境、手写内容、日常媒体、专业工作流或当前部署中的表现。
打开一手来源 ↗2023 年 8 月 4 日首次提交Microsoft Research and collaborators — MM-Vet评估在综合任务中结合识别、OCR、知识、语言生成、空间感知与数学能力的开放式输出。
边界小规模精选图像集与基于 LLM 的裁判需要单独验证;不能独立证明稳健运行或所有能力组合。
打开一手来源 ↗2024 年 5 月 31 日首次提交Video-MME collaboration — Comprehensive Evaluation of Multimodal LLMs in Video Analysis区分短、中、长视频理解,并在多种视频领域测试画面、字幕与音频各自带来的信息贡献。
边界抽样视频与问答不复现直播、罕见事件、剪辑效果、隐私约束、工具时延或所有时序工作流。
打开一手来源 ↗