冻结视频任务、输入与验收决定
- 判断问题
- 主张针对文生视频、图生视频、扩展、转换还是编辑工作流;面向哪些受众、渠道与后果?
- 最低证据
- 逐字主张与日期;生成模式;源输入;目标时长、帧率、分辨率与镜头结构;提示语言;受众、渠道、质量底线与验收量表。
- 停止条件
- 演示集锦、模型名称或笼统“电影级”标签替代明确任务、输入分布与观看决定时停止。
流畅不等于正确、稳定或可用
漂亮首帧与整体平均分会隐藏身份漂移、对象突变、动作错配、短暂闪烁、物理违背、失败重试与后期编辑。一条视频可以运动平滑,却没有正确执行提示中的动作或关系。
适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、创作者、数据集或排行榜;不构成质量保证、身份或权利许可、来源认定、安全认证、采购、审计、投资、法律或合规意见。
六道可拒绝的证据门
最低视频生成主张失效矩阵
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。
最低视频生成能力评估记录
统一证据状态
证据支持准确生成器、视频任务、源素材与提示分布、时序链路、分项评估、完整运行与有日期部署边界。
证据仅支持更窄的生成模式、输入类别、提示语言、时长、帧率、动作、筛选过程、受众或渠道。
结果在单帧质量、身份、时序一致、运动、动作、物理、人物、语言、种子、裁判、安全或验收之间存在实质差异。
缺少系统身份、代表性提示与源素材、时序设置、分项指标、人工验证、完整视频、安全、投入、成本或迁移证据。
FUURAA 分析AI 视频生成能力主张的最小判断单位是“准确生成器与版本 × 视频任务、输入、提示分布、语言、受众与用途 × 时长、帧率、分辨率、镜头与完整生成链路 × 单帧质量、时序一致、动作、交互、物理、镜头与提示遵循 × 全部视频、失败、筛选、编辑、安全、时延、成本与人工投入 × 部署边界和截止日期”。FVD、EvalCrafter、VBench、VideoPhy、T2V-CompBench 与 VBench++ 分别照亮不同局部;任何一个都不能独立代表真实视频生产能力。
一手来源与不可外推边界
来源于 2026 年 8 月 27 日重新核对。每项保留发布日期、方法作用与不可外推边界。
提出 FVD,以生成视频与参考视频的分布差异反映视觉质量、时序一致性与多样性。
边界分布分数不能验证单条视频的提示忠实度、动作正确性、物理合理性、身份一致性、安全或目标工作流适用性。
打开一手来源 ↗2023 年 10 月 17 日首次提交;2024 年 3 月 23 日修订EvalCrafter — Benchmarking Large Video Generation Models以 700 条提示、17 项客观指标与人类对齐分析,覆盖视觉质量、内容质量、运动质量与文视频对齐。
边界其提示集、指标选择、拟合权重与受测模型是研究快照,不是通用生产排行榜或验收测试。
打开一手来源 ↗2023 年 11 月 29 日首次提交VBench — Comprehensive Benchmark Suite for Video Generative Models把视频生成拆为 16 个细分维度,包括身份一致、运动平滑、时序闪烁与空间关系,并用人类偏好验证。
边界结果依赖其提示、维度定义、自动裁判与人工标注集,不能覆盖所有时长、语言、镜头语法或部署。
打开一手来源 ↗2024 年 6 月 5 日首次提交;2024 年 10 月 3 日修订VideoPhy — Evaluating Physical Commonsense for Video Generation通过固体与流体等材料交互,测试文本遵循与物理常识,并以人工评估支撑。
边界选定物理交互不能证明通用模拟、因果理解、长时一致、安全或生产适用性。
打开一手来源 ↗2024 年 7 月 19 日首次提交;2025 年 1 月 15 日修订T2V-CompBench — Compositional Text-to-Video Generation以 1,400 条提示覆盖属性、空间、运动与动作绑定、对象交互和计数,并让多模态模型、检测与跟踪指标接受人工评估校验。
边界其组合性分类不能证明美学、镜头剪辑、文化准确性、安全、音频质量或真实渠道验收。
打开一手来源 ↗2024 年 11 月 20 日首次提交VBench++ — Versatile Video Generation Benchmark Suite把细粒度评估扩展到文生视频与图生视频,引入自适应图像套件,并把可信性与技术质量并列考察。
边界更广的基准覆盖仍不能证明所有输入、身份、时长、政策、受众、披露要求或下游工作流。
打开一手来源 ↗继续核对