FUURAA™ 赋睐™ AI 知识图书馆 · 视频生成评估

如何评估 AI 视频生成能力主张

用六道证据门把“高质量视频生成”还原为准确任务、输入与提示分布、系统版本、时序设置、单帧质量、身份与对象持续、动作、交互、物理、完整视频与人工筛选、安全、披露、时延、成本和有日期的部署边界。

发布27 August 2026证据状态基于一手视频生成评估研究的方法综合适用范围文生视频、图生视频、扩展、转换与内容生产研究

流畅不等于正确、稳定或可用

视频生成主张必须把提示、源素材、时序配置、完整视频、逐时段失败、人工筛选和真实用途保留在同一证据链中。

漂亮首帧与整体平均分会隐藏身份漂移、对象突变、动作错配、短暂闪烁、物理违背、失败重试与后期编辑。一条视频可以运动平滑,却没有正确执行提示中的动作或关系。

适用边界本页是公共研究方法,不代表 FUURAA 或 FUUVO 产品能力,也不评价任何模型、供应商、创作者、数据集或排行榜;不构成质量保证、身份或权利许可、来源认定、安全认证、采购、审计、投资、法律或合规意见。

六道可拒绝的证据门

每道门都回答一个判断问题、要求最低证据,并在关键未知时停止外推或缩小结论。

01

冻结视频任务、输入与验收决定

判断问题
主张针对文生视频、图生视频、扩展、转换还是编辑工作流;面向哪些受众、渠道与后果?
最低证据
逐字主张与日期;生成模式;源输入;目标时长、帧率、分辨率与镜头结构;提示语言;受众、渠道、质量底线与验收量表。
停止条件
演示集锦、模型名称或笼统“电影级”标签替代明确任务、输入分布与观看决定时停止。
02

保留准确生成器与时序链路

判断问题
哪一模型、API 或检查点产生视频;经过怎样完整的时序与后期链路?
最低证据
供应商、模型与 API 版本;检查点与适配器;提示优化器;种子、采样器、步数与引导;时长、帧率、分辨率与宽高比;参考图或视频;插帧、扩展、放大、稳定、编辑、音频、过滤与算力。
停止条件
不同版本、帧率、隐藏重排、未披露编辑或后处理被汇总成一个能力主张时停止。
03

定义提示与源素材的溯源、覆盖和重合

判断问题
提示与源素材如何抽样、翻译、改写或取得许可;覆盖哪些语言、人物、动作、运镜与难度?
最低证据
带哈希的提示与源素材集;溯源与许可;抽样框;去重;翻译与改写;主题、动作、交互、语言、时长与镜头分层;基准重合与污染复核。
停止条件
精选英文提示、策划源图或未披露优化器被当作广泛多语言、文化或开放世界生成证据时停止。
04

分开单帧质量、时序一致、动作与物理

判断问题
评估是否分开视觉质量、身份与对象持续、闪烁、运动、动作和关系绑定、物理常识、镜头行为与提示遵循?
最低证据
指标与裁判版本;逐维度和逐时段结果;身份、跟踪、动作、关系、物理、文字与镜头检查;合格人工评分、说明、盲评、一致性、不确定性及指标—人工验证。
停止条件
FVD、类 CLIP 分数、单一多模态裁判或漂亮首帧被当作所有视频质量维度的证明时停止。
05

计入每条视频、失败、重试、筛选与编辑

判断问题
展示或验收输出之前经历了多少视频、种子、扩展、重跑、淘汰与编辑?
最低证据
全部提示、源输入、种子与视频;无效、拦截、截断与超时运行;候选数;筛选与重排规则;扩展和编辑历史;验收、放弃与失败率;人工时间、时延与成本分布。
停止条件
只保留最佳视频、短暂严重失败消失在平均值中,或成功率缺少完整生成量与人工工作分母时停止。
06

测试伤害、披露、部署迁移与到期

判断问题
面对可识别人群、受保护群体、敏感动作、误导性真实感、真实分发渠道及后续模型或政策变更时会怎样?
最低证据
同意与肖像控制;子群与红队提示;色情、暴力及欺骗内容测试;溯源或披露检查;目标渠道复核;事件与降级程序;监测、变更触发器、负责人和到期。
停止条件
基准平均值或过滤标签未经目标情境直接复核就被外推为权利、文化、安全或生产适用性时停止。

最低视频生成主张失效矩阵

主动检查这些情形,避免把精选样片、漂亮首帧或单一平均分外推为广泛视频生成能力。

  • 01
    提示优化或翻译悄然改变所请求的动作、运镜、否定或文化

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 02
    首帧正确,但人物、对象、数量或属性随时间突变

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 03
    运动看似平滑,但动作、交互、空间关系或提示含义错误

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 04
    视觉上吸引人的视频违反物理常识、因果或对象恒常

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 05
    平均分掩盖短暂但严重的身份、文字、结构、安全或连续性失败

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 06
    多选一与后期编辑隐藏淘汰、拦截、截断或低质量生成

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 07
    结果随时长、帧率、宽高比、种子、语言或 API 修订发生实质变化

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

  • 08
    基准视频未经渠道复核就被外推到广告、编辑、教育或敏感用途

    记录受影响的提示、输入、时段、设置、指标、受众与渠道;保留仍成立的最窄结论,并明确需要补采、重生成、逐帧复核、纳入失败、人工评估还是撤回主张。

最低视频生成能力评估记录

让下一位复核者能够用同一输入、提示、版本、时序设置、完整视频、分项指标、人工量表与部署边界重建结论。

  1. 01准确主张、日期、视频任务、源输入、受众、渠道、后果与验收量表
  2. 02供应商、模型、API 或检查点版本及完整生成与后期链路
  3. 03种子、采样器、步数、引导、时长、帧率、分辨率、宽高比、过滤与算力
  4. 04提示与源素材集、语言、溯源、许可、抽样、翻译、改写与哈希
  5. 05基准重合、污染复核及主题、动作、交互与镜头语法覆盖
  6. 06分开的单帧、时序、身份、运动、动作、关系、物理、镜头、文字与偏好结果
  7. 07指标与裁判版本、逐时段复核、人工协议、一致性与不确定性
  8. 08全部视频、无效运行、拦截、截断、重试、扩展、候选数、筛选与编辑
  9. 09验收、放弃、子群、安全、时延、成本与人工投入分布
  10. 10权利与披露复核、部署边界、监测、降级、变更触发器、负责人和到期

统一证据状态

把结论绑定到准确生成器、视频任务、输入与提示分布、时序链路、评估维度、完整运行、用途和日期。

有支持

证据支持准确生成器、视频任务、源素材与提示分布、时序链路、分项评估、完整运行与有日期部署边界。

有条件

证据仅支持更窄的生成模式、输入类别、提示语言、时长、帧率、动作、筛选过程、受众或渠道。

结果混合

结果在单帧质量、身份、时序一致、运动、动作、物理、人物、语言、种子、裁判、安全或验收之间存在实质差异。

证据不足

缺少系统身份、代表性提示与源素材、时序设置、分项指标、人工验证、完整视频、安全、投入、成本或迁移证据。

FUURAA 分析AI 视频生成能力主张的最小判断单位是“准确生成器与版本 × 视频任务、输入、提示分布、语言、受众与用途 × 时长、帧率、分辨率、镜头与完整生成链路 × 单帧质量、时序一致、动作、交互、物理、镜头与提示遵循 × 全部视频、失败、筛选、编辑、安全、时延、成本与人工投入 × 部署边界和截止日期”。FVD、EvalCrafter、VBench、VideoPhy、T2V-CompBench 与 VBench++ 分别照亮不同局部;任何一个都不能独立代表真实视频生产能力。

一手来源与不可外推边界

这些来源分别约束分布质量、视觉/内容/运动、时序一致、物理常识、组合动作及文生视频/图生视频;没有任何单项能独立证明通用视频生成能力。

来源于 2026 年 8 月 27 日重新核对。每项保留发布日期、方法作用与不可外推边界。

2018 年 12 月 3 日首次提交;2019 年 3 月 27 日修订Unterthiner et al. — Fréchet Video Distance (FVD)

提出 FVD,以生成视频与参考视频的分布差异反映视觉质量、时序一致性与多样性。

边界分布分数不能验证单条视频的提示忠实度、动作正确性、物理合理性、身份一致性、安全或目标工作流适用性。

打开一手来源 ↗
2023 年 10 月 17 日首次提交;2024 年 3 月 23 日修订EvalCrafter — Benchmarking Large Video Generation Models

以 700 条提示、17 项客观指标与人类对齐分析,覆盖视觉质量、内容质量、运动质量与文视频对齐。

边界其提示集、指标选择、拟合权重与受测模型是研究快照,不是通用生产排行榜或验收测试。

打开一手来源 ↗
2023 年 11 月 29 日首次提交VBench — Comprehensive Benchmark Suite for Video Generative Models

把视频生成拆为 16 个细分维度,包括身份一致、运动平滑、时序闪烁与空间关系,并用人类偏好验证。

边界结果依赖其提示、维度定义、自动裁判与人工标注集,不能覆盖所有时长、语言、镜头语法或部署。

打开一手来源 ↗
2024 年 6 月 5 日首次提交;2024 年 10 月 3 日修订VideoPhy — Evaluating Physical Commonsense for Video Generation

通过固体与流体等材料交互,测试文本遵循与物理常识,并以人工评估支撑。

边界选定物理交互不能证明通用模拟、因果理解、长时一致、安全或生产适用性。

打开一手来源 ↗
2024 年 7 月 19 日首次提交;2025 年 1 月 15 日修订T2V-CompBench — Compositional Text-to-Video Generation

以 1,400 条提示覆盖属性、空间、运动与动作绑定、对象交互和计数,并让多模态模型、检测与跟踪指标接受人工评估校验。

边界其组合性分类不能证明美学、镜头剪辑、文化准确性、安全、音频质量或真实渠道验收。

打开一手来源 ↗
2024 年 11 月 20 日首次提交VBench++ — Versatile Video Generation Benchmark Suite

把细粒度评估扩展到文生视频与图生视频,引入自适应图像套件,并把可信性与技术质量并列考察。

边界更广的基准覆盖仍不能证明所有输入、身份、时长、政策、受众、披露要求或下游工作流。

打开一手来源 ↗

继续核对

从视频生成进入图像生成、多模态、事实性、基准阅读与完整馆藏。

进入 AI 知识图书馆评估图像生成评估多模态能力评估事实性阅读基准主张进入 AI 溯源图谱