Ultralytics YOLO27:
返回 Ultralytics 术语表

VBench

了解 VBench 如何评估 AI 生成视频的视觉质量、运动连贯性和提示词对齐情况,并学习如何解读其分数和局限性。

VBench 是一个基准套件,用于从多个维度评估 AI 生成视频的质量及其与用户指令的匹配程度。它不只会询问片段“看起来是否不错”,还会检查主体是否保持一致、运动是否流畅,以及视频是否呈现了用户要求的内容。因此,它既适合比较视频生成系统,也有助于理解为什么一段吸引人的视频仍可能无法完成实际任务。

VBench 的评估指标#

评估文本生成视频时,需要检查单帧画面以及随时间发生的变化。原始VBench 评估框架定义了 16 个维度,涵盖视觉质量和与输入提示词的一致性。这些维度能够提供比单一总分更有参考价值的评估概况。(vchitect.github.io)

以下三个类别有助于理解这个概念:

  • 视觉质量:成像质量关注模糊、噪声等缺陷;美学质量关注视觉吸引力和构图。画面清晰不一定就赏心悦目。
  • 时间质量:主体和背景一致性用于评估外观能否保持稳定。运动平滑度考察动作的连续性,而时间闪烁则关注相邻帧之间不必要的波动。
  • 提示词对齐:内容检查会核对用户要求的对象、动作、颜色、场景和空间关系,例如,确认狗确实在自行车旁边奔跑,而不只是出现在附近的某个位置。

主体一致性与身份保持有关:角色在移动或视角变化时仍应保持可辨识。运动评估可能会用到光流,它用于估算帧间的表观运动。不过,仅凭动作平滑并不能证明动作符合物理规律。(vchitect.github.io)

评估流程#

标准评估从一组明确的提示词开始。生成模型会根据这些提示词生成视频,再由针对各个维度的评估器分析输出。保持测试条件一致,才能有意义地比较模型,而不是比较经过挑选的片段。(github.com)

与提供测试样例的基准数据集不同,VBench 还提供评估流程。它的自动评估器会生成旨在反映人类感知某些方面的测量结果,但这些结果只是代理指标,并不能保证观众满意。(vchitect.github.io)

实际比较时,应尽量保持提示词、样本数量、分辨率、时长和生成设置一致。在条件允许时记录随机种子,同时注意PyTorch 的可复现性指南中提到的局限性。检查各个维度的结果:较高的外观得分可能掩盖较弱的指令遵循能力;几乎静止的片段也可能看起来很一致,却没有呈现要求的动作。(github.com)

VBench 评估生成内容;它既不是视频生成模型,也不是通用视频分析系统。

视频理解用于解读已有视频,而视频生成则会创建新视频。同样,目标检测会识别并定位物体,但检测到自行车并不能证明生成的整个场景都符合提示词。

Ultralytics YOLO 基准测试模式会评估不同导出格式下的任务精度和推理速度。这些部署指标与 VBench 对视觉和时间质量的评估回答的是不同问题。同样,vLLM 的基准测试命令评估的是语言模型的执行性能,而不是生成视频的质量。(docs.ultralytics.com)

文本生成视频排行榜会汇总基准测试结果,而人工偏好竞技场则会收集观众的评价。两者都不能取代针对具体应用的模型测试。

实际应用#

以下两个示例说明了这些区别为何重要:

  • 广告制作:创意团队在为跑鞋广告比较生成器时,可以检查主体一致性、运动平滑度和提示词对齐情况。跟拍镜头中鞋子的形状发生变化,可能会让其他方面制作精良的片段无法使用。审核人员还应单独核实品牌标识和产品细节,而不是假定高基准分数也涵盖了这些内容。
  • 合成训练视频:团队生成仓库场景视频时,可以利用质量评估筛除背景不稳定或运动不合常理的片段。不过,视觉上逼真的合成数据仍可能遗漏重要的现实条件。必须通过在代表性数据上进行验证来检查合成数据对训练的价值,而不能只凭 VBench 的结果推断。

这些是质量评估的互补用途,并不意味着 VBench 能认证内容是否适合商业使用,也不意味着它能认证训练数据的有效性。

实际评估与局限性#

有文档说明的VBench 软件包工作流支持针对选定维度评估自定义视频。在兼容环境中安装所需依赖项后,可以使用以下 Bash 示例指定一个已生成的视频,并评估主体一致性:(pypi.org)

# Install the evaluation package.
python -m pip install vbench

# Supply an existing generated MP4 file.
read -r -p "Path to generated video: " video_path

# Evaluate one supported custom-input dimension.
vbench evaluate \
    --videos_path "$video_path" \
    --dimension subject_consistency \
    --mode custom_input

这会生成针对特定维度的评估结果,而不是完整的排行榜分数。自定义视频评估仅支持原始维度中的一部分,因此进行基准测试比较时,应使用标准流程。(pypi.org)

最后,应将自动测量结果与人工检查和应用测试结合起来。画面吸引人且连贯的视频仍可能包含误导性内容或其他风险。NIST 人工智能风险管理框架为评估这些超出视觉质量范畴的问题提供了更全面的指导。(nist.gov)

Explore solutions

航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情

让我们携手构建 AI 的未来!

开启你的旅程,迎接机器学习的未来