
HeliosBench实战指南视频生成模型评估的10项指标与时序漂移检测方法【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/Helios什么是 HeliosBenchHeliosBench是 Helios 项目14B 参数、支持实时长视频生成的扩散模型配套开源的视频生成模型评估基准。它从 5 个基础质量维度 4 个时序漂移维度 1 个吞吐量维度系统量化一个视频生成模型生成得好不好、稳不稳。对于新手来说最直接的用法是把你模型的输出视频丢进eval/目录一键跑完全部指标得到一个 1~10 分的综合评分。下面用 wave.jpg 这类自然素材生成视频打比方——评估系统会检查画面是否美观、运动是否流畅、内容是否与提示词一致以及视频开头和结尾是否出现了漂移内容崩坏、风格突变。一、快速搭建评估环境评估流程全部位于 eval/ 目录文档见 eval/README.md。第 1 步安装依赖conda activate helios pip install -r requirements.txt依赖清单见 eval/requirements.txt。第 2 步下载评估模型权重cd eval/checkpoints bash get_checkpoints.sh该脚本eval/checkpoints/get_checkpoints.sh会拉取 HeliosBench 官方权重目录结构如下 checkpoints/ ├── aesthetic_model/ # CLIP ViT-L-14 美学线性预测头 │ ├── sa_0_4_vit_l_14_linear.pth │ └── ViT-L-14.pt └── ViCLIP/ # 语义一致性模型 ├── bpe_simple_vocab_16e6.txt.gz └── ViClip-InternVid-10M-FLT.pth另外还需要 AMT-S 光流平滑度模型checkpoints/amt_model/amt-s.pth其网络实现参考自 eval/utils/third_party/amt/。二、准备你的视频数据评估采用提示词 CSV 视频目录的组织方式。仓库内置了一套玩具数据可直接上手提示词表eval/playground/helios_t2v_prompts.csv含id / prompt / duration三列覆盖 240~1440 帧的长视频任务示例视频eval/playground/toy-video/文件命名规则为{id}_{目标时长}_{真实时长}.mp4你自己评估时只需在eval/playground/下为每个模型建一个子目录例如 playground/ ├── helios_t2v_prompts.csv ├── model-a/ # 模型A生成的视频 │ └── 1_*_ori*.mp4 ... └── model-b/ # 模型B生成的视频 └── ...视频命名中的数字前缀1_、2_…必须与 CSV 的id对应。如需测试短视频场景可用 eval/utils/extract_short_from_long.py 从长视频中截取前 81 帧。三、10 项指标全解析1. 五项基础指标衡量整体质量指标衡量内容技术方案源码美学质量 Aesthetic画面美观度CLIP LAION 美学预测器0_get_aesthetic.py运动幅度 Motion Amplitude画面动态程度Farneback 光流1_get_motion_amplitude.py运动平滑度 Motion Smoothness帧间运动是否连贯AMT 光流网络2_get_motion_smoothness.py语义一致性 Semantic内容是否符合提示词ViCLIP3_get_semantic.py自然度 Naturalness是否像真实拍摄GPT-5.2 多模态评分1~5 分4_get_naturalness.py其中自然度指标最有意思它从长视频中均匀抽取 16 帧让多模态大模型按单帧技术瑕疵、局部物理逻辑、生物结构异常、瞬态伪影4 条标准判断这是真视频还是 AI 视频提示词模板见 4_get_naturalness.py。2. 四项时序漂移指标长视频专属长视频最大的坑是开头很好、结尾崩盘。HeliosBench 用首尾对比来捕捉它取视频前 15% 帧与后 15% 帧分别计算同一指标再取绝对差ΔM_drift(V) | M(V_start) − M(V_end) |实现见 5_get_drifting_aesthetic.pyDRIFT_RATIO 0.15。四项漂移指标漂移指标含义源码Drifting Aesthetic画质/风格随时间退化5_get_drifting_aesthetic.pyDrifting Motion Smoothness运动流畅度随时间下降6_get_drifting_motion_smoothness.pyDrifting Semantic主题内容随时间漂移7_get_drifting_semantic.pyDrifting Naturalness真实感随时间流失8_get_drifting_naturalness.py注意漂移分数越小越好基础指标则是越大越好。3. 吞吐量指标可选在 384×640 分辨率下测量端到端 FPS含 VAE 与文本编码器延迟每 3.2 FPS 记 1 分封顶 10 分。评测时需开启 FlashAttention、torch compile、KV-cache 等官方加速手段。四、一键运行评估单卡cd eval bash run_metrics.sh多卡/多机cd eval bash run_metrics_ddp.shrun_metrics.sh 会自动扫描playground/下所有模型目录并行跑全部指标多机版 run_metrics_ddp.sh 会检测机器数与 GPU 数按ARNOLD_WORKER_NUM / ARNOLD_WORKER_GPU环境变量调度。脚本顶部的API_KEY / BASE_URL用于 Naturalness 指标的大模型 API 调用。跑完后执行合并python 9_merge_all_scores.py --input_dir playground/results/模型名 --is_long python 10_merge_all_results.py --input_dir playground/results --score_type rating各指标原始结果以 JSON 形式保存在playground/results/模型名/如 aesthetic_results.json支持断点续跑——已完成的视频会被自动跳过。五、看懂结果从分数到综合评分评分换算逻辑9_merge_all_scores.py 把原始分数映射为 1~10 分制按阈值表逐项打分例如美学分 ≥0.70 记 10 分每低于 0.05 一档扣 1 分漂移分 ≤0.01 记 10 分逐档上浮扣 1 分。长视频加权总分长视频--is_long的 10 项权重如下9_merge_all_scores.py指标权重指标权重美学 / 运动幅度 / 运动平滑度各 0.034 项漂移指标各 0.099语义一致性0.255自然度0.255可以看到语义一致性和自然度合计占 51%4 项漂移指标合计占 39.6%——这正是 HeliosBench 对长视频的定义内容不跑偏、结尾不崩盘比单帧画质更重要。短视频模式则只用 5 项基础指标。玩具数据实测样例仓库自带的 toy-video 结果merged_results.json长这样models: { toy-video: { aesthetic: 9, motion_amplitude: 3, motion_smoothness: 10, naturalness: 7, semantic: 8, drifting_aesthetic: 8, drifting_motion_smoothness: 10, drifting_naturalness: 10, drifting_semantic: 10, total_weighted_rating: 8.247 } }解读要点该样例运动幅度仅 3 分画面偏静态但四项漂移全部高分说明长时稳定性优秀最终综合分 8.247。六、常见问题速查问题解决方式视频未被识别检查命名是否为{id}_*_ori*.mp4且id与 CSV 一致Naturalness 无结果run_metrics.sh中填入API_KEY / BASE_URL结果与论文对不上确认权重目录结构完整且使用了--is_long想对比多模型把多个模型目录都放进playground/10_merge_all_results.py会输出横向对比的all_models_merged.json参考 eval/playground/results/all_models_merged.json 小贴士HeliosBench 的设计哲学是——现有指标不足以准确评估视频生成模型未来方向是发展更贴近人类感知的指标。如果你有自研模型直接复用这套目录规范即可与 Helios 系列站在同一标尺下对比。总结环境pip install -r requirements.txt 官方权重脚本两分钟就位10 项指标5 项基础质量 4 项首尾漂移 1 项吞吐量一键运行bash run_metrics.sh自动扫描、并行、断点续跑结果解读关注total_weighted_rating漂移分越小模型越稳按 eval/README.md 的完整文档你现在就可以把第一个模型送进 HeliosBench 了。【免费下载链接】HeliosHelios: Real Real-Time Long Video Generation Model项目地址: https://gitcode.com/gh_mirrors/helios33/Helios创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考