ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

InternVideo评测完全指南:如何复现60+视频基准上的SOTA成绩

InternVideo评测完全指南:如何复现60+视频基准上的SOTA成绩 InternVideo评测完全指南如何复现60视频基准上的SOTA成绩【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideoOpenGVLab是面向多模态理解的开源视频基础模型系列其中 InternVideo2 发布时即在60 个视频/音频相关任务上取得 SOTA 成绩并在 Kinetics-400 上达到 92.1% Top-1 精度。本文带你用仓库内置脚本一步步复现这些视频基准评测成绩覆盖动作识别、时序定位、视频检索、长视频问答等主流评测方向。 一图看懂InternVideo 评测版图InternVideo2 的评测矩阵横跨三大类任务详见 InternVideo2/README.md动作识别Kinetics-400/600/700、Something-Something v1/v2、ActivityNet、HACS 等时序定位Thumos14、FineAction、HACS、QN-MOMents 等视频-文本检索与问答MSR-VTT、MSVD、DiDeMo、LSMDC、VATEX、EgoSchema 等⚙️ 一键安装评测环境准备git clone https://gitcode.com/OpenGVLab/InternVideo环境依赖与权重下载说明见 InternVideo2/INSTALL.md核心步骤安装 PyTorch、torchvision 等基础依赖按 InternVideo2/requirements.txt下载 Stage1/Stage2 预训练权重放入仓库对应目录准备基准数据集Kinetics、Thumos14 等官方数据模型与脚本的对应关系都列在模型表里这是复现工作的地图资料路径单模态模型与成绩表InternVideo2/single_modality/MODEL_ZOO.md多模态VideoCLIP模型表InternVideo2/multi_modality/MODEL_ZOO.md训练/评测入口InternVideo2/single_modality/run_finetuning.py 动作识别基准从 K710 预训练到 K400 复现InternVideo2-1B 的标准评测流水线是K-Mash 预训练 → K710 微调 → 目标基准微调每个基准都有对应的评测脚本。例如复现 K400 的 91.3% Top-1# 参考官方脚本 bash InternVideo2/single_modality/scripts/finetuning/full_tuning/k400/1B_ft_k710_ft_k400_f8.sh各基准脚本集中存放在 InternVideo2/single_modality/scripts/finetuning/ 下按 k400、k600、k710、ssv2、anet、hacs 等目录组织直接对照 MODEL_ZOO.md 中的 Shell 列即可运行。评测小贴士复现 Top-1 时注意 #Frame 参数8x3x4表示输入帧数×空间裁剪×时间片段这是成绩差异最常见的原因蒸馏小模型S/B/L成绩见同一张表脚本在 scripts/distillation/ 时序定位与下游任务评测时序动作定位Temporal Action Localization在 InternVideo1/Downstream/Temporal-Action-Localization/ 提供四个基准的一键脚本anet_run.sh、th14_run.sh、hacs_run.sh、fa_run.sh评测逻辑统一由 train_eval.py 驱动。空间-时序动作定位AVA 数据集则使用 InternVideo1/Downstream/Spatial-Temporal-Action-Localization/ 下的akfinetune.sh/akeval.sh完成微调与评测。 视频-文本检索零样本评测脚本VideoCLIP多模态阶段的零样本检索评测脚本按模型规格分目录存放InternVideo2/multi_modality/scripts/evaluation/clip/zero_shot/1B/6B/S14/B14/L14InternVideo2/multi_modality/scripts/evaluation/stage2/zero_shot/配合 tasks_clip/retrieval.py 即可对 MSR-VTT、MSVD、DiDeMo、LSMDC 等基准计算 R1/R5/R10 与 nDCG 指标。 新前沿InternVideo3 长视频问答基准评测InternVideo3 面向长视频理解与智能体推理官方评测基于 lmms-eval 框架构建脚本齐全地放在 InternVideo3/InternVideo3_eval/scripts/覆盖30 余个评测脚本包括基准类型代表脚本长视频问答eval_videomme.sh、eval_mlvu.sh、eval_longvideobench.sh、eval_lvbench.sh短视频综合eval_mvbench.sh、eval_nextqa.sh高难度/时空推理eval_hrbench.sh、eval_ptest.sh、eval_motionbench.sh时序定位eval_grounding.sh、calc_grounding_metrics.py一键全量eval_all.sh运行方式统一为设环境变量 跑脚本export MODEL_PATH/path/to/your/model # 模型检查点路径 export OUTPUT_DIR./logs # 结果输出目录 bash InternVideo3/InternVideo3_eval/scripts/eval_videomme.sh脚本内部自动完成 lmms-eval 安装、参数设置fps4、max_pixels 等并用accelerate启动多进程评测。官方在 Video-MME、MLVU、LongVideoBench、EgoSchema 等长视频任务上取得开源模型最佳成绩另外InternVideo2.5 在 InternVideo2.5/README.md 中给出的成绩MVBench 75.7、VideoMME 65.1、MLVU 72.8、Perception Test 74.9也提供了可直接对照的复现目标值。 视频指令数据评测之外可复用的资产仓库的 Data/ 目录还提供了大规模视频数据资产Data/InternVid/视频-文本数据集与 Data/instruction_data/视频指令对话数据前者附带 Viclip 代码后者包含对话式问答与详细描述两类标注样例✅ 复现成绩排查清单问题检查项指标偏低#Frame 采样配置是否与 MODEL_ZOO 表一致如8x3x4长视频跑不动调小max_num_frames/max_pixels确认开启flash_attention_2数据集下载失败脚本已设HF_DATASETS_OFFLINE1需提前准备本地数据集结果输出在哪OUTPUT_DIR/基准名/模型名/并开启--log_samples保存逐条预测不确定脚本参数对照 eval_all.sh 与 InternVideo2/multi_modality/MODEL_ZOO.md按照上述路径从 K400 动作识别到 30 长视频问答基准你都可以用仓库内置脚本完整复现 InternVideo 系列在 60 视频基准上的 SOTA 评测成绩。【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表