ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

InternVideo下游任务部署指南:视频检索、时序定位与视觉语言导航六大场景

InternVideo下游任务部署指南:视频检索、时序定位与视觉语言导航六大场景 InternVideo下游任务部署指南视频检索、时序定位与视觉语言导航六大场景【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo 是上海 AI Lab 开源的视频基础模型ECCV 2024除了强大的预训练能力仓库中还内置了6 大下游任务部署方案视频-文本检索、时序动作定位、时空动作定位、视觉语言导航、开放集动作识别与多模态问答。本文将手把手带你了解每个场景的用途、数据准备与一键运行脚本帮助新手快速上手 InternVideo 视频检索与时序定位实战。一、部署前准备环境与仓库获取所有下游代码位于InternVideo1/Downstream/目录下共 6 个子项目。先克隆仓库git clone https://gitcode.com/OpenGVLab/InternVideo通用环境要点各子项目略有差异项目PythonPyTorch其他依赖视频-文本检索3.6.91.8.1 CUDA 11.1基于 CLIP4Clip时序动作定位3.71.8.0 CUDA 11.1编译 C 扩展见 INSTALL.md时空动作定位3.61.8.0 / 1.11.0timm、deepspeed、decord视觉语言导航3.6-Habitat Simulator、Habitat-lab、CLIP 建议用 Conda 为每个任务单独建环境避免依赖冲突。二、视频-文本检索MSRVTT 上 37.5% R1 的零样本部署 代码位置Video-Text-Retrieval/这是 InternVideo 最经典的下游任务给定一段文字描述找到对应视频或反向。仓库提供6 个数据集MSRVTT、MSVD、LSMDC、ActivityNet、DiDeMo、VATEX的零样本评测与全量微调两套脚本。部署三步走准备数据下载数据集与标注文件解压到data/目录可选预处理用 compress_video.py 将视频压缩到 3fps、宽 224大幅节省磁盘一键评测/微调# 零样本评测以 MSRVTT 为例 ./zeroshot_scripts/eval_msrvtt.sh # 微调 InternVideo 检索模型 ./finetune_scripts/train_msrvtt.sh微调后的模型在 MSRVTT 视频到文本检索上R1 达到 57.9远超零样本的 37.5。评测入口为 main_task_retrieval.py指标计算见 metrics.py。三、时序动作定位找到视频里动作发生的时间段 代码位置Temporal-Action-Localization/时序动作定位TAL要回答的问题是这个人什么时候在游泳InternVideo 使用 ViT-H 主干 ActionFormer 头部在 4 个基准上全面领先数据集THUMOS-14ActivityNetHACSFineAction之前最佳方法66.8036.6038.7113.24InternVideo71.5839.0041.3217.57部署步骤按 INSTALL.md 安装依赖并编译代码下载各数据集特征含预提取特征与标注解压到./data训练与评测只需一行命令配置文件在 configs/ 目录bash th14_run.sh # THUMOS-14 bash anet_run.sh # ActivityNet-v1.3 bash hacs_run.sh # HACS bash fa_run.sh # FineAction训练入口为 train_eval.py实验配置与权重会保存在./ckpt目录。四、时空动作定位AVA 数据集上同时定位哪里 何时 代码位置Spatial-Temporal-Action-Localization/如果说时序定位只关心何时那么时空动作定位STAL还要同时框出哪里——即在视频帧中定位正在执行动作的人物。该项目整合了 VideoMAE 与 AlphAction 两套代码环境搭建推荐使用 Anacondaconda create -n VideoMAE_ava python3.7 conda activate VideoMAE_ava pip install torch1.11.0cu113 torchvision0.12.0cu113 torchaudio0.11.0 conda install av -c conda-forge训练/评测数据准备遵循 AlphAction 的 AVA2.2 规范训练入口为 run_class_finetuning.py使用--data_set ava-kinetics --enable_deepspeed参数启动 8 卡分布式训练。模型定义见 modeling_finetune.py。五、视觉语言导航让机器人听懂往左走进厨房 代码位置Visual-Language-Navigation/视觉语言导航VLN-CE要求智能体在 Matterport3D 三维家居场景中根据自然语言指令如 R2R、RxR 数据集行走到目标位置是具身智能的核心任务。部署四步安装 Habitat Simulator 与 Habitat-labPython 3.6并安装 CLIP下载 Matterport3D 场景数据放到data/scene_datasets/mp3d/下载预处理后的 VLN-CE 数据集到data/datasets权重文件放到pretrained/含 6 个子目录运行脚本bash eval_cma_r2r.bash # 评测脚本见 run/ 目录 bash train.bash # 训练6 卡各数据集的超参配置在 exp/ 目录如 cma_r2r.yaml模型实现位于vlnce_baselines/models/。六、开放集动作识别识别没见过的动作类别 代码位置Open-Set-Action-Recognition/传统动作识别只认识训练时见过的类别而开放集识别OSAR要求模型能察觉这是训练集外的未知动作并正确拒绝。该项目基于 MMAction2 开发从证据深度学习EDL视角在 UCF-101 上微调 VideoMAE 主干以 HMDB-51 / MiT-v2 为未知类。测试结果HMDB / MiT 未知集 AUC模型Open Set AUCClosed Set ACCSlowFast DEAR82.94 / 86.9996.48InternVideo-H EDL85.48 / 91.8597.89评测流程分三步先用run_get_mae_threshold.sh获取不确定性阈值再跑 OOD 检测最后计算 AUROC。训练入口脚本在 experiments/mae/ 目录配置示例见 finetune_ucf101_mae_edlnokl.py。七、多模态下游零样本动作识别与视频问答 代码位置multi-modalities-downstream/最后这个子项目基于 All-In-One 框架覆盖三类多模态任务任务数据/模型入口脚本代表结果零样本动作识别K400scripts/zs_classify.shK400 56.65B/16零样本多选题MSRVTT / LSMDCscripts/zs_choice_msrvtt.shMSRVTT 91.31视频问答MSRVTT / MSVD / TGIFscripts/finetune_msrvttqa.shMSRVTT 44.58只需下载 InternVideo-MM-B-16 检查点与原始 CLIP ViT-B-16 权重修改脚本中的模型路径即可运行。数据加载器在 datasets/ 目录入口为 run.py。八、总结与常见问题六大场景速查表场景一句话定位核心脚本/配置视频-文本检索以文搜视频、以视频搜文zeroshot_scripts/、finetune_scripts/时序动作定位找动作发生的时间段th14_run.sh等 4 个脚本时空动作定位同时定位时间与空间框run_class_finetuning.py视觉语言导航3D 场景中按指令行走train.bash、eval_*.bash开放集动作识别识别并拒绝未知类别experiments/mae/多模态下游零样本识别与视频问答scripts/zs_*.sh新手常见坑磁盘不足视频任务请先用压缩脚本预处理视频或只下载所需的单个数据集⚡版本敏感PyTorch/torchvision 版本对复现结果影响很大严格按各项目 README 版本安装权重下载各任务预训练权重在对应 README 中给出下载入口注意解压目录结构需与文档一致。InternVideo 的下游代码组织清晰、脚本化程度高只要数据与权重就位几乎每个任务都能一条命令跑通。建议新手从视频-文本检索的零样本评测入手再逐步尝试时序定位等更复杂的场景。【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表