ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UniML3D数据集揭秘:UniMate的13006个文本配对运动序列如何炼成

UniML3D数据集揭秘:UniMate的13006个文本配对运动序列如何炼成 UniML3D数据集揭秘UniMate的13006个文本配对运动序列如何炼成【免费下载链接】UniMate[SIGGRAPH Asia 2026] UniMate: One Unified Model to Animate Diverse Skeletons项目地址: https://gitcode.com/GitHub_Trending/un/UniMateUniML3D 是 UniMateSIGGRAPH Asia 2026 论文的官方训练数据集包含13,006 条文本配对运动序列覆盖双足、四足、鸟类、海洋生物、昆虫、蛇形与铰接刚体等 7 类骨骼拓扑并统一校准到同一规范坐标系。本文带你一次看懂这些序列从何而来、六阶段数据流水线如何把 FBX/GLB 原始资产变成训练用运动片段以及视觉语言模型VLM如何自动为每条运动生成文本描述。一、三大来源Mixamo、Truebones 与 Objaverse-XL 混合而成UniML3D 并非单一数据集而是三个来源的大熔炉来源特点拓扑覆盖Mixamo人类动作库行走、格斗、舞蹈、手势全部共享同一副人体骨骼双足Truebones ZOO商业动物动作资产包犬科、猛禽、爬行动物等因授权限制仅发布标注文件四足、鸟类、蛇形、海洋生物、昆虫Objaverse-XL超大规模 3D 资产库中的绑定骨骼子集含人形、动物与机械物体全部 7 类多样性最高⚠️ 小知识Truebones ZOO 是商业资产包其运动文件不允许再分发官方仅发布提示词、元数据与渲染图其余两个来源可通过 Hugging Face 直接下载。二、六阶段流水线从原始资产到训练就绪完整流程见 data_process/README.md可概括为一条单向流水线下载 → 导出Blender→NPZ→ 多视角渲染 → VLM 字幕生成 → 关节标注 → 特征提取规范化最后阶段 5Animate负责在推理时把生成动作驱动回原始网格。各阶段的入口脚本都放在 data_process/scripts/ 下例如下载原始数据run_download.sh导出骨骼动画run_export.sh字幕生成run_caption_motion.sh关节标注run_joints_names_clean_llm.sh特征提取run_extract_features.sh所有阶段默认可断点续跑——重新执行会自动跳过已完成的输出只重试失败项非常适合新手小规模复现。阶段1 · 导出Blender 无头模式输出标准 NPZ每条运动被导出为一个 NPZ 文件含静息姿态、逐帧局部平移/旋转、父关节索引与骨骼名称并自动剔除不带蒙皮权重的控制/辅助骨骼、统一到 Y-up 坐标系。骨架的修剪是资产级原子操作一条资产的所有运动全部导出完成后才算完成保证数据一致。阶段2a · 渲染EEVEE 四相机多视角每条运动由 4 个间隔 90° 的固定相机渲染前/后/左/右每段上限 200 帧、30 fps输出v000–v003四组逐帧图像——这正是后续 VLM 字幕的输入。阶段2b · VLM 自动字幕每条运动配一句文本这是文本配对的关键一步。默认使用本地 Qwen3.5-9B 视觉模型也可切换 Gemini/GPT 等 API 后端模型观察四视角画面后按严格协议输出一句不超过 12 个词的描述。提示词模板定义在 data_process/vlm_caption/prompts.py三个数据集共用同一套观察协议先确定朝向从身体几何推断而非相机方向、再左右镜像校正、逐帧扫描、最后挑选最具体的动词。一个精妙设计所有字幕的主语统一为 An object如An object flaps its wings and rises.刻意不出现物种名、类别名、外观与颜色。这样文本编码器就无法从字幕里偷看数据集或拓扑标签模型必须真正学会文本 → 任意骨骼的通用映射。阶段3 · 关节标注统一骨骼命名与朝向不同资产库的骨骼命名五花八门thigh_l、Upper Leg.001……。该阶段做两件事均有LLM 版和纯规则版双实现名称清洗把原始骨骼名映射到规范解剖学词汇输出clean_joint_names.json——这是跨资产库共享同一关节嵌入的前提朝向选择为每副骨骼挑出定义前进方向的对称关节对蛇形骨骼则用头尾轴输出face_joint_names.json。LLM 失败或超时的骨骼会自动回退到规则方法并记录在failed_*.txt中供二次精修还有配套的可视化脚本run_joints_vis_tpose.sh、run_joints_vis_facing.sh方便人工抽查。阶段4 · 特征提取规范化 质量过滤这是把原始素材变成13006 条精挑细选训练片段的一步实现在 data_process/feature_extraction/extract_features.py。每类资产先按 T-pose 做四步规范化朝向对齐面向 Z→ XZ 平面居中 → 直径缩放到统一尺度 → 接地贴合地面然后执行一系列质量闸门不合格片段会被自动剔除并记录在filtered_clips.json过滤器默认阈值作用关节数范围5–100Objaverse 为 4–180骨架过小/过大的类型直接跳过静止帧裁剪位移 1e-5 计为静止去掉开头/结尾的静止段低活跃过滤关节活跃度 0.02剔除几乎不动的假动作跳变过滤单帧位移 ≥ 0.2 个身长且 ≥ 8 倍中位数剔除拼接错误的断裂运动最短长度裁剪后 8 帧过短片段丢弃帧率必须 30 fps保证特征尺度一致此外Mixamo 的 65 关节骨架会被精简到内置的22 关节人体核心长运动可按滑动窗口切成 200 帧的重叠片段APPLY_CLIP1。最终每条片段输出为含全局关节位置、局部旋转四元数与根朝向的 NPZ并写出每类资产的拓扑条件文件cond.npy父索引、图距离、深度、拉普拉斯特征等——这正是模型实现任意拓扑通用的数据基础。三、拿到数据两种复现路径直接下载官方在 Hugging FaceLinzhan/UniML3D发布了阶段 1–3 的全部产出运动 NPZ、字幕、标注只需跑一遍阶段 4 即可得到训练片段从零复现按 Quick Start 顺序执行导出 → 渲染 → 字幕 → 关节标注 → 特征提取五个脚本见 data_process/README.md全流程自包含、可并行--multi-worker/--multi-gpu、可断点续跑。得到的dataset/features/dataset/目录即可配合 configs/uniml3d_60frames_graph_adaln.json 等配置用 flow matching 训练 UniMate最终支持文本驱动运动生成、运动插值、文本编辑与运动扩展四种能力。四、总结13006 是怎么算出来的 一句话总结UniML3D Mixamo 人体动作 Truebones 动物动作 Objaverse-XL 多样化资产经过Blender 导出 → 四视角渲染 → VLM 生成拓扑无关短字幕 → 骨骼命名/朝向标注 → 规范化与多重质量过滤的完整流水线最终沉淀为 13,006 条统一坐标系的文本配对运动序列——这也是 UniMate 无需针对任何单一骨骼重新训练、即可一句话驱动任意骨架动起来的底气所在。延伸阅读数据流水线全解data_process/README.md字幕提示词工程data_process/vlm_caption/prompts.py身体构型分类器data_process/vlm_caption/classify_category.py训练配置说明README.md【免费下载链接】UniMate[SIGGRAPH Asia 2026] UniMate: One Unified Model to Animate Diverse Skeletons项目地址: https://gitcode.com/GitHub_Trending/un/UniMate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表