
LongCat-Video 分辨率选择策略480p与720p对生成质量和速度的影响【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 参数视频生成模型支持文本生成视频、图像生成视频与视频续写。实际部署时决定画质 vs 速度最关键的一个开关就是分辨率选择480p / 720p选错了要么显存爆掉要么白白多等几分钟。本文结合仓库源码讲清楚两种分辨率背后的真实参数、切换方法以及官方推荐的480p 打底 720p 精修策略帮你在首次运行时就做出正确选择。一、480p 与 720p 在 LongCat-Video 中到底意味着什么打开核心管线 pipeline_longcat_video.py可以看到generate_i2v、generate_t2v等接口的分辨率参数被严格限定为两种取值resolution: Literal[480p, 720p] 480p也就是说480p默认选项单帧约 480×832横向总像素量小注意力序列短速度快、显存友好720p约 768×1280像素总量约为 480p 的2.46 倍。由于 Transformer 注意力的计算量随 token 数量平方增长720p 的单步推理开销会显著更高但换来更清晰的细节。分辨率背后的桶配置不同宽高比的输入并不会直接按原尺寸生成而是被映射到训练时覆盖过的桶bucket上。这套映射定义在 buket_config.py 的get_bucket_config()中分辨率桶表覆盖的宽高比示例480pASPECT_RATIO_627480×832、640×640、1280×320 等 23 种尺寸720pASPECT_RATIO_960960×960、768×1280、1920×480 等 27 种尺寸管线中的get_condition_shape()见 pipeline_longcat_video.py#L352-L366会根据输入图像的宽高比自动挑选最接近的桶所以横屏、方图、竖图都能正确处理无需手动裁剪。二、如何切换分辨率三种运行方式都只需一处修改1. 命令行 Demo--resolution 参数音频驱动人像视频Avatar的两个脚本都提供了--resolution命令行参数例如 run_demo_avatar_single_audio_to_video.py# 480p默认输出 480×832 torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --context_parallel_size2 --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --stage_1at2v --input_jsonassets/avatar/single_example_1.json \ --resolution 720p # 改为 720p 后输出 768×1280 --use_distill --model_type avatar-v1.5 --use_int8脚本内部的处理非常简单480p → (480, 832)720p → (768, 1280)见 run_demo_avatar_single_audio_to_video.py#L85-L88。多人对话场景同样支持示例配置可参考 assets/avatar/multi_example_1.json。2. 代码内调用图像生成视频在 run_demo_image_to_video.py 中分辨率直接写死在调用参数里把resolution480p改成resolution720p即可该文件第 85 行有# 480p / 720p的注释提示。3. Web 界面Streamlit如果通过 run_streamlit.py 启动网页界面左侧边栏直接提供 Resolution 下拉框480p / 720p二选一默认 480p对新手最友好。三、关键策略先用 480p 打底再用 720p 精修这是 LongCat-Video 官方 demo 最值得学习的工作流——不要一上来就直接生成 720p。run_demo_image_to_video.py 的完整流程分三步480p 粗生成generate_i2v(resolution480p, num_inference_steps50)快速确定构图和运动480p 蒸馏加速加载cfg_step_lora后仅用 16 步完成同样任务速度提升约 3 倍720p 超分精修加载refinement_lora并启用 Block Sparse Attentionpipe.dit.enable_bsa()调用generate_refine()把 480p 视频升格为 720p。精修接口的核心实现在 pipeline_longcat_video.py#L1098-L1156它有一个很实用的开关spatial_refine_onlyTrue只提升分辨率帧数不变15fps 输出耗时更短False分辨率和帧数同时翻倍15fps → 30fps得到官方宣传的720p / 30fps 几分钟出片效果。为什么这样做更聪明粗阶段容忍度高480p 下的瑕疵在精修阶段会被重绘掉所以粗阶段可以用更少的步数、更快的配置Block Sparse Attention 在高分辨率下收益最大README 明确提到BSA 让 720p 注意力成本不再随 token 数平方爆炸这正是高分辨率也能在几分钟内完成的关键显存峰值可控直接 720p 全流程时显存压力最大而分阶段策略把峰值拆成了两次较低的占用。四、480p vs 720p 怎么选一张决策表使用场景推荐分辨率理由调 Prompt、试镜头运动480p最快迭代成本低显存紧张单卡 / 中低端 GPU480p --use_int8480p 序列更短可搭配 INT8 量化进一步省显存长视频 / 视频续写480p 打底续写帧数多720p 直接跑会非常慢最终成品交付480p 生成 →generate_refine到 720p质量与速度兼得官方 demo 标准流程人像口型视频要清晰720p--resolution 720p人脸细节对分辨率敏感768×1280 更耐放大五、常见问题问720p 一定比 480p 慢很多吗像素量约为 2.46 倍若全程直接跑 720p 会明显变慢但走480p 粗生成 蒸馏 720p 精修BSA路线时总耗时通常低于直接生成且画质更好。问改分辨率会影响口型同步吗不会。分辨率参数与音频 CFGaudio_guidance_scale相互独立Avatar 场景中口型同步质量主要取决于音频引导强度官方建议 3–5。问能不能只要 720p 画面、不要双倍帧数可以。调用generate_refine()时设置spatial_refine_onlyTrue只升分辨率、保持原帧数输出仍为 15fps是要画质但想省时间的折中选项。六、快速上手清单克隆仓库git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/lo/LongCat-Video按 README.md 安装依赖并下载权重先用480p跑通 run_demo_image_to_video.py确认构图与运动符合预期正式出片时叠加蒸馏 LoRA16 步generate_refine精修到720p / 30fps遇到显存不足时为 Avatar 模型追加--use_int8需avatar-v1.5或改用多卡--context_parallel_size2分摊计算。掌握480p 求快、720p 求质、中间用精衔接这条主线你就能在 LongCat-Video 中把生成速度、显存占用和画面质量三者调到最佳平衡点。【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考