
LongCat-Video模型权重管理终极指南HuggingFace与ModelScope双平台下载、版本控制与本地部署【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video是美团开源的 13.6B 参数视频生成基础模型一个模型统一支持文生视频、图生视频与视频续写并衍生出音频驱动的 Avatar 数字人版本。本文手把手带你完成LongCat-Video 模型权重的 HuggingFace 与 ModelScope 双平台下载、本地目录规范、v1.0/v1.5 版本控制及常见问题排查一次搞定视频生成模型部署前的所有权重管理问题。 核心关键词LongCat-Video 模型权重、HuggingFace 模型下载、ModelScope 镜像、数字人模型版本控制 长尾关键词LongCat-Video-Avatar-1.5 权重下载、视频生成模型本地部署、模型目录结构管理三大模型版本选型基础生成与数字人对比在管理权重之前先搞清楚官方发布了哪三个模型它们的权重构成各不相同模型版本定位音频编码器推理加速特性LongCat-Video基础视频生成文生视频/图生视频/视频续写无LoRA 蒸馏 720p 空间精修LongCat-Video-Avatarv1.0单/多角色音频驱动数字人wav2vec2-base50 步常规采样LongCat-Video-Avatar-1.5升级版数字人口型更准Whisper-large-v38 步蒸馏 INT8 量化三个版本的关系是基础模型 数字人扩展Avatar 系列复用了基础模型的 tokenizer、text_encoder 和 VAE 组件因此本地需要同时保留基础模型目录这一点是权重管理中最容易踩坑的地方。基础模型支持图生视频等任务下面这张单人肖像图就是典型的参考输入素材风格项目示例图HuggingFace 模型下载huggingface-cli 一键命令官方推荐的下载方式是huggingface-cli只需两行命令。先安装命令行工具pip install huggingface_hub[cli]然后按模型逐个下载到统一的./weights/目录下--local-dir指定本地落盘位置天然支持断点续传# 基础视频生成模型 huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video # 数字人 v1.0wav2vec2 音频编码器 huggingface-cli download meituan-longcat/LongCat-Video-Avatar --local-dir ./weights/LongCat-Video-Avatar # 数字人 v1.5Whisper-large-v3 蒸馏 INT8 huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5省流提示huggingface-cli的download命令会自动跳过已存在的文件中断后直接重跑即可续传无需手动管理缓存碎片。ModelScope 国内镜像加速下载 LongCat-Video 权重国内网络环境访问 HuggingFace 较慢时可以改用 ModelScope 平台作为镜像源。官方在 README 中已为 Avatar-1.5 标注了 ModelScope 模型入口模型 ID 与 HuggingFace 保持一致均为meituan-longcat/命名空间下的同名仓库。两种推荐操作方式命令行方式安装modelscopeSDK 后使用snapshot_download拉取到与上文完全相同的./weights/目录结构网页手动方式在 ModelScope 模型页面逐个下载文件按下面的目录规范手动摆放。✅关键原则无论来自哪个平台只要落盘后的目录结构一致推理脚本就完全无感切换。双平台互为备份也是权重版本管理的第一道保险。统一权重目录规范weights 文件夹结构速查推理代码通过subfolder参数按子目录加载组件。以文生视频脚本为例权重加载逻辑见 run_demo_text_to_video.py它依次从tokenizer/、text_encoder/、vae/、scheduler/、dit/五个子目录读取组件。整理后的标准目录树如下./weights/ ├── LongCat-Video/ # 基础模型 │ ├── tokenizer/ # 文本分词器UMT5-XXL │ ├── text_encoder/ # 文本编码器 │ ├── vae/ # 视频 VAEAutoencoderKLWan │ ├── scheduler/ # 流匹配采样调度器 │ ├── dit/ # 13.6B 主干 DiT 模型 │ └── lora/ │ ├── cfg_step_lora.safetensors # 蒸馏加速 LoRA16步 │ └── refinement_lora.safetensors # 720p 空间精修 LoRA ├── LongCat-Video-Avatar/ # 数字人 v1.0 │ ├── avatar_single/ # 数字人 DiT 主干 │ ├── chinese-wav2vec2-base/ # wav2vec2 音频编码器 │ └── vocal_separator/Kim_Vocal_2.onnx # 人声分离模型 └── LongCat-Video-Avatar-1.5/ # 数字人 v1.5 ├── scheduler/ # v1.5 专用调度器 ├── base_model/ # bf16 完整主干 ├── base_model_int8/ # INT8 量化主干省显存 ├── whisper-large-v3/ # Whisper 音频编码器 ├── lora/dmd_lora.safetensors # 8 步蒸馏 LoRA └── vocal_separator/Kim_Vocal_2.onnx版本控制要点v1.5 的主干有base_modelbf16和base_model_int8INT8 量化两套分别由--use_int8开关切换加载逻辑见 run_demo_avatar_single_audio_to_video.py量化实现位于 longcat_video/modules/quantization.py。数字人 v1.5 的单角色演唱场景正是这套权重体系驱动生成的效果项目示例图版本控制实战用 --model_type 切换 v1.0 与 v1.5权重下载完毕后选哪个版本跑由命令行参数决定而不是改代码# v1.0wav2vec2 编码器常规 50 步采样 torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --checkpoint_dir./weights/LongCat-Video-Avatar \ --model_type avatar-v1.0 --input_jsonassets/avatar/single_example_1.json # v1.5Whisper 编码器 蒸馏 INT8口型更准、显存更省 torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --model_type avatar-v1.5 --use_distill --use_int8 \ --input_jsonassets/avatar/single_example_1.json版本切换的核心规则--model_type avatar-v1.0默认值加载avatar_single/主干 chinese-wav2vec2-base/音频编码器调度器复用基础模型目录的scheduler/--model_type avatar-v1.5加载whisper-large-v3/音频编码器与自身目录的scheduler/此时--use_distill8 步蒸馏为必需参数--use_int8仅 v1.5 支持加载 INT8 量化主干显存紧张时的首选⚠️ 两个版本的 tokenizer、text_encoder、vae 均回指基础模型目录./weights/LongCat-Video见 run_demo_avatar_single_audio_to_video.py所以基础模型目录删不得。双角色对唱场景是 v1.5 多音频流的典型用例两支音频流独立驱动两个角色口型多角色长视频目录规划与增量更新策略长视频续写场景下建议额外保留一份备份目录策略实现类似版本控制的权重管理按版本分目录weights/下每个模型独立成文件夹如上文结构树升级时先下载新版本到新目录如LongCat-Video-Avatar-1.5验证通过后再决定旧版去留——这就是最朴素的双版本并存、灰度切换LoRA 小文件优先同步lora/*.safetensors仅几十到几百 MB更新迭代最快可以频繁从平台增量拉取主干权重不动多角色输入配置多音频示例配置见 assets/avatar/multi_example_1.json参考双人对话场景即可下图为项目多角色示例常见问题下载断点、版本错配与显存优化问题原因解决方案下载到一半中断网络波动重跑同一条huggingface-cli download命令自动续传已下载文件不重复占用加载报子目录缺失手动摆放时漏文件对照上文目录树速查补齐v1.5 特别注意base_model_int8与base_model二选一即可口型同步差误用 v1.0 权重跑 v1.5 参数严格用--model_type与权重版本配对v1.5 记得加--use_distill显存不够 OOM加载了 bf16 完整主干v1.5 加--use_int8或参考 README 调整dit/config.json关闭 FlashAttention-2 改用 xformers想只保留部分版本省空间磁盘紧张可删除不用的旧版本目录但基础模型LongCat-Video目录必须保留 模型权重采用MIT License发布见 LICENSE可自由用于商业与个人项目依赖版本锁定在 requirements.txt 与 requirements_avatar.txt 中建议照单安装以避免组件版本错配。小结三步管好 LongCat-Video 模型权重下载HuggingFace 用huggingface-cli download --local-dir一键落盘国内网络切 ModelScope 镜像保持模型 ID 与目录结构一致摆放严格按weights/模型名/组件子目录规范存放LoRA 与量化主干各自独立方便增量更新切换运行时用--model_type、--use_distill、--use_int8三个开关控制版本与精度代码零改动。权重管理做对后面的多卡推理--context_parallel_size和 Streamlit 可视化部署就只是加参数的事祝你的 LongCat-Video 部署一次跑通【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考