
Xinference 内置视频模型指南使用 Wan2.1-i2v-14B-480p 实现图像到视频生成【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceWan2.1-i2v-14B-480p 是 Xinference 内置的 Wan 系列图像到视频image2video模型一条命令即可拉起 480p 分辨率、14B 参数的视频生成服务并通过 OpenAI 兼容风格的 RESTful API 对外提供推理能力。本文以该模型的官方文档页为核心结合 Xinference 仓库中的模型规格、Diffusers 引擎实现与客户端代码完整讲解模型特性、启动方式、底层加载流程与图像驱动视频的调用方法帮助你快速在自有环境中部署并接入该视频生成能力。模型概览定位与基本信息在 Xinference 中Wan2.1-i2v-14B-480p属于内置视频模型之一其官方文档页位于 doc/source/models/builtin/video/wan2.1-i2v-14b-480p.rst关键元数据如下Model Name模型名Wan2.1-i2v-14B-480pModel Family模型家族WanAbilities能力image2video以输入图像为条件生成视频Model ID远端模型标识Wan-AI/Wan2.1-I2V-14B-480P-Diffusers从命名可以解读出三个关键信息Wan2.1属于阿里通义万相 Wan2.1 系列开源视频生成模型i2v即 image-to-video与同家族 T2Vtext-to-video模型的能力形成区分14B-480p模型参数量约 14B输出分辨率为 480p 档位与同系列的 720p 版本Wan2.1-i2v-14B-720p在规格上形成高低搭配。在 Xinference 的视频模型目录页 doc/source/models/builtin/video/index.rst 中该模型与 CogVideoX、HunyuanVideo、LTX-2、MiniMax-H3 以及同家族的 Wan2.1-1.3B、Wan2.1-14B、Wan2.1-i2v-14B-720p、Wan2.2 系列等一同被列为内置视频模型。一条命令启动模型官方文档给出了最简启动方式xinference launch --model-name Wan2.1-i2v-14B-480p --model-type video该命令的核心语义拆解如下对应 xinference/deploy/cmdline.py 中的参数定义参数说明--model-name指定内置模型名这里为Wan2.1-i2v-14B-480p--model-type声明模型类型为videoXinference 据此走视频模型注册与实例化流程启动过程中Xinference 会在xinference/model/video/core.py的create_video_model_instance中完成以下动作通过resolve_video_model_name_and_engine解析模型与引擎未显式指定引擎时使用默认引擎通过match_diffusion在BUILTIN_VIDEO_MODELS注册表中查找模型规格并按download_hub偏好HuggingFace / ModelScope默认auto选择下载源通过VideoCacheManager下载并缓存模型权重到本地缓存目录实例化具体的视频引擎模型类并加载到显存随后即可对外提供推理。如需显式指定引擎可在启动命令中追加--model-engine参数。对绝大多数用户而言直接执行上述一行命令即可完成部署。模型规格细节从 model_spec.json 看真实配置内置模型的权威规格定义在 xinference/model/video/model_spec.json 中。其中Wan2.1-i2v-14B-480p条目version 2完整记录了如下配置{ version: 2, model_name: Wan2.1-i2v-14B-480p, model_family: Wan, engine: diffusers, model_format: diffusers, model_ability: [image2video], default_model_config: { torch_dtype: bfloat16 }, default_generate_config: { max_area: [480, 832] }, virtualenv: { packages: [ diffusers0.33.0 ; #engine# \diffusers\, ftfy, imageio-ffmpeg, imageio, #system_numpy# ] }, model_src: { huggingface: { model_id: Wan-AI/Wan2.1-I2V-14B-480P-Diffusers, model_revision: b184e23a8a16b20f108f727c902e769e873ffc73 }, modelscope: { model_id: Wan-AI/Wan2.1-I2V-14B-480P-Diffusers, model_revision: master } }, updated_at: 1766385305, featured: false }对照官方文档页中给出的 Model IDWan-AI/Wan2.1-I2V-14B-480P-Diffusers可以确认二者一致且该模型在 HuggingFace 与 ModelScope 两个源上均可用ModelScope 侧 revision 为masterHuggingFace 侧固定了精确的 revision 以保证可复现。值得注意的配置要点engine / model_format 均为diffusers该模型由 Diffusers 引擎驱动。从 xinference/model/video/engine.py 可以看到DiffusersVideoEngineModel是注册在SUPPORTED_ENGINES[diffusers]中的默认引擎实现并且注释明确说明第一个注册的引擎保持为默认因此不传--model-engine时即使用 Diffusers。而 MLX 引擎只支持白名单内的模型MLX_VIDEO_MODEL_NAMES且要求 Apple Silicon 与 Python 3.11该 480p I2V 模型不在其列。torch_dtype默认bfloat16加载权重时的默认精度兼顾显存占用与推理质量。max_area: [480, 832]输入图像的最大面积约束宽高像素这正是模型 480p 档位的体现。720p 版本对应配置为[720, 1280]。虚拟环境依赖diffusers0.33.0、ftfy、imageio-ffmpeg、imageio以及系统 NumPy。Xinference 的虚拟环境机制XINFERENCE_ENABLE_VIRTUAL_ENV会自动为模型准备独立 Python 环境并安装这些依赖避免与主环境相互污染。底层实现Diffusers 引擎如何加载与运行 Wan I2V在 xinference/model/video/diffusers.py 中模型加载逻辑针对model_family Wan做了专门分支处理elif self.model_spec.model_family Wan: from diffusers import AutoencoderKLWan, WanImageToVideoPipeline, WanPipeline if image2video in self.model_spec.model_ability: image_encoder CLIPVisionModel.from_pretrained(..., torch_dtypetorch.float32) vae AutoencoderKLWan.from_pretrained(self._model_path, subfoldervae, torch_dtypetorch.float32) pipeline self._model WanImageToVideoPipeline.from_pretrained(self._model_path, vaevae, image_encoderimage_encoder, **kwargs)该分支说明了 Wan I2V 模型的推理组成使用WanImageToVideoPipeline作为主流水线额外加载CLIPVisionModel作为图像编码器以float32精度加载和AutoencoderKLWan作为 VAE同样float32保证条件图像能够被正确编码并引导视频扩散过程。在图像到视频的生成入口image_to_video中关键处理步骤包括max_area generate_kwargs.pop(max_area) if isinstance(max_area, str): max_area [int(v) for v in max_area.split(*)] max_area reduce(operator.mul, max_area, 1) image self._process_image(image, max_area) height, width image.height, image.width output self._model(imageimage, promptprompt, heightheight, widthwidth, **generate_kwargs) return self._output_to_video(output, fps, response_format)可以看到max_area取自模型规格的default_generate_config即[480, 832]计算其乘积作为像素面积上限通过_process_image对输入图像进行等比缩放确保送入模型的图像满足 480p 档位约束推理时实际生成的宽高height/width直接取自预处理后的图像尺寸fps未显式指定时默认取10生成结果默认以b64_json形式返回由_output_to_video使用imageio将帧序列导出为视频文件仓库专门实现了基于 imageio 的导出逻辑用于规避部分模型输出绿屏问题支持通过n参数一次生成多段视频num_videos_per_prompt并可通过seed控制随机性。仓库测试 xinference/model/video/tests/test_diffusers_video.py 覆盖了 Diffusers 视频引擎的加载与生成路径可作为验证引擎行为是否正常的参考。通过 RESTful API 调用图像生成视频模型启动并加载完成后即可通过 HTTP 接口进行推理。Xinference 在 xinference/api/routers/videos.py 中注册了三个视频相关路由路由对应处理函数能力POST /v1/video/generationscreate_videos文生视频text-to-videoPOST /v1/video/generations/imagecreate_videos_from_images图生视频image-to-videoPOST /v1/video/generations/flfcreate_videos_from_first_last_frame首尾帧生视频针对本模型的 image2video 能力应调用POST /v1/video/generations/image。该接口采用multipart/form-data上传请求字段包含model模型 UID、prompt提示词、可选的negative_prompt与n生成数量110以及 JSON 序列化的kwargs可传入推理参数图像文件通过image字段上传。Xinference 的 Python 客户端在 xinference/client/restful/restful_client.py 中封装了同名方法image_to_video可直接使用from xinference.client import Client client Client(http://127.0.0.1:9997) # 启动模型等价于 xinference launch 命令 model_uid client.launch_model( model_nameWan2.1-i2v-14B-480p, model_typevideo, ) # 获取模型句柄 video_model client.get_model(model_uid) # 图像驱动视频生成image 可为本地图片路径或 bytes result video_model.image_to_video( image/path/to/input.png, promptA cat walking on the beach, waves rolling, natural lighting, negative_promptblurry, low quality, n1, seed42, ) # 解析返回结果b64_json 视频数据 print(result)异步场景下可使用 xinference/client/restful/async_restful_client.py 中对应的async_image_to_video方法两者接口签名一致。返回的VideoList中每个视频对象默认携带b64_json格式的视频数据可自行解码保存为 MP4 文件。同家族模型横向参考为帮助你在实际项目中选择合适档位这里列出仓库中 Wan 家族其他内置视频模型同样定义于 xinference/model/video/model_spec.json模型名能力输出档位/关键配置Model IDWan2.1-i2v-14B-480pimage2videomax_area: [480, 832]Wan-AI/Wan2.1-I2V-14B-480P-DiffusersWan2.1-i2v-14B-720pimage2videomax_area: [720, 1280]Wan-AI/Wan2.1-I2V-14B-720P-DiffusersWan2.1-1.3Btext2video1.3B 轻量档Wan-AI/Wan2.1-T2V-1.3B-DiffusersWan2.1-14Btext2video14B 档Wan-AI/Wan2.1-T2V-14B-DiffusersWan2.1-flf2v-14B-720pfirstlastframe2videomax_area: [720, 1280]Wan-AI/Wan2.1-FLF2V-14B-720P-diffusersWan2.2-i2v-A14Bimage2video新一代 Wan2.2 I2VWan-AI/Wan2.2-I2V-A14B-DiffusersWan2.2-ti2v-5Btext2video / image2video5B 双能力Wan-AI/Wan2.2-TI2V-5B-Diffusers其中 Wan2.2 系列的部分模型在featured字段被标记为true代表新一代主推模型而 480p/720p 两个 I2V 版本则代表了 Wan2.1 时代图像驱动视频的完整分辨率梯度。文档页的生成机制说明值得注意的是本文讲解的官方文档页本身是由仓库脚本自动生成的doc/source/gen_docs.py读取各模型族的model_spec.json规格数据结合 doc/templates/video.rst.jinja 模板渲染出内置模型文档页。因此文档页中出现的 Model Name、Model Family、Abilities、Model ID 以及启动命令均直接来源于model_spec.json中的真实配置——例如模板中的{{ model_name }}、{{ model_family }}、{{ model_ability }}、{{ specifications }}等占位符最终被替换为Wan2.1-i2v-14B-480p、Wan、image2video与Wan-AI/Wan2.1-I2V-14B-480P-Diffusers。这意味着如果你想了解任何内置视频模型的最新规格直接查阅 xinference/model/video/model_spec.json 即可获得与文档页同步的一手数据。实践要点与注意事项综合上述内容在实际使用 Wan2.1-i2v-14B-480p 时有几点值得注意显存与精度14B 参数量模型默认以bfloat16加载请根据实际 GPU 显存评估是否可容纳权重与中间激活必要时可考虑 1.3B 档或 Wan2.2 的 5B 档模型输入图像约束模型会对输入图像按max_area480 × 832 像素面积自动等比缩放无需手动裁剪到特定宽高比注意max_area也支持以480*832这样的字符串形式传入下载源选择默认按auto决定从 HuggingFace 还是 ModelScope 下载国内环境可通过配置或显式指定download_hub选择 ModelScope 源以提升下载速度引擎固定为 Diffusers该模型仅注册了 Diffusers 引擎MLX 白名单中不包含此模型无需也不能指定其他引擎服务地址默认 RESTful 服务地址为http://127.0.0.1:9997认证开启时客户端需携带对应鉴权头。至此从文档元数据、模型规格、引擎实现到 HTTP 调用你已经掌握了在 Xinference 中完整使用 Wan2.1-i2v-14B-480p 图像生成视频的闭环流程。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考