输入主题生成 AI 短视频:Pixelle-Video 数字人口播与全自动出片实战手册

发布时间:2026/9/4 9:11:10
输入主题生成 AI 短视频:Pixelle-Video 数字人口播与全自动出片实战手册 输入主题生成 AI 短视频Pixelle-Video 数字人口播与全自动出片实战手册【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-VideoPixelle-Video 是一个开源的 AI 全自动短视频引擎输入一个主题它依次调用 LLM 写文案、图像模型出配图、TTS 合成语音、再叠加 BGM 渲染成完整视频全程无需剪辑软件也无需自己出镜。按文档口径一条 5 分镜的视频从点击生成到出片约 2-5 分钟。它适合内容创作者、电商运营、教育机构和只想把想法变成成片的新手本文按部署、配置、三条工作流的顺序讲清怎么用。横屏电影感模板深色底加居中画框标题在上、解说着落在下适合 B 站和 YouTube能力总览Web 界面以 Tab 形式提供三条流水线共用同一套 LLM、图像、视频、TTS 服务可在「系统配置」中随时替换模块支持内容主题生成视频输入主题或粘贴固定文案AI 完成分镜、配图、语音、合成数字人口播上传人物照片或商品图生成口播视频支持两种合成模式图生视频上传首帧图生成约 5 秒动态片段动作迁移上传参考视频加人物图迁移动作扩展模块LLM通义千问、GPT、DeepSeek、Ollama 等任何 OpenAI 兼容接口图像 / 视频本地 ComfyUI、云端 RunningHub或直连 DashScope、OpenAI、Kling、Seedance语音Edge-TTS 免费音色或 Index-TTS 等工作流加参考音频做声音克隆模板与尺寸templates/ 下 30 余种 HTML 模板覆盖竖屏 1080x1920、横屏 1920x1080、方形 1080x1080上手路径1. 获取并启动 Web 界面从源码启动只需两条命令依赖由 uv 自动安装macOS / Linux 需先装 ffmpeggit clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyWindows 用户建议直接用官方 Releases 的一键整合包解压后双击start.bat无需 Python 和 ffmpeg。启动后浏览器打开http://localhost:8501云端部署也可以按 Dockerfile 和 docker-compose.yml 走容器方式。水墨留白风格的横屏模板顶部标题、底部解说画面元素少长文案可读性更好2. 配置系统设置首次进入页面展开「⚙️ 系统配置」按三组填写并保存LLM下拉选预设通义千问性价比最高填 API Key本地模型填 Ollama 地址ComfyUI / RunningHub本地服务填comfyui_url默认http://127.0.0.1:8188并点「测试连接」走云端则填 RunningHub API KeyAPI 媒体模型可选直连 DashScope、OpenAI、ARK、Kling 时填密钥和 Base URL可单独开本地代理只选 ComfyUI 或 RunningHub 工作流的话第三组可以不填选了api/...工作流则必填。3. 选一条流水线试跑默认在「快速生成」Tab选「AI 生成内容」输入主题例如为什么要养成阅读习惯分镜数保持 5TTS 用默认 Edge-TTS模板选竖屏image_default.html点「生成视频」。右侧会实时显示进度生成文案 → 逐分镜配图 → 合成语音 → 合成视频完成后自动预览文件落在output/目录。跑通这一条后再切数字人口播和图生视频 Tab。深入使用三条核心工作流按「输入 → 配置 → 输出」拆解如下。工作流一主题生成短视频输入一个主题词或直接粘贴完整文案「固定文案」模式跳过 LLM 创作文案按段落、行或句子分割成分镜配置分镜数默认 5BGM 可选无、内置或自定义把 mp3 放进bgm/目录图像工作流决定配图模型「提示词前缀」用英文统一整片画风模板决定布局和画幅输出带解说的完整 mp4每句文案对应一张 AI 配图进度条按分镜计数深色科技风左右分栏模板左侧标题与解说、右侧 AI 生成的配图适合专业讲解类数字人视频工作流二数字人口播输入人物照片jpg/png/webp是必填项「数字人」模式再加一张商品图和商品标题「自定义」模式直接写口播文案配置TTS 分本地Edge-TTS 选音色、语速 0.5x-2.0x和 ComfyUI 两种推理模式后者可上传参考音频做声音克隆合成服务可选 RunningHub、本地 ComfyUI 或直连 API 参考生视频模型如 DashScope输出竖屏 9:16 口播视频。「数字人」模式走三步工作流先合成人物加商品的推广画面、LLM 写 80 字以内推广文案、再合成音频「自定义」模式直接用人物图加你写的文案。API 模式下会先出口播音频再连同人物图、商品图一起送入视频模型生成约 5 秒带原生语音的口播片段工作流三图生视频输入首帧图片支持多张批量配置选 i2v 工作流本地如 workflows/runninghub/i2v_LTX2.json或 API 模式的已验证参考生视频模型输出每张图生成约 5 秒的动态片段首帧构图和色调保持不变适合做封面动效或商品展示方形 1080x1080 极简模板细线画框居中构图适配小红书等方形信息流实战技巧用固定文案模式时建议把完整解说词直接贴进去避免每次生成都重新跑 LLM 导致文案漂移也省一步 API 费用控制分镜数量时建议 3-5 个就够用5 分镜视频出片约 2-5 分钟分镜越多耗时和费用线性增长统一配图风格时建议把英文提示词写进「提示词前缀」例如Minimalist black-and-white matchstick figure style illustration, clean lines并先用「预览风格」试一张再批量生成做零成本方案时建议 LLM 选 Ollama 本地模型、图像选selfhost/工作流全程 0 元无独立显卡就改用 RunningHub 跑图像LLM 仍可用通义千问压低成本混合部署随时可切批量出片时建议把runninghub_concurrent_limit调大1-10默认 1 表示所有任务串行排队想用自己的声音时建议切 TTS 的 ComfyUI 模式并上传 10 秒以上干净人声做参考音频走 Index-TTS 工作流生成前先用「预览语音」试听选输出尺寸时建议按发布平台定画幅竖屏 1080x1920 对应抖音、小红书、快手横屏 1920x1080 对应 B 站和 YouTube模板按尺寸分组别选错组导致裁切技术要点pixelle_video/service.py核心服务层把 LLM、TTS、图像/视频生成、帧处理、合成封装成统一接口Web UI 和 API 都从这里取能力workflows/ComfyUI 与直连 API 的工作流 JSON按 runninghub、selfhost 分组新增文件放入即被自动扫描templates/HTML 视频模板按 1080x1920、1080x1080、1920x1080 三个尺寸分组会随 README 持续新增下一步可以先跑通「主题生成视频」的最小流程再按需换模板、音色和工作流。遇到报错优先看 docs/zh/troubleshooting.md模板和 API 细节在 docs/zh/user-guide/ 下按主题分类。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考