如何用FLUX.2做AI图像生成:从零到第一张图的5分钟实践

发布时间:2026/8/24 1:24:57
如何用FLUX.2做AI图像生成:从零到第一张图的5分钟实践 如何用FLUX.2做AI图像生成从零到第一张图的5分钟实践【免费下载链接】flux2Official inference repo for FLUX.2 models项目地址: https://gitcode.com/gh_mirrors/flux/flux2FLUX.2 是 Black Forest Labs 的 AI 图像生成与编辑推理仓库它把文生图、单参考图编辑和多参考图融合放进同一套代码里。这里最实在的一点是klein 4B 模型约 8GB 显存就能跑装好 Python 环境后 5 分钟左右就能拿到第一张生成图。本文只走真实可执行的命令不掺参数虚构。版本怎么选 先用这张表判断你的显卡能不能跑、该下哪个权重模型版本参数量显存参考采样策略许可证适合场景klein 4B4B约 8GB4 步蒸馏亚秒级Apache 2.0消费级显卡入门、实时应用klein 9B9B约 30GB4 步蒸馏非商业许可更高质量的文本生成图像klein 9B KV9B约 30GB4 步 KV 缓存非商业许可多参考图编辑提速 1.2–2.7 倍klein 4B / 9B Base4B / 9B约 8GB / 30GB未蒸馏50 步Apache 2.0 / 非商业微调、LoRA 训练FLUX.2 dev32BH100 级4-bit 量化后约 18–24GB50 步非商业许可追求最高生成质量所有版本都支持文本生成图像、单参考编辑和多参考编辑区别主要在速度和显存上。从零到第一张图 官方在 CUDA 12.9 Python 3.12支持 3.10–3.12上验证过直接按这个顺序执行即可git clone https://gitcode.com/gh_mirrors/flux/flux2 cd flux2 python3.12 -m venv .venv source .venv/bin/activate pip install -e . --extra-index-url https://download.pytorch.org/whl/cu129 --no-cache-dir然后启动交互式命令行模型列表里直接回车选默认的 klein 4BPYTHONPATHsrc python scripts/cli.py在提示符后直接输入一句提示词例如a photo of a black horse jumping in the desert再按一次回车触发生成。首次运行会自动从 Hugging Face 拉取权重稍等即可图片按顺序存到output/sample_0.png。如果不想进交互模式也可以一条命令跑完PYTHONPATHsrc python scripts/cli.py --model_nameflux.2-klein-4b --prompta fox in a snowy forest --single_evalTrue。核心用法场景三种用法共用同一个会话改prompt和input_images两个参数就行。文本生成图像写清主体、光照和风格出图偏照片级真实感也覆盖动漫、超现实等风格。 prompta photo of a black horse jumping in the desert, cinematic lighting run单参考图编辑放一张参考图用文字说明要改什么模型会保留主体特征做局部改造。 input_imagesref.jpg promptput the person on a snowy city street at sunset, keep the face unchanged run多参考图融合逗号分隔传入多张图把不同图片的元素组合成一张新图适合做角色换装、场景拼接。 input_imagescat.jpg,red-flower.jpg promptthe cat climbs on the red flower, keep the flower details sharp run多参考编辑较多时建议换用 9B KV 版本PYTHONPATHsrc python scripts/cli.py --model_nameflux.2-klein-9b-kv它靠 KV 缓存避免每步重复计算参考图。提升质量的手法 ✏️按下面的清单调每一项对应一个可预期的结果prompt...写全主体、光照、构图、风格四个要素 → 出图更贴合意图少跑偏upsample_prompt_modelocal→ 用 Mistral-Small-3.2-24B 视觉语言模型在本地扩写提示词对含文字的图片、图内指令类提示词收益明显upsample_prompt_modeopenrouter→ 走 API 扩写需先设OPENROUTER_API_KEY官方认为效果普遍更好width1920 height1080→ 控制输出分辨率默认是 1360x768seed42→ 固定随机种子复现同一张结果match_image_size0→ 输出尺寸跟随第一张参考图编辑时保持构图比例dev 模型把num_steps从 50 降到 28 左右 → 官方文档提到这是速度和质量的可取折中多参考编辑换用 9B KV → 参考图越多、输出分辨率越小提速越明显详见 docs/flux2_klein_kv_cache.md提示词上采样有输入输出对比可以参考常见问题速查 ❓显存不够装不下模型首选 klein 4B约 8GB非要跑 32B 的 dev按 docs/flux2_dev_hf.md 用 diffusers 的 4-bit 量化加远程文本编码器RTX 4090 约 18GB 可跑CLI 也支持--cpu_offloadingTrue做 CPU/GPU 互换。首次运行很慢或下载失败权重默认从 Hugging Face 自动下载网络不稳定时先手动下好再通过FLUX2_MODEL_PATH、KLEIN_4B_MODEL_PATH等环境变量指向本地路径程序就不再联网拉取。想改步数或 guidance 却报错蒸馏版4B/9B/9B KV的num_steps4和guidance1.0是锁死的CLI 会直接拒绝需要调参就用 Base 系列或 dev默认 50 步、guidance 4.0。提示词或图片被拦下不生成CLI 内置了版权与 NSFW 过滤命中后该次 prompt 或输入图会被丢弃换个说法或换图即可。进阶选读模型架构基于流匹配的 transformer三档尺寸定义Flux2Params、Klein9BParams、Klein4BParams在 src/flux2/model.py采样与 KV 缓存逻辑在 src/flux2/sampling.py文本编码器在 src/flux2/text_encoder.pyKV 缓存原理与各分辨率下的加速数据docs/flux2_klein_kv_cache.md消费级显卡部署 dev量化、远程文本编码器docs/flux2_dev_hf.md提示词上采样的适用场景与两种模式细节docs/flux2_with_prompt_upsampling.md微调与 LoRAklein Base 系列4B/9B就是为此设计dev 的模型说明见 model_cards/FLUX.2-dev.md水印隐形水印实现位于 src/flux2/watermark.pyREADME 同时建议对输出补充 C2PA 元数据许可证4B 系列为 Apache 2.09B、9B KV 和 dev 系列适用 FLUX 非商业许可原文见 model_licenses/LICENSE-FLUX-DEV 与 model_licenses/LICENSE-FLUX-NON-COMMERICAL接下来三件事一、把 klein 4B 的最小路径跑通并生成一张图二、用同一会话试单参考和多参考编辑三、稳定后按 docs/flux2_dev_hf.md 探索量化部署。更多模型更新和下载入口都写在仓库的 README.md 里那里也是官方信息的起点。【免费下载链接】flux2Official inference repo for FLUX.2 models项目地址: https://gitcode.com/gh_mirrors/flux/flux2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考