🤗
HF-Mirror Engineering Guide
扩散模型 🕒 阅读时间:约 12 分钟 📅 2026-03 深度修订

FLUX.1 扩散生图大模型 ComfyUI 工作流与 LoRA 权重高速配置指南

开源文生图模型 FLUX.1 组件多且体积庞大。本文详解其 DiT 主干、双文本编码器与 VAE 的分离拉取步骤,并提供针对消费级显卡的低显存 ComfyUI 极速配置指南。

🎨 一、FLUX.1 架构与多组件拆解

由 Stable Diffusion 原班创始团队打造的 Black Forest Labs 推出了 FLUX.1 系列开源扩散模型。在画面质感、手指肢体准确度、排版文字渲染(Typography)以及复杂 Prompt 理解上达到了业界标杆水平。

FLUX.1 包含两个主要开源分支:

  • FLUX.1 [dev]: 120 亿参数非商用高精度底模,支持复杂采样步数(通常 20~30 步),画质上限极高。
  • FLUX.1 [schnell]: 针对实时生成蒸馏的急速版本,仅需 4 步即可出图,且遵循 Apache 2.0 开源商用协议。

在工程落地(特别是 ComfyUI 与 WebUI)中,FLUX.1 并非一个单一文件,而是由多个核心组件复合而成:

1. DiT 主干 (Diffusion Transformer)
负责降噪去噪的核心网络,原版单文件约 23.8 GB (FP16) 或 11.9 GB (FP8)。
2. 双文本编码器 (CLIP-L + T5-v1.1-XXL)
CLIP-L 负责基础语义(约 240MB),T5-XXL 负责极细粒度文字描述与长提示词(FP16 约 9.8GB,FP8 约 4.9GB)。
3. 变分自编码器 (AE / VAE)
负责 Latent 潜空间与高分辨率像素图像之间的解码映射(单文件约 335MB)。
4. LoRA 风格微调适配器
挂载在 DiT 线性层上的低秩自适应权重,体积通常在 20MB ~ 300MB 之间。

⚡ 二、镜像站模块化拉取与 ComfyUI 目录映射

为了避免在 ComfyUI 中拉取过多无用文件,建议利用 huggingface-cli 配合 --include 语法按需下载,直接落盘至 ComfyUI 对应模型目录中:

自动化拉取并归档到 ComfyUI 目录
#!/usr/bin/env bash
export HF_ENDPOINT="https://hf-mirror.net"
COMFY_ROOT="/data/ComfyUI"

echo "=== 1. 拉取 FLUX.1 VAE 权重 ==="
huggingface-cli download black-forest-labs/FLUX.1-dev ae.safetensors \
  --local-dir "$COMFY_ROOT/models/vae" \
  --local-dir-use-symlinks False

echo "=== 2. 拉取 CLIP-L 文本编码器 ==="
huggingface-cli download comfyanonymous/flux_text_encoders clip_l.safetensors \
  --local-dir "$COMFY_ROOT/models/clip" \
  --local-dir-use-symlinks False

echo "=== 3. 拉取 T5XXL 文本编码器 (推荐 FP8 低显存版) ==="
huggingface-cli download comfyanonymous/flux_text_encoders t5xxl_fp8_e4m3fn.safetensors \
  --local-dir "$COMFY_ROOT/models/clip" \
  --local-dir-use-symlinks False

echo "=== 4. 拉取 FLUX.1-dev 主干网络 (FP8 优化版) ==="
huggingface-cli download Kijai/flux-fp8 flux1-dev-fp8.safetensors \
  --local-dir "$COMFY_ROOT/models/unet" \
  --local-dir-use-symlinks False

echo "全部组件下载完成!可以直接在 ComfyUI 载入对应节点。"

🎛️ 三、显存分级与低显存启动调优

FLUX.1 原始 FP16 运行需要超过 32GB 显存,个人工作站需合理规划精度与内存卸载策略:

硬件环境 模型格式方案 ComfyUI 启动参数 出图速度 (1024x1024)
12GB 显存 (3060/4070) NF4 / GGUF Q4_K_S + T5 FP8 --lowvram 约 30 ~ 45 秒
16GB 显存 (4080/4070TiS) FP8 DiT + T5 FP8 --gpu-only 或默认 约 15 ~ 20 秒
24GB 显存 (3090/4090) FP8 / 原版 FP16 + T5 FP8 --highvram 约 8 ~ 12 秒

提示:在 ComfyUI 工作流中使用 DualCLIPLoader 节点,分别选中 clip_l.safetensors 与 t5xxl_fp8_e4m3fn.safetensors,type 设为 flux 即可完美适配。

← 专栏目录 查看全部 12 篇大模型工程实录 动手配置 → 5分钟零门槛配置与高速拉取教程