极速克隆
🕒 阅读时间:约 13 分钟
📅 2026-03 深度精选
CosyVoice 2 与 F5-TTS 零样本语音克隆大模型:流式低延迟合成与极速推理
CosyVoice 2 与 F5-TTS 推动了零样本声音克隆的极速普及。只需 3~5 秒参考音频即可 1:1 复刻音色与情绪。本文带来两者的架构对比与极速流式生成工程实践。
🎙️ 一、零样本声音克隆双雄:CosyVoice 2 vs F5-TTS
| 模型框架 | 生成架构 | 首包时延 (TTFT) | 跨语种克隆能力 |
|---|---|---|---|
| CosyVoice 2 (0.5B) | 自回归语义 Token + 流匹配 (Flow Matching) | 约 150ms (流式极佳) | 支持中、英、日、粤、韩多方言混说 |
| F5-TTS | 纯非自回归流匹配 (Diffusion / Flow) | 整句生成极快 (RTF < 0.15) | 高保真中英文双语复刻 |
⚡ 二、镜像拉取与快速音色复刻
export HF_ENDPOINT="https://hf-mirror.net"
# 拉取 CosyVoice2 官方模型
huggingface-cli download FunAudioLLM/CosyVoice2-0.5B \
--local-dir /data/models/CosyVoice2-0.5B \
--local-dir-use-symlinks False
# 拉取 F5-TTS 权重
huggingface-cli download SWivid/F5-TTS \
--local-dir /data/models/F5-TTS \
--local-dir-use-symlinks False