阿里通义千问 3-TTS 是一体化引擎,可根据你的设置自动选择并下载对应的模型,无需手动管理模型文件。
4 种模型类型
🎭 定制音色(CustomVoice)—— 预设发言人 内置 9 个多语种发言人:Vivian、Serena、傅叔(Uncle_Fu)、Dylan、Eric、Ryan、Aiden、小野安娜(Ono_Anna)、Sohee 提供 0.6B、1.7B 两种模型参数量版本 支持风格指令(例如:“语气欢快地说话”、“听起来专业沉稳”) 通过 [角色名] 切换角色,会自动映射到这 9 个预设发言人之一
🎨 音色生成(VoiceDesign)—— 通过文本创建音色 用文字描述音色,模型可即时生成 示例:“一位开朗年轻女性,音色清亮有活力” 仅 1.7B 版本可用 可在音色描述的同时附加风格指令 生成的音色会缓存至本地磁盘,跨会话可重复使用
🎤 基础版(Base)—— 零样本语音克隆 使用 3–30 秒参考音频即可克隆任意人声 提供 0.6B、1.7B 两种模型参数量版本 ⚠️ 不支持风格指令:该模式下指令字段会被忽略 两种克隆模式:
- ICL 模式(默认,音质最佳):同时使用参考音频 + 参考文本。模型把参考文本作为上下文学习素材,更好复刻人声。推荐搭配🎭角色音色节点使用,该节点会同时提供音频与文本。
- X-Vector 模式:仅依靠音频提取说话人特征向量,无需文本。速度更快,但音质较差。
🔤 语音转文字(ASR) 搭配 ✏️统一语音转录节点使用 将音频转写为文本,支持可选强制文本对齐
技术规格
🌍 支持 10 种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语 📏 两种模型规模:0.6B、1.7B(音色生成 VoiceDesign 仅 1.7B) ⚡ 注意力机制:eager、flash_attention_2、sdpa、sage_attn 🔧 生成参数:温度(temperature)、top_k、top_p、重复惩罚(repetition_penalty) ⚡ torch.compile:可选,约 1.7 倍加速(要求 PyTorch 2.10 及以上版本)
统一通用能力
兼容全部 TTS 音频套件功能:角色切换、语种切换、停顿标签 [pause:1s]、SRT 时间轴、Step Audio EditX 后期编辑。
⚠️ 重要限制:风格指令仅部分模型生效
表格
| 模型 | 风格指令支持情况 |
|---|---|
| CustomVoice(定制音色) | ✅ 支持 |
| VoiceDesign(音色生成) | ✅ 支持 |
| Base(语音克隆) | ❌ 不支持 |
| ASR 语音转写 | ❌ 不适用 |
如果你需要控制朗读风格(情绪、语调、语速),请使用定制音色或文本生成音色。语音克隆模式无法接收风格指令。
Qwen3-TTS 性能优化
torch.compile(约 1.7 倍推理加速)
在 Qwen3-TTS 引擎节点中开启: use_torch_compile → True compile_mode → default(推荐,Windows 与 Linux 均可运行) use_cuda_graphs → False(开启 torch.compile 时该项冗余)
重点提示:开启后的首次生成速度很慢(编译耗时约 30–60 秒),后续生成速度很快;编译后的内核会跨会话缓存。
注意力模式
attn_implementation 参数用来切换注意力后端:
- sdpa — 通用默认选项,兼容性最好
- flash_attention_2 — 速度最快,需要匹配的显卡与驱动
- eager — 速度最慢,兜底兼容方案
- sage_attn — 另一款高速注意力实现
torch.compile 环境要求
PyTorch 2.10.0+,CUDA 13.0 triton 3.6.0+(Windows 系统使用 triton-windows) 推荐 Python 3.12
⚠️ reduce-overhead 和 max-autotune 编译模式在 Windows 会报错(cudaMallocAsync 异常),请使用 default 默认模式。
📖 完整部署指南,含安装命令、故障排查与性能基准测试:docs/qwen3_tts_optimizations.md
术语注释(保持插件开发习惯,方便你直接放进文档)
- Speaker:发言人 / 音色
- Style instructions:风格指令
- Zero-Shot Voice Cloning:零样本语音克隆
- In-context Learning (ICL):上下文学习
- Speaker embedding:说话人特征向量
- Forced alignment:强制时间对齐
- Attention backend:注意力后端
- repetition_penalty:重复惩罚
- disk-cached:磁盘缓存
直接使用生成的定制音色
通过 🎨 音色设计(Voice Designer)节点生成音色后,有两种使用方式:
方案 1 — 用作旁白音色(同一次工作流运行,无需刷新)
将音色设计节点的 NARRATOR_VOICE 输出端,直接连接到 TTS Text/SRT 节点的 narrator_voice 输入端。 生成好的音色会立刻作为主旁白音色生效。
方案 2 — 命名角色音色,通过标签 [tag] 调用
使用 💾 保存角色音色(Save Character Voice)节点,将音色以你指定的名称保存到角色文件夹。保存完成后,就可以在文本内用角色切换标签调用该音色:
[new_voice_bob] 你好,我是鲍勃。[narrator] 而我是旁白。
限制说明:新保存的音色需要刷新角色文件夹后才能被识别。如果你连续运行两次工作流,第二次运行时会自动加载该音色。 如果需要同一次运行内直接使用,请搭配 ♻️ 刷新音色缓存(Refresh Voice Cache)节点。
术语对照(适配 ComfyUI 插件文档)
- Designed Voice:定制生成音色
- Narrator:旁白
- character switching tags:角色切换标签
- character folder:角色音色目录
- Refresh Voice Cache:刷新音色缓存
🎭 Step Audio EditX 参考音频使用提示
- 你可以将「加载音频核心(Load Audio Core)」节点输出的任意音频,直接接入 🎭角色音色(Character Voices)节点,并手动填入转写文本,以此实现零样本语音克隆。
- 类似 F5 这类 Step Audio EditX 工具需要同时提供音频与参考文本。通过 🎭角色音色(Character Voices)载入的任意角色,都必须同时具备这两个所需文件。
术语对照
- Reference Audio:参考音频
- zero-shot voice cloning:零样本语音克隆
- transcription:转写文本 / 参考文本
🎭 Step Audio EditX 参考音频使用提示
- 你可以将「加载音频核心(Load Audio Core)」节点输出的任意音频,直接接入 🎭角色音色(Character Voices)节点,并手动填入转写文本,以此实现零样本语音克隆。
- 类似 F5 这类 Step Audio EditX 工具需要同时提供音频与参考文本。通过 🎭角色音色(Character Voices)载入的任意角色,都必须同时具备这两个所需文件。
术语对照
- Reference Audio:参考音频
- zero-shot voice cloning:零样本语音克隆
- transcription:转写文本 / 参考文本