通义千问 3-TTS 引擎(Qwen3-TTS Engine)

17次阅读
没有评论

阿里通义千问 3-TTS 是一体化引擎,可根据你的设置自动选择并下载对应的模型,无需手动管理模型文件。

4 种模型类型

🎭 定制音色(CustomVoice)—— 预设发言人 内置 9 个多语种发言人:Vivian、Serena、傅叔(Uncle_Fu)、Dylan、Eric、Ryan、Aiden、小野安娜(Ono_Anna)、Sohee 提供 0.6B、1.7B 两种模型参数量版本 支持风格指令(例如:“语气欢快地说话”、“听起来专业沉稳”) 通过 [角色名] 切换角色,会自动映射到这 9 个预设发言人之一

🎨 音色生成(VoiceDesign)—— 通过文本创建音色 用文字描述音色,模型可即时生成 示例:“一位开朗年轻女性,音色清亮有活力” 仅 1.7B 版本可用 可在音色描述的同时附加风格指令 生成的音色会缓存至本地磁盘,跨会话可重复使用

🎤 基础版(Base)—— 零样本语音克隆 使用 3–30 秒参考音频即可克隆任意人声 提供 0.6B、1.7B 两种模型参数量版本 ⚠️ 不支持风格指令:该模式下指令字段会被忽略 两种克隆模式:

  • ICL 模式(默认,音质最佳):同时使用参考音频 + 参考文本。模型把参考文本作为上下文学习素材,更好复刻人声。推荐搭配🎭角色音色节点使用,该节点会同时提供音频与文本。
  • X-Vector 模式:仅依靠音频提取说话人特征向量,无需文本。速度更快,但音质较差。

🔤 语音转文字(ASR) 搭配 ✏️统一语音转录节点使用 将音频转写为文本,支持可选强制文本对齐

技术规格

🌍 支持 10 种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语 📏 两种模型规模:0.6B、1.7B(音色生成 VoiceDesign 仅 1.7B) ⚡ 注意力机制:eager、flash_attention_2、sdpa、sage_attn 🔧 生成参数:温度(temperature)、top_k、top_p、重复惩罚(repetition_penalty) ⚡ torch.compile:可选,约 1.7 倍加速(要求 PyTorch 2.10 及以上版本)

统一通用能力

兼容全部 TTS 音频套件功能:角色切换、语种切换、停顿标签 [pause:1s]、SRT 时间轴、Step Audio EditX 后期编辑。

⚠️ 重要限制:风格指令仅部分模型生效

表格

模型 风格指令支持情况
CustomVoice(定制音色) ✅ 支持
VoiceDesign(音色生成) ✅ 支持
Base(语音克隆) ❌ 不支持
ASR 语音转写 ❌ 不适用

如果你需要控制朗读风格(情绪、语调、语速),请使用定制音色或文本生成音色。语音克隆模式无法接收风格指令。

Qwen3-TTS 性能优化

torch.compile(约 1.7 倍推理加速)

在 Qwen3-TTS 引擎节点中开启: use_torch_compile → True compile_mode → default(推荐,WindowsLinux 均可运行) use_cuda_graphs → False(开启 torch.compile 时该项冗余)

重点提示:开启后的首次生成速度很慢(编译耗时约 30–60 秒),后续生成速度很快;编译后的内核会跨会话缓存。

注意力模式

attn_implementation 参数用来切换注意力后端:

  • sdpa — 通用默认选项,兼容性最好
  • flash_attention_2 — 速度最快,需要匹配的显卡与驱动
  • eager — 速度最慢,兜底兼容方案
  • sage_attn — 另一款高速注意力实现

torch.compile 环境要求

PyTorch 2.10.0+,CUDA 13.0 triton 3.6.0+(Windows 系统使用 triton-windows) 推荐 Python 3.12

⚠️ reduce-overhead 和 max-autotune 编译模式在 Windows 会报错(cudaMallocAsync 异常),请使用 default 默认模式。

📖 完整部署指南,含安装命令、故障排查与性能基准测试:docs/qwen3_tts_optimizations.md

术语注释(保持插件开发习惯,方便你直接放进文档)

  • Speaker:发言人 / 音色
  • Style instructions:风格指令
  • Zero-Shot Voice Cloning:零样本语音克隆
  • In-context Learning (ICL):上下文学习
  • Speaker embedding:说话人特征向量
  • Forced alignment:强制时间对齐
  • Attention backend:注意力后端
  • repetition_penalty:重复惩罚
  • disk-cached:磁盘缓存

直接使用生成的定制音色

通过 🎨 音色设计(Voice Designer)节点生成音色后,有两种使用方式:

方案 1 — 用作旁白音色(同一次工作流运行,无需刷新)

将音色设计节点的 NARRATOR_VOICE 输出端,直接连接到 TTS Text/SRT 节点的 narrator_voice 输入端。 生成好的音色会立刻作为主旁白音色生效。

方案 2 — 命名角色音色,通过标签 [tag] 调用

使用 💾 保存角色音色(Save Character Voice)节点,将音色以你指定的名称保存到角色文件夹。保存完成后,就可以在文本内用角色切换标签调用该音色:

[new_voice_bob] 你好,我是鲍勃。[narrator] 而我是旁白。

限制说明:新保存的音色需要刷新角色文件夹后才能被识别。如果你连续运行两次工作流,第二次运行时会自动加载该音色。 如果需要同一次运行内直接使用,请搭配 ♻️ 刷新音色缓存(Refresh Voice Cache)节点。


术语对照(适配 ComfyUI 插件文档)

  • Designed Voice:定制生成音色
  • Narrator:旁白
  • character switching tags:角色切换标签
  • character folder:角色音色目录
  • Refresh Voice Cache:刷新音色缓存

🎭 Step Audio EditX 参考音频使用提示

  1. 你可以将「加载音频核心(Load Audio Core)」节点输出的任意音频,直接接入 🎭角色音色(Character Voices)节点,并手动填入转写文本,以此实现零样本语音克隆。
  2. 类似 F5 这类 Step Audio EditX 工具需要同时提供音频与参考文本。通过 🎭角色音色(Character Voices)载入的任意角色,都必须同时具备这两个所需文件。

术语对照

  • Reference Audio:参考音频
  • zero-shot voice cloning:零样本语音克隆
  • transcription:转写文本 / 参考文本

🎭 Step Audio EditX 参考音频使用提示

  1. 你可以将「加载音频核心(Load Audio Core)」节点输出的任意音频,直接接入 🎭角色音色(Character Voices)节点,并手动填入转写文本,以此实现零样本语音克隆。
  2. 类似 F5 这类 Step Audio EditX 工具需要同时提供音频与参考文本。通过 🎭角色音色(Character Voices)载入的任意角色,都必须同时具备这两个所需文件。

术语对照

  • Reference Audio:参考音频
  • zero-shot voice cloning:零样本语音克隆
  • transcription:转写文本 / 参考文本
正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)
验证码