ComfyUI 大家最熟悉的是文生图、图生视频,绝大多数人的工作流停留在「图片→视频」,配音还要导出文本,丢到外部网页、剪辑软件单独生成音频,再导回剪辑,来回导出导入非常割裂ComfyUI。
而 ComfyUI TTS(文本转语音),就是把语音合成直接搬进节点画布,实现:输入文字 → 生成音频 → 直接对接视频生成、字幕、音频保存节点,一套工作流跑完「文案‑画面‑视频‑配音」全链路,不用切换任何外部工具CSDN博…。
一、ComfyUI 做 TTS 的优势
- 全流程一体化 LLM 生成文案 → TTS 生成配音 → 传给视频节点生成带人声的短片,漫画解说、短视频旁白、AI 短剧、播客都可以在一张画布完成,省去复制粘贴导出文件的重复劳动ComfyUI。
- 可视化节点编排,灵活可控 所有参数可视化调节:语速、情感、音色、采样率;可以接入声音克隆节点,拿一小段参考音频复刻声线;支持长文本自动分段,批量生成多角色对话音频GitHub。
- 两种方案可选:本地离线 / API 云端调用
- 本地离线 TTS:ChatTTS、Qwen‑TTS、Fish‑Speech、VITS 系列,显卡本地跑,不需要网络、不需要 API 密钥,隐私性强,吃显存资源GitHub。
- 云端 API 节点:ElevenLabs、Index‑TTS,音质极强,对显卡无要求,需要网络与 API‑Key,适合没有高性能显卡的用户ComfyUI。
- 高度可复用,可保存工作流模板 调好一套配音模板,后续直接改输入文本,一键批量输出旁白音频,自媒体做连载漫剧、系列短视频效率提升巨大。
二、主流 TTS 节点插件盘点
1. ComfyUI‑Qwen‑TTS(阿里通义开源,中文友好)
基于 Qwen3‑TTS,中文表现优秀,支持零样本声音克隆,可通过文本描述定制音色;支持 MPS 苹果芯片,N 卡更流畅。
获取:ComfyUI‑Manager 搜索
ComfyUI‑Qwen‑TTS安装,模型会自动下载,也可以手动放置模型目录GitHub。
2. ChatTTS ComfyUI 节点
国内热门开源 TTS,口语自然,支持多情绪,适合短视频旁白;长文本自动分句,适合大段文案配音;显存建议 8G 以上。
3. ElevenLabs 官方合作节点(云端天花板音质)
ComfyUI 官方内置合作节点,多语种,声音克隆效果顶尖,适合做多角色对话;需要注册账号填入 API Key,按字符计费,无需本地大模型。
节点名称:
ElevenlabsTextToSpeech、ElevenLabsTextToDialogue,直接生成多人对话音频ComfyUI。
4. Fish‑Speech / VITS 系列
老牌语音合成方案,大量社区开源音色,二次元角色配音首选,适合做动漫角色配音,模型文件放在models/vits目录使用CSDN博…。
5. Pocket‑TTS
轻量化本地 TTS,开箱即用,自带多种预设音色,配置门槛低,适合新手入门体验 TTS 能力GitHub。
三、最简上手工作流(新手直接抄结构)
一套最基础文本转音频链路,节点连接顺序:
字符串输入(String Input) → TTS生成节点 → 保存音频(Save Audio) / 音频预览节点
- 用
String Input输入要朗读的文案,支持多行大段文本; - 接入对应 TTS 生成节点,调节核心参数:
- 语速 Speed:0.8‑1.2 最自然,大于 1.5 语速过快;
- 情感 / 风格:neutral 平静、happy 开心、sad 伤感,不同模型参数略有区别;
- speaker_id:选择音色编号;克隆声音则接入参考音频输入;
- 输出端连接
Save Audio,设置输出路径,点击队列执行; - 运行完成,画布直接预览播放音频,自动输出 wav/mp3 文件。
进阶拓展链路: LLM 大模型生成文案 → TTS 语音合成 → SRT 字幕生成 → 视频生成节点,端到端产出带配音字幕 AI 短视频。
四、常见踩坑与避坑
- 节点红框报错,模型加载失败 安装完自定义节点必须重启 ComfyUI;缺少依赖包按照节点 README 补全 pip 依赖;本地模型下载失败可以手动把模型放到对应 models 文件夹。
- 生成语音卡顿、显存爆 OOM 本地 TTS 对显存有门槛,ChatTTS/Qwen‑TTS 建议≥8G 显存;开启 fp16/fp8 量化降低显存占用;超长文案做文本拆分,不要一次性丢几万字文本进去。
- 音色漂移,同角色前后声音不一样 很多开源 TTS 随机性强,每次生成音色会轻微变化;尽量固定 seed 种子值,长文本分段使用同一个 speaker / 参考音频,避免音色跳戏,做漫剧配音尤其要注意这一点。
- 中文发音生硬,断句混乱 输入文本适当添加逗号句号换行,帮助模型识别停顿;优先选择专门针对中文优化的模型,如 ChatTTS、Qwen‑TTS。
五、适用的真实业务场景
✅ AI 短视频 / 漫剧:文案一键生成角色旁白,对接视频节点直接成片; ✅ 播客、有声书片段批量配音; ✅ 多角色对话剧本,批量生成多人对白音频; ✅ 教育课件 AI 朗读、解说音频素材; ✅ 完整多模态流水线:大模型写稿→TTS 配音→AI 生成视频,全链路 ComfyUI 内部闭环。
六、写在最后
过去 ComfyUI 擅长图像视频,音频一直是短板。随着各类 TTS 自定义节点爆发,我们终于可以不用来回切换多个软件。 本地显卡够强就跑开源离线 TTS,追求极致音质就用云端 API 节点,把配音环节完整纳入可视化工作流,这也是未来 AIGC 内容生产的趋势:一个画布搞定图文音视频全部产出。
小提示:新手建议先用 ChatTTS 或者 Qwen‑TTS 体验中文本地 TTS,不需要 API,上手成本最低。