ComfyUI MiMo TTS:把小米语音合成塞进 ComfyUI 工作流,8种音色+克隆+剧本配音一键搞定
最近在 GitHub 上发现了一个非常实用的 ComfyUI 自定义节点项目:ComfyUI MiMo TTS。它把小米 MiMo 的语音合成 API 封装成了 ComfyUI 节点,让你能在工作流里直接用节点生成语音——从简单的”文字转语音”到复杂的”多角色剧本配音+拼接”,全在一个工作流里搞定。
为什么值得关注?
ComfyUI 生态里虽然图像生成、视频生成类的插件已经非常丰富,但语音合成一直是个比较空白的领域。大多数 TTS 工具要么需要独立部署服务,要么需要复杂的 Python 环境配置。而 MiMo TTS 直接把小米商用级 TTS API 桥接到了 ComfyUI 的节点系统里——一个 git clone 就能跑。
五大核心节点
这个插件提供了 5 个节点,覆盖了从基础到进阶的所有场景:
| 节点 | 功能 | 一句话理解 |
|---|---|---|
| MiMo TTS | 预置音色合成 | 选音色→输文字→出音频 |
| MiMo 音色克隆 | 参考音频克隆音色 | 给一段音频,克隆它的声音 |
| MiMo 音色设计 | 文字描述定制音色 | “青年女性,声音甜美温柔” → 新音色 |
| MiMo 剧本配音 | JSON 剧本批量配音 | 一段 JSON,自动生成多人对话 |
| MiMo 音频拼接 | 多路音频合并 | 5路音频输入,合并成一条输出 |
8 种预设音色 + 18 种情感标签
插件内置了 8 种预设音色,覆盖了中文和英文场景:
中文音色:冰糖(甜美少女)、茉莉(温柔知性)、苏打(阳光少年)、白桦(沉稳大叔)
英文音色:Mia(青春活力)、Chloe(优雅知性)、Milo(磁性男声)、Dean(专业播音)
每种音色还可以搭配 18 种情感标签(开心、悲伤、愤怒、惊讶等),让语音表达更加自然。这在做短视频配音、有声内容创作时非常有用。
剧本配音:JSON 驱动多角色对话
最让我惊艳的是剧本配音功能。你只需要写一段 JSON,就能批量生成多角色对话:
{ |
节点会自动为每个角色用对应音色生成语音,然后拼接成完整对话。以前要手动一条条生成再拼接的工作,现在一个节点全部搞定。
配合 MiMo 音频拼接节点,你还可以把不同场景的对话片段串联起来,做出完整的”广播剧”效果。
音色克隆 + 音色设计:创造独一无二的声音
音色克隆节点支持上传参考音频来克隆音色——不管是你的声音、朋友的声音,只要有一段清晰的音频样本,就能让 MiMo 复刻出来。
音色设计节点更进一步,直接用文字描述来创造新音色。输入”青年女性,声音甜美温柔”,AI 就能按你的描述合成一个新音色。这种”自然语言编程”式的交互方式,对非专业用户非常友好。
ComfyUI 工作流示例
基础用法:一行流水线
MiMo TTS → PreviewAudio |
最简单的方式,一端接入文本和音色,另一端输出音频。
多角色对话
MiMo TTS (小玲) ──→ audio_1 ──┐ |
两个 MiMo TTS 节点分别配置不同音色,经过音频拼接节点合并,最终输出一段完整的对话音频。
音色克隆
Load Audio → MiMo Voice Clone → PreviewAudio |
先加载参考音频,克隆音色后再用新音色合成文本——不需要写任何代码。
安装和配置
安装
cd ComfyUI/custom_nodes |
或者直接下载 ZIP 解压到 ComfyUI/custom_nodes/ 目录。
配置
编辑 config.env 文件:
MIMO_API_KEY=你的API密钥 |
也可以在节点界面上直接填入 api_key 和 api_base,节点界面设置的优先级更高,方便随时切换。
依赖
- ComfyUI 0.25.0+
- PyTorch(ComfyUI 自带)
- torchaudio(音色克隆和音频拼接需要)
- ffmpeg(可选,用于高级音频处理)
适用场景
| 场景 | 推荐节点 |
|---|---|
| 短视频配音 | MiMo TTS(预置音色) |
| 有声书/播客 | 剧本配音 + 音频拼接 |
| 个性化语音助手 | 音色克隆 |
| 角色扮演/AI互动 | 音色设计 |
| 批量语音生成 | 剧本配音(JSON 驱动) |
总结
ComfyUI MiMo TTS 是一个非常”对味”的开源插件——它没有尝试自己造 TTS 引擎,而是巧妙地桥接了小米 MiMo 的商用级 API,让 ComfyUI 工作流从此有了”说话”的能力。
5 个节点分工明确,从简单到复杂都有覆盖。尤其是剧本配音和音色设计这两个节点,把过去需要多个工具配合的流程做到了一个节点里,效率提升非常明显。
对于已经在用 ComfyUI 做 AI 内容创作的人来说,这个插件补上了语音合成的关键一环——图像、视频、音频终于在同一个工作流里产生了化学反应。
项目地址:https://github.com/kkitx/comfyui-mimo-tts
协议:MIT(完全开放,商用友好)
环境要求:ComfyUI 0.25.0+






