最近在 GitHub 上发现了一个非常实用的 ComfyUI 自定义节点项目:ComfyUI MiMo TTS。它把小米 MiMo 的语音合成 API 封装成了 ComfyUI 节点,让你能在工作流里直接用节点生成语音——从简单的”文字转语音”到复杂的”多角色剧本配音+拼接”,全在一个工作流里搞定。

为什么值得关注?

ComfyUI 生态里虽然图像生成、视频生成类的插件已经非常丰富,但语音合成一直是个比较空白的领域。大多数 TTS 工具要么需要独立部署服务,要么需要复杂的 Python 环境配置。而 MiMo TTS 直接把小米商用级 TTS API 桥接到了 ComfyUI 的节点系统里——一个 git clone 就能跑

五大核心节点

这个插件提供了 5 个节点,覆盖了从基础到进阶的所有场景:

节点 功能 一句话理解
MiMo TTS 预置音色合成 选音色→输文字→出音频
MiMo 音色克隆 参考音频克隆音色 给一段音频,克隆它的声音
MiMo 音色设计 文字描述定制音色 “青年女性,声音甜美温柔” → 新音色
MiMo 剧本配音 JSON 剧本批量配音 一段 JSON,自动生成多人对话
MiMo 音频拼接 多路音频合并 5路音频输入,合并成一条输出

8 种预设音色 + 18 种情感标签

插件内置了 8 种预设音色,覆盖了中文和英文场景:

中文音色:冰糖(甜美少女)、茉莉(温柔知性)、苏打(阳光少年)、白桦(沉稳大叔)
英文音色:Mia(青春活力)、Chloe(优雅知性)、Milo(磁性男声)、Dean(专业播音)

每种音色还可以搭配 18 种情感标签(开心、悲伤、愤怒、惊讶等),让语音表达更加自然。这在做短视频配音、有声内容创作时非常有用。

剧本配音:JSON 驱动多角色对话

最让我惊艳的是剧本配音功能。你只需要写一段 JSON,就能批量生成多角色对话:

{
"characters": {
"小玲": {"voice": "冰糖"},
"哥哥": {"voice": "白桦"}
},
"lines": [
{"char": "小玲", "text": "你好!"},
{"char": "哥哥", "text": "你好啊!"},
{"char": "小玲", "text": "今天天气真好"},
{"char": "哥哥", "text": "是啊,出去走走吧"}
]
}

节点会自动为每个角色用对应音色生成语音,然后拼接成完整对话。以前要手动一条条生成再拼接的工作,现在一个节点全部搞定。

配合 MiMo 音频拼接节点,你还可以把不同场景的对话片段串联起来,做出完整的”广播剧”效果。

音色克隆 + 音色设计:创造独一无二的声音

音色克隆节点支持上传参考音频来克隆音色——不管是你的声音、朋友的声音,只要有一段清晰的音频样本,就能让 MiMo 复刻出来。

音色设计节点更进一步,直接用文字描述来创造新音色。输入”青年女性,声音甜美温柔”,AI 就能按你的描述合成一个新音色。这种”自然语言编程”式的交互方式,对非专业用户非常友好。

ComfyUI 工作流示例

基础用法:一行流水线

MiMo TTS → PreviewAudio

最简单的方式,一端接入文本和音色,另一端输出音频。

多角色对话

MiMo TTS (小玲) ──→ audio_1 ──┐
├──→ MiMo Audio Concat → SaveAudio
MiMo TTS (哥哥) ──→ audio_2 ──┘

两个 MiMo TTS 节点分别配置不同音色,经过音频拼接节点合并,最终输出一段完整的对话音频。

音色克隆

Load Audio → MiMo Voice Clone → PreviewAudio

先加载参考音频,克隆音色后再用新音色合成文本——不需要写任何代码。

安装和配置

安装

cd ComfyUI/custom_nodes
git clone https://github.com/kkitx/comfyui-mimo-tts.git

或者直接下载 ZIP 解压到 ComfyUI/custom_nodes/ 目录。

配置

编辑 config.env 文件:

MIMO_API_KEY=你的API密钥
MIMO_API_BASE=http://你的服务器地址/v1

也可以在节点界面上直接填入 api_keyapi_base,节点界面设置的优先级更高,方便随时切换。

依赖

  • ComfyUI 0.25.0+
  • PyTorch(ComfyUI 自带)
  • torchaudio(音色克隆和音频拼接需要)
  • ffmpeg(可选,用于高级音频处理)

适用场景

场景 推荐节点
短视频配音 MiMo TTS(预置音色)
有声书/播客 剧本配音 + 音频拼接
个性化语音助手 音色克隆
角色扮演/AI互动 音色设计
批量语音生成 剧本配音(JSON 驱动)

总结

ComfyUI MiMo TTS 是一个非常”对味”的开源插件——它没有尝试自己造 TTS 引擎,而是巧妙地桥接了小米 MiMo 的商用级 API,让 ComfyUI 工作流从此有了”说话”的能力。

5 个节点分工明确,从简单到复杂都有覆盖。尤其是剧本配音音色设计这两个节点,把过去需要多个工具配合的流程做到了一个节点里,效率提升非常明显。

对于已经在用 ComfyUI 做 AI 内容创作的人来说,这个插件补上了语音合成的关键一环——图像、视频、音频终于在同一个工作流里产生了化学反应。


项目地址https://github.com/kkitx/comfyui-mimo-tts
协议:MIT(完全开放,商用友好)
环境要求:ComfyUI 0.25.0+