5. 音频模型相关介绍

以下是 ComfyUI 生态中音频相关模型的完整分类,按要求的格式重新整理:

5.1 文生音频(Text-to-Audio, TTA)

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

AudioLDM

文生音效、环境声,Latent Diffusion 架构

AudioLDM-S、AudioLDM-L、AudioLDM 2

早期开源标杆,文本理解准确,音效丰富,AudioLDM 2 扩展至音乐/语音/音效三模态,社区节点支持中等

✅ 可商用(MIT)

✅ 支持,文本描述生成对应音效

Tango

轻量高效文生音效,扩散模型

Tango

推理速度快,适合实时预览,但生态较 AudioLDM 弱,社区跟进一般

✅ 可商用

✅ 支持

Make-An-Audio

复杂语义理解,扩散模型

Make-An-Audio、Make-An-Audio 3D

语义理解强,复杂描述效果好,3D 版支持空间音频,但社区资源有限

✅ 可商用

✅ 支持,复杂自然语言描述

Stable Audio

高质量音乐/音效生成,Stability AI 官方

Stable Audio 1.0、Stable Audio 2.0

音乐质量高,生成时长可达 3 分钟,商用友好,但 ComfyUI 集成一般,多通过 API 使用

✅ 可商用(官方协议)

✅ 优秀支持,支持风格/乐器/情绪描述

MusicGen

旋律连贯音乐生成,Meta 开源

MusicGen Small、MusicGen Medium、MusicGen Large、MusicGen Melody

当前开源文生音乐首选,旋律连贯性顶尖,Melody 版支持参考旋律条件,生态丰富,ComfyUI 节点较成熟

✅ 可商用(MIT)

✅ 优秀支持,支持风格+乐器+节奏描述

AudioCraft(Meta 套件)

综合音频生成,含 MusicGen + AudioGen + EnCodec

AudioCraft

Meta 官方统一套件,生态整合好,但 ComfyUI 直接支持有限,多需外部调用

✅ 可商用

✅ 支持

Riffusion

频谱图生成音乐,Stable Diffusion 变种

Riffusion

将音频转为频谱图用 SD 生成,创意独特但音乐质量一般,连贯性差,更多用于实验

✅ 可商用

⚠️ 有限支持,需特定格式描述

Suno(闭源)

完整歌曲生成,含歌词+演唱

Suno v3、Suno v4

当前文生音乐天花板,支持完整歌曲结构(主歌/副歌/桥段),但闭源仅 API/网页

❌ 不可本地商用(平台付费订阅)

✅ 顶尖支持,支持歌词+风格+情绪完整描述

Udio(闭源)

高质量音乐生成,细节丰富

Udio

与 Suno 竞争,音乐细节和乐器分离度优秀,同样闭源

❌ 不可本地商用(平台付费订阅)

✅ 顶尖支持

5.2 图生音频(Image-to-Audio, ITA)

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

Im2Wav

图像内容推断对应环境音效,视觉-听觉关联

Im2Wav

学术项目,从图像生成匹配的环境声,但开源程度一般,ComfyUI 支持极弱

需查看具体许可

❌ 不支持,纯图像驱动

Spectral-GAN

图像特征驱动频谱生成

Spectral-GAN

早期实验性工作,质量一般,生态几乎无,未进入实用阶段

需查看具体许可

❌ 不支持

CLAP-TTA

CLAP 跨模态嵌入驱动音频生成

CLAP-TTA

利用 CLAP 统一表示空间,图像和音频语义对齐,但实用性有限

✅ 可商用(如基于开源 CLAP)

❌ 不支持,图像驱动

Make-An-Audio 3D

结合深度图生成 3D 空间音频

Make-An-Audio 3D

扩展版支持深度条件,生成空间化音效,VR/AR 方向有潜力,但生态不成熟

✅ 可商用

❌ 不支持,图像+深度驱动

Video-to-Audio 简化版(单帧)

取视频首帧或关键帧生成对应音频

Im2Wav 扩展、FoleyCrafter 单帧版

图生音频的过渡形态,实际多归入视频生音频范畴,独立工具少

视具体工具

❌ 不支持

5.3 视频生音频(Video-to-Audio, VTA)

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

FoleyCrafter

视频画面生成匹配拟音(脚步声、碰撞声等)

FoleyCrafter

2024 开源爆款,拟音质量顶尖,时序对齐好,ComfyUI 有实验性节点,影视后期潜力巨大

✅ 可商用

⚠️ 有限支持,主要视频驱动,可配合文本微调

DiffFoley

扩散模型生成高质量拟音

DiffFoley

扩散架构,拟音质量高,同步性强,但计算量大速度慢,ComfyUI 支持弱

需查看具体许可

⚠️ 有限支持

RegNet + SpecVQGAN

视觉编码驱动音频 token 生成

RegNet-SpecVQGAN

视频内容驱动音频量化生成,生态较老,被 FoleyCrafter 超越

需查看具体许可

❌ 不支持,纯视频驱动

VATT

大规模视频-音频-文本联合预训练

VATT

Google 研究项目,跨模态能力强,但开源程度低,实用性有限

需查看具体许可

✅ 支持(三模态联合)

Specter

端到端视频到音频,同步性优秀

Specter

视觉-音频同步生成,时序对齐好,但社区生态弱

需查看具体许可

❌ 不支持

MM-Diffusion

音视频联合生成,一致性最强

MM-Diffusion

同时生成视频和对应音频,一致性顶尖,但计算量极大,ComfyUI 无直接支持

需查看具体许可

✅ 支持(文本条件)

Sora(闭源)

原生生成带声音视频

Sora

OpenAI 闭源,音视频一致性顶尖,但仅 API/网页访问

❌ 不可本地商用

✅ 顶尖支持

Veo(闭源)

Google 视频生成,含音频

Veo 2

Google 闭源产品,音视频同步优秀

❌ 不可本地商用

✅ 支持

5.4、音频到音频(Audio-to-Audio, ATA)

5.4.1 音频增强/修复

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

Audio Super-Resolution

低清→高清音频,提升采样率

AudioSR、NU-Wave

提升采样率(8kHz→48kHz),修复音质,但 ComfyUI 集成弱,多独立工具

✅ 可商用

❌ 不支持

EnCodec

神经音频编解码,音频 token 化基石

EnCodec 24kHz、EnCodec 48kHz

Meta 开源,AudioCraft 套件核心,几乎所有音频生成的基础,ComfyUI 间接使用

✅ 可商用

❌ 不支持

SoundStream

Google 神经编解码器

SoundStream

Google 版 EnCodec,功能类似,生态不如 EnCodec 开放

需查看具体许可

❌ 不支持

VoiceFixer

修复录音噪声、混响、削波

VoiceFixer

开源语音修复标杆,效果优秀,ComfyUI 有社区节点,播客后期常用

✅ 可商用

❌ 不支持

Adobe Podcast(闭源)

一键语音增强、去噪

Adobe Podcast Enhance

闭源云端服务,效果顶尖,一键操作

❌ 不可本地商用(付费订阅)

❌ 不支持

5.4.2 声音转换/克隆

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

RVC

实时声音克隆/转换,VITS+检索

RVC 1006、RVC 1006Nvidia

开源声音转换首选,实时推理,音色克隆自然,ComfyUI 节点较成熟,虚拟主播/配音生态极丰富

✅ 可商用(需遵守肖像权)

❌ 不支持,音频驱动

So-VITS-SVC

歌声音色转换,VITS  singing

So-VITS-SVC 4.0、So-VITS-SVC 4.1

AI 翻唱/虚拟歌手生态最丰富,社区模型海量,但训练门槛高于 RVC,ComfyUI 支持一般

✅ 可商用(需遵守版权)

❌ 不支持

DDSP + Diff-SVC

结合传统信号处理与扩散模型

DDSP、Diff-SVC

歌声合成研究向,DDSP 轻量快速,Diff-SVC 质量高,但生态被 So-VITS 超越

✅ 可商用

❌ 不支持

Bark

文本到语音生成,含音色克隆

Bark、Bark Voice Clone

Suno 开源 TTS,支持多语言和情感,但语音克隆质量一般,被更专业方案替代

✅ 可商用

✅ 支持,文本驱动语音

XTTS

高质量文本到语音, few-shot 克隆

XTTS v1、XTTS v2

Coqui 开源,克隆质量顶尖,只需 6 秒样本,多语言支持好

✅ 可商用

✅ 优秀支持,文本+参考音频驱动

5.4.3 音源分离

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

Demucs

人声/鼓/贝斯/其他分离,U-Net

Demucs v3、Demucs v4、Demucs Hybrid

开源音源分离 SOTA,效果顶尖,ComfyUI 有社区节点,伴奏提取首选

✅ 可商用(MIT)

❌ 不支持

Spleeter

2/4/5 轨快速分离,Deezer 开源

Spleeter 2stems、Spleeter 4stems、Spleeter 5stems

老牌分离工具,速度快,但精度被 Demucs 超越,ComfyUI 支持一般

✅ 可商用(MIT)

❌ 不支持

Open-Unmix

灵活可训练分离模型

Open-Unmix、UMX-L

模块化设计,适合研究和定制,实用不如 Demucs

✅ 可商用

❌ 不支持

5.4.4 音频转录/分析

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

Basic Pitch

轻量音频转 MIDI

Basic Pitch

Spotify 开源,音高检测快准,音频转谱首选,ComfyUI 集成弱

✅ 可商用

❌ 不支持

Magenta Onsets and Frames

音频转录,Google 开源

Onsets and Frames

转录精度高,但模型较老,被 Basic Pitch 等替代

✅ 可商用

❌ 不支持

Whisper

语音识别/转录,OpenAI 开源

Whisper Tiny、Whisper Base、Whisper Small、Whisper Medium、Whisper Large-v3

语音识别 SOTA,多语言支持顶尖,ComfyUI 有节点,字幕/歌词提取必备

✅ 可商用(MIT)

✅ 支持,语音转文本

5.4.5 音频效果/处理

系列

侧重点

代表模型

现状

是否可商用

是否支持自然语言

Neural DSP

吉他效果器模拟

Neural DSP Archetype、ToneX

商业产品,模拟音箱/效果器音色极逼真,专业音乐制作标配

❌ 不可本地商用(付费软件)

❌ 不支持

Audio Inpainting

音频修复/补全,扩散模型

Audio Inpainting、Music InpaintNet

修复音频缺失片段,去除杂音,研究性质强,实用工具少

需查看具体许可

❌ 不支持

5.5  ComfyUI 音频生态辅助工具/节点

节点包/工具

功能

说明

ComfyUI-AudioLDM

AudioLDM 文生音效节点

社区节点,文生音频基础功能

ComfyUI-MusicGen

MusicGen 文生音乐节点

社区节点,音乐生成

ComfyUI-RVC

RVC 声音转换节点

较成熟,虚拟主播工作流常用

ComfyUI-Demucs

Demucs 音源分离节点

伴奏提取、分轨处理

ComfyUI-VoiceFixer

VoiceFixer 语音修复节点

播客后期、语音增强

ComfyUI-Whisper

Whisper 语音识别节点

字幕提取、歌词识别

ComfyUI-AudioScheduler

音频驱动动画

用音频节奏驱动画面变化(如频谱可视化)

ComfyUI-VideoHelperSuite

音视频合成

最终音视频对齐输出

5.6  音频模型完整工作流示例

5.6.1 完整音乐视频创作链

步骤

模型/工具

输入

输出

文生音乐

MusicGen

“史诗管弦乐,战斗场景,紧张激烈,120BPM”

背景音乐.wav

视频生成

Wan 2.1 / CogVideoX

“战士在战场冲锋,电影感,火焰与烟雾”

视频.mp4

音源分离(如需)

Demucs

背景音乐.wav

鼓/贝斯/其他分轨

语音合成(如需旁白)

XTTS

文本 + 参考音色

旁白语音.wav

语音增强

VoiceFixer

旁白语音.wav

清晰旁白.wav

字幕提取

Whisper

旁白语音.wav

字幕.srt

音视频合成

VideoHelperSuite

视频 + 音频 + 字幕

最终成片.mp4

5.6.2 AI 翻唱工作流

步骤

模型/工具

说明

原曲分离

Demucs

提取原唱人声 + 伴奏

歌声转换

So-VITS-SVC / RVC

将原唱音色转为目标歌手音色

后期混音

传统 DAW

转换后的人声 + 伴奏混音

5.6.3 虚拟主播语音工作流

步骤

模型/工具

说明

文本输入

直播脚本/弹幕回复

TTS 语音

XTTS / Bark

文本转语音,可用参考音色

实时音色转换

RVC

进一步转换为虚拟角色音色

对口型视频

Wav2Lip / LivePortrait

语音驱动虚拟形象口型

一句话总结

ComfyUI 的音频生态正处于"从可用到好用"的过渡期——文生音频有 MusicGen/Stable Audio 打开创作大门,音频到音频有 RVC/Demucs/VoiceFixer 实现专业级处理,但图生音频和视频生音频仍相对薄弱,多需外部工具配合。随着多模态大模型和节点包的持续迭代,ComfyUI 有望成为首个真正整合"视听一体"创作流程的开源平台。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐