Comfyui 教程-18
5. 音频模型相关介绍
以下是 ComfyUI 生态中音频相关模型的完整分类,按要求的格式重新整理:
5.1 文生音频(Text-to-Audio, TTA)
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
AudioLDM |
文生音效、环境声,Latent Diffusion 架构 |
AudioLDM-S、AudioLDM-L、AudioLDM 2 |
早期开源标杆,文本理解准确,音效丰富,AudioLDM 2 扩展至音乐/语音/音效三模态,社区节点支持中等 |
✅ 可商用(MIT) |
✅ 支持,文本描述生成对应音效 |
|
Tango |
轻量高效文生音效,扩散模型 |
Tango |
推理速度快,适合实时预览,但生态较 AudioLDM 弱,社区跟进一般 |
✅ 可商用 |
✅ 支持 |
|
Make-An-Audio |
复杂语义理解,扩散模型 |
Make-An-Audio、Make-An-Audio 3D |
语义理解强,复杂描述效果好,3D 版支持空间音频,但社区资源有限 |
✅ 可商用 |
✅ 支持,复杂自然语言描述 |
|
Stable Audio |
高质量音乐/音效生成,Stability AI 官方 |
Stable Audio 1.0、Stable Audio 2.0 |
音乐质量高,生成时长可达 3 分钟,商用友好,但 ComfyUI 集成一般,多通过 API 使用 |
✅ 可商用(官方协议) |
✅ 优秀支持,支持风格/乐器/情绪描述 |
|
MusicGen |
旋律连贯音乐生成,Meta 开源 |
MusicGen Small、MusicGen Medium、MusicGen Large、MusicGen Melody |
当前开源文生音乐首选,旋律连贯性顶尖,Melody 版支持参考旋律条件,生态丰富,ComfyUI 节点较成熟 |
✅ 可商用(MIT) |
✅ 优秀支持,支持风格+乐器+节奏描述 |
|
AudioCraft(Meta 套件) |
综合音频生成,含 MusicGen + AudioGen + EnCodec |
AudioCraft |
Meta 官方统一套件,生态整合好,但 ComfyUI 直接支持有限,多需外部调用 |
✅ 可商用 |
✅ 支持 |
|
Riffusion |
频谱图生成音乐,Stable Diffusion 变种 |
Riffusion |
将音频转为频谱图用 SD 生成,创意独特但音乐质量一般,连贯性差,更多用于实验 |
✅ 可商用 |
⚠️ 有限支持,需特定格式描述 |
|
Suno(闭源) |
完整歌曲生成,含歌词+演唱 |
Suno v3、Suno v4 |
当前文生音乐天花板,支持完整歌曲结构(主歌/副歌/桥段),但闭源仅 API/网页 |
❌ 不可本地商用(平台付费订阅) |
✅ 顶尖支持,支持歌词+风格+情绪完整描述 |
|
Udio(闭源) |
高质量音乐生成,细节丰富 |
Udio |
与 Suno 竞争,音乐细节和乐器分离度优秀,同样闭源 |
❌ 不可本地商用(平台付费订阅) |
✅ 顶尖支持 |
5.2 图生音频(Image-to-Audio, ITA)
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
Im2Wav |
图像内容推断对应环境音效,视觉-听觉关联 |
Im2Wav |
学术项目,从图像生成匹配的环境声,但开源程度一般,ComfyUI 支持极弱 |
需查看具体许可 |
❌ 不支持,纯图像驱动 |
|
Spectral-GAN |
图像特征驱动频谱生成 |
Spectral-GAN |
早期实验性工作,质量一般,生态几乎无,未进入实用阶段 |
需查看具体许可 |
❌ 不支持 |
|
CLAP-TTA |
CLAP 跨模态嵌入驱动音频生成 |
CLAP-TTA |
利用 CLAP 统一表示空间,图像和音频语义对齐,但实用性有限 |
✅ 可商用(如基于开源 CLAP) |
❌ 不支持,图像驱动 |
|
Make-An-Audio 3D |
结合深度图生成 3D 空间音频 |
Make-An-Audio 3D |
扩展版支持深度条件,生成空间化音效,VR/AR 方向有潜力,但生态不成熟 |
✅ 可商用 |
❌ 不支持,图像+深度驱动 |
|
Video-to-Audio 简化版(单帧) |
取视频首帧或关键帧生成对应音频 |
Im2Wav 扩展、FoleyCrafter 单帧版 |
图生音频的过渡形态,实际多归入视频生音频范畴,独立工具少 |
视具体工具 |
❌ 不支持 |
5.3 视频生音频(Video-to-Audio, VTA)
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
FoleyCrafter |
视频画面生成匹配拟音(脚步声、碰撞声等) |
FoleyCrafter |
2024 开源爆款,拟音质量顶尖,时序对齐好,ComfyUI 有实验性节点,影视后期潜力巨大 |
✅ 可商用 |
⚠️ 有限支持,主要视频驱动,可配合文本微调 |
|
DiffFoley |
扩散模型生成高质量拟音 |
DiffFoley |
扩散架构,拟音质量高,同步性强,但计算量大速度慢,ComfyUI 支持弱 |
需查看具体许可 |
⚠️ 有限支持 |
|
RegNet + SpecVQGAN |
视觉编码驱动音频 token 生成 |
RegNet-SpecVQGAN |
视频内容驱动音频量化生成,生态较老,被 FoleyCrafter 超越 |
需查看具体许可 |
❌ 不支持,纯视频驱动 |
|
VATT |
大规模视频-音频-文本联合预训练 |
VATT |
Google 研究项目,跨模态能力强,但开源程度低,实用性有限 |
需查看具体许可 |
✅ 支持(三模态联合) |
|
Specter |
端到端视频到音频,同步性优秀 |
Specter |
视觉-音频同步生成,时序对齐好,但社区生态弱 |
需查看具体许可 |
❌ 不支持 |
|
MM-Diffusion |
音视频联合生成,一致性最强 |
MM-Diffusion |
同时生成视频和对应音频,一致性顶尖,但计算量极大,ComfyUI 无直接支持 |
需查看具体许可 |
✅ 支持(文本条件) |
|
Sora(闭源) |
原生生成带声音视频 |
Sora |
OpenAI 闭源,音视频一致性顶尖,但仅 API/网页访问 |
❌ 不可本地商用 |
✅ 顶尖支持 |
|
Veo(闭源) |
Google 视频生成,含音频 |
Veo 2 |
Google 闭源产品,音视频同步优秀 |
❌ 不可本地商用 |
✅ 支持 |
5.4、音频到音频(Audio-to-Audio, ATA)
5.4.1 音频增强/修复
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
Audio Super-Resolution |
低清→高清音频,提升采样率 |
AudioSR、NU-Wave |
提升采样率(8kHz→48kHz),修复音质,但 ComfyUI 集成弱,多独立工具 |
✅ 可商用 |
❌ 不支持 |
|
EnCodec |
神经音频编解码,音频 token 化基石 |
EnCodec 24kHz、EnCodec 48kHz |
Meta 开源,AudioCraft 套件核心,几乎所有音频生成的基础,ComfyUI 间接使用 |
✅ 可商用 |
❌ 不支持 |
|
SoundStream |
Google 神经编解码器 |
SoundStream |
Google 版 EnCodec,功能类似,生态不如 EnCodec 开放 |
需查看具体许可 |
❌ 不支持 |
|
VoiceFixer |
修复录音噪声、混响、削波 |
VoiceFixer |
开源语音修复标杆,效果优秀,ComfyUI 有社区节点,播客后期常用 |
✅ 可商用 |
❌ 不支持 |
|
Adobe Podcast(闭源) |
一键语音增强、去噪 |
Adobe Podcast Enhance |
闭源云端服务,效果顶尖,一键操作 |
❌ 不可本地商用(付费订阅) |
❌ 不支持 |
5.4.2 声音转换/克隆
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
RVC |
实时声音克隆/转换,VITS+检索 |
RVC 1006、RVC 1006Nvidia |
开源声音转换首选,实时推理,音色克隆自然,ComfyUI 节点较成熟,虚拟主播/配音生态极丰富 |
✅ 可商用(需遵守肖像权) |
❌ 不支持,音频驱动 |
|
So-VITS-SVC |
歌声音色转换,VITS singing |
So-VITS-SVC 4.0、So-VITS-SVC 4.1 |
AI 翻唱/虚拟歌手生态最丰富,社区模型海量,但训练门槛高于 RVC,ComfyUI 支持一般 |
✅ 可商用(需遵守版权) |
❌ 不支持 |
|
DDSP + Diff-SVC |
结合传统信号处理与扩散模型 |
DDSP、Diff-SVC |
歌声合成研究向,DDSP 轻量快速,Diff-SVC 质量高,但生态被 So-VITS 超越 |
✅ 可商用 |
❌ 不支持 |
|
Bark |
文本到语音生成,含音色克隆 |
Bark、Bark Voice Clone |
Suno 开源 TTS,支持多语言和情感,但语音克隆质量一般,被更专业方案替代 |
✅ 可商用 |
✅ 支持,文本驱动语音 |
|
XTTS |
高质量文本到语音, few-shot 克隆 |
XTTS v1、XTTS v2 |
Coqui 开源,克隆质量顶尖,只需 6 秒样本,多语言支持好 |
✅ 可商用 |
✅ 优秀支持,文本+参考音频驱动 |
5.4.3 音源分离
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
Demucs |
人声/鼓/贝斯/其他分离,U-Net |
Demucs v3、Demucs v4、Demucs Hybrid |
开源音源分离 SOTA,效果顶尖,ComfyUI 有社区节点,伴奏提取首选 |
✅ 可商用(MIT) |
❌ 不支持 |
|
Spleeter |
2/4/5 轨快速分离,Deezer 开源 |
Spleeter 2stems、Spleeter 4stems、Spleeter 5stems |
老牌分离工具,速度快,但精度被 Demucs 超越,ComfyUI 支持一般 |
✅ 可商用(MIT) |
❌ 不支持 |
|
Open-Unmix |
灵活可训练分离模型 |
Open-Unmix、UMX-L |
模块化设计,适合研究和定制,实用不如 Demucs |
✅ 可商用 |
❌ 不支持 |
5.4.4 音频转录/分析
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
Basic Pitch |
轻量音频转 MIDI |
Basic Pitch |
Spotify 开源,音高检测快准,音频转谱首选,ComfyUI 集成弱 |
✅ 可商用 |
❌ 不支持 |
|
Magenta Onsets and Frames |
音频转录,Google 开源 |
Onsets and Frames |
转录精度高,但模型较老,被 Basic Pitch 等替代 |
✅ 可商用 |
❌ 不支持 |
|
Whisper |
语音识别/转录,OpenAI 开源 |
Whisper Tiny、Whisper Base、Whisper Small、Whisper Medium、Whisper Large-v3 |
语音识别 SOTA,多语言支持顶尖,ComfyUI 有节点,字幕/歌词提取必备 |
✅ 可商用(MIT) |
✅ 支持,语音转文本 |
5.4.5 音频效果/处理
|
系列 |
侧重点 |
代表模型 |
现状 |
是否可商用 |
是否支持自然语言 |
|
Neural DSP |
吉他效果器模拟 |
Neural DSP Archetype、ToneX |
商业产品,模拟音箱/效果器音色极逼真,专业音乐制作标配 |
❌ 不可本地商用(付费软件) |
❌ 不支持 |
|
Audio Inpainting |
音频修复/补全,扩散模型 |
Audio Inpainting、Music InpaintNet |
修复音频缺失片段,去除杂音,研究性质强,实用工具少 |
需查看具体许可 |
❌ 不支持 |
5.5 ComfyUI 音频生态辅助工具/节点
|
节点包/工具 |
功能 |
说明 |
|
ComfyUI-AudioLDM |
AudioLDM 文生音效节点 |
社区节点,文生音频基础功能 |
|
ComfyUI-MusicGen |
MusicGen 文生音乐节点 |
社区节点,音乐生成 |
|
ComfyUI-RVC |
RVC 声音转换节点 |
较成熟,虚拟主播工作流常用 |
|
ComfyUI-Demucs |
Demucs 音源分离节点 |
伴奏提取、分轨处理 |
|
ComfyUI-VoiceFixer |
VoiceFixer 语音修复节点 |
播客后期、语音增强 |
|
ComfyUI-Whisper |
Whisper 语音识别节点 |
字幕提取、歌词识别 |
|
ComfyUI-AudioScheduler |
音频驱动动画 |
用音频节奏驱动画面变化(如频谱可视化) |
|
ComfyUI-VideoHelperSuite |
音视频合成 |
最终音视频对齐输出 |
5.6 音频模型完整工作流示例
5.6.1 完整音乐视频创作链
|
步骤 |
模型/工具 |
输入 |
输出 |
|
文生音乐 |
MusicGen |
“史诗管弦乐,战斗场景,紧张激烈,120BPM” |
背景音乐.wav |
|
视频生成 |
Wan 2.1 / CogVideoX |
“战士在战场冲锋,电影感,火焰与烟雾” |
视频.mp4 |
|
音源分离(如需) |
Demucs |
背景音乐.wav |
鼓/贝斯/其他分轨 |
|
语音合成(如需旁白) |
XTTS |
文本 + 参考音色 |
旁白语音.wav |
|
语音增强 |
VoiceFixer |
旁白语音.wav |
清晰旁白.wav |
|
字幕提取 |
Whisper |
旁白语音.wav |
字幕.srt |
|
音视频合成 |
VideoHelperSuite |
视频 + 音频 + 字幕 |
最终成片.mp4 |
5.6.2 AI 翻唱工作流
|
步骤 |
模型/工具 |
说明 |
|
原曲分离 |
Demucs |
提取原唱人声 + 伴奏 |
|
歌声转换 |
So-VITS-SVC / RVC |
将原唱音色转为目标歌手音色 |
|
后期混音 |
传统 DAW |
转换后的人声 + 伴奏混音 |
5.6.3 虚拟主播语音工作流
|
步骤 |
模型/工具 |
说明 |
|
文本输入 |
— |
直播脚本/弹幕回复 |
|
TTS 语音 |
XTTS / Bark |
文本转语音,可用参考音色 |
|
实时音色转换 |
RVC |
进一步转换为虚拟角色音色 |
|
对口型视频 |
Wav2Lip / LivePortrait |
语音驱动虚拟形象口型 |
一句话总结
ComfyUI 的音频生态正处于"从可用到好用"的过渡期——文生音频有 MusicGen/Stable Audio 打开创作大门,音频到音频有 RVC/Demucs/VoiceFixer 实现专业级处理,但图生音频和视频生音频仍相对薄弱,多需外部工具配合。随着多模态大模型和节点包的持续迭代,ComfyUI 有望成为首个真正整合"视听一体"创作流程的开源平台。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)