在 AI 音频源分离领域,MDX23C 架构凭借双流网络设计,兼顾时频域特征,在流行音乐人声、乐器拆解任务中拥有很高的人气,是 UVR5 软件生态中核心模型基座。社区开发者基于 MDX23C 衍生出多款专用微调模型,其中MDX23C‑InstVoc HQ、MDX23C‑DrumSep 6stem、MDX23C‑Phantom Centre extraction三款应用最为广泛,分别面向人声伴奏分离、鼓组精细化拆解、幻象中置信号提取三大场景。本文将对三款模型的开发背景、能力边界、优缺点以及实际使用场景做完整介绍。
MDX23C‑InstVoc HQ|高质量人声与伴奏二分模型
开发作者:aufr33 & jarredou
输出轨道:vocals(人声)、instrumental(伴奏)
MDX23C‑InstVoc HQ 是 MDX23C 体系下面向人声 / 伴奏二分类的HQ 高画质微调版本,也是流行歌曲提取干人声、制作伴奏最常被优先推荐的模型。该模型在大量流行、摇滚、华语歌曲数据集完成微调,在复杂编曲、多层配器的歌曲中,可以很好区分演唱人声与背景乐器,对高频细节保留优秀,伴奏残留控制优秀。
优势:
- 人声与伴奏分离均衡,不会过度阉割伴奏高频,也不容易把乐器杂音大量漏进人声轨;
- 对带混响、和声的商业录音适应性强,输出音频失真、削波风险较低;
- 综合 SDR 指标在同架构二分离模型中处于上游水平,适合直接产出可用半成品。
局限:
- 遇到人声和乐器频谱高度重叠片段,依旧会存在少量伴奏泄露;
- 无法把鼓、贝斯、吉他做单独拆分,只做 “人声” 和 “全部伴奏” 两大轨输出;
- 处理时长相对较长,需要合理设置 overlap 参数进一步优化残留。
适用场景:翻唱素材提取人声、制作卡拉 OK 伴奏、耳扒伴奏素材、音频预处理。
MDX23C‑DrumSep 6stem|六通道鼓组细分分离模型
开发作者:aufr33 & jarredou
输出轨道:Kick 底鼓、Snare 军鼓、Toms 通鼓、Hi‑hats 踩镲、Cymbals 镲片、Other_drums 鼓组残响 / 剩余鼓噪音
和普通全曲源分离模型不同,DrumSep 6stem 并不处理人声、贝斯、吉他,它的目标是专门把歌曲内部整套鼓组拆解为六个独立分轨。普通 4‑stem 模型仅输出一整条 Drums 鼓轨,而该模型进一步把鼓件拆开,适合编曲、混音、鼓采样二次创作。
模型原理是基于 MDX23C 架构专门针对打击乐做训练,专注识别鼓类瞬态信号,把底鼓、军鼓、镲片等不同打击音色互相剥离开,最后一条 Other_drums 收纳不属于前五类的鼓残响与噪音成分。
优势:
- 实现鼓组部件级拆分,得到可单独编辑的分轨鼓音频;
- 对流行、摇滚、电子音乐鼓组识别效果稳定;
- 输出分轨可以直接导入 DAW(Studio One、Reaper 等)做二次混音。
局限:
- 不会分离人声、贝斯、键盘、吉他等其他乐器,其余音乐会全部被丢弃;
- 原声鼓录音中乐器串音无法完全消除;
- 计算量大,处理单首歌曲耗时显著高于普通二分离模型。
适用场景:鼓组采样提取、音乐编曲参考、鼓声部降噪修复、音乐分析研究。
MDX23C‑Phantom Centre extraction|幻象中置提取模型
开发作者:wesleyr36
输出轨道:centre(中置信号)、side(侧边立体声信号)
Phantom Centre extraction 结合 MDX23C 网络与经典幻象中置算法。立体声音乐中,人声、底鼓、贝斯绝大多数会被摆放在声场正中央;而和声、电吉他、镲片、环境混响多分布在左右两侧。该模型提取左右声道高度一致的中置内容,剩下左右差异部分归入 side 轨道。
需要区分:它不等同于传统 AI 人声分离,本质是中置 / 侧边信号筛选,不是专门以 “识别人声” 为目标训练的模型。
优势:
- 处理速度快,适合大批量音频快速预处理;
- 可以快速剥离大部分立体声伴奏,保留居中的人声、贝斯、底鼓;
- 可作为前置工序,搭配其它分离模型组合使用,减少后期处理压力。
局限:
- 分离质量弱于 MDX23C‑InstVoc HQ;如果人声存在立体声和声,人声会大量跑到 side 轨道丢失;
- 中置的贝斯、底鼓会和人声混在 centre 轨道,无法自动区分人声与居中乐器;
- 不能直接作为成品人声,多用于预处理,很少直接输出最终作品。
适用场景:音频快速筛选、多模型处理前置预处理、声场结构分析、快速粗提取人声素材。
三款模型选型与组合使用建议
| 模型名称 | 分离目标 | 轨道数 | 适合定位 |
|---|---|---|---|
| MDX23C‑InstVoc HQ | 人声 / 完整伴奏 | 2 | 主力成品分离,优先首选 |
| MDX23C‑DrumSep 6stem | 鼓组件件细分 | 6 | 鼓声部专项拆解 |
| MDX23C‑Phantom Centre extraction | 中置 / 侧边声场 | 2 | 快速预处理、辅助工序 |
实操经验:
- 日常提取人声伴奏,优先选择 MDX23C‑InstVoc HQ,合理调大 overlap 参数,降低频谱泄露;
- 需要拆解鼓分轨:先用普通模型把鼓声部提取出来,再送入 DrumSep 6stem 进一步拆分;
- Phantom Centre extraction 建议作为前置过滤,不要直接当作最终输出,后续再使用 InstVoc HQ 做二次精细分离,提升干净度。
写在最后
MDX23C 系列社区模型为音频爱好者、编曲人提供了强大本地音频处理能力,但所有 AI 源分离都存在固有局限,无法做到 100% 理想完全剥离,重叠频谱处总会存在少量泄露。根据音频素材类型,选对合适模型,配合参数调整、多模型组合,才可以拿到更理想的分离结果。


评论(0)