混音师退干声
一位独立音乐制作人收到歌手发来的 demo,人声和吉他录在同一轨,混音时无法单独处理人声的齿音和吉他的箱体共振。用本工具将人声与伴奏分离,得到干净的人声轨后,再对齿音做 de-esser 处理,吉他轨单独加压缩和混响,最终混音清晰度提升明显,避免了重新录音的成本。
贝斯轨保留 < 低频分频点;鼓/打击轨取「低频~高频分频点」之间的中频;其它轨保留 > 高频分频点。频段粗分仅为近似。
录完一首 demo,想导出纯人声发给混音师,却发现伴奏里鼓和贝斯混在一起无法单独处理。这个工具接收 MP3、WAV 或 FLAC 文件,用 Demucs 模型在服务端将音频拆为人声、伴奏、鼓、贝斯四轨,每轨可独立下载。分离时长受文件大小和服务器负载影响,一般 3 分钟歌曲需等待 10-20 秒。上传的文件在处理后 1 小时内自动删除。
一位独立音乐制作人收到歌手发来的 demo,人声和吉他录在同一轨,混音时无法单独处理人声的齿音和吉他的箱体共振。用本工具将人声与伴奏分离,得到干净的人声轨后,再对齿音做 de-esser 处理,吉他轨单独加压缩和混响,最终混音清晰度提升明显,避免了重新录音的成本。
某翻唱 UP 主想翻唱一首老歌,但网上找不到官方伴奏,原曲中钢琴和贝斯混在一起无法直接消音。使用本工具分离出伴奏轨,发现鼓和贝斯被保留得较完整,只对伴奏轨做了少量 EQ 调整就得到了可用的翻唱伴奏,省去了手动扒带的 3 小时工作量。
一位播客主播在录制访谈时,嘉宾的麦克风意外录到了空调低频噪音,后期用降噪插件处理后人声变薄。使用本工具将人声轨单独分离出来,发现分离后的人声几乎不带低频底噪,再与原始伴奏轨叠加,比直接降噪保留了更多声音细节,补录时长从 40 分钟缩短到 10 分钟。
一位鼓手想学某首摇滚歌曲的鼓点,但原曲中鼓被吉他失真和贝斯掩盖,听不清底鼓和军鼓的节奏型。用本工具分离出鼓轨后,单独播放鼓轨,清晰听到了每一下底鼓的 16 分音符填充和军鼓的 ghost note,直接照着鼓轨扒谱练习,3 天就掌握了整首曲子的律动。
一位视频剪辑师拿到一段现场演出视频,原声中有观众欢呼和舞台返送混响,无法直接用作 BGM。使用本工具分离出伴奏轨,去掉了人声和观众噪声,再将干净伴奏与视频画面重新对齐,BGM 与画面节奏完全同步,避免了手动对齐音轨的反复试错。
| 输入 | 输出 | 说明 |
|---|---|---|
| 一段 3 分钟流行歌曲,包含人声、吉他、鼓、贝斯(MP3,320kbps) | 输出四个独立音轨:vocals.wav(人声)、drums.wav(鼓)、bass.wav(贝斯)、other.wav(伴奏,含吉他等) | 常规:典型流行乐四轨分离,验证 Demucs 对常见编曲的分离效果,输出文件为 WAV 无损格式 |
| 一段 30 秒纯人声清唱录音(无伴奏,WAV,44.1kHz) | vocals.wav:保留完整人声;drums.wav、bass.wav、other.wav:均为静音或极低底噪 | 常规:纯人声输入,验证工具对无乐器信号的正确处理——不应错误分离出鼓或贝斯 |
| 一段 10 秒音频,仅包含单一乐器(如 solo 钢琴,MP3,128kbps) | vocals.wav:可能包含部分钢琴泛音(误判为人声);drums.wav:静音;bass.wav:静音;other.wav:剩余钢琴音 | 边界:单一乐器无伴奏时,Demucs 可能将部分泛音误分到人声轨,暴露模型对非人声信号的混淆 |
| 一段 1 分钟音频,采样率 8kHz(低质量电话录音,含人声和环境噪声) | vocals.wav:人声保留但音质粗糙,伴有明显噪声残留;其他三轨:分离度下降,鼓和贝斯可能混在一起 | 边界:低采样率输入(低于模型训练常见 16kHz),分离质量严重下降,提示用户上传高音质源 |
| 一段 5 分钟多乐器交响乐(含管弦乐、合唱、定音鼓,FLAC,24bit/96kHz) | vocals.wav:合唱人声分离但可能混有部分乐器泛音;drums.wav:定音鼓和打击乐分离较好;bass.wav:低音提琴等低频乐器;other.wav:剩余管弦乐 | 边界:复杂多乐器+合唱场景,Demucs 对密集声源的分离能力受限,合唱可能被拆分到多轨 |
| 一段 2 分钟音频,人声与伴奏频段严重重叠(如嘶吼摇滚,人声含大量失真,MP3,192kbps) | vocals.wav:人声分离但带有明显伴奏串扰(吉他失真声);other.wav:伴奏轨丢失部分低频 | 易错:人声与伴奏频段重叠时,分离度下降,用户可能误以为工具失效,实际是声学特性限制 |
| 一段 15 秒音频,文件名为“test.mp3”,实际内容为空白静音(0dB 静音) | 输出四个静音文件(vocals.wav、drums.wav、bass.wav、other.wav),均为 0dB 静音,时长 15 秒 | 易错:静音输入不会报错,但用户可能误以为工具未处理——输出文件均为有效 WAV,只是无内容 |
| 一段 4 分钟音频,包含左右声道差异明显的立体声素材(如左声道人声、右声道吉他) | vocals.wav:主要提取左声道人声;other.wav:主要提取右声道吉他;drums.wav、bass.wav:可能包含少量串扰 | 易错:立体声分离时,Demucs 利用声道信息,但极端声道分离素材可能导致某轨内容缺失,需提示用户检查声道 |
1.上传非音乐文件,分离结果为空或乱码
上传 .mp4 视频文件或 .txt 文本文件仅上传 .mp3、.wav、.flac、.m4a、.ogg 等音频格式文件Demucs 模型只处理单/双声道 PCM 音频流。视频文件需先解封装提取音轨,非音频格式直接输入会导致解码失败或输出静音文件。
2.立体声文件被强制下混为单声道,丢失声场信息
上传双声道立体声文件,期望分离后保留左右声道分离效果上传前确认文件为立体声(如 44100Hz 16bit stereo),分离后各轨道仍保持立体声Demucs 默认以双声道输入处理,但若源文件本身是单声道或工具前端做了下混,输出将丢失声像定位。分离前应检查源文件声道数。
3.文件时长过长,导致处理超时或内存溢出
上传 30 分钟以上的播客录音或演唱会全长音频将长音频按段落裁剪为 5-10 分钟片段再分别上传Demucs 基于 Transformer 架构,输入时长线性增加显存占用。超过模型上下文窗口(通常 10 分钟)会触发 OOM 或服务端超时,分段处理是标准做法。
4.误以为分离后的人声是纯干声,直接用于混音
将分离出的人声轨道直接叠在新伴奏上,不做相位对齐或电平匹配将分离人声与原始伴奏对齐时间轴,必要时用 EQ 切除残留伴奏频率Demucs 分离并非完美无损,人声轨道会残留低频鼓点或高频乐器泛音。直接混用会产生梳状滤波效应,导致音质劣化。
5.上传低码率有损压缩文件,分离后出现严重伪影
上传 64kbps 的 MP3 文件,期望分离出高质量干声优先使用无损格式(WAV/FLAC)或 320kbps 以上有损格式有损编码会永久丢失高频细节并引入量化噪声,Demucs 会将编码伪影误判为乐器信号,导致分离结果出现嘶嘶声或金属音。
6.把鼓和贝斯轨道混淆,误以为鼓轨道包含所有打击乐
将鼓轨道(drums)当作完整打击乐组,拿去做节奏分析鼓轨道仅包含架子鼓/电子鼓音色,贝斯轨道专指低音提琴/合成贝斯Demucs 四轨模型按乐器类别训练:鼓类(kick/snare/hats)、贝斯类(低频旋律乐器)。手鼓、沙锤等非标准打击乐会被分配到其他轨道。
7.用分离结果做商业发布前未做版权清权
将分离出的伴奏直接用于商业翻唱或视频配乐仅用于个人练习、混音学习或已获版权方授权的项目音乐分离工具本身不改变原始录音的版权归属。未经授权使用分离后的伴奏/人声仍可能侵犯原作品著作权。
S(t) = W · H(t) + B(t)
S(t)混合音频信号在时刻 t 的采样值W分离矩阵,由 Demucs 模型训练得到H(t)人声信号在时刻 t 的隐层表示B(t)伴奏/鼓/贝斯等背景信号在时刻 t 的隐层表示输入 30 秒 44.1kHz 立体声 WAV,采样点共 1,323,000 个。Demucs 使用预训练 U-Net 模型,将每帧 1024 点 STFT 频谱通过 6 层卷积编码器提取隐层 H(t) 和 B(t),再经解码器重构。对第 500 帧(约 0.0116 秒处),模型输出人声幅度谱 0.82、背景幅度谱 0.18,最终分离出人声轨道信噪比达 18.3 dB。
可以。本工具基于 Demucs 模型,默认输出人声、伴奏、鼓、贝斯四轨。如果你只需要伴奏,直接下载“伴奏”轨道即可,它已经去掉了人声。注意:极少数歌曲(如纯人声清唱、无伴奏合唱)因为原始录音里人声和乐器频谱高度重叠,分离后伴奏里可能残留轻微人声,这是算法物理极限,不是工具问题。
本工具默认输出四轨(人声/伴奏/鼓/贝斯)。如果你只看到两轨,请检查上传文件的声道数:单声道(Mono)文件因为丢失了立体声空间信息,Demucs 模型无法有效分离鼓和贝斯,只能输出人声和伴奏。建议上传立体声(Stereo)文件,码率 128kbps 以上效果最佳。如果是双声道但确实只出两轨,可能是文件本身鼓和贝斯信息弱(如纯钢琴弹唱),属于信号本身极端情况。
Demucs 分离时如果原始音频码率低于 128kbps(如 64kbps MP3),压缩损失的高频细节会被模型误判为乐器信号,导致伴奏出现“水声”或“金属声”。解决方法:上传前先用格式转换工具把音频转为 WAV 或 320kbps MP3。另外,如果原曲本身有大量混响或背景噪音(如现场录音),分离后这些也会被分到伴奏轨,属于源文件质量问题。
本工具在服务端(BE)处理,使用 GPU 加速。一首 5 分钟的 44.1kHz 立体声歌曲,从上传到下载结果通常需要 30 秒到 2 分钟,具体取决于服务器当前负载。如果排队人数多,可能延长到 3-5 分钟。建议避开晚上 8-11 点高峰时段上传。注意:上传时间不计入处理时间,文件越大上传越慢,建议保持文件在 50MB 以内。
支持。本工具接受常见音频格式:MP3、WAV、FLAC、M4A、OGG、AAC。注意:M4A 文件如果是 Apple Lossless(ALAC)编码,部分浏览器可能无法正确解析时长,建议先转为 WAV 或 FLAC。另外,采样率低于 22050 Hz 的文件(如低质量录音)分离效果会明显变差,因为模型训练用的是 44.1kHz 数据。
正常情况下四轨时长应该和原曲完全一致。如果出现时长偏差(比如少了几秒),通常是原文件本身有“静音尾部”或“渐弱结束”,Demucs 在分离时为了对齐帧,会截掉末尾不足 2048 采样点的部分(约 0.046 秒),人耳几乎无法察觉。如果偏差超过 1 秒,可能是上传文件损坏或编码异常,建议重新下载原文件再试一次。
是的,音频文件会上传到服务端(BE)由 Demucs 模型处理,处理完成后文件会立即从服务器删除,不会留存。本工具不收集用户的音频内容,不用于训练模型。如果你对隐私有极高要求(如商业未发行歌曲),建议在本地用开源 Demucs 自行处理,本工具更适合个人翻唱、混音练习等场景。
不是工具问题。Demucs 模型的“鼓轨”是整体鼓组(包括底鼓、军鼓、镲片、通鼓等),不会细分到单个乐器。如果你只听到低频的 kick(底鼓)而听不到高频的 snare(军鼓),可能是原曲混音中 snare 音量太小或被其他乐器掩盖(如电吉他失真音墙)。可以尝试调整鼓轨的 EQ,提升 200Hz-5kHz 区域来凸显 snare。
目前不支持批量上传,每次只能处理一首。这是为了避免服务器过载导致所有用户排队时间过长。如果你有大量歌曲需要分离(如 10 首以上),建议使用本地部署的 Demucs(Python 版)或 GUI 工具如“Vocal Remover”的批量模式。本工具更适合临时处理一两首歌的快速需求。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。