Python技术迷

StemDeck:本地拆人声和鼓点,不注册、不上传,终于像个正常工具了

我一开始看到 StemDeck,第一反应不是“哇 AI 音频分离又来了”,而是:啧,终于有人把这事做成本地工具了。

拆人声、鼓、贝斯这种需求,其实一点不小众。做翻唱的想要伴奏,练鼓的想抠鼓轨,做视频的想把背景音乐和人声分开。麻烦的是,网上一搜,大半都把你往注册、额度、订阅里带。音频还得传上去。 有些歌你只是想自己练一下,结果先被一堆登录弹窗教育。

Image

StemDeck 抓人的点很直白:本地跑,不要账号,不上传,不订阅。丢一个 MP3、WAV、FLAC,或者贴 YouTube 链接,它能把音频拆成最多 6 条 stem:人声、鼓、贝斯、吉他、钢琴和其他。README 里写得也挺硬,主打就是“Free, local stem separation”。

老鬼看这种工具,一般不先看功能表,先看它有没有把后面那堆脏活藏好。因为音频 AI 工具最烦的不是“能不能分离”,而是分完之后你还得来回导入 DAW、对齐波形、调音量、A/B 对比,半小时就没了。

StemDeck 这里有个多轨混音器,能直接静音、solo、拉音量、缩放波形、圈一段循环听。这个不花哨,但很实用。尤其是你只想扒一段鼓 fill,或者听贝斯怎么贴着底鼓走,它比单纯导出几个 wav 文件舒服多了。

先别急着吹。

Image

它底层用的是 Demucs 的 htdemucs_6s,质量大概率够个人练习、拆参考、做草稿,但别把它当录音棚级万能刀。README 自己也说了,商业工具在速度、质量、移动端和更深的音乐人功能上还是有优势。这个态度我反而喜欢,没硬装。

还有个现实点:本地跑就看机器。NVIDIA 显卡、Apple Silicon 会舒服点,CPU 也能跑,但慢就别怪它。第一次启动还会下载运行时、FFmpeg 和 Demucs 模型,仓库里写模型大概 170MB;这类东西你以为双击就完事,结果网络、缓存、权限都可能出来凑热闹。

更毛边的是,最新 Release 还是 Alpha,macOS 还没做代码签名,说明里专门提了 Gatekeeper 的问题。Windows 有 zip 包,macOS 有 DMG,Release 里也已经出现 Linux 包。适合能接受一点开源工具粗糙感的人。

我会怎么用? 拿来拆练习素材、扒人声、抠鼓点、做简单 remix 草稿,挺香。真要商用交付、批量处理、追求特别干净的分离质量,那还是得谨慎。

Github地址:stemdeckapp/stemdeck