§ 指南 · 音频转MIDI

无需键盘即可将音频转换为MIDI

更新于2026年7月

MIDI键盘向DAW(数字音频工作站)发送的是音符的开和关信号。而录音则是一个连续的信号,其中完全没有音符的界限。弥合这种差距——即不检测音高——才是难点所在。

演奏你已经会演奏的乐器。

那些想在不使用键盘的情况下将音频转换为MIDI人通常并不缺少硬件。这个想法可能源于吉他,也可能是在公交车站对着电话哼唱,或者是在喇叭声中产生的——如果用键盘重新输入,就意味着要弹奏两次,而且每次都会出错。

所以路由方式很重要。音频会根据演奏乐器的不同,通过不同的模型传输到音符:钢琴使用专用的复音模型,独奏管乐器、铜管乐器、弦乐器和贝斯使用基于音域的音高跟踪模型,吉他和合奏乐器则使用通用的复音模型。你可以指定乐器名称,也可以让系统根据音频推断乐器。

单声部演唱和拨弦和弦是不同的问题,针对其中一种进行调校的追踪器对另一种则表现不佳。告知追踪器你交出了哪一种声音是目前最廉价的精确度。

时机是决定成败的关键。

音符只是容易的部分。真正毁掉乐谱的是节拍:第一小节从哪里开始,这个音符是附点八分音符还是三连音,乐句是从节拍开始还是提前一个节拍开始。

因此,首先检测速度、重拍和节拍,然后将音符拟合到该网格中——而不是先输入音符,然后再根据音符猜测网格。

网格也可以移动。如果你在最后一个和弦上用力,节奏图也会随之移动。自由节奏会被保留,而不是被压缩到节拍器上,这对于手弹的乐曲比编程编曲要重要得多。

如果是完全混合的,先将其分开。

让转录员对着一个完成的混音文件,却期望得到某个乐器的干净音轨,这是最常见的做法,结果往往是得到一团乱麻。贝斯、底鼓和钢琴左手都处于相同的两个八度音程内。

对于完整的混音,顺序是:先将音轨分离成stems ——人声、鼓、贝斯、吉他、键盘——然后分别对每个声部进行转录。这一步是整个流程中提升准确性的关键,比对转录器本身进行任何调整都更加重要。

返回的结果

多轨MIDI编曲,每个声部一个轨道,外加一个和弦轨道(和弦在同一遍中检测)以及演奏的速度映射。

它是可编辑的,而这正是关键所在。在MIDI音轨中修正一个错误的音符;乐谱会根据相同的修改重新刻录,你导出的MIDI文件就是你修正后的内容,而不是模型最初猜测的内容。

导出格式可以是每个声部的MIDI ,也可以是包含stems (已命名)、每个声部MIDI 、速度映射和和弦指南的Logic或Ableton工程文件。通常这才是你最初想要的——将你的音乐想法保存在 DAW 中,而不是保存在桌面上的文件。

它难以应对的地方

没有哪份真实录音的转录是完美的。混音浓重、失真严重、混响过重都会增加转录难度:失真会增加听起来像音符的谐波,而混响会使音符的结尾模糊不清,导致偏移延迟。

如果你对音源有选择权,那就录制干声、近距离、单独录制。在安静的房间里用手机录制的单一乐器音色,比音量大、混音过强、声音浑浊的参考音色效果更好。

无需触碰键盘即可获取MIDI

上传一段录音——人声、吉他、贝斯、管乐或完整的混音——即可获得MIDI 、和弦和乐谱。无需安装,直接在浏览器中运行。注册账号即可每日免费使用。

打开转录器 →

常问问题

我需要MIDI键盘才能制作MIDI吗?

不MIDI是音符数据;它并不关心这些音符是来自键盘还是从录音中检测到的。无论是唱一句歌词、弹吉他,还是上传一段现有的音轨,音符都会以可编辑的MIDI编排形式返回。

我可以哼唱一段旋律并获得MIDI吗?

是的。哼唱的旋律是单音素材,由音域控制的音高追踪来处理。在安静的房间里演唱,保持音符的稳定而不是滑音,音符之间的界限就会清晰得多。

它适用于整首歌曲,还是仅适用于单个乐器?

两者都是,但方法不同。完整的混音首先会被拆分成stems ——人声、鼓、贝斯、吉他、键盘——然后每个音轨单独进行转录,这是提高准确性的关键。而独奏录音则直接进行转录。

MIDI信号会被量化到节拍器吗?

只有在演奏符合要求的情况下才会如此。系统首先检测速度、重拍和节拍,并允许速度图移动,因此,慢速过渡到节奏的录音会保持在你演奏的位置,而不是被固定到网格上。

它的准确度如何?

任何对真实录音的转录都不可能完美无缺。混音密集、失真严重、混响过重的情况尤其棘手。最终生成的文件是可编辑的MIDI文件,方便您修正错误,乐谱和导出的MIDI都会同步更新您的编辑。

有关的