TakeOff Music Studio
← Blog 技巧存藏

AI Demo 一聽就露餡:製作人耳朵抓的 4 個破綻

人聲不換氣、動態壓成一條線、尾音被切斷、鼓點準到像節拍器——AI 生成音樂最容易被抓包的四個聲學破綻,每一個都有具體判斷方法,不是印象流的批評。

《AI Demo 一聽就露餡:製作人耳朵抓的 4 個破綻》文章封面圖

AI 做的 demo,為什麼專業耳朵一聽就抓到「假假的」?不是玄學,是四個具體、聽得出來的破綻——不是每一首都會全部踩到,但只要踩中一個,錄音室裡受過訓練的耳朵就會心裡咯噔一下。這四個破綻背後都有明確的聲學原理,不是印象流的批評。

破綻一:人聲整段不換氣

真人唱長句子時,身體會誠實地告訴你極限在哪——句子唱到一半,會有一個很輕、很快的偷換氣,這是生理限制,躲不掉。AI 生成的人聲常常整段唱完都不喘,因為它沒有肺活量這回事,模型只負責把音符和歌詞對上,不會替自己安排呼吸。判斷方法很簡單:把副歌放到 0.75 倍速慢速聽,真人版本一定聽得到換氣的縫隙;如果整段完全平順、沒有任何停頓感,那大概率是機器唱的。

破綻二:主歌到副歌的動態被壓成一條線

好的混音,主歌到副歌之間會有一個「打開」的瞬間——音量、能量感忽然撐大,這個對比是歌曲情緒堆疊的關鍵。專業母帶的動態範圍通常落在 6 到 10 分貝之間;AI 生成的混音經常把整首歌壓進 3 到 5 分貝這種很窄的動態區間,聽起來每一小節都差不多響,副歌並沒有比主歌「大聲」多少。這不是音量夠不夠大的問題,是「對比夠不夠」的問題——AI 目前還不太會處理這種情緒起伏該留在哪裡。

破綻三:句尾的收音有破綻

聽每一句歌詞的最後一個字怎麼收尾,是老製作人的習慣動作。真人唱歌的尾音會自然地收、常常帶一點點抖音,那是聲帶放鬆的生理反應。AI 生成的人聲在尾音處經常出現不自然的痕跡——要嘛整個音被硬生生切斷,要嘛用一層厚厚的殘響蓋過去,掩蓋收尾銜接不上的問題。這個破綻最容易被一般聽眾忽略,但對做過現場配唱的耳朵來說,是最快抓到的一個。

破綻四:鼓點準到像節拍器,沒有呼吸感

真鼓手不會把每一拍都打在絕對精準的格線上——尤其是 backbeat(也就是 2、4 拍的小鼓),有經驗的鼓手習慣稍微「拖」一點點,這種微小的延遲叫做人類的微時差(micro-timing),通常落在 5 到 30 毫秒之間。這幾毫秒的「不準」,反而是聽起來「有人味」的關鍵。AI 生成的鼓軌經常完全卡在數學格線上,零偏移、零拖拍,理論上很「精準」,但聽起來反而生硬、沒有律動的呼吸感。

這代表什麼

這四個破綻,沒有一個是「AI 做不到」的技術極限——換氣、動態、收音、微時差,每一項都有明確的後製方法可以修正,只是這些修正需要一雙聽過大量真實錄音、知道「人味」聽起來該是什麼樣子的耳朵去做判斷。這正是我們常說的:AI 能有效率地把一首歌做到 60 分的骨架,但最後決定這首歌聽起來像不像「有人在乎地做出來」的那 40 分,還是得靠人耳去補。

下次你在聽自己或別人的 AI demo 時,不妨照這四個破綻一項一項檢查——你會發現,抓破綻其實比想像中容易,只是沒人告訴過你要聽哪裡。

讀完了,回到你手上那首歌

文章講的是通則,你的歌是個案——先用《AI 音樂商用安全檢核表》逐項確認能不能安全商用, 有疑慮再來找我們。

繼續讀

回目錄看其他文章,或到 FAQ 找版權與委託最常被問的七題。