AI 做的 demo,為什麼專業耳朵一聽就抓到「假假的」?不是玄學,是四個具體、聽得出來的破綻——不是每一首都會全部踩到,但只要踩中一個,錄音室裡受過訓練的耳朵就會心裡咯噔一下。這四個破綻背後都有明確的聲學原理,不是印象流的批評。
破綻一:人聲整段不換氣
真人唱長句子時,身體會誠實地告訴你極限在哪——句子唱到一半,會有一個很輕、很快的偷換氣,這是生理限制,躲不掉。AI 生成的人聲常常整段唱完都不喘,因為它沒有肺活量這回事,模型只負責把音符和歌詞對上,不會替自己安排呼吸。判斷方法很簡單:把副歌放到 0.75 倍速慢速聽,真人版本一定聽得到換氣的縫隙;如果整段完全平順、沒有任何停頓感,那大概率是機器唱的。
破綻二:主歌到副歌的動態被壓成一條線
好的混音,主歌到副歌之間會有一個「打開」的瞬間——音量、能量感忽然撐大,這個對比是歌曲情緒堆疊的關鍵。專業母帶的動態範圍通常落在 6 到 10 分貝之間;AI 生成的混音經常把整首歌壓進 3 到 5 分貝這種很窄的動態區間,聽起來每一小節都差不多響,副歌並沒有比主歌「大聲」多少。這不是音量夠不夠大的問題,是「對比夠不夠」的問題——AI 目前還不太會處理這種情緒起伏該留在哪裡。
破綻三:句尾的收音有破綻
聽每一句歌詞的最後一個字怎麼收尾,是老製作人的習慣動作。真人唱歌的尾音會自然地收、常常帶一點點抖音,那是聲帶放鬆的生理反應。AI 生成的人聲在尾音處經常出現不自然的痕跡——要嘛整個音被硬生生切斷,要嘛用一層厚厚的殘響蓋過去,掩蓋收尾銜接不上的問題。這個破綻最容易被一般聽眾忽略,但對做過現場配唱的耳朵來說,是最快抓到的一個。
破綻四:鼓點準到像節拍器,沒有呼吸感
真鼓手不會把每一拍都打在絕對精準的格線上——尤其是 backbeat(也就是 2、4 拍的小鼓),有經驗的鼓手習慣稍微「拖」一點點,這種微小的延遲叫做人類的微時差(micro-timing),通常落在 5 到 30 毫秒之間。這幾毫秒的「不準」,反而是聽起來「有人味」的關鍵。AI 生成的鼓軌經常完全卡在數學格線上,零偏移、零拖拍,理論上很「精準」,但聽起來反而生硬、沒有律動的呼吸感。
這代表什麼
這四個破綻,沒有一個是「AI 做不到」的技術極限——換氣、動態、收音、微時差,每一項都有明確的後製方法可以修正,只是這些修正需要一雙聽過大量真實錄音、知道「人味」聽起來該是什麼樣子的耳朵去做判斷。這正是我們常說的:AI 能有效率地把一首歌做到 60 分的骨架,但最後決定這首歌聽起來像不像「有人在乎地做出來」的那 40 分,還是得靠人耳去補。
下次你在聽自己或別人的 AI demo 時,不妨照這四個破綻一項一項檢查——你會發現,抓破綻其實比想像中容易,只是沒人告訴過你要聽哪裡。