多模態與視覺語言
語音基礎模型
語音基礎模型是在海量音訊上預訓練的大型網路,使得在極少或完全沒有特定任務資料的情況下,便能轉錄、翻譯、辨識語言,並作為口語任務的通用前端。如同文字的基礎模型,重點在於:一個重度預訓練的骨幹能在數百種語言、數十種任務之間攤平成本,取代傳統語音流程中拼湊起來的客製化聲學模型與語言模型。
預訓練主要有兩種哲學。自監督模型(如 wav2vec 2.0 與 HuBERT)從無標註音訊中學習——遮蔽波形的片段、預測量化或聚類後的目標——建立豐富的表示,再用少量有標註資料微調以做辨識。弱監督模型(如 Whisper)則在數十萬小時、跨多語言、標註不完美的網路音訊上做序列到序列訓練,直接學會穩健的多語言轉錄與翻譯,無需微調步驟。兩者都產出編碼器,並越來越常充當多模態語言模型的音訊前端。
它們的長處是穩健與廣度,能跨口音、跨噪音、跨任何單一精選語料都涵蓋不到的語言運作,但在低資源語言上仍參差不齊、可能在靜默期間幻覺出流暢的轉錄,並繼承了網路規模音訊的偏誤。隨著語音辨識、翻譯與音訊語言建模逐漸匯流,同一個骨幹也越來越同時撐起這三者。
Whisper 的穩健來自規模與標註雜訊,而非架構:它只是個普通的編碼器-解碼器 transformer,卻訓練在遠比精選基準更雜亂、更廣的資料上。
又稱
另見