多模態大型語言模型
語音轉文字(speech-to-text)
語音轉文字(speech-to-text),即轉錄,是最成熟的音訊任務:把說出的話變成寫下的字。它撐起字幕、口述輸入、語音助理與會議記錄。單純的轉錄存在多年,但經過大型語言模型後多了理解:模型能合理標點、標出說話者、邊轉錄邊翻譯,並回答說了什麼的問題,而不只是丟出一大片文字。
音訊編碼器把語音轉成特徵向量,語言模型再把它們解碼成文字,一個詞一個詞地預測,和它寫作時一模一樣。因為模型帶著世界知識與文法,它能靠上下文分辨同音字(例如英文的 their 與 there)、還原專有名詞、保持格式乾淨,這些是純聲學模型所缺的優勢。同一套架構也能處理多種語言,以及一句話中途換語言。
遇上雜訊、口音、行話與交談重疊時,準確率會崩,而且模型可能在靜默或不清楚的音訊裡幻聽出流暢的文字——憑空捏造從沒說過、卻看似合理的字,這比誠實地留白更危險。
又稱
另見