解碼與取樣
串流生成(streaming generation)
因為 LLM 一次只產生一個詞元,它不必等到整段答案完工才給你看任何東西。串流生成會在每個詞元一被解碼的當下就送上螢幕,這就是為什麼聊天機器人的回覆會一個字一個字打出來。模型本身毫無改變;改變的是遞送方式——內容被持續地推給你,而不是憋著、到最後一口氣整塊交出。
好處是感受得到而非量得出來:第一個詞元的等待時間(time-to-first-token)降到零點幾秒,所以即使完整回應要花上好幾秒,體驗依然鮮活。它也讓使用者邊讀邊跟、提早打斷、或在還沒為其餘內容付費前就取消一個轉錯的彎。取捨則屬於工程面——你無法驗證或重新排版已經秀出去的輸出、事後的約束變得更難、而半成形的詞元(一個只成形一半的字或表情符號)需要小心緩衝,串流讀起來才會乾淨。
又称
另见