大型語言模型是什麼
下一個詞元預測(next-token prediction)
每一步,模型會看完目前為止的所有文字,然後預測最可能的下一個片段——通常不是一個完整的詞,而是一個「詞元(token)」,例如「to」「ken」或一個標點符號。接著它把這個詞元接到文字後面,再重複一次,一個詞元接一個詞元,直到它判斷該停為止。你看聊天機器人一個字一個字打出來,其實就是這個迴圈在跑。
這個預測是一個機率分布:模型替詞彙表裡每一個可能的下一個詞元打分數,然後挑出其中一個——有時挑分數最高的,有時為了變化挑一個稍微出人意料的。大型語言模型所做的一切,從回答問題到寫程式,都是同一個「猜下一個詞元」反覆做上千次而已。
P(\text{token}_t \mid \text{token}_1, \dots, \text{token}_{t-1})
模型在已知前面所有詞元的條件下,估計下一個詞元的機率。
另見