大型語言模型是什麼

大型語言模型的訓練資料(training data)

訓練資料就是大型語言模型用來學習的文字——而規模大得驚人:公開網路的大量內容、書籍、程式碼倉庫、文章與論壇,往往多達數兆個詞。模型並不像資料庫那樣把這些逐字背下來;它吸收的是散布其中的規律、詞彙與事實,就像一個博覽群書的人會習得文風與知識,卻不會記得每一頁的內容。

餵進去的資料,決定了產出來的東西。某個主題若在資料裡占比充足,模型處理起來就流暢;若這主題稀少或根本沒有,模型就會搖搖晃晃,甚至乾脆編造。資料也帶著它那些人類來源的偏見、錯誤與缺漏,而模型會一併繼承下來。這正是為什麼資料的選擇與清理,跟模型的設計一樣重要。