機器學習

參數(parameter)

/ puh-RAM-uh-tur /

參數,是模型在學習時不斷調整的內部數字之一——它要擰的一個旋鈕。想像一台調音台:每根推桿控制聲音的一部分,你把它們上下推動,直到混音聽起來對味。模型的參數,正是這些推桿,只不過它們可能成千上萬、數以百萬計,在今天的大語言模型裡甚至上千億,而且機器是在訓練中自動設定它們,不是靠耳朵去調。

具體來說,參數就是填滿模型所選形式的那些數字。在直線 價格 = a × 面積 + b 中,斜率 a 和截距 b 就是它的兩個參數。訓練,無非就是去搜尋那樣一組參數取值,使模型的答案盡可能貼近已知答案——把每根推桿一點一點地擰動,好讓錯誤變小。訓練一停,參數就凍結下來,而這一套凍結的數字,本質上就是訓練好的模型。

參數越多,模型能捕捉的模式就越精細——但這並非免費。相對於資料量參數過多的模型,可能把訓練例子背下來,而不是學到真正的規律(過擬合),執行起來也更耗記憶體和算力。你聽說的那些巨型模型動輒多少億參數,只是對「容量」的粗略代稱,並不保證品質:一個更小、訓練扎實的模型,常常勝過一個臃腫、卻餵著劣質資料的模型。

一個有 3 個輸入、1 個輸出的小網路可能只有 4 個參數:三個權重(每個輸入一個)加一個偏置。GPT 一類的模型則有上千億。兩種情形裡,「訓練」都意味著:去搜尋那組讓預測錯得最少的參數取值。

參數就是訓練所要擰的旋鈕——從寥寥幾個到上千億不等。

別把參數和超參數搞混。參數是訓練過程從資料中學出來的;超參數則是你在訓練開始前手動設定的旋鈕(比如學習速度有多快,或者把模型造多大)。

又稱
weightlearned parameter参数參數权重model weights