模型是其資料的一面鏡子
語言模型中的偏見不是機器自己選擇的道德缺陷,而是一種統計上的承襲。模型從人類文字的廣大切片中學習,而那些文字承載著產生它們的人群與時代所帶有的刻板印象、失衡與盲點。當某個群體被過度呈現、另一個群體幾乎不出現時,模型就會把這種失衡當成「事物的自然秩序」吸收進去——一種資料集偏誤(dataset bias),最終變成模型的偏誤。
這些傾斜會以具體方式浮現:把某個職業預設為某個性別、對某些方言與語言產生較差或刻板的輸出、或在只更換姓名的情況下對相同履歷給出不同評價。由於偏見藏在模型習得的相關性裡,即使沒有任何指令要求,它也可能出現——這正是大家所說的、部署系統中的演算法偏誤(algorithmic bias)。
词向量示意图,展示“国王−男人+女人≈王后”的类比。
誰的公平?
衡量偏見會逼出一個令人不安的問題:對誰公平、又如何定義公平?群體公平要求各群體之間結果相等;個體公平要求對相似的個案給予相似的對待,而這兩者可能彼此衝突——滿足其一可能違反其二。世上沒有一個標著「無偏見」的單一開關。減少某一種差距,往往只是把它挪到別處,因此團隊必須在自己的具體脈絡中,決定哪些傷害最重要,並據此衡量,而非寄望於一個奇蹟般中立的模型。
群体公平(人口均等)要求各群体 A 的正例率相等——这是对“对谁公平”的一种形式化回答。
有害的輸出
由於訓練資料包含網路最醜陋的角落,模型可能生成有害或惡意的輸出:辱罵、騷擾、危險指示、自傷內容。各實驗室投入巨大心力把這類行為訓練下去,並加裝內容審核濾網來篩檢輸入與輸出。成果遠比原始模型安全——但那是一道機率性的防線,不是一堵牆。措辭巧妙的請求仍可能溜過去,而過度激進的過濾則會以另一種方式造成傷害:拒絕關於醫療、歷史或安全的正當問題。
流程:人类偏好 → 奖励模型 → 策略微调。
看起來對、其實不對的推理
最令人迷惘的失效是推理失誤,因為模型會產出一步步的推導過程,讀起來像縝密的思考,卻得到錯誤的結論。模型可能在推導中途把兩個數字加錯、套用一個有缺陷的類比、或被一道表面神似熟悉謎題的陷阱題給絆倒。關鍵在於:一段寫出來的思維鏈(chain of thought)是一則貌似合理的敘事,而非有保證的證明——那段解釋可能只是事後編出的故事,並不反映答案實際上是如何產生的。
循环图:模型每次生成一个词元并把它送回输入。
- 留意流暢推導中夾帶的算術與單位錯誤——文字可能毫無瑕疵,卻有單一數字出錯。
- 用重新表述問題來測試穩健度;真正會推理的會給出相同答案,脆弱的則會翻盤。
- 對任何「必須正確」的事,獨立驗算結果,而不要信任伴隨而來的那段解釋。