侷限、幻覺與風險
大型語言模型中的偏見(bias)
模型從人寫的文字中學習,而人的文字承載著他們的種種預設——關於性別、種族、國籍、年齡,以及更多。於是模型吸收了這些模式,並可能把它們再現出來:預設護理師是女性、工程師是男性,把某些名字和某些職業綁在一起,或是對某個群體的描述比對另一個群體更溫暖。它並不是「選擇」要不公平,而是在映照訓練資料裡那些一開始就不公平的統計。
讓這件事危險的,是規模與權威感。同一種偏斜一旦被烤進一個被廣泛使用的模型,就會被套用到數以百萬計的決策上——篩履歷、草擬推薦信、審核言論——還披著一層「中立機器」的外衣,把底下的人類偏見藏了起來。緩解手段頂多只是部分有效:篩選資料、加入對齊步驟、跨群體測試輸出都有幫助,但沒有任何模型是零偏見的。對它關於「人」的判斷,要抱持格外的懷疑。
另見