侷限、幻覺與風險
隱私外洩(privacy leakage)
用網際網路上海量抓取的內容來訓練,意味著模型可能讀到了人們從沒打算給它看的東西:貼在論壇裡的一封電子郵件、一則舊貼文裡的住家地址、一份外流的文件。其中有些會卡進模型的參數裡,而在對的提示之下,有時能被誘導著吐回來——研究者已經從模型中逐字抽出過姓名、電話號碼、以及一整段一整段的私人文字。這些資料本該只是教材,模型卻把它部分背了下來。
還有第二種、更日常的外洩:使用者輸入給模型的內容。把一份客戶名單、未發布的程式碼、或醫療細節貼進提示裡,那段文字可能被記錄、被拿去改進服務、或在供應商遭入侵時外曝。兩種風險都需要謹慎——在訓練端盡量減少個資、套用差分隱私(differential privacy)之類的技術;在使用者端,則永遠別把「你承受不起在別處冒出來」的祕密餵給模型。
另見