安全、越獄與紅隊測試
用大型語言模型做內容審核(content moderation with LLMs)
內容審核(content moderation)這項工作,是判定一段文字是否被允許:暴力、仇恨、自我傷害、涉及未成年人的性內容、騷擾、非法教學等等。在大型語言模型產品裡,這份工作需要做兩次——進來時攔截有害的使用者請求,出去時攔截有害的模型回覆——而審核者本身越來越常是一個經過微調的模型,它讀文字、輸出類別與嚴重度,而非依靠一張手寫的禁字清單。
用模型去管模型有明顯的長處:它懂脈絡,所以能分辨「關於用藥過量的醫療提問」與「一份自殺計畫」、或「新聞引述的一句髒話」與「一次真正的攻擊」——這是關鍵字過濾器永遠做不到的。它可以被一份成文政策引導、按各傷害類別輸出結構化標籤,並針對某個應用想要的精確門檻去調校。請求拒絕的底層往往就是這樣實作的,平台也是這樣大規模地分流使用者生成內容。
困難之處恰恰是那些屬於人的部分。每一條線該畫在哪,是一項有爭議的政策抉擇,而非技術事實;同樣的字眼,會因「誰在說、為什麼說」而有害或無害;跨文化與跨語言的覆蓋並不均勻;而任何分類器都會繼承其標籤的偏見。所以審核模型能減少人類必須複審的量、讓判斷一致,但底層的價值判斷仍是真正有爭議的,困難案例需要人類監督。
又称
另见