安全、越獄與紅隊測試

大型語言模型安全(LLM safety)

一個會寫程式、能擬電子郵件、幾乎什麼問題都能回答的助理,同時也是一個陌生人幾乎什麼都能問的對象。大型語言模型安全(LLM safety)這門功夫,就是要確保在那個龐大的可能請求空間裡,模型不會主動協助造成嚴重傷害:製造武器、撰寫惡意程式、策劃暴力、產製兒童性虐待內容,或誘騙與操弄脆弱的人。目標不是一個什麼敏感問題都拒絕的模型,而是一個依然真正有用、卻會回絕那一小撮「幫了就會造成現實傷害」之請求的模型。

安全是由層層交疊堆出來的,而不是單一開關。預訓練資料先經過過濾,模型再經安全微調學會拒絕明顯有害的請求,一段系統提示與使用政策框出它該做與不該做的事,獨立的輸入與輸出過濾器攔截漏網之魚,而人類紅隊測試加上自動化評估則持續探測失敗。沒有任何一層是完美的,所以才把它們疊起來——讓一次攻擊必須同時擊破好幾層才能得逞。

誠實面對範圍很重要。安全與對齊、能力、公平並不相同(雖然彼此重疊);它專指「防止傷害」。而且它永遠做不完:每一項新能力、新語言、新用途都會打開新的失敗模式,所以安全被當成對「殘餘風險」的持續量測,而不是認證一次就了事的性質。

安全約束的是行為而非知識——模型可以被訓練成拒談某個它其實仍瞭如指掌的主題,這正是為什麼有心人會不斷探測。

又称
model safetyAI safety for language models