侷限、幻覺與風險

毒性與有害輸出(toxicity and harmful output)

因為模型讀過了整片漫無邊際的網際網路,它也讀過了其中最醜陋的角落——辱罵、騷擾、教人造成傷害的步驟、極端主義的長篇大論。這些材料會留下痕跡,所以在缺乏防護的情況下,模型被提示時(有時甚至沒被提示時)就可能產出冒犯、威脅、或真正危險的文字。「生成傷害」這項原始能力,從一開始就在模型內部;擋在它與使用者之間的,是一層訓練與過濾,而不是這份知識的缺席。

開發者用對齊與護欄來抵擋:教模型學會拒絕、過濾訓練資料、篩查輸出。這些大幅減少了問題,卻永遠減不到零——巧妙的措辭、角色扮演的包裝、切換語言,都可能溜過去,而這正是「越獄(jailbreak)」的整套遊戲。誠實的圖像是一種無法完全化解的張力:讓模型擅長寫作的那份流暢,正是讓有害寫作變容易的同一份流暢,所以安全是一項持續進行的工作,而非一個做完的功能。