評估、基準測試與紅隊測試
TruthfulQA(真實性問答基準)
TruthfulQA 鎖定一個特定失敗:模型複述人類的謬誤。它的 817 道題刻意圍繞人們普遍持有錯誤觀念的主題——健康迷思、陰謀論、記錯的歷史、迷信——使一個被訓練去模仿人類文本的模型,被引向熱門卻錯誤的答案。真實性與資訊量分開計分,因為像「我沒有意見」這樣的拒答雖真卻無用。
它有兩種格式:多選(依概似排序真與假的參考答案)與生成(模型自由作答,由一個微調過的評審模型——最初稱 GPT-judge——對照策展的真與假參考來評分)。一個揭示性的發現是某些面向上的逆向尺度律:更大的模型可能更不真實,因為更大的容量意味著更貼合人類文本中的謬誤,使真實性與單純規模脫鉤。
該基準是圍繞已知陷阱對抗式建構的,所以量的是對模仿式謬誤的抵抗力,而非對新主張的一般事實準確率或幻覺。其評審模型會漂移,而 RLHF 調校過的模型如今分數高得多,部分靠的是迴避作答——所以高 TruthfulQA 數字並不能認證一個模型廣泛地真實,只代表它較難被常見迷思釣中。
TruthfulQA 隔離的是模仿式謬誤(複述常見迷思),這有別於幻覺(自信地捏造毫無根據的主張)。
又称
另见