侷限、幻覺與風險
推理失靈(reasoning failures)
模型能寫出一段關於邏輯的、無懈可擊的文字,接著卻在邏輯本身上絆倒。它會數錯清單裡的項目、在算術裡掉一個負號、與自己三句話前講過的話自相矛盾,或一臉篤定地「解開」一道謎題——其實是偷偷把規則改了。原因是它在比對「推理是怎麼被寫出來的」這種模式,而不是在底下跑一套有保證的推理程序——所以它模仿出縝密思考的外型,卻沒有那套讓思考可靠的機制。
這在「小步驟必須精確接龍」的地方最明顯:多步驟數學、追蹤一個故事裡誰知道什麼、或同時滿足好幾個都得成立的限制條件。提示模型「一步一步想(think step by step)」會有幫助,因為把中間步驟寫出來給了它更多保持一致的空間;把難算的算術外包給計算器工具,幫助更大。但這份脆弱永遠不會徹底消失——夠長的推理鏈、或一個陌生的轉折,終究會把它弄垮,所以凡是真的要緊的結論,都要驗證。
另见