能力與推理
長程推理(long-horizon reasoning)
長程推理,是在許多步驟之間保持連貫、不偏離目標——那種會在數十個動作中展開、而非一次回覆就結束的任務。證明一個冗長的定理、在龐雜的程式碼庫裡跨檔除錯,或執行一個橫跨數日的研究專案,都要求從目標到當前行動的那條線索始終不斷。難點與其說在任何單一步驟(模型也許輕鬆就能應付),不如說在不要迷失主軸、不要與先前的決定自相矛盾、不要在途中悄悄忘掉最初的目標。
兩股壓力讓這件事困難。其一,小錯會累積:一個有九成九可靠度的步驟,經過數百步仍會嚴重偏離,所以在短任務上看來無虞的可靠度,在長任務上就崩解了。其二,相關事實可能滑出情境窗,使模型字面上看不見自己稍早做過的決定。對策包括外部記憶、定期摘要、對照一份明確的計畫,以及行動後再以真實結果重新接地,而不是一口氣推理到底。長程能力之所以是前沿,正因為它考驗的是耐力,而不只是聰明。
又称
另见