治理與災難性風險

遞迴自我改進(recursive self-improvement)

用一把刀去磨另一把刀很方便;但把一把刀磨到它現在能磨自己、而且每磨一次都讓它更擅長磨自己,那就完全是另一回事了。遞迴自我改進就是把第二幅畫面套用到 AI 上:一個系統去改進它自己「改進的能力」,於是增益在自身之上層層複利。

「遞迴」這個詞是關鍵。尋常的進展是「人類讓 AI 變更好」。遞迴自我改進則是「AI 讓 AI 變更好」,而那個被改進過的系統接著又去做改進,一輪接一輪。這可能有很多形式:一個 AI 寫出更好的訓練程式碼、設計出更好的模型架構、產生更好的訓練資料,或找到更有效率的演算法,然後把這些增益用來產出一個更有能力的自己版本,再重複這個循環。這個迴圈,正是智慧爆炸假說背後的那具引擎。

它之所以重要,是因為若這個迴圈真的運轉、且每一步都帶來巨大增益,能力就可能升得非常快,這正是為什麼遞迴自我改進坐落在「快速起飛」憂慮、以及「讓強大系統維持可糾正、可控制」之論點的核心。但在前沿規模上,它大致仍屬理論。今天的系統已經能在狹窄的片段上幫上忙(AI 協助寫程式與調校模型),然而一個真正、持續、自我加速的迴圈尚未被展示出來,而現實的瓶頸(報酬遞減、對新鮮資料、算力與實體實驗的需求)可能讓任何這類迴圈走得溫和、而非爆炸。這個效應會有多強,仍無定論。

一個 AI 提出一項調整,讓它自己的訓練效率提升了百分之十;它所產出的、稍微更好一點的模型,又找到了進一步的調整,依此類推。懸而未決的問題是:這些增益會持續跟上,還是會迅速縮減趨近於零。

危險與希望都繫於一點:每一輪自我改進,究竟是維持巨大,還是逐漸消退。

狹義的自我改進(AI 協助撰寫 AI)已經在發生;但前沿上一個持續、自我加速的迴圈還沒有。別把今天工具層面的漸進增益,當成「爆炸性迴圈近在眼前」的證明。

又称
RSIself-improving AI自我改進