前沿與開放問題
RL 的基礎模型(foundation models for RL)
基礎模型(foundation model)是一個在龐大而廣泛的資料上預訓練、再被重用於眾多下游任務的單一大型網路——就像一個語言模型撐起上千個應用。RL 的基礎模型(foundation models for RL)問的是:決策能不能搭上同一股浪潮——拿一個在多樣經驗、影片、文字或軌跡上預訓練好的大模型,把它當成智能體的骨幹來重用,而不是每個策略都從頭訓練?
在實務上,這以好幾種形式出現。在既有軌跡上訓練的序列模型,把控制改寫成「預測下一個 token」,例如決策 transformer。視覺與語言的基礎模型被接上來,賦予智能體它原本不必去學的感知與遵循指令的能力。而在影片上預訓練的世界模型,則想給規劃一個豐富、可遷移的「事物如何運動」模擬器。它們共同的賭注是:廣泛的預訓練能買到狹隘 RL 拿不到的泛化與樣本效率。
這是這個領域最熱門的方向之一,但契合度並不完美。RL 的資料是互動的、序列的、由獎勵驅動的,這一點和網路文字不同;以網際網路規模蒐集多樣經驗,遠比抓取文件困難;而一個凍結的骨幹,可能編碼了對控制而言錯誤的抽象。決策究竟會不會迎來屬於自己、乾淨俐落的「基礎模型時刻」,仍是真正開放的問題。
另见