前沿與開放問題

通才智能體(generalist agents)

多數 RL 智能體都是專才:一個網路玩一款遊戲,或控制一具機器人。通才智能體(generalist agents)則是相反的野心——單一一組權重,能玩數百款遊戲、為影像配字幕、聊天,並控制不同的機器人身體,在無需重新訓練的情況下切換任務、甚至切換身體形態。那個里程碑式的概念驗證——常被稱為「通才智能體」——把一切(像素、文字、關節力矩)都切成同一條序列的 token,並訓練一個 transformer 在所有這些之上預測下一個 token。

技術上的訣竅是「統一」:把每一種模態、每一種動作空間都當成同一條串流裡的 token,於是天差地別的任務都變成同一個大型序列建模問題,可由一個大模型吸收。這讓正向遷移得以在任務之間流動,也讓單一一個成品到處都能部署。它揉合了 RL、模仿學習與監督式預訓練,並大量倚賴基礎模型等級的規模。

通才智能體是令人矚目的展示,但仍很早期。它們通常樣樣通、樣樣鬆,在任何單一困難任務上常常落後專才;在不互相干擾的前提下處理多種身體形態仍未解決;而單靠擴大規模能否得出專屬智能體所達到的那種深層能力,也並不清楚。它們與其說是已抵達的終點,不如說是這個領域期望前往何方的一個鮮明宣示。