JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

因果、效應,以及前方的路

把相關當成操控的智慧體,會在開放世界裡翻車。我們以因果強化學習收尾,並誠實地勾勒出,究竟什麼能讓強化學習真正變得通用。

當相關性弄垮一個智慧體

多數 RL 是從相關性學習的——哪些狀態傾向於先於高回報出現。這很脆弱,因為相關可能來自一個混淆因子(confounder):一個同時推動動作與結果的隱藏成因。如果你用人類紀錄訓練一個駕駛智慧體,而下雨時雨刷通常是開的,它可能學成「雨刷開→安全」——複製了成因的標記,而不是成因本身。世界一變,這條虛假連結就斷掉。這種失敗,恰恰在前沿最想使用的離線與歷史資料設定中最為尖銳。

由于智能体会作用于环境,每一步都是一次干预,而非被动观察——这正是相关性会误导它的关键所在。

智能体—环境循环示意图:智能体执行动作,并获得下一状态与奖励。

因果強化學習——介入,而非僅是觀察

因果強化學習(causal RL)讓智慧體配備一個因與果的模型,而不只是統計。它用結構因果模型(structural causal models)與do 演算(do-calculus)的語言,把「什麼傾向同時出現」和「如果我介入、做了這件事會發生什麼」區分開來。策略本身就是一種介入,所以這正是 RL 的自然語言。它的回報恰好落在第一篇的兩道鴻溝上:因果結構是能在分佈偏移中存活下來的不變量,因此承諾更穩固的泛化;而對機制——而非僅對獎勵——進行推理,能大幅提升樣本效率

P\big(y \mid \mathrm{do}(x)\big) \neq P(y \mid x)

do 演算的核心:主动“干预”把 x 设为某个值,其效果可能不同于仅仅“观察”到 x——这正是因果智能体必须尊重的区别。

反事實與信用分配

因果也讓 RL 最古老的頭痛問題——信用分配——更加銳利。一個反事實(counterfactual)問題:「在其他一切固定下,如果我當時換個做法,結果會不會更好?」——正是優勢函數(advantage)試圖估計的比較,只是現在有了更扎實的根基。反事實推理支撐起更乾淨的離策略評估;在多智慧體設定裡,它還能藉由想像「沒有某個智慧體的動作」的世界,來分離出該智慧體真正的貢獻。

A^{\pi}(s,a) = Q^{\pi}(s,a) - V^{\pi}(s)

优势函数刻画了信用分配核心的反事实问题:动作 a 比该状态的基线价值好多少?

把前沿拼起來

退一步看,本軌的各塊拼圖合成了一幅圖像:一個通用智慧體會需要什麼。第一篇:跨過泛化樣本效率兩道鴻溝。第二篇:重複利用知識——快速適應、遷移、永不遺忘、無獎勵也能學。第三篇:用基礎模型的配方規模化,由規模法則開放式環境餵入源源不絕的多樣經驗。第四篇:設定對的目標並維持安全。本篇:讓這一切立基於因果理解之上。沒有任何單一想法是充分的;前沿是它們的交集

誠實的收尾

這些都是開放問題,而非已解之題——這對你來說正是好消息。今天的 RL 大約處在監督式學習進入規模化時代之前的位置:在狹隘勝利上強大,卻仍在尋找那套讓它廣泛可靠的配方。如果你想貢獻,挑一道鴻溝、把它變得可衡量:打造一個逼出泛化的基準、一個永不重複的環境產生器、一個抵抗駭取的獎勵,或一個能在相關性基線全軍覆沒的偏移下存活的因果方法。那些最終能依我們期望的方式學習的智慧體,正是建立在這些問題之上。