強化學習

探索與利用(exploration vs exploitation)

/ ek-splor-AY-shun vurs ek-sploy-TAY-shun /

想像你最愛的那家餐館。你是點那道你早已知道很美味的菜(利用),還是試一道新菜——它也許更出色,也許令人失望(探索)?這個日常的兩難,正是強化學習的核心張力。一個總是走當前最佳著法的智能體,永遠發現不了更好的;一個總是嘗新的智能體,又永遠兌現不了它已經學到的東西。

這種張力無可迴避,因為智能體在學習的同時也在行動。每一個動作既是一次抉擇(去做此刻看來最好的事),也是一場實驗(去弄清那個動作究竟通向何方)。兩者無法同時做到極致:花在蒐集資訊上的時間,就是沒花在賺取獎勵上的時間,反之亦然。把這個平衡拿捏得恰到好處,從真切的意義上說,就是這門技藝的全部。

並不存在普適的解,只有一道策略光譜——從粗糙的 ε-貪心(大多時候利用,偶爾擲骰子),到那些在最不確定處探索得更多的精巧方案。一個自然且有充分依據的直覺是:在知之甚少的早期大膽探索,隨著認識日漸扎實再多去利用。但探索得太少,你可能會永遠鎖死在一個平庸的習慣上,既自信又錯誤;探索得太多,你又會把獎勵白白揮霍在那些本就不可能有回報的選項上。

你搬到一座有二十家咖啡館的新城。頭幾週裡,你每天換一家試(探索)。一旦找到三家心頭好,你便大多回去光顧它們(利用)——但仍時不時溜進一家新店,萬一它更好呢。這種混搭,恰恰就是一個好的強化學習智能體所做的事。

去試新選項以學習(探索)對上吃定已知的最佳(利用)——兩者無法同時最大化。

純粹的利用是一個陷阱:一個一旦鎖定它找到的第一個還過得去的選項就不撒手的智能體,可能永遠學不到一個好得多的選項其實近在咫尺。危險在於,它從頭到尾都感覺自己很成功——按它自己的尺度獎勵很高,而一個高得多的天花板,卻被永遠擱置在未曾探索之處。

又稱
explore-exploit tradeoff探索—利用权衡探索—利用兩難