探索
不確定下的樂觀(optimism under uncertainty)
這裡有一個簡單卻強大的原則:當你不確定某樣東西有多好時,就先假設它是好的,直到經驗說不是。一個樂觀的智能體會給沒試過或很少試過的動作一個被灌高的價值,這讓貪婪的選擇者無法抗拒它們。於是不需要任何明確的隨機性,智能體就自然被拉向它最不了解的東西——而每次造訪都會把這份樂觀往真相收斂一點。
這把探索變成對一個刻意樂觀的價值估計做普通的貪婪利用,這也是為什麼它撐起許多最強、帶可證明保證的方法。把價值表初始化成很高的數字(樂觀初始化)是最粗糙的版本;信賴上界規則與基於計數的獎勵則是有原則的形式。危險在於校準:太過樂觀會浪費時間追逐毫無希望的選項,太不樂觀則會塌回過早的貪婪。
又称
另见