應用、環境與模擬到真實

強化學習環境與基準(RL environments and benchmarks)

就像跑者需要一條跑道才能比較成績,RL 研究者也需要共享的環境——具有固定規則、觀測與獎勵的模擬世界——這樣兩套演算法才能在完全相同的任務上被衡量。基準(benchmark)就是這類環境,再加上大家在上面回報過的分數所組成的精選集合。

一個環境提供乾淨的契約:重置(reset)回到起始狀態,再用一個動作去步進(step),取得下一個觀測、一份獎勵與一個結束旗標。基準會把所有影響難度的東西都釘死——觀測格式、動作空間、獎勵尺度、回合長度、隨機種子——好讓結果可重現。常見的測試套件涵蓋控制(CartPole、MuJoCo)、Atari 遊戲與格子世界。

要小心對基準過度擬合:一個被調到能在少數任務上榨出分數的智能體,可能完全無法類推到別處。良好的做法是回報多個隨機種子並附上其變異數,因為 RL 的分數在不同次執行之間會劇烈擺盪。

又称
RL testbedsbenchmark suites