馬可夫決策過程
有限視野與無限視野(finite vs infinite horizon)
視野指問題往未來延伸多遠。有限視野的任務有已知的截止點,例如恰好走二十步然後停,因此最佳動作可以取決於還剩幾步。無限視野的任務沒有固定終點;智能體無限期地持續互動,就像恆溫器或交易機器人,且不論時鐘怎麼走,行為都一樣。
這個區別會改變數學。在有限視野下,最佳策略一般是非平穩的,會隨時間變化,你可以從最後一步往回推來求解。在無限視野下,你靠折扣因子讓回報保持有限,而最佳策略通常是平穩的,對每個狀態都用同一條固定規則。許多實際問題是分段式但很長的,為了方便,會被建模成無限視野。
又稱
另見