模仿學習與逆向強化學習

從觀察中學習(learning from observation)

從觀察中學習處理模仿裡最自然也最困難的形式:你看得到專家做了什麼,卻看不到他是怎麼做到的。示範是一連串的狀態——比方說某人打繩結的影片畫格——而沒有記錄下動作。這正是小孩模仿大人時的處境,也正是讓智能體能從網路上海量、不含動作的示範中學習的關鍵。

缺少動作使單純的行為複製變得不可能,因為沒有標籤可預測。各種方法以兩大途徑填補這個缺口:用一個學習而來的逆動力學模型推斷相鄰狀態之間可能的動作,再進行複製;或乾脆略過動作,直接匹配專家所產生的狀態轉移分布,常用一個作用於狀態或狀態配對上的對抗判別器。

另一個麻煩是「身體形態不匹配」——人手與機器夾爪達到同一狀態的方式並不相同——所以最乾淨的表述會以狀態與目標來推理,而非低階的動作。

又稱
imitation from observationLfOstate-only imitation