多智能體強化學習

多智能體功勞分配(multi-agent credit assignment)

想像一支五個智能體的隊伍贏得了一份共享獎勵——比方說贏了這一局——但實際上只有兩個做了有用的事。學習該如何獎賞有貢獻的、而不獎賞搭便車的?這就是多智能體功勞分配:從一個團隊層級的數字,推斷出究竟是哪個智能體的動作真正起了作用。一旦弄錯,懶惰的智能體會被增強,幫忙的反而因連坐而被懲罰。

麻煩在於:共享獎勵本身並不會自動拆解成各智能體的部分。一個智能體看到隊伍表現好,卻分不清那是因為自己的選擇、還是儘管自己這樣選仍如此。這是單智能體 RL 中時序功勞分配問題的多智能體版本——在那裡問的是「哪個時間步該得功勞」,在這裡還要問「哪個智能體該得功勞」,而且兩者糾纏在一起。

主要的合作式方法,本質上就是對這個問題的不同回答。價值分解(VDN、QMIX)學著把團隊價值拆成可加或單調的各智能體貢獻;反事實基準線(COMA)問的是「若這一個智能體做了別的動作、其餘人不變,隊伍會表現如何」;而差異獎勵則比較有沒有某智能體動作時的全域結果。把功勞分配解得好,正是協調有序的隊伍與一團混亂的隊伍之間的分水嶺。

又称
team credit assignment