机器人学习

控制策略

控制策略,就是机器人在每一刻用来决定该做什么的那套规则。把机器人此刻对自己和世界的了解喂给它——比如各个关节的角度、摄像头看到的画面、自己移动得有多快——策略就会回给它一个动作:转这个电机、迈这一步、把这个夹爪合上。你可以把它想象成机器人的本能,或者一种“看到这个、就做那个”的习惯。机器人学习的全部意义,就在于让机器人从数据和经验中长出一套好的策略,而不是靠人一条一条地手写出每一个“如果……就……”的规则。

策略分为两类。确定性策略是一份严格的食谱:同样的处境永远产生完全相同的动作,就像一台恒温器,每次都在分毫不差的同一温度把暖气打开。随机性策略则给出一组带概率的可能——“大多往左走,偶尔直走”——再像掷骰子一样从中挑一个。这点内置的随机性出奇地有用:它让机器人在学习的同时还能尝试新做法,也让机器人不至于可预见地卡死——否则那份严格的食谱会让它一次又一次地撞向同一面墙。

一台行走机器人的策略读取自身的倾斜角度和双脚位置,每秒二十次地输出每条腿电机的下一次出力,让自己保持站立。

策略把机器人此刻感知到的东西映射成它下一步要做的动作。

在机器人学习里,被学出来的东西就是这套策略;强化学习是学出它的一种常见方法。

又称
policy策略策略函数