机器人学习

仿真到现实迁移

仿真到现实迁移,指的是先在计算机仿真里训练机器人的技能,再设法让它在真实的实体机器人上稳稳地用起来。仿真就是一款关于机器人及其世界的精细电子游戏,那里的物理是被计算出来的,而不是被亲历的。在那里训练有着难以抗拒的诱惑:它跑得比真实时间还快,不会磨损电机、也不会损坏零件,分文不费,而且绝对安全,于是机器人一夜之间就能尝试一项任务上百万次——远比一台真机器能扛得住的练习量还要多。仿真到现实迁移,正是那座桥,把在这个又快又省的梦境世界里学到的本领,运到那个又慢又不留情面的真实世界里去。

整个难处在于这座桥往往摇摇晃晃,因为仿真从来不是现实的完美复制——这道落差就是现实鸿沟。一个在仿真器里满分通关的策略,搬到硬件上却可能手足无措,因为真实的摩擦、传感器噪声、时间延迟,以及略有偏差的电机响应,会一一打破它私底下依赖的那些假设。所以仿真到现实与其说是单独的一步,不如说是一门讲究——一整套让迁移站得住脚的技术。其中最主要的一招是域随机化:在数不清的运行中把仿真里的各项设定打乱(摩擦、光照、质量、延迟),让机器人见识到种类如此庞杂的假条件,以至于真实世界看上去不过是它早已会应付的又一种变体罢了。

其他招数也有帮助:把仿真器的物理调得更贴合从真机器测得的数据;掺入少量真实世界的数据来微调技能;并刻意加入各种噪声与不完美,让策略永远不会变得脆弱易碎。当它奏效时,正是仿真到现实迁移,让一台腿式机器人或一只灵巧手能在仿真里学会一件真正困难的事,并且在现实里第一次上手就把它做成。

一只灵巧手完全在仿真里学会翻转一个方块,在成千上万种被随机化的摩擦与光照设定中反复练习;多亏了仿真到现实迁移,它第一次摸到真方块时,就能把它平顺地转起来。

在梦境世界里安全练习上百万次,到现实里第一次出手就兑现。

仿真到现实迁移指的是目标——把技能从仿真搬到硬件上;现实鸿沟指的是障碍;域随机化则是跨越它最常用的工具。

又称
sim2realsim-to-real仿真迁移