深度学习

层级表示学习(hierarchical representation learning)

/ hy-uh-RAR-kik-ul rep-ree-zen-TAY-shun LURN-ing /

层级表示学习是深度学习最核心的思想:不再由人去手工挑选程序该寻找的线索,而是让机器自己去发现它们,并一层一层地把理解搭建起来——底层是简单的概念,越往上越丰富。想想你读一页印刷品的过程。你的眼睛先捕捉到一笔笔细小的墨迹;这些笔画拼成字母;字母拼成词;词拼成一个终于有意义的句子。每一层,都是由它下面那一层搭起来的。

深度网络也是这样运作。给它看一张照片,第一层学到的不过是对边缘和一块块颜色起反应。下一层把这些边缘组合成转角和简单的纹理。更高一层把纹理拼成部件——一只眼睛、一个车轮、一片叶子。最顶层把这些部件凑到一起,得出「猫」或「车」。所谓「表示」,就是网络在某一层上对输入的描述方式:底层握着的是粗糙、局部的描述,高层握着的则是有意义、抽象的描述。没有人手工定义什么是「边缘」、什么是「眼睛」;网络靠着被喂以大量例子、再被轻轻往正确答案那边纠正,自己长出了这些概念。

它为什么重要:几十年来,机器学习最难的部分一直是「特征工程」——由人煞费苦心地决定该把哪些量度喂给模型。层级学习把这件事自动化了,这才是深度网络在图像、声音和语言上一跃领先的真正原因。但也要老实说出代价:它通常需要海量的数据和算力,而且网络发明出的那些概念,未必是我们所期望的、整洁可读的概念。这些层确实抓住了结构,但并不保证会像我们那样去切分世界。

在一个人脸识别网络里,从底到顶各层依次亮起来的是:边缘 → 眼角和唇线 → 完整的眼睛、鼻子、嘴 → 整张脸。每一级都是由下面那一级拼装而成的。

底层是简单零件,顶层是完整概念——靠学习得来,而非手工写就。

「边缘 → 部件 → 物体」这套整齐的说法是教科书式的理想;真实网络要混乱得多,我们也未必总能读出每一层究竟表示了什么。最大的收获在于:这些特征是自动学到的,而非靠人手设计的。

又称
hierarchical feature learning层级特征学习層級特徵學習deep representation learning