深度學習理論

深度分離與表達力(depth separation and expressivity)

深度分離提出一個尖銳的問題:是否存在某些函數,深層網路能用很精簡的方式表示,而任何淺層網路都得用荒謬的寬度才追得上?答案是肯定的,這賦予深度一項可證明的優勢。有些函數用組合的方式建構很便宜,用單一寬層建構卻貴得天文數字,因此「堆疊」不只是方便,而是本質上更省。

經典的構造是 Telgarsky 的。把一個簡單的三角(鋸齒)映射與自己組合 k 次,會產生一個有二的 k 次方個振盪的函數,深度 k 的網路用寥寥幾個單元就能表示,而任何深度為二的網路都需要 k 的指數級寬度才能逼近它。這類結果是存在性證明:它們展示了某些特定函數,在那裡深度可換來大小上的指數級縮減,從而把通用逼近定理磨利——後者保證淺層網路能逼近任何函數,卻對「需要多大」隻字不提。

關鍵的提醒是:表達力不等於可學習性。知道一個深層網路能高效表示某函數,並不代表梯度下降能從資料中找到那個表示。深度分離定理描述的是「可以表示什麼」,而不是「訓練可以到達什麼」,而這兩者之間的落差很大。

通用逼近說淺層網路能逼近任何東西;深度分離說它們可能得用指數級的寬度才辦得到。

又称
depth separation深度分離expressive power