深度學習理論
樂透票假說(lottery ticket hypothesis)
想像在一個剛初始化的稠密網路裡,藏著一個小而幸運的子網路——一張中獎的樂透票——它隨機的起始權重已經與任務如此契合,以至於單獨訓練它,就能在相同的步數內達到整個網路的準確率。這個假說主張這類稀疏子網路可靠地存在;稠密網路的成功,有一部分是「一次買了很多張票」的成功。
找出一張票的方法是迭代式幅度剪枝:先訓練稠密網路,移除幅度最小的權重,把存活下來的權重重設回它們原本的初始值,然後重複。最後得到的稀疏遮罩,加上那組一模一樣的早期權重,就是這張票。重設是關鍵——剪掉同樣的連接、但把它們隨機重新初始化,訓練效果會差很多。對大型網路,權重必須回捲到的不是第零步,而是某個早期的檢查點,這個修正稱為樂透票的「穩定性」。
這個結果重新定義了剪枝:它暗示可訓練的稀疏結構在初始化時就已存在,而不是事後才把訓練好的模型壓縮掉。誠實的提醒是:中獎遮罩只能藉由先訓練整個網路才找得到,所以這還不是一份能「從零開始訓練稀疏網路」的食譜。
迭代式幅度剪枝是事後才找到遮罩;這個假說談的是「存在性」,而不是稀疏訓練的免費午餐。
又称
另见