深度學習理論
頓悟式延遲泛化(grokking, delayed generalization)
頓悟(grokking)是一條令人吃驚的訓練曲線。模型幾乎立刻就記住了訓練集——訓練準確率衝到百分之百,而測試準確率還停在亂猜的水準——接著經過一段漫長、看似毫無動靜的平台期,有時是多達一百倍的步數之後,測試準確率突然啪地一聲跳到近乎完美。泛化在配適之後很久才姍姍來遲,彷彿網路忽然之間懂了那條規則。
它最早是在模算術之類的小型演算法任務上被報告的,那裡有一條乾淨的潛在規則可供發現。一個主要的解釋是:權重衰減緩慢地把網路從一個高範數的記憶解,推向一個低範數、有結構的泛化解——對模加法而言,學到的解最後竟是實作了一個傅立葉式或環形的表示。從機制上看,這像是一個記憶電路與一個泛化電路之間的競爭,而後者只有在持續的壓力下才獲勝。
頓悟是一扇生動而可控的窗,讓我們窺見記憶與泛化之間的落差。誠實的提醒是:它對正則化強度與所用資料的比例很敏感,而其確切機制仍是一個活躍的研究問題,而非已成定論的說法。
頓悟最可靠的觸發方式是在小型演算法資料集上搭配權重衰減;拿掉正則化,那個延遲的跳躍往往就消失了。
又称
另见