微調與適配
QLoRA(量化 LoRA)
QLoRA 把微調硬塞進你可能真的擁有的硬體裡。它的訣竅是把凍結的基礎模型以高度壓縮的量化形式存放——每個權重大約四位元,而非十六位元——讓原本塞不進你 GPU 記憶體的模型忽然塞得下,然後在它之上訓練普通的 LoRA 適配器。
基礎權重被量化到四位元並維持凍結;梯度只穿過它們去更新那些較小、仍保持較高精度的 LoRA 矩陣。一些細緻的設計——一種貼合權重分布的資料型別,以及在用量飆高時把優化器狀態分頁換到 CPU 記憶體——讓品質逼近全精度微調。最受矚目的成果,是在單一張消費級 GPU 上微調了一個 650 億參數的模型。
QLoRA 讓微調平民化了:業餘玩家和小型實驗室忽然也能適配大型的開源模型。代價是訓練稍微慢一些,以及量化通常會帶來的那一點點品質損失。
另见