2026年6月24日12 個節點#showcase#tech#ai#research
超越 LoRA
一張 LoRA 之後參數高效微調的導圖,DoRA、PiSSA、VeRA 等方法如何在同一條帕雷托前沿上權衡精度與顯存。
完整簡報
LoRA 已成為適配大模型的預設選擇,便宜、可合併、推論零開銷。但「Beyond LoRA」研究指出,各種方法都落在精度與顯存的帕雷托前沿上:正確的選擇取決於任務,而非某個萬用最優解。
LoRA 基線#
在凍結權重上加低秩 A·B
LoRA 凍結基礎權重,學習一個低秩更新 B·A。它的弱點是結構性的:A 以雜訊初始化而 B 為零、A 與 B 共用一個學習率、更新的幾何形態與全量微調相背離。
PiSSA#
用主成分做 SVD 初始化
PiSSA 對原始權重 W 做 SVD,以主奇異向量初始化 A·B,並凍結殘差。報告增益:Mistral-7B 在 GSM8K 上 72.86%,而 LoRA 為 67.7%;4-bit 的 QPiSSA 在 LLaMA-3-70B 上勝過 QLoRA(86.05% 對 81.73%)。
DoRA#
只更新方向的低秩方案
DoRA(NVIDIA,ICML 2024 Oral)只對方向分量套用 LoRA,僅額外加一個幅值向量。LLaMA-7B 常識推理:78.4% 對 LoRA 的 74.7%(+3.7),可訓練參數僅多約 0.01%,且推論零額外開銷。
VeRA#
共享凍結隨機矩陣 + 極小縮放向量
VeRA 在所有層間凍結一對共享的低秩隨機矩陣,只訓練每層的小縮放向量。隨機矩陣可由種子重新生成,因此檢查點極小,在效能相當的情況下,可訓練參數約為 LoRA 的十分之一。
顯存之牆#
用量化把大模型塞進一張 GPU
當瓶頸是顯存時,量化要先行。QLoRA 透過 4-bit NF4、雙重量化和分頁最佳化器,在單張 48GB GPU 上微調 65B 模型,Guanaco 在 24 GPU 小時後於 Vicuna 上達到 ChatGPT 的 99.3%。
帕雷托式抉擇#
任務、預算、服務形態
精度關鍵的領域用全量微調;想在 LoRA 的預算下接近全量品質,用 DoRA/PiSSA;要服務大量適配器,用 VeRA;受顯存所限,用 QLoRA;LoRA+ 則是近乎免費的加成。Beyond-LoRA 的基準(例如 OFT 在影像任務上以更低顯存勝過 LoRA)說明了一點:在前沿上做選擇。
想把這張圖做成真正的系統
讀完簡報之後,下一個問題通常是「那我們該怎麼把它做出來」。Weple 是一家外包開發工作室,擅長把這樣的結構拆成小塊交付。諮詢時把本頁連結一併附上即可。
諮詢開發