2026年6月24日12 个节点#showcase#tech#ai#research
超越 LoRA
一张 LoRA 之后参数高效微调的导图,DoRA、PiSSA、VeRA 等方法如何在同一条帕累托前沿上权衡精度与显存。
完整简报
LoRA 已成为适配大模型的默认选择,便宜、可合并、推理零开销。但「Beyond LoRA」研究表明,各种方法都落在精度与显存的帕累托前沿上:正确的选择取决于任务,而非某个万能最优。
LoRA 基线#
在冻结权重上加低秩 A·B
LoRA 冻结基础权重,学习一个低秩更新 B·A。它的弱点是结构性的:A 用噪声初始化而 B 为零、A 与 B 共用一个学习率、更新的几何形态与全量微调相背离。
PiSSA#
用主成分做 SVD 初始化
PiSSA 对原始权重 W 做 SVD,用主奇异向量初始化 A·B,并冻结残差。报告增益:Mistral-7B 在 GSM8K 上 72.86%,而 LoRA 为 67.7%;4-bit 的 QPiSSA 在 LLaMA-3-70B 上胜过 QLoRA(86.05% 对 81.73%)。
DoRA#
只更新方向的低秩方案
DoRA(NVIDIA,ICML 2024 Oral)只对方向分量应用 LoRA,仅额外加一个幅值向量。LLaMA-7B 常识推理:78.4% 对 LoRA 的 74.7%(+3.7),可训练参数仅多约 0.01%,且推理零额外开销。
VeRA#
共享冻结随机矩阵 + 极小缩放向量
VeRA 在所有层间冻结一对共享的低秩随机矩阵,只训练每层的小缩放向量。随机矩阵可由种子重新生成,因此检查点极小,在性能相当的情况下,可训练参数约为 LoRA 的十分之一。
显存之墙#
用量化把大模型塞进一块 GPU
当瓶颈是显存时,量化要先行。QLoRA 通过 4-bit NF4、双重量化和分页优化器,在单块 48GB GPU 上微调 65B 模型,Guanaco 在 24 GPU 小时后于 Vicuna 上达到 ChatGPT 的 99.3%。
帕累托式抉择#
任务、预算、服务形态
精度关键的领域用全量微调;想在 LoRA 的预算下接近全量质量,用 DoRA/PiSSA;要服务大量适配器,用 VeRA;受显存所限,用 QLoRA;LoRA+ 则是近乎免费的加成。Beyond-LoRA 的基准(例如 OFT 在图像任务上以更低显存胜过 LoRA)说明了一点:在前沿上做选择。
想把这张图变成真正的系统
读完简报之后,下一个问题通常是「那我们该怎么把它做出来」。Weple 是一家外包开发工作室,擅长把这样的结构拆成小块交付。咨询时把本页链接一并发给我们即可。
咨询开发