2026년 6월 24일 노드 12개 #showcase#tech#ai#research

LoRA를 넘어서

LoRA 이후의 파라미터 효율적 파인튜닝(PEFT)을 정리한 지도, DoRA, PiSSA, VeRA 등이 단일 파레토 프런티어 위에서 정확도와 메모리를 어떻게 맞바꾸는지 보여준다.

브리프 전문

LoRA는 대형 모델을 적응시키는 기본값이 되었다, 값싸고, 병합 가능하며, 추론 오버헤드가 0이다. 하지만 'Beyond LoRA' 연구는 각 기법이 정확도 대 메모리의 파레토 프런티어 위에 놓여 있음을 보여준다. 올바른 선택은 보편적 최강자가 아니라 과제에 따라 달라진다.

LoRA 베이스라인 #

동결된 가중치에 더해지는 저랭크 A·B

LoRA는 기본 가중치를 동결한 채 저랭크 업데이트 B·A를 학습한다. 그 약점은 구조적이다. A는 노이즈로 초기화하고 B는 0으로 두는 점, A와 B가 학습률 하나를 공유하는 점, 그리고 전체 파인튜닝과 어긋나는 고정된 업데이트 기하 구조가 그것이다.

더 나은 초기화 #

중요한 것에서 출발하라

무작위 A와 0인 B 대신, 기존 가중치에서 가장 정보량이 많은 방향으로 어댑터를 초기화한다. 그러면 학습이 노이즈가 아니라 정답 근처에서 시작된다.

PiSSA #

주성분 기반 SVD 초기화

PiSSA는 원본 가중치 W에 SVD를 수행해 주특이벡터로 A·B를 초기화하고 나머지(잔차)는 동결한다. 보고된 성능: Mistral-7B의 GSM8K에서 72.86%로 LoRA의 67.7%를 앞섰고, 4비트 QPiSSA는 LLaMA-3-70B에서 QLoRA를 86.05% 대 81.73%로 능가했다.

가중치 분해 #

크기와 방향을 분리하라

각 가중치를 학습 가능한 크기와 방향으로 분해한 뒤 방향만 적응시킨다. 이렇게 하면 LoRA의 업데이트가 전체 파인튜닝에 더 가까운 형태로 바뀌면서도 파라미터 비용은 거의 동일하고 여전히 병합이 가능하다.

DoRA #

방향만 갱신하는 저랭크 업데이트

DoRA(NVIDIA, ICML 2024 Oral)는 LoRA를 방향 성분에만 적용하고 크기 벡터 하나만 추가한다. LLaMA-7B의 상식 추론에서 78.4%로 LoRA의 74.7%보다 3.7%포인트 높았으며, 학습 파라미터는 약 0.01%만 더 늘고 추론 비용 증가는 0이다.

파라미터 공유 #

저장 공간이 병목일 때

사용자별·과제별 어댑터를 다수 서빙해야 한다면 발목을 잡는 제약은 순수 정확도가 아니라 체크포인트 크기다, 그러니 학습 파라미터를 최대한 낮춰야 한다.

VeRA #

공유·동결된 난수 행렬과 작은 스케일링 벡터

VeRA는 모든 레이어에 걸쳐 공유되는 무작위 저랭크 행렬 한 쌍을 동결하고, 레이어별 작은 스케일링 벡터만 학습한다. 난수 행렬은 시드로부터 재생성되므로 체크포인트가 매우 작다, 동등한 성능에서 학습 파라미터가 LoRA보다 약 10배 적다.

공짜로 얹는 개선 #

같은 연산으로 더 많이

어떤 개선은 비용이 거의 들지 않는다, 구조가 아니라 하이퍼파라미터 하나를 바꾸는 것이고, 기존 기법 위에 그대로 얹을 수 있다.

LoRA+ #

A와 B에 서로 다른 학습률

A와 B가 학습률 하나를 공유하는 방식은 폭이 넓은 모델에서 최적이 아니다. LoRA+는 고정된 비율로 B에 더 높은 학습률을 부여한다. 같은 연산에서 성능은 1~2% 높고 파인튜닝은 최대 약 2배 빨라진다.

메모리 벽 #

양자화로 대형 모델을 GPU 한 장에 담기

제약이 VRAM일 때는 양자화가 먼저다. QLoRA는 4비트 NF4, 이중 양자화, 페이지드 옵티마이저를 통해 65B 모델을 48GB GPU 한 장에서 파인튜닝한다. Guanaco는 24 GPU-시간 만에 Vicuna 벤치마크에서 ChatGPT의 99.3% 수준에 도달했다.

파레토 위에서의 선택 #

과제·예산·서빙 형태

정밀도가 중요한 영역에는 전체 파인튜닝을, LoRA 예산으로 전체 파인튜닝에 가까운 품질을 원한다면 DoRA/PiSSA를, 어댑터를 다수 서빙할 때는 VeRA를, 메모리에 묶여 있을 때는 QLoRA를, 그리고 거의 공짜 추가 옵션으로는 LoRA+를 택하라. Beyond-LoRA 벤치마크(예: OFT가 더 적은 메모리로 이미지 과제에서 LoRA를 앞선 사례)가 말해주는 핵심은 하나다, 프런티어 위에서 골라라.