모바일 LoRA 합성 하이퍼네트워크는 온디바이스 LLM 개인화의 현실적 경로다

LoRA-generating hypernetworks for efficient on-device LLM generative personalization

arXiv2609.24979v1

Sean Augenstein2026-09-21조회 4

무엇인가

이 논문이 푸는 문제는 온디바이스 LLM의 개인화다. 모바일 기기는 연산 자원이 제한되어 모델 규모를 줄여야 하고, 그만큼 모델 품질도 제약을 받는다. 그런데 휴대폰은 보통 한 사람만 쓰기 때문에 사용 패턴이 오랜 기간 상대적으로 일관되며, 사용자의 문체나 어조 같은 특성이 반복적으로 나타난다. 따라서 중장기 사용 패턴에 맞춘 개인화가 가능하다면, 모델 규모에서 오는 품질 손실을 상당 부분 상쇄할 수 있다는 것이 저자들의 출발점이다. 기존의 두 가지 접근은 이 상황에서 각각 걸림돌이 있다. LoRA로 대표되는 PEFT는 개인화에 경사하강법이 필요해 모바일에서 연산적으로 불가능하고, ICL은 입력 시퀀스를 늘려 추론 지연을 키우며 컨텍스트가 길어질수록 품질이 떨어지고 시퀀스 앞뒤 예시에 편향되는 문제가 있다. 논문은 개인화 파이프라인을 세 단계로 구분한다. 전체 사용자 집단에 대해 한 번만 수행하는 공통 아티팩트 생성(1단계), 사용자마다 한 번씩 수행하는 개인 아티팩트 생성(2단계), 질의마다 수행하는 개인화 추론(3단계)이다. 제안 방법은 연산 비용을 제약이 가장 적고 분산 상각이 가능한 1단계로 끌어올리고, 기기에서 반드시 일어나야 하는 2·3단계에서는 비용을 낮추는 것을 목표로 한다.

어떻게 동작하나

제안 방법의 핵심은 LoRA 생성 하이퍼네트워크다. 하이퍼네트워크의 입력은 사용자에 대한 컨텍스트 예시들, 즉 질의와 그에 대한 원하는 응답의 쌍이다. 이 예시들을 배치로 병렬 처리할 수도 있고 하나의 연결된 시퀀스로 넣을 수도 있는데, 저자들은 후자가 더 효과적이었다고 밝히고 모든 실험에서 연결 방식만 사용한다. 출력은 LoRA 행렬의 집합이다. 대상 LLM에서 저랭크 적응으로 수정해야 할 각 가중치 행렬마다 A와 B 한 쌍의 저랭크 행렬을 만들어낸다. 즉 입력 쪽은 ICL처럼 컨텍스트를 토큰으로 신경망에 먹이고, 출력 쪽은 PEFT처럼 LoRA 행렬을 산출하는 형태다. 구조는 두 부분으로 나뉜다. 먼저 기기에 이미 있는 동결된 대상 LLM을 그대로 재사용해 임베더의 기반으로 삼는다. 이 LLM에 학습 가능한 임베더 LoRA를 붙여 전용 텍스트 인코더로 바꾸고(LLM2Vec 방식), 사용자 컨텍스트 토큰을 잠재 사용자 공간의 임베딩 벡터로 매핑한다. 임베더 LoRA의 랭크 r은 하이퍼파라미터다. 다음으로 임베딩-행렬 MLP라 부르는 병렬 2층 피드포워드 블록 묶음이 임베딩 벡터를 입력받아 대상 LLM의 특정 층·모듈에 대응하는 A 또는 B LoRA 행렬 하나씩을 출력한다. 이 블록들은 병목 구조여서 중간 벡터 차원이 입력인 임베딩 벡터보다도, 출력인 LoRA 행렬보다도 훨씬 작다. 저자들은 이 중간 벡터를 계수 벡터로, 2층 블록의 위층을 학습된 주성분(아이겐) 저랭크 행렬 집합으로 해석한다. 병목 폭 k가 하이퍼파라미터이며, 그 값을 고르는 것은 저랭크 특이값 분해에서 상위 특이값 몇 개를 남길지 고르는 것과 대략 유사하다고 설명한다. LoRA가 한 번 생성되고 나면 하이퍼네트워크의 추가 파라미터는 기기에서 삭제할 수 있다.

무엇과 다른가

학습은 두 단계다. 먼저 임베더 LoRA 파라미터만 비지도 대조 학습으로 사전학습한다. LLM2Vec의 대조 학습 단계를 그대로 적용한 것으로, 사용자 컨텍스트에 나타나는 언어적 특성에 따라 서로 다른 사용자가 잠재 공간에서 서로 멀리 떨어진 임베딩 벡터를 갖도록 만든다. 그다음 임베더 LoRA와 임베딩-행렬 MLP를 포함한 모든 학습 가능 파라미터를 종단간 손실로 학습한다. 학습 각 스텝에서 사용자 집단을 샘플링하고, 사용자마다 서로 겹치지 않는 두 배치를 만든다. 하나는 하이퍼네트워크의 입력이 될 컨텍스트 예시 배치이고, 다른 하나는 대상 LLM의 입력과 원하는 출력으로 쓸 배치다. 전자로 LoRA를 생성해 대상 LLM에 붙인 뒤, 후자에 대한 토큰 교차엔트로피 손실을 계산하고 하이퍼네트워크의 학습 파라미터에 대해 최소화한다. 대상 LLM과 하이퍼네트워크 두 신경망을 모두 통과하는 역전파가 필요해 연산량은 크지만, 이 단계는 기기 밖에서 전체 사용자 집단에 대해 한 번만 수행된다. 저자들은 여기에 더해 ICL을 교사로 삼아 하이퍼네트워크로 증류하는 것이 종단간 학습에서 매우 효과적이었다고 밝힌다. 고정된 컨텍스트 대신 매번 서로 다른 사용자 컨텍스트를 교사 ICL과 학생 하이퍼네트워크에 보여주는 방식의 컨텍스트 증류다.

어떻게 쓰나

실험은 개인화 연구에서 상대적으로 덜 다뤄진 장문 생성 과제 세 가지에서 이뤄진다. 아마존 리뷰 심층 작성(LongLaMP-3), 레딧 게시물 작성(LongLaMP-4), 학술 논문 제목 작성(LaMP-5)이다. 각 데이터셋은 여러 사용자가 각자 여러 예시를 가진 사용자 분할 구조이며, 학습과 테스트에 서로 다른 사용자 집합을 써서 개인화 능력의 일반화를 본다. 베이스 LLM은 모바일 기기에서 쓰이는 규모에 해당하는 Gemma3-1B-IT와 Gemma1-2B-IT 두 가지를 쓰고, LoRA 랭크도 두 가지를 시험한다. 공정한 비교를 위해 개인화 추론 시점의 LoRA 랭크를 동일하게 맞추며, 예를 들어 비개인화 베이스라인 LoRA 랭크 4, ICL용으로 학습한 LoRA 랭크 4, PEFT와 하이퍼네트워크가 만드는 사용자별 LoRA도 랭크 4로 비교한다. 실험에서는 대상 LLM의 어텐션 관련 행렬에만 저랭크 적응을 생성·적용했는데, 이는 실험 구현상의 선택일 뿐이며 하이퍼네트워크는 피드포워드 관련 행렬용 LoRA도 동일하게 생성할 수 있다고 밝힌다. 비교 대상은 전체 사용자에 하나의 공통 LoRA를 학습하는 비개인화 베이스라인, 사용자별 ICL 접두사를 붙여 학습한 단일 공통 LoRA(MetaICL 계열이되 LoRA만 파인튜닝), 사용자마다 경사하강법으로 개별 LoRA를 학습하는 PEFT(공통 LoRA에서 초기화하고 Adam 사용, 학습률은 하이퍼파라미터 탐색으로 공통 선택), 그리고 하이퍼네트워크다. 평가는 ROUGE 점수를 쓰고, 디코딩 온도 T를 스윕해 최적값을 찾은 결과 LongLaMP-3과 LongLaMP-4에서는 T=1.0, LaMP-5에서는 T=0.0(그리디)이 가장 좋았다. T가 0보다 클 때는 테스트 질의마다 10개의 예측을 생성해 평균 ROUGE를 계산해 분산을 줄였다. 개인화 품질은 사용자 평균 ROUGE(개선의 깊이)와 단일 공통 LoRA 대비 ROUGE가 개선된 사용자 비율(개선의 폭) 두 가지로 본다. 결과는 하이퍼네트워크가 생성한 LoRA가 모든 시나리오에서 ROUGE-1 기준 최고이거나 거의 최고였다. LongLaMP-3과 LongLaMP-4에서는 거의 모든 구성에서 하이퍼네트워크가 사용자 4분의 3 이상의 ROUGE-1 점수를 개선했다. LaMP-5는 하이퍼네트워크뿐 아니라 다른 모든 방법에도 개인화가 어려운 데이터셋이었다. 흥미로운 점으로, ICL이 교차엔트로피는 가장 잘 낮췄지만 ROUGE-1은 가장 나쁘게 나왔다. 저자들은 ICL의 예측 분포가 더 뾰족한 탓일 수 있다고 보지만, 온도를 1.0 이상으로 올려도 ROUGE-1은 더 오르지 않았다고 밝힌다. 다만 본문에 제공된 부분에는 구체적인 ROUGE 수치 표가 실려 있지 않고, 세부 결과는 부록 D의 표 4·5·6에 제시되어 있다.

전제와 한계

개발자 관점에서 이 논문의 실무적 의미는 명확하다. 온디바이스 개인화를 기기 위 경사하강법 없이, 순전파만으로 수행할 수 있는 경로를 제시한다. 개인 LoRA를 만드는 2단계는 신경망 순전파만 필요하고, 3단계 추론은 입력 시퀀스를 늘리지 않으므로 ICL처럼 지연이 커지지 않는다. 저장 공간 측면에서도 하이퍼네트워크가 대상 LLM의 가중치 일부를 그대로 재사용하기 때문에 추가 부담이 작고, LoRA 생성이 끝나면 하이퍼네트워크 파라미터를 기기에서 지울 수 있다. Android AICore 같은 모바일 생성 AI 플랫폼에서 기기에 올라가는 베이스 LLM이 인스트럭션 튜닝된 디코더 전용 모델이고 LoRA가 지원되는 적응 방식이라는 점도 이 설계와 맞물린다. 1단계 학습은 기기 밖에서 신뢰 실행 환경 기반 연합 학습으로 수행하는 것을 전제로 하며, 저자들은 이것이 생산 환경에서 실현 가능하다고 본다. 도입을 검토한다면 개인화 대상이 장기 페르소나 특성이라는 점을 먼저 확인해야 한다. 논문은 즉시적·질의 관련 개인화(검색 증강 생성 계열)에는 하이퍼네트워크가 적합하다고 주장하지 않으며, 오히려 장기 개인화를 하이퍼네트워크로 처리해 입력 시퀀스 용량을 질의 관련 개인화를 위해 남겨두는 것을 권한다.

저자들이 명시한 한계와 전제도 분명하다. 하이퍼네트워크는 ICL과 마찬가지로 어느 정도 군중의 지혜에 의존한다. 테스트 시점의 사용자가 학습 시점에 기여한 사용자들과 유사하거나 그들 사이의 보간에 해당한다는 가정이다. 기존 관행에 반하는, 분포 밖 사용자는 하이퍼네트워크 기반 개인화로도 충분한 혜택을 받기 어렵고, 이런 사용자에게는 파라미터 파인튜닝 기반 접근만이 유의미한 품질 향상을 기대할 수 있다고 인정한다. 따라서 생산 환경에서는 분포 밖 사용자가 생길 가능성을 줄이기 위해 실제 사용자 데이터를 1단계 학습에 포함해야 하며, 여기에는 프라이버시 보호가 따라야 한다. 연합 학습에 차분 프라이버시를 결합하면 학습 참여자를 익명화할 수 있지만, 유용한 품질과 의미 있는 프라이버시 사이에서 균형을 잡는 하이퍼파라미터 선택 같은 복잡성이 추가된다. 차분 프라이버시 하에서의 하이퍼네트워크 학습은 생산 준비를 위한 다음 단계의 연구 과제로 남겨져 있다. 또한 저자들은 어떤 유형의 개인화 시나리오에서 특정 사용자에게 하이퍼네트워크가 나쁜 성능을 내는지에 대한 추가 연구가 필요하다고 밝힌다.