Infinite-Parameter LLM은 프롬프트 대신 가중치에 기억한다

Hacker News23일 전조회 4

배포된 언어모델이 사용자와 대화하면서 얻는 정보를 어디에 저장할 것인가. 지금까지의 답은 프롬프트였다. arXiv에 공개된 논문 「Infinite-Parameter LLM: Generating and Adapting Weights from Live Data」는 그 답을 가중치로 바꾸자고 제안한다. 학습이 끝난 모델의 가중치를 고정된 자산으로 두는 대신, 실행 중에 들어오는 데이터로부터 가중치를 그때그때 생성해 쓰는 구조다. 저자는 Jinli Hu, Ross M. Clarke, Yichuan Zhang, José Miguel Hernández-Lobato이며 arXiv:2609.18842(cs.AI)로 올라왔다.

핵심 착상은 MoE(Mixture-of-Experts)에서 가져왔다. MoE는 거대한 파라미터 뱅크를 저장해 두고 토큰마다 일부만 활성화한다. 논문은 여기서 한 발 더 나아가 파라미터를 저장하지 않고 생성한다. 작은 하이퍼네트워크가 런타임에 주어진 데이터를 받아, 공유 베이스 네트워크의 피드포워드 가중치를 저랭크 변조(low-rank modulation) 형태로 만들어낸다. 고정된 뱅크에서 꺼내 쓰는 게 아니라 라이브 데이터에서 컴파일하는 셈이다.

기존 가중치 생성기와의 차이는 갱신 방식에 있다. 앞선 시도들은 컨텍스트를 한 번 읽고 생성된 가중치를 그대로 고정했다. 이 논문은 생성기의 잠재 코드(latent code)에 대한 베이지안 신념을 유지하고 이를 온라인으로 업데이트한다. 세션이 진행되면서 신념이 바뀌고, 유효 가중치도 그 변화에 맞춰 계속 다시 유도된다. 저장 공간은 고정 크기로 유지되지만, 모델이 컴파일할 수 있는 가중치의 가짓수는 사실상 무한하다는 것이 저자들의 주장이다.

배경에는 스케일링 법칙이 있다. 파라미터와 학습 데이터가 늘수록 성능이 오른다는 법칙 위에서 MoE 같은 구조가 성과를 냈다. 다만 그 성과는 정적인 사전학습 데이터 위에 세워진 것이다. 배포된 모델이 마주하는 환경은 다르다. 사용자가 알려주는 사실, 대화 중에 주는 교정 같은 정보는 학습 데이터에 없고 지금 이 상호작용 안에 있다. 가중치가 얼어붙어 있는 모델은 이 데이터를 학습할 수 없다. 그래서 지식과 행동 양식을 프롬프트에 넣고, 검색이나 지시로 매 요청마다 다시 읽은 뒤 요청이 끝나면 버린다.

저자들이 내세우는 이점은 네 가지다. 런타임에 주입되는 지식과 행동을 프롬프트가 아니라 가중치에 담으면 컴퓨팅이 상각(amortized)되고, 컨텍스트 윈도우가 비워지며, 턴이 바뀌어도 유지되고, 인컨텍스트로 쓸 때보다 일반화가 잘 될 수 있다는 것이다. 특히 매 턴 같은 내용을 다시 읽어야 하는 검색 증강 방식과 비교했을 때 비용 구조 자체가 달라진다는 점이 눈에 띈다.

논문은 아키텍처 제안과 함께 평가 프로토콜도 명시한다. 인컨텍스트 학습과 검색을 정면으로 비교 대상에 놓고, 런타임에 주입된 지식과 행동을 가중치로 옮겼을 때의 효과를 측정하는 방식이다.

개발자 입장에서 주목할 지점은 세션 단위 적응이다. 지금은 대화가 길어질수록 컨텍스트를 요약하거나 벡터 DB에서 다시 검색하는 식으로 버틴다. 이 구조가 실현되면 사용자별·세션별로 달라지는 가중치를 고정된 저장 공간 안에서 다룰 수 있게 된다. 파인튜닝이나 LoRA처럼 별도 학습 파이프라인을 돌리지 않고도 대화 중에 들어온 사실과 교정을 반영할 수 있다는 구상인 만큼, 서빙 스택에서 가중치를 어디에 캐시하고 언제 버릴지가 새로운 설계 문제로 떠오른다.

다만 초록 기준으로는 실제 벤치마크 수치나 구현 결과가 제시되지 않았고, 제안과 평가 설계 단계에 머문다. 하이퍼네트워크가 만든 저랭크 변조가 기존 적응 기법과 비교해 어떤 트레이드오프를 갖는지, 온라인 베이지안 업데이트의 연산 오버헤드가 어느 정도인지는 논문 본문을 확인해야 한다.

관련 글