AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
LSP가 압축으로 제거할 부분공간을 네트워크 출력 기준으로 학습한다
저차원 분해 압축은 계층별 국소 기준으로 제거할 부분공간을 골라 고압축에서 성능이 무너졌다. LSP는 사전학습 가중치를 고정한 채 모든 직교 투영자를 출력 KL 기준으로 공동 학습해 Llama-2-7B를 70% 압축하고도 10.9 퍼플렉시티를 낸다.
LLM 에이전트 반복 자기증류의 성능 붕괴를 ReSAIL이 막는다
반복 자기증류로 LLM 에이전트를 개선할 때 사이클이 거듭될수록 성능이 붕괴하는 문제를, PI 민감도가 높은 스텝만 골라 증류하고 특권 뷰 행동을 보존하는 ReSAIL로 완화한다. ALFWorld와 TextCraft에서 최종 사이클 성공률이 평균 22.5%p 올랐다.
ReGain이 합성 이미지 개인화에서 무너진 피사체 충실도를 되살린다
합성 이미지로 DreamBooth 개인화를 하면 CFG의 guidance 항이 각도 때문에 부풀어 색이 과포화되고 고주파 디테일이 과해진다. ReGain은 공개 베이스 모델을 기준으로 대역·스텝별 이득을 재서 샘플링 시점에 guidance를 낮춰 충실도 격차의 절반 이상을 되돌린다.
SparseEngine이 희소 추론 방법 15종을 하나의 수명주기 계약으로 묶는다
SparseEngine은 희소 어텐션 방법마다 제각각인 KV 캐시 표현과 워크플로를 공통 수명주기 훅으로 통합한 추론 엔진이다. vLLM 대비 10배 이상의 디코드 처리량과 에이전트 벤치마크 2배 이상 속도를 내면서 원래 방법의 품질을 유지한다고 주장한다.
재사용 스킬로 로봇 정책을 스스로 개선하는 스킬 스페이스 슈팅
실패 감지기와 파운데이션 모델 판정으로 재사용 스킬을 로봇 정책의 실패 지점에 실행해 교정 데이터를 모으고, 성공한 구간만 DAgger 방식으로 학습해 정책을 반복 개선한다. 실제 4개 과제에서 초기 성공률 0%였던 정책도 사람 시연 추가 없이 성능이 올랐다.
SimpleICL은 로봇 인컨텍스트 학습의 프롬프트 모호성을 문제 정의로 해소한다
사람의 시연 영상만으로 로봇이 새 과제를 수행하는 인컨텍스트 학습에서, 무엇을 배우고 무엇에 흔들리지 않아야 하는지를 먼저 정의한 뒤 최소한의 구조와 저비용 데이터 수집법으로 구현한 SimpleICL을 제안한다.
픽셀 디퓨전에 GAN 후학습을 더해 고주파 디테일을 되살린다
픽셀 디퓨전 모델이 체계적으로 부족하게 만드는 고주파 성분을, 기존 학습 목표에 적대적 손실을 얹는 후학습으로 보정한다. DeCo와 PixelGen에서 FID·recall·DPG 점수를 동시에 개선했고, 잠재 디퓨전에서는 같은 효과가 나타나지 않았다.
선형 어텐션 반복 상태를 6비트로 압축해 서빙 메모리를 68.7% 줄인다
선형 어텐션의 고정 크기 반복 상태를 낮은 비트로 양자화하면 오차가 갱신을 거치며 누적돼 정확도가 무너진다. STEPQuant는 오차의 수명과 위치를 함께 반영해 6비트에서 FP32 상태에 근접한 정확도를 유지하고 서빙 메모리를 최대 68.7% 줄인다.
LeapQuant가 선형 어텐션 재귀 상태를 8비트로 손실 없이 양자화한다
선형 어텐션의 재귀 상태를 8비트로 양자화해도 FP32급 정확도를 유지하는 학습 불필요 기법 LeapQuant가 제안됐다. 16토큰 윈도 단위 양자화와 고정밀 보상 토큰으로 누적 오차와 이상치를 줄여 커널 2.05~3.70배, 종단 간 1.47배 속도를 낸다.
Rho는 로봇별 중간학습으로 VLA 과제 적응 데이터를 절반으로 줄인다
마이크로소프트가 양팔 로봇 조작용 5B 파라미터 오픈웨이트 VLA 패밀리 Rho를 공개했다. 로봇별 중간학습으로 과제 적응에 필요한 파인튜닝 데이터를 절반으로 줄이고, 15개 교정 에피소드만으로 배포 후 온라인 적응이 가능하다고 주장한다.
네 단계로 25단계 교사를 앞서는 픽셀 공간 확산 증류 DMA²
픽셀 공간 확산 모델의 소수 단계 증류를 위해 DMD의 교사 매칭 대역과 실제 데이터 가이던스를 다시 설계한 DMA²를 제안한다. 4단계 학생이 25단계 교사를 일곱 개 지표 모두에서 앞서고 스텝 시간도 2.5배 줄였다.
장시간 영상 기억을 물리적 개체의 전기로 재구성한다
장시간 영상 질의응답에서 같은 물체가 여러 사건에 걸쳐 등장할 때 물리적 동일성을 시각 근거로 묶어 개체 전기로 기억하는 GEB 프레임워크를 제안한다. EgoLifeQA에서 72.0%로 기존 최고 메모리 프레임워크를 4.4%p 앞선다.
비디오 생성 증류 LoRA를 한 번만 학습해 54개 하위 모델에 재사용한다
비디오 확산 모델마다 반복되던 증류 비용을 없애기 위해, 기반 모델에서 CFG·few-step·장문맥 보정 능력을 LoRA로 한 번만 학습해 호환되는 하위 모델에 학습 없이 붙이는 LongLive-Plug를 제안한다. 3개 백본 패밀리, 54개 하위 모델에서 검증했고 SCOPE FVD를 805.5에서 478.7로 낮췄다.
FracGen이 단일 이미지에서 물체의 인장 파괴 영상을 생성한다
FracGen은 단일 이미지와 힘·재료 조건만으로 물체가 늘어나 찢어지는 영상을 생성하는 모델이다. MPM 시뮬레이터에 손상 모델을 얹은 FracSim으로 물리 맵을 함께 학습해 기존 영상 생성 베이스라인을 물리·시각 지표 모두에서 앞선다.
LIFT가 사전학습에 잠재 상태 피드백을 넣어 추론 성능을 높인다
LIFT는 다음 토큰과 함께 교사 모델의 출력 분포에서 뽑은 잠재 상태를 예측하도록 Transformer를 확장해, 사전학습 단계에서 깊은 층 정보를 얕은 층으로 되먹인다. 135M~1B 규모 실험에서 토큰과 연산을 맞춘 기준선을 앞섰고 절차적 과제에서 가장 큰 이득을 냈다.
에이전트 제어를 별도 추론으로 분리하면 긴 작업 성능이 오른다
긴 작업을 수행하는 AI 에이전트에서 '다음에 무엇을 할지'를 정하는 제어 자체를 별도 추론 과정으로 분리한 메타 추론 하네스를 제안한다. ProgramBench에서 GPT-5.5 기준 71.5%로 Codex의 58.0%를 앞섰고, 12개 모델·벤치마크 조합 전부에서 직접 제어 베이스라인을 이겼다.
에이전트 하네스를 설계하는 메타스킬로 고정된 모델의 성능을 올린다
Builder가 Target의 가중치를 고정한 채 실행 환경을 설계하는 메타스킬을 학습해, 전체 뱅크 사용 시 매크로 평균 65.31%로 스킬 없는 조건보다 8.95%포인트 높은 성능을 냈다. 같은 뱅크를 Target에 직접 주는 대신 Builder가 하네스로 구현할 때 이득이 더 컸다.
작은 어드바이저가 실행을 바꾸는 교정만 골라 학습해 프런티어 LLM을 개선한다
고정된 프런티어 LLM을 자연어 조언으로 조종하는 소형 어드바이저를, 실행을 실제로 바꾸는 교정만 선택해 자기증류로 학습하는 AdviSD를 제안한다. BFCL-v3에서 GRPO 대비 4.2~6.4%p, EnvScaler에서 3.9~5.1점 높은 점수를 냈다.
SplitMoE가 영상 확산 모델의 균일성 함정을 깬다
영상 확산 모델에 LLM식 MoE를 그대로 적용하면 시공간적으로 중복된 토큰이 의미 단위로 뭉치지 못해 구조 왜곡과 시간적 떨림이 생긴다. SplitMoE는 전문가 풀을 의미·일반 두 갈래로 나누고 VAE 프로토타입으로 라우팅을 유도해 같은 활성 파라미터에서 수렴 속도와 생성 품질을 개선한다.
LongHarness가 장문맥 하네스의 정확도와 비용을 함께 시험한다
LongHarness는 장문맥 언어모델 하네스의 정확도와 계산 비용을 함께 측정하는 4개 과제 벤치마크다. 최고 조합도 매크로 평균 68%에 그쳤고, 같은 모델이 하네스에 따라 12배 이상 다른 비용을 쓰는 사실을 드러냈다.
DeGG-Flow가 다중 에이전트 생성의 결합 제약을 분산 유도로 보장한다
다중 에이전트 생성 모델이 학습 이후 생긴 하드 제약을 재학습 없이 만족하도록, 에이전트별로 분리된 유도 입력을 생성 과정에 더하는 DeGG-Flow를 제안한다. MuJoCo의 다중 로봇 협업과 다중 물체 장면 생성에서 학습에 없던 팀 크기를 포함해 250회 전부 요구사항을 만족했다.
WUSH-KV가 2비트 KV 캐시 양자화 오차를 줄인다
긴 문맥 추론의 병목인 KV 캐시를 저비트로 양자화할 때, 키와 값에 각각 데이터 적응형 WUSH 변환을 적용해 오차를 줄이는 방법을 제안한다. Qwen3-8B에서 2비트 모듈 출력 오차를 0.208까지 낮추고 WikiText-2 퍼플렉시티 10.51을 기록했다.
확률적 월드 모델로 비전 기반 신경 피드백 시스템을 검증한다
비전 기반 신경 피드백 시스템 검증을 위해 물리적 의미를 가진 잠재변수로 구동되는 확률적 월드 모델을 지각 서로게이트로 제안한다. GAN보다 130배 적은 파라미터로 더 충실한 영상을 만들고, 반증·전방·후방·기호 분석을 결합한 절차로 그레이스케일 비상제동 벤치마크의 상태 공간 전체를 해결한다.
VideoLoop가 긴 영상 에이전트의 기억 비대화를 되쓰기로 막는다
긴 영상 이해 에이전트가 겪는 'semantic thrashing'을 구조적으로 분석하고, 무한 파일시스템과 32K 토큰 작업기억을 분리한 이중 루프 VideoLoop를 제안한다. Gemini 3.1 Pro 기준 VideoMME(long) 88.3%를 기록했다.
같은 노이즈 단계로 히스토리를 정렬해 스트리밍 영상 생성을 안정화한다
자기회귀 영상 확산 모델의 히스토리 K/V를 현재 블록과 같은 노이즈 단계에서 만들어 미분 가능하게 유지하는 Self-Aligned Forcing을 제안한다. 긴 롤아웃의 오차 누적을 줄이면서 학습 속도를 SGF 대비 최대 1.8배 높이고 4GPU에서 49.1 FPS를 달성한다.
MoE 라우팅 확률로 VLM의 없는 객체 질문을 생성 전에 걸러낸다
MoE VLM의 라우터 확률만으로 이미지에 없는 객체를 생성 전에 탐지하고, 트리거된 입력에만 검토 프롬프트를 적용해 정답률을 최대 22.25%p 끌어올린다. 모델 가중치를 건드리지 않고 Qwen3-VL과 Gemma 양쪽에서 검증된 선택적 재그라운딩 기법이다.
국소 혼합층이 전역 NoPE 어텐션에 상대 위치를 심는다
슬라이딩 윈도우 어텐션 같은 국소 혼합층이 잔차 스트림에 최근성 편향을 만들고, 이것이 전역 NoPE 어텐션 로짓에 선택되어 암묵적 상대 위치 인코딩으로 작동한다는 이론·실증 분석. 120M·350M 하이브리드 모델에서 학습 중 편향이 강화됨을 확인했다.
LLM 에이전트가 선언한 계획을 실행하도록 강제하면 성공률이 오른다
LLM 에이전트가 선언한 계획 구조를 실제 실행에서 유지한 궤적은 22~45%에 그쳤다. 선언한 계획 모드를 전용 실행기로 라우팅하면 ALFWorld 성공률이 0.48에서 0.92로 오르지만, 과제별 모드 선택은 여전히 미해결로 남는다.
검증 가능한 초등 수학 문제에서 정답과 사고 흔적은 어긋난다
합성 초등 수학 벤치마크 iGSM에서 정답과 사고 흔적의 유효성이 분포 밖에서 어긋난다는 것을 보인 연구다. 가장 어려운 문제에서는 정답의 31.6%가 잘못된 흔적을 동반했고, 흔적을 뒤섞거나 다른 문제 것으로 바꿔 학습해도 정답률은 크게 유지됐다.
실패만 나온 롤아웃 그룹을 이웃 모델 궤적으로 바꾸는 GRAFT
GRPO 같은 RLVR은 한 프롬프트의 롤아웃이 전부 실패하면 보상 신호가 0이 되어 학습하지 못한다. GRAFT는 이종 모델이 서로 다른 프롬프트에서 성공한다는 상보성에 착안해, 실패 그룹을 상대 모델의 궤적으로 교체하고 호환성 가중치와 토큰 단위 클리핑으로 오프폴리시 불일치를 통제한다.