AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
트랜스포머 잔차 표현은 깊어지며 자기 끝점에 특화된다
중간 잔차 상태가 자기 최종 표현을 다른 문맥의 최종 표현들과 얼마나 구분하는지 측정한 연구다. 6개 모델에서 초기부터 평균적 선호는 나타나지만 개별 경쟁자는 많고, 깊어지며 경쟁 집합이 줄어든다.
LoopVL이 순환 트랜스포머를 비전언어 모델로 확장한다
LoopVL은 공유 파라미터를 반복 호출하는 순환 트랜스포머를 비전언어 모델로 확장해 1B 규모 백본으로 더 큰 밀집 모델에 맞먹는 멀티모달 성능을 낸다. 루프마다 시각 토큰의 어텐션이 재배분되는 현상도 관찰한다.
검증된 궤적에만 증류하는 OASIS가 자기증류의 스케일 한계를 넘는다
온폴리시 자기증류(OPSD)는 모델이 커질수록 효과가 사라진다. OASIS는 정답이 검증된 궤적에만 감독을 집중하고 참조 해설 대신 자기 시도를 교사 문맥으로 써서 Qwen3 8B에서 OPSD를 3.05점 앞선다.
커뮤니티 스킬을 검증 가능한 훈련 환경으로 바꾸는 SkillGym
커뮤니티 스킬 1만1천여 개에서 검증 가능한 과제 6.8k개와 성공 궤적 19k개를 자동 생성해 스킬 사용 에이전트를 학습시키는 SkillGym이 공개됐다. 2B~122B 모델 6종에서 평균 13.8점 향상을 냈고, 스킬 열람률은 28%에서 96%로 올랐다.
MILO가 하네스 설계와 탐색 전략을 함께 진화시켜 에이전트 성능을 끌어올린다
에이전트 성능을 좌우하는 하네스 설계를 LLM 진화 탐색으로 자동화하는 MILO를 소개한다. 섬 기반 계보 메모리와 오케스트레이터로 탐색 전략까지 함께 진화시켜 Terminal-Bench 2.1 등 세 벤치마크에서 최고 성능을 냈다.
Tacit-TTS가 마스크 예측으로 참조 전사 없는 음성 복제를 10배 빠르게 한다
Tacit-TTS는 IndexTTS2를 교사로 증류해 자기회귀 텍스트→시맨틱 디코딩을 마스크 예측으로 바꾸고, 참조 전사 없이 10배 이상 빠른 제로샷 음성 복제를 달성한다. 학습 불필요 길이 추정과 reflow 증류로 T2S 지연을 26.5배 줄였다.
PixelUMM이 인코더 없이 이미지와 영상 이해·생성을 픽셀 공간에서 통합한다
PixelUMM은 ViT 인코더와 VAE 없이 원시 픽셀 패치와 튜블릿을 1층 선형 투영만으로 공유 백본에 연결해 이미지·영상 이해와 생성을 한 모델에서 처리한다. 16×16 이미지 패치, 4×16×16 영상 튜블릿, Mixture-of-Transformers, 픽셀 공간 플로 매칭을 결합했다.
공개 스킬 수백만 개를 검색해 에이전트 스킬을 최적화하는 RASO
에이전트 스킬 최적화에 외부 스킬 코퍼스 검색을 결합한 RASO를 제안한다. 롤아웃 없이 초기 스킬을 만드는 RASI와 실행 피드백으로 스킬을 고치는 RASU가 4개 벤치마크에서 기존 기법을 앞선다.
자연어 설명만으로 LLM용 스킬을 최적화하는 Prompt2Skill
자연어 과제 설명만으로 LLM용 스킬을 자동 구축·최적화하는 Prompt2Skill을 소개한다. 데이터 검색·합성과 반성적 편집을 결합해 4개 도메인 5개 모델에서 평균 10.8%p 개선을 보고했다.
FlexRouter가 모델 상관관계까지 고려해 LLM 라우팅 중복을 줄인다
LLM 라우팅에서 모델을 독립적으로 점수화해 top-k를 고르면 실패 모드가 겹치는 중복 모델이 뽑힌다. FlexRouter는 DPP로 모델 간 상관관계를 모델링해 정답 커버리지를 최대화하고, 쿼리마다 부분집합 크기를 스스로 정한다.
LLM 라우팅을 재학습 없이 새 환경으로 옮기는 RouteFM
LLM 라우팅을 환경마다 다시 학습하는 대신, 이질적 환경에서 한 번 사전학습해 새 도메인과 후보 풀에 그대로 옮기는 RouteFM을 제안한다. MMR-Bench에서 후보당 8개 관측만으로 최강 베이스라인을 2.23 품질점 앞선다.
HeteroFold가 이종 LLM 간 KV 캐시를 프리필 없이 전달한다
이종 모델로 구성된 멀티에이전트 시스템에서 수신 모델의 프리필을 없애고 송신 측 KV 캐시를 그대로 재사용하는 HeteroFold를 제안한다. 토크나이저 경계 정렬과 통계 기반 매핑, 수신자 행동 보정으로 32K 문맥에서 기존 프리필 대비 10.7배 빠르다.
작은 모델의 추론을 파인튜닝 없이 병렬 템퍼링 샘플링으로 끌어올린다
강화학습 후학습 없이 추론 성능을 높이는 추론 시점 샘플링 기법 PPT를 제안한다. 샤프닝 수준이 다른 복제 체인을 병렬로 돌리고 스왑으로 연결해, Qwen3 계열 소형 모델이 15개 모델-벤치마크 조합에서 최고 또는 공동 최고 정확도를 기록했다.
질문 상태 릴레이 교정으로 오디오비주얼 LLM의 출처 혼동 환각을 줄인다
오디오비주얼 LLM이 질문이 요구하지 않은 모달리티 단서에 끌려 답하는 출처 혼동 환각을 질문 토큰 상태의 릴레이 문제로 규명하고, 학습 없이 교정하는 SECRET을 제안한다. CMM과 AVHBench에서 베이스 모델 대비 최대 18.0%p, 7.1%p 향상을 보고했다.
다중 보상 GRPO의 정규화를 상관계수로 바꿔 큰 보상 독점을 막는다
GRPO의 다중 보상 정규화가 공분산 합에 의존해 스케일 큰 보상에 지배되는 문제를 분석하고, 분모를 피어슨 상관계수로 교체한 CorrGRPO를 제안한다. 코드 생성·도구 호출·에이전트 보안에서 0.5B~8B 모델로 GRPO 대비 개선을 보고했다.
NEEDLE가 가중치 직교화로 LLM 백도어를 지우고 거부 능력을 보존한다
LLM에 심긴 백도어를 재학습 없이 가중치 직교화로 제거하는 NEEDLE을 소개한다. 백도어 방향만 지우고 거부 표현은 보존해 Gemma에서 평균 공격 성공률을 99.5%에서 1.67%로 낮추고 코드 인젝션 공격은 0%로 막았다.
작은 LoRA 하나가 트랜스포머의 참조 추적 깊이를 수십 배로 늘린다
사전학습 트랜스포머는 문맥 안 참조 사슬을 2줄 남짓만 따라간다. 한 중간 레이어에 rank-8 LoRA를 붙이면 가중치를 얼려둔 채 Qwen3-8B가 24줄 사슬 정확도를 15.5%에서 99%로 올리고, 루프 모델은 160줄까지 도달한다.
MemFold가 압축 메모리를 독자 행동 기준으로 학습한다
MemFold는 고정 예산 잠재 메모리를 텍스트 복원이 아니라 독자가 실제로 생성한 응답 위에서 최적화한다. GRPO 보상과 텍스트 메모리 교사의 신뢰도 게이트 온폴리시 증류를 결합해 PersonaMem-128K 등에서 최고 정확도를 낸다.
3차원 텐서 상태로 선형 어텐션의 기억 용량을 늘린다
선형 어텐션의 행렬 상태를 키·두 번째 키·값의 3중 외적으로 만든 3차원 텐서로 확장해, 파라미터를 1.2%만 늘리고 기억 용량을 E배로 키우는 Triadic Linear Attention을 제안한다. 400M·1.3B 실험에서 Gated DeltaNet의 긴 문맥 퍼플렉시티와 회수 성능을 개선하고 64k 문맥에서 Transformer보다 5.1배 빠르다.
온폴리시 업데이트 방향만 맞춰도 SFT 일반화가 살아난다
온폴리시 학습이 만들어낸 파라미터 업데이트 방향을 SFT에 강제로 적용하면 롤아웃 없이도 GRPO에 필적하는 일반화를 얻는다. OPSFT는 50스텝 GRPO로 방향만 식별한 뒤 100스텝 SFT로 학습해 시간을 절반으로 줄인다.
범용 VLM 하나로 로봇 조작을 제로샷으로 수행하는 MotorMind
특수 학습된 VLA나 외부 도구 없이 범용 VLM만으로 로봇을 조작하는 MotorMind를 제안한다. 중간 수준 행동 표현과 비동기 실행 하네스로 LIBERO-PRO 제로샷 66.7%, 실제 xArm6에서 95% 성공률을 보고한다.
롤아웃 청크를 독립 채점해 장기 영상 생성의 품질 붕괴를 막는다
자동회귀 영상 확산 모델의 오류 누적 문제를 청크 단위 독립 채점으로 분리한 Rollout-Marginal Distillation을 제안한다. 60초 롤아웃에서 VBench-Long 총점 81.26으로 기존 베이스라인 70.94를 크게 앞선다.
WEFT가 도구 사용 후학습을 에이전트 상호작용 시스템 전체로 확장한다
도구 사용 후학습을 실행 환경 합성에만 맡기지 않고 환경·과제·하네스·평가자를 함께 진화시키는 WEFT를 제안한다. WEFT-14B는 Agent-World-14B를 BFCL V4, τ²-Bench, Claw-Eval에서 각각 6.41, 2.23, 12.27%p 앞선다.
선제적 LLM 에이전트를 과업·시간·신뢰로 평가하는 Proactivity-Gym
요청 전에 먼저 움직이는 선제적 LLM 에이전트를 과업 능력·시간 배분·신뢰의 3축으로 설계하고 평가하는 프레임워크를 제안한다. 23개 모델-하네스 조합 실험과 30인 사용자 연구로 현재 에이전트의 뚜렷한 결손을 보인다.
VLA가 로봇 실행 오차를 배포 중 스스로 보상하도록 적응시킨다
VLA 정책이 로봇의 마모나 페이로드 변화로 명령과 다른 동작을 실행할 때 생기는 실패를, 배포 중 고유수용감각 잔차만으로 스스로 보상하도록 적응시키는 방법과 이를 검증하는 RoboStress 벤치마크를 제안한다. 실제 Piper 암 두 대에서 평균 성공률을 30%포인트 이상 올렸다.
Salt++가 인과 문맥 정렬 후처리로 4스텝 스트리밍 영상 생성을 구현한다
Salt++는 Causal Self-Flow와 문맥 정렬 AR DMD 두 단계 후처리로 4스텝 스트리밍 오디오-비디오 생성을 만든다. 480p에서 OmniForcing 대비 시각 품질 57.1%, 모션 품질 44.5%를 개선하고 1664×960까지 확장한다.
실제 긴 영상으로 자기회귀 비디오 생성의 장기 동역학을 유지하는 LongTake
자기회귀 비디오 확산 모델이 긴 롤아웃에서 정지하거나 화질이 무너지는 문제를, 실제 긴 영상으로 후반 프레임까지 직접 감독하는 Long-Horizon Teacher Forcing으로 해결한다. 별도 few-step 초기화 없이 DMD로 넘어가는 2단계 파이프라인과 Hybrid DMD로 30초·60초 롤아웃에서 동적 정도와 미학 품질의 파레토 프론트를 달성했다.
PreviewDiff가 디노이징 중간 잠재를 분기 검색해 프롬프트 충실도를 높인다
디퓨전 샘플링 도중 중간 잠재를 미리 디코딩해 멀티모달 심판의 비평을 받고, 그 피드백으로 프롬프트 수정과 잠재 분기를 만들어 검색한다. Best-of-N처럼 완성된 결과만 고르는 대신 실패하기 전에 궤적을 교정하는 것이 핵심이다.
한 번의 학습으로 20개 깊이 모두를 서빙하는 Telescopic Language Model
중첩 구조 트랜스포머를 무작위 프리픽스 감독과 전체 앵커로 학습해 한 번의 런으로 모든 깊이에서 유효한 언어 모델을 얻는 TLM 논문. 고정 exit 방식보다 품질-예산 곡선 면적을 43~44% 줄이고 GPU 비용도 약 12% 낮췄다.
DMD 증류의 critic 오차를 잔차 투영으로 걸러내는 PDMD
비디오 확산 모델의 소수 스텝 증류에서 DMD가 겪는 과포화와 아티팩트를 critic 오차 누적으로 진단하고, student–critic 엔드포인트 잔차에 평행한 성분을 제거하는 한 줄짜리 수정 PDMD를 제안한다. Wan2.1 4 NFE에서 VBench 83.73, MiniMax-H3에서 VideoGen-Eval 83.17을 기록했다.