AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
서비스를 조합해 크로스 환경 에이전트를 학습시키는 CompoWorld
CompoWorld는 재사용 가능한 실행 서비스 448개를 조합해 서비스 간 의존성이 있는 크로스 환경 태스크를 자동 생성·검증하고, SFT와 완료 중심 루브릭 보상 RL로 에이전트를 학습시킨다. Qwen3.6-35B-A3B 백본에서 8개 벤치마크 평균 9.17점 향상, AutomationBench 성공률을 10.33%에서 32.33%로 올렸다.
보상 모델을 조건부 확률분포로 다시 정의한 확산 보상 모델(DRM)
보상 모델의 출력을 단일 스칼라 대신 확산 모델로 학습한 조건부 확률분포로 바꾼 DRM을 제안한다. 동일 데이터·백본에서 기존 스칼라·양자화 헤드를 앞서고, 불확실성 기반 선택과 RLHF 정책 성능까지 개선한다.
장기 호라이즌 에이전트용 AlignOPSD는 타임스탬프가 아니라 결정에 정렬한다.
장기 호라이즌 에이전트의 온폴리시 자기증류에서 특권 지도가 학생의 실제 결정과 어긋나는 Decision–Timestamp Mismatch를 규명하고, 형제 롤아웃 간 기능적 대응을 먼저 정렬한 뒤 가변 길이 결정 스팬에 결과 기반 크레딧을 배분하는 AlignOPSD를 제안한다. Qwen2.5-3B/7B로 ALFWorld·WebShop·Search-QA에서 GRPO 대비 5.5~8.7% 향상을 보고했다.
국소·전역 재구성을 QA로 배우고 공간 CoT로 추론하는 2단계 VLM 훈련법
다중 뷰 공간 추론을 위해 국소 포인트와 전역 객체 중심 재구성을 텍스트 QA로 사전학습하고, 신뢰도 평가와 시각 보정을 포함한 공간 CoT로 미세조정하는 2단계 프레임워크 SpatialSpeak을 제안한다. ReVSI 62.8점으로 비교 최강 베이스라인을 8.7점 앞선다.
EAPO가 성공과 실패에 엔트로피를 비대칭으로 적용해 LLM 탐색을 넓힌다
검증 가능한 보상 기반 강화학습에서 정책 엔트로피를 이용해 토큰별 기여도를 재분배하는 EAPO를 제안한다. 성공 응답의 불확실한 결정은 더 강하게 강화하고, 실패 응답의 확신에 찬 결정은 더 강하게 교정해 수학 추론 벤치마크 전반에서 최고 성능을 냈다.
공개 문서를 교란해 문맥 학습 능력을 키우는 합성 데이터 파이프라인
공개 문서를 고유명사와 숫자 수준에서 교란해 암기를 차단하고, 문서 없이는 풀 수 없는 질문만 걸러 장문맥 학습 데이터를 자동 생성한다. 35B 학생 모델이 CL-bench에서 13.7%에서 24.6%까지 오르며 조 단위 파라미터 모델과 비슷해진다.
Skill2Env가 스킬을 실행 환경으로 합성해 에이전트를 학습시킨다
스킬 문서에서 출발해 에이전트의 능력 요구를 난이도 패턴과 태스크 블루프린트로 구체화하고 실행 환경과 루브릭 평가기를 함께 합성하는 Skill2Env를 제안한다. 2,963개 과제에서 뽑은 1.5K 궤적으로 미세조정한 Qwen3.6-35B-A3B가 7개 에이전트 벤치마크 평균을 36.6에서 45.0으로 올렸다.
QwenGyre가 xLong 에이전트 RL의 GPU 유휴와 궤적 중복을 줄인다
QwenGyre는 수 시간·수백 번 상호작용·약 100만 토큰에 이르는 xLong 에이전트 롤아웃에 온라인 RL을 적용할 때 생기는 GPU 유휴와 궤적 중복을 탄성 스케줄링과 궤적 처리로 줄인다. 2.4T 모델에서 NL2RepoBench 통과율을 52.5%에서 58.5%로 올리고 최대 1.85배 속도를 냈다.
화자 검증 EER 대신 임베딩 기하학으로 음성 유사도를 평가해야 한다
화자 검증 모델의 EER이 낮다고 사람이 느끼는 음성 유사도와 잘 맞는 것은 아니라는 체계적 분석이다. 학습 목적함수가 좌우하는 임베딩의 유효 차원을 낮추면 사람 지각과의 정렬이 0.08에서 0.74까지 올라간다.
DiT 잔차 연결을 단계 대응 검색 경로로 바꾸면 학습이 빨라진다
Diffusion Transformer의 균일한 잔차 스트림을 미분 가능한 단계 대응 검색 경로로 재설계한 논문이다. ImageNet 256×256에서 FID를 최대 20% 낮추고 학습 반복을 1.73배 줄였으며, REPA-XL/2를 5.9에서 4.34 FID까지 끌어올렸다.
TT-VidT가 영상 자기지도학습에서 시간축을 분리해 모션 표현을 앞세운다
영상 자기지도학습의 24개 아키텍처·목적함수 조합을 동일 레시피로 통제 비교해, TT3D와 Diff Compression을 결합한 TT-VidT가 모션 민감 벤치마크에서 앞선다는 것을 보인 논문이다. 인코더 FLOPs는 비교군의 절반 수준이다.
강한 에이전트의 개입 경험을 플레이북으로 증류해 로봇 조작 성공률을 높인다
고정된 VLA 정책에 대한 개입 경험을 강한 에이전트가 플레이북으로 증류하고, 가벼운 에이전트의 실행 피드백으로 재귀적으로 다듬어 모델 파라미터 수정 없이 로봇 조작 성공률을 끌어올린다. SimplerEnv Bridge에서 41.7%였던 성공률이 66.7%로 오르고, 실물 Franka 조작에서도 37.3%에서 64.0%로 개선됐다.
SMAT는 병합 연산을 학습에 시뮬레이션해 병합 성능을 끌어올린다
모델 병합을 염두에 둔 전문가 학습 기법 SMAT를 제안한다. Scale·Mask·Perturb 세 연산을 학습 중 시뮬레이션해 5개 병합 방식 평균 점수를 최대 2.16점 올리면서 학습 시간 오버헤드는 2% 미만으로 유지한다.
Pruned CTC가 LLM 네이티브 어휘 음성인식 학습 메모리를 줄인다
CTC 학습에서 프레임×어휘 활성값을 전부 메모리에 올리던 병목을, 배치에 등장하는 토큰과 blank만으로 정렬을 계산하는 방식으로 없앤다. 손실과 1차 기울기는 전체 어휘 CTC와 동일하면서 헤드 메모리가 어휘 크기에 선형으로 늘지 않는다.
VisionHOPE가 이미지 안에서 기억과 학습 규칙을 함께 진화시킨다
VisionHOPE는 이미지 처리 중 콘텐츠·키·값·학습률·유지율 다섯 메모리가 함께 진화하는 자기수정 학습 시스템 비전 백본이다. 소프트 주입 상한과 스펙트럼 클램프로 안정성을 확보하고 4방향 스캔으로 ImageNet-1K, COCO, ADE20K에서 경쟁력 있는 결과를 냈다.
온폴리시 증류에서 KL 발산 없이 방향 신호만으로 충분하다
온폴리시 증류(OPD)에서 역 KL 발산 대신 교사 방향만 알려주는 ±1 보상만으로 동등한 성능을 낸다. 교사와 크게 어긋나는 토큰 2% 미만의 방향만 지켜도 학습이 되며, 이를 활용한 C-MOPD가 다중 교사 증류를 개선한다.
WhiteMatter가 모든 층의 KV 재사용으로 캐시를 절반으로 줄인다
WhiteMatter는 Transformer의 모든 층이 임의 깊이의 과거 토큰 표현을 KV로 재사용하도록 라우터 기반 혼합을 도입한다. 절반 캐시로 1.3B 규모에서 perplexity를 4.3% 낮췄고, cyclic Gauss–Seidel 반복으로 Jacobi보다 12.5배 빠르게 수렴한다.
프리트레인 LLM의 소프트맥스를 거칠게 근사해 B200 어텐션을 가속한다
B200에서 지수 함수 평가가 어텐션 커널의 병목이 되자, 저자들은 프리트레인 LLM 10개에서 소프트맥스 근사 민감도를 측정하고 행 최댓값 기준 근사로 FP8 어텐션을 12~26% 가속했다. BF16 커널에서는 perplexity가 0.091~0.492% 상승했다.
SFT 추론 경로를 다양하게 고르면 RL 이후 일반화가 좋아진다
검증된 SFT 해답이라도 추론 경로가 다양한 것을 골라야 강화학습 이후 문제 커버리지가 올라간다. 모델 호출 없이 CPU에서 도는 규칙 기반 지문 선택법이 그 방법이며, OLMo3-7B에서 pass@8이 16.9점 올랐다.
TGRL이 샘플링 온도차를 탐험 신호로 바꿔 RLVR 학습을 앞당긴다
TGRL은 프롬프트별 rollout을 저온·고온 그룹으로 나눠 보상 격차로 탐험 이득을 추정하고, JS 발산으로 토큰별 크레딧을 배분하는 RLVR 학습법이다. rollout 예산을 늘리지 않고 수학·코드·에이전트 11개 벤치마크에서 GRPO·DAPO 같은 강한 베이스라인을 앞선다.
미해결 정보 요구를 기준으로 다중 에이전트 탐색을 조율하는 ANTMAN
정보 공간을 고정 분할해 에이전트 수를 늘리던 기존 방식과 달리, ANTMAN은 실행 중 남은 미해결 정보 요구를 Need Graph로 추적해 필요한 작업자만 활성화한다. 검색 공간이 16배 커져도 조율 비용은 1.23배만 늘었다.
AnyStep-WAM이 로봇 조작 추론의 디노이징 예산을 장면별로 줄인다
월드 액션 모델의 고정 디노이징 스텝을 예산별 증류와 위험-이득 스케줄러로 대체해, 성공률을 유지하면서 평균 스텝을 최대 85% 줄인 연구다. 한 번의 프리뷰로 필요한 최소 예산을 골라 재사용한다.
StoryEngine이 이야기 상태를 명시 전파해 장편 영상 일관성을 지킨다
StoryEngine은 장편 영상 생성에서 사건의 결과를 구조화된 세계 상태로 명시적으로 전파하고, 생성된 픽셀은 서사적 사실이 아닌 관측으로만 취급하는 에이전트 프레임워크다. 60개 스토리 벤치마크에서 Veo 3.1과 Wan2.2 두 백본 모두 영상 기반 7개 지표 1위를 기록했다.
DuoOPD가 교사와 학생의 성공 조합으로 다중 과제 증류를 개선한다
DuoOPD는 학생 정답 여부로 피드백 방향을, 교사와 학생의 결합 정오로 교사 활용 방식을 정해 다중 과제 온폴리시 증류 성능을 끌어올린다. Qwen3와 Llama에서 평균 매크로 정확도를 OPD 대비 2.58%p, 5.98%p 개선했다.
마스크 확산 언어모델은 상태가 바뀔 때만 언마스킹 전략을 바꿔야 한다
마스크 확산 언어모델의 언마스킹 전략을 점수·영역·개수·확정·계획 다섯 축으로 정리하고, 고정 전략이 뒤집히는 상태에서만 적응하는 선택적 적응을 제안한다. 실험으로 LLaDA-8B 제약 JSON 채우기에서 상위 10% 상태만 적응해 후보집합 오라클 기회의 56.9%를 회수했다.
SFT 학습 델타를 부호 있는 게이트로 억제·역전·외삽하는 SCALE
SFT가 남긴 학습 델타를 고정해 두고, 엔트로피만으로 토큰·모듈별 부호 있는 게이트를 학습해 억제·역전·외삽하는 SCALE을 제안한다. 기존 토큰 재가중이 못 하는 역전과 외삽을 가능하게 해 수학 추론과 코드 생성에서 베이스라인을 앞선다.
HamiFormer는 확산모델과 해밀턴전파를 섞어 장기물리예측오차누적을 줄인다.
HamiFormer는 전체 윈도우 확산 디노이징과 잔차 보정 해밀턴 전파를 라우터로 섞어 장기 물리 예측의 오차 누적을 줄인다. 192스텝 평가에서 PhysiFormer 대비 26.3%, DiT 대비 21.4% MSE 감소를 보고했다.
순열 등변 플로우 매칭으로 정렬 없이 신경망 가중치를 생성하는 방법
독립적으로 학습된 신경망들의 가중치 분포를 순열 정렬 없이 학습하는 플로우 매칭 기법을 제안한다. 순열 등변 그래프 메타네트워크로 속도장을 parameterize해 MNIST·CIFAR-10·OpenML·Folktables 실험에서 기존 베이스라인보다 훨씬 높은 결합 생성 품질(JWS 0.91/0.92)을 달성했다.
통합 멀티모달 모델의 KV 캐시를 태스크·타입별로 나눠 압축하는 UniCache
통합 멀티모달 모델에서 태스크마다 다른 KV 캐시 타입과 중요도 변화를 반영해 압축 정책을 배정하고 예산을 동적으로 배분하는 학습 불필요 프레임워크다. 이해·편집 5배, 생성 2.5배 압축에 긴 문맥 처리량 최대 1.78배 향상을 보고한다.
여러 LLM 에이전트 협업을 선호도 학습으로 최적화하는 MAPL
LLM 여러 개를 협업시킬 때 보상 함수를 손으로 설계하기 어렵다는 문제를 비교 선호 피드백만으로 푸는 멀티에이전트 선호학습 프레임워크 MAPL을 제안한다. 요약·코딩·함수호출·여행계획 네 도메인에서 오라클 보상 MARL에 1% 미만 차이로 근접하고 테스트 시점 협업 기법은 모두 앞선다.