AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
월드 액션 모델은 미래를 생성하지 않고 한 번만 준비해도 일반화한다
월드 액션 모델(WAM)에서 추론 시 미래 영상 생성을 생략하면 일반화가 떨어진다는 실험 결과와, 완전히 노이즈인 미래 토큰을 한 번만 통과시켜도 대부분의 일반화 이득을 회복하는 Simple-WAM을 제안한다. 시뮬레이션과 실제 로봇에서 명시적 WAM보다 빠르면서 일반화 성능은 앞선다.
HiRAE가 깊이별 잔차 예산으로 계층 융합 토크나이저를 학습한다
HiRAE는 동결된 DINOv3-L의 24개 층을 얕은·중간·깊은 세 그룹으로 나눠 깊은 표현에 잔차 보정을 더하는 토크나이저다. ImageNet-256에서 재구성 FID를 0.299에서 0.209로 낮추면서 생성 품질도 유지한다.
EasyPPO가 critic 노이즈를 다뤄 PPO 학습 붕괴를 막는다
PPO의 critic이 LLM 강화학습을 불안정하게 만드는 두 가지 실패 모드를 분석하고, actor-only 필터링과 노이즈 정규화 critic 회귀, 작은 critic 미니배치로 이를 고치는 EasyPPO를 제안한다. 세 과제에서 PPO 대비 최대 14.89% 상대 개선을 보고했다.
Real2Gym이 시연 영상에서 로봇 학습용 시뮬레이션 환경을 만든다
Real2Gym은 시연 영상을 물리 검증을 거친 MuJoCo 환경으로 바꾸고, 그 안에서 실행 코드를 시행착오로 쌓아 실제 로봇 조작 성공률을 높이는 Real2Sim2Real 프레임워크다. 시뮬레이션 성공률 87.5%로 GPT-6 Astra 직접 제어를 앞서면서 정책 실행 토큰은 약 75% 줄였다.
되돌아본 판단이 바뀌는 지점에서 분기해 RLVR 롤아웃 비용을 줄인다
GRPO 계열 RLVR은 완전한 궤적을 독립 샘플링해 롤아웃 비용이 크다. HDL은 검증 피드백을 넣은 hindsight 문맥에서 토큰 로그확률이 가장 크게 바뀌는 지점을 찾아 그곳에서만 접미사를 분기시켜 생성 토큰을 35~61% 줄인다.
SAKI가 최대 결합으로 교사 감독 위치를 스스로 고른다
온폴리시 증류에서 약한 학생이 교사와 어긋난 접두사를 방문하는 문제를 최대 결합으로 해결한다. 수용 위치는 역KL, 교정 위치는 교사 최빈 토큰으로 감독을 나눠 1.7B·0.6B 학생 모두 수학 추론 벤치마크에서 TRB를 앞선다.
먼저 행동하고 나중에 추론해 다중턴 에이전트 증류 훈련을 가속한다
다중턴 LLM 에이전트의 온폴리시 증류에서 추론이 행동을 막는 병목을 참조 궤적 기반 역동역학으로 제거한 ActFirst-OPD를 제안한다. ALFWorld·WebShop·ScienceWorld에서 최대 4.9배 훈련 가속과 동등 이상의 성공률을 보고했다.
시각 생성 학습이 시각 이해를 돕는 조건을 19개 생성 과제로 밝힌다
시각 생성 학습이 시각 이해를 언제 돕는지 통합 멀티모달 모델에서 통제 실험으로 규명했다. 19개 이미지 생성 과제와 25개 이해 능력을 담은 OmniTaskonomy 전이 지도와 그라디언트 정렬 신호를 제시한다.
TabFM-Auto는 고정된 표 형식 모델 주위에서 데이터 파이프라인을 진화시킨다
TabFM-Auto는 가중치를 고정한 표 형식 파운데이션 모델 주위에서 LLM 에이전트가 데이터 정제·피처 엔지니어링·컨텍스트 선택·보정 파이프라인을 반복 진화시킨다. TabArena 51개 데이터셋에서 상위 다섯 구성을 모두 차지하며 최고 2013.0 Elo를 기록했다.
GUI와 CLI를 함께 쓰도록 학습해 컴퓨터 사용 에이전트를 개선한다
GUI만 쓰던 컴퓨터 사용 에이전트에 CLI를 선택적으로 섞어 쓰는 하이브리드 궤적과 CLI 인지 보상 학습을 적용한 HybridCUA를 제안한다. OSWorld에서 53.6%로 베이스 모델 대비 14.8%포인트, WindowsAgentArena에서 4.0%포인트 향상됐다.
EpiCon이 에이전트 간 멀티모달 경험 공유로 파라미터 없이 성능을 올린다
EpiCon은 호스트 모델 파라미터를 갱신하지 않고 여러 에이전트가 멀티모달 경험을 공유하도록 만드는 메모리 프레임워크다. 2B 메모리 컨트롤러와 트리 자기조직화 모델로 11개 벤치마크에서 매크로 평균을 1.7~4.9점 올리고 메모리 연산 시간을 67~74% 줄였다.
언어모델이 자기 컨텍스트를 파일처럼 직접 편집하는 CLM
컨텍스트 관리를 외부 하네스가 아니라 모델 자체가 하도록 만든 Context Language Models를 제안한다. 컨텍스트를 편집 가능한 파일로 두고 Bash로 고쳐 쓰게 하면, BrowseComp-Plus에서 11.4% 높은 정확도를 21.5% 적은 FLOPs로 달성한다.
반복되는 엔티티를 앵커로 삼아 코퍼스를 탐색 지도로 바꾼다
여러 문서에 흩어진 근거를 연결해야 하는 에이전트 검색에서, 반복 등장하는 엔티티를 앵커로 코퍼스를 오프라인 지도로 만들어 질의마다 재사용하는 CorpusMap을 제안한다. 3개 벤치마크와 7개 모델에서 품질 6.4~11.7점 향상, 입력 토큰 34~57% 절감을 보고한다.
SoL-Refiner가 4K 영상 정제를 단일 디노이징 스텝으로 압축한다
엔비디아가 저해상도 영상 생성 결과를 한 번의 디노이징 스텝으로 4K까지 정제하는 SoL-Refiner를 공개했다. 3단계 학습 레시피와 전용 벤치마크 Refiner-Bench로 기존 3스텝 리파이너 대비 8.91배 빠른 정제 지연시간을 달성했다.
위협 토큰 5%만 설명해도 전체를 설명한 성공률의 95%를 유지한다
자연어 오토인코더가 모델 내부 활성화를 설명으로 바꿀 때 어느 토큰 위치를 골라야 하는지를 470만 개 설명으로 분석했다. 순전파가 필요 없는 대화 구조 랭커가 계산 신호보다 나았고, 위치 5%만 설명해도 세 데이터셋에서 전체 설명 성공률의 95.8% 이상을 유지했다.
에이전트가 요청받지 않은 정보까지 스스로 캐묻도록 학습한다
도구를 쓰는 에이전트가 사용자가 말하지 않은 정보까지 스스로 캐묻는 능력을 수평·수직 두 축으로 나눠 측정하고, 질문의 결과만으로 질문 정책을 학습하는 Q&D를 제안한다. 8B 질문자가 같은 조건에서 15배 큰 모델을 세 벤치마크 중 둘에서 앞섰고, 고객 서비스 에이전트에서도 더 적은 질문으로 더 많은 과제를 완수했다.
분포형 디퓨전 모델을 소수 스텝 이미지 생성에 실용화한다
분포형 디노이저를 쓰는 확산 모델의 학습 오버헤드와 고정 하이퍼파라미터 문제를 늦은 레이어 파티클 확장과 시간 의존 스케줄로 줄인다. ImageNet-256²에서 4스텝 4.48, 50스텝 2.38 FID를 단일 모델로 달성했다.
SaveRouter는 라우터 학습 비용까지 계산해 배포 손익분기점을 앞당긴다
LLM 라우터는 배포 후 서빙 비용만이 아니라 라우터를 만드는 데 드는 사전 감독 비용까지 회수해야 한다. SaveRouter는 필요한 질의-모델 피드백만 골라 관측하고 그룹 간 능력 정보를 공유해, 전체 피드백의 33~41%만으로 손익분기 배포량을 최대 9.5배 줄인다.
FocusVTC가 시각 텍스트 압축의 해상도 딜레마를 적응형 확대로 푼다
FocusVTC는 문서를 저해상도 이미지로 압축해 토큰을 줄이면서 추론 중 필요한 영역만 고해상도로 확대해 읽는 적응형 시각 텍스트 압축 기법이다. RULER v1에서 2.9배 압축으로 87.4점을 내고 LongBench에서 텍스트 입력 백본을 앞선다.
루프 트랜스포머의 반복 추론에서 업데이트 크기를 궤적에 맞춰 조절한다
루프 트랜스포머는 매 반복마다 같은 업데이트를 크기 1로 적용해 비효율이 생긴다. TAPS는 잠재 상태 궤적에서 지속적 진전과 요동을 추정해 스텝 크기를 온라인으로 조절하고, 재학습 없이 정확도를 높인다.
반복 언어모델의 추가 루프는 추론을 늘리지만 지식을 깎는다
루프 언어모델이 학습 지평을 넘어 반복을 늘릴 때 추론은 좋아지고 지식은 나빠진다는 조건을 통제 실험으로 분해한다. 물리 깊이와 루프 배분, 비반복 경계층 위치가 추론 예산별로 성능을 좌우하며 히스토리 상태 주입과 타임스텝 조건화의 조합이 가장 강했다.
SCOUT는 학생이 생성한 접두사에 교사를 적응시켜 온폴리시 증류를 개선한다
온폴리시 증류에서 학생 궤적은 학생에게는 온폴리시지만 교사에게는 오프폴리시라는 비대칭을 지적하고, 학생 접두사에 조건화한 교사 업데이트(SCOUT)로 수학·코드 추론 성능을 일관되게 끌어올린다.
영상 편집 지시의 숨은 의도를 MLLM 추론으로 먼저 해석하는 ThinkV2V
영상 편집 지시문에는 표면 표현 뒤에 숨은 의도가 많지만 기존 모델은 MLLM을 의미 인코더로만 쓴다. ThinkV2V는 MLLM의 사고 과정을 먼저 활성화해 편집 조건으로 변환하고, 5B DiT로 10B급 베이스라인을 앞선다고 주장한다.
MLLM이 답하기 전에 3D 장면을 상상하도록 가우시안 요약 토큰을 학습시킨다
다중 시점 이미지에서 3D 추론을 못 하는 MLLM 문제를, 답변 전에 압축된 3D 가우시안 장면을 스스로 구성하도록 훈련해 푼다. 7B 백본으로 SPAR-Bench에서 72B 모델을 29점 이상 앞선다.
중국어 글자 내부 구조를 분해해 보상하는 IDSpect가 텍스트 렌더링을 개선한다
텍스트-이미지 모델의 중국어 렌더링에서 OCR 보상이 한자를 원자적 문자로 취급해 라디칼 수준 오류를 구분하지 못하는 문제를, 표의문자 기술 시퀀스(IDS)로 분해해 토큰 단위 F1 보상을 주는 IDSpect로 해결한다. Qwen-Image GRPO 후학습에서 LongText와 GenTextEval의 구조 품질과 의미 정합성을 모두 끌어올렸다.
AREX-2가 장기 반성 궤적으로 자기개선 에이전트를 학습한다
BAAI의 AREX-2는 머신러닝과 알고리즘 문제에서 수백 라운드 개선 궤적을 합성해 반성과 장기 실행 능력을 학습한 27B 에이전트다. MLE-bench Lite 81.8, Frontier-CS 70.7을 기록하고 새 딥리서치 데이터 없이 BrowseComp 84.0으로 전이됐다.
AIM이 연구 아이디어를 클러스터로 관리해 자동 연구 탐색을 앞당긴다
구글 클라우드 AI 연구팀이 자동 연구를 아이디어 단위로 관리하는 AIM을 제안한다. 아이디어를 클러스터로 조직하고 유망성을 추정해 실험 예산을 배분하며, AutoLab 10개 과제에서 최강 베이스라인을 앞서고 최대 3.1배 빠르게 도달한다.
EVOKE는 고정된 상태에서 목표를 다양화해 에이전트의 세계지식을 끌어낸다
LLM 에이전트의 새 환경 전이 실패를 세계모델 추가 학습이 아니라 사전학습된 세계지식의 유도 문제로 재정의한다. EVOKE는 상태를 고정한 채 여러 목표에서 같은 후보 행동의 순위를 매기게 해, 정책이 표면적 습관 대신 내재된 지식에 의존하도록 만든다.
시스템 프롬프트의 숨은 날짜가 LLM 평가를 매일 흔든다
시스템 프롬프트에 사용자 모르게 삽입되는 현재 날짜가 LLM 평가 점수와 모델 순위를 바꾼다는 연구다. 9개 모델과 6개 데이터셋에서 날짜만 바꿔도 MCQA 최대 6%, 수학 14%, 코드 7%, 번역 2.84 BLEU가 달라졌고 CoT는 민감도를 키웠다.
언어모델이 실제로 쓰는 문맥 토큰 수를 어텐션 선택으로 측정한다
언어모델이 문맥에서 실제로 몇 개 토큰을 쓰는지 어텐션 상위 토큰만 남기는 개입으로 측정한다. 문맥이 길어지고 경쟁 토큰이 늘수록 손실을 유지하는 데 필요한 토큰 수가 커지며, 남긴 가중치를 재정규화하면 필요한 수가 줄어든다.