AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
GUI 에이전트의 실행 하네스를 반복 실행 증거로 자동 최적화한다
GUI-HARVEST는 모델 가중치를 고정한 채 GUI 에이전트 주위의 실행 하네스 코드를 반복 실행 증거로 자동 개선한다. OSWorld-Verified에서 6개 백본 모두 성능이 올랐고 Qwen3-VL-32B는 전체 스위트에서 12.33점 향상됐다.
추론 생성을 선택으로 바꿔 멀티모달 검색 에이전트 지연을 90% 줄인다
애플과 CMU 연구진이 멀티모달 검색 에이전트의 자유형 추론을 미리 정해둔 후보 중 선택으로 바꾸는 SSR을 제안했다. 4B 모델에서 평균 성공률 61.37%로 동급 최고 수준을 유지하면서 턴당 추론 지연을 90% 이상, 문항당 모델 추론 지연을 28~54% 줄였다.
로봇 파운데이션 모델의 행동 생성을 한 번의 순전파로 끝내는 K-MF
MeanFlow를 로봇 파운데이션 모델에 그대로 적용하면 학습이 붕괴하는 원인을 속도장 동역학에서 규명하고, 시간 미분항을 두 구간으로 분리한 K-MF로 1스텝 행동 생성을 달성한다. GR00T-N1.6의 행동 헤드 지연을 67.5~74.4% 줄이면서 다단계 flow matching과 대등하거나 더 나은 성공률을 보고한다.
VIEScore2는 이미지 품질 점수와 결함 위치를 한 번에 예측한다
VIEScore2는 이미지 생성·편집 결과를 16×16 격자로 표현해 품질 점수와 결함 위치를 한 번에 예측하는 평가기다. 38K 예시로 SFT 후 GRPO를 적용해 overall SRCC 0.601을 기록하며 Gemini-3-Flash의 0.491을 앞섰다.
UniWAM이 VLM 추론과 월드모델 동역학을 한 구조로 묶는다
UniWAM은 VLM 추론기와 비디오 생성기, 액션 예측기를 하나의 MoT 구조로 묶어 로봇의 이해·생성·제어를 동시에 학습한다. LIBERO 99.2%, LIBERO-Plus 92.6%로 SOTA를 기록하고 인간-로봇 공동학습의 로그선형 스케일링 법칙을 제시한다.
Multimodal Flow가 언어와 이미지를 하나의 연속 플로우로 통합 생성한다
이미지를 이산 토큰으로 양자화하지 않고, 텍스트 블록과 이미지를 연속 임베딩 '하이퍼청크'로 묶어 하나의 Flow Matching 목적함수로 학습하는 Multimodal Flow를 제안한다. 1.6B 모델 MF-1이 150B 토큰만으로 GenEval 0.821, DPG-Bench 83.44를 기록했다.
SCAPO가 준반사실 안정성으로 GRPO 토큰 신용을 세분화한다
GRPO가 응답 전체에 같은 어드밴티지를 주는 문제를 지적하고, 답을 바꾸지 않는 프롬프트 개입에서 토큰 확률 드리프트를 재서 불안정한 토큰의 신용만 깎는 SCAPO를 제안한다. Qwen3-4B-Base와 1.7B-Base에서 AIME 정확도를 각각 5.63, 4.17%p 끌어올렸다.
언어를 물리 표현으로 삼아 비디오 월드 모델의 물리 위반을 줄인다
비디오 월드 모델이 물리 법칙을 어기는 문제를 자연어 표현의 자기 진화로 줄인다. 물리 캡션 벤치마크 PhysCapBench와 언어 기반 데이터 검색으로 Cosmos3와 Wan 백본을 파인튜닝해 Veo 3.1을 앞선다.
VideoMSN이 이미지 ViT 재활용으로 영상 사전학습을 160배 줄인다
비디오를 2D 슈퍼 이미지로 재배열해 이미지 ViT와 마스크드 샴 네트워크로 자기지도 학습하는 VideoMSN을 제안한다. Kinetics-400에서 최고 성능을 유지하면서 비디오 사전학습 에포크를 최대 160배 줄이고, UCF101에서는 320배, HMDB51에서는 480배 줄인다.
Turbo Harness가 작업 인스턴스마다 하네스를 패치해 성능을 높인다
전역으로 최적화된 에이전트 하네스를 작업 인스턴스별로 다시 패치하는 Turbo Harness를 제안한다. 기존 하네스 탐색이 버리던 아카이브를 플레이북으로 재활용하고 소형 편집기를 GRPO로 학습해 7개 벤치마크에서 일관된 성능 향상과 비용 절감을 보였다.
구글 Cogentic이 다중 에이전트 검증 루프로 미해결 정리 증명을 찾아낸다
구글 연구진이 다중 에이전트 하네스 Cogentic으로 온라인 학습·경매 이론·메커니즘 설계의 미해결 문제 5개를 풀고 전문가 검증까지 받았다. 증명자 집단과 적대적 검증자, 검증된 보조정리 원장을 라운드 단위로 돌리는 구조가 핵심이다.
Atomizer-IO는 관측을 원자로 다뤄 격자 가정을 걷어낸다
지구관측 데이터처럼 채널·해상도·시각·기하가 제각각인 센싱 입력을 격자 없이 처리하는 Atomizer-IO를 제안한다. 각 관측을 측정값과 획득 메타데이터를 가진 원자로 표현하고, 물리 좌표 기반 국소 크로스어텐션으로 구조를 사후에 유도한다.
DynaHarness가 로봇 실행 계약으로 실패를 능력 개선으로 전환한다
동결된 VLA 정책 위에 느린 의미 추론과 2Hz 빠른 물리 거버넌스를 얹고, 모든 명령을 예산과 리스가 걸린 실행 계약으로 묶어 실패를 검증된 능력 개정으로 바꾸는 DynaHarness를 제안한다. LIBERO-Pro의 새 초기 상태 800개에서 75.2%로 동결 정책 17.5%를 크게 앞섰다.
공유 블록 반복으로 파라미터를 고정한 이미지 생성 모델 Looped-DiT
denoising step마다 공유 Transformer 블록을 반복 실행해 파라미터를 늘리지 않고 계산 깊이를 키우는 Looped-DiT를 제안한다. 260M 모델이 6.5배 큰 모델을 넘고 추론 연산은 4.9배 적다.
강한 코딩 에이전트에는 MLE 하네스가 거의 필요 없다
동일한 백본·하드웨어·시간 예산에서 최소 하네스 코딩 에이전트 한 세션이 최신 MLE 하네스들을 능가하거나 동등했다는 실측 연구다. 저자들은 성능을 결정하는 것은 하네스 설계가 아니라 모델과 실행 환경이라고 주장한다.
웹의 AI 생성 텍스트는 데이터가 부족할 때만 사전학습에 이득이다
2026년 웹 크롤링 토큰의 27.5%가 AI 생성 텍스트라는 측정과 함께, 800개 모델 실험으로 AI 토큰의 이득과 해악을 분리한 새 스케일링 법칙을 제안한다. 데이터가 충분한 모델에는 AI 텍스트가 즉시 해가 되며, 인간 텍스트 반복이 AI 텍스트 추가보다 낫다고 주장한다.
언어를 바꾸면 되살아나는 LLM 언러닝 구멍을 174개 언어로 측정한다
한 언어에서 지운 사실이 다른 언어 질의나 답변 언어를 바꾸면 다시 드러나는 교차언어 구멍을 174개 언어-문자 쌍 벤치마크로 분석하고, 적은 언어 예산으로 삭제를 확산시키는 소스 언어 선택 기법 COVER를 제안한다.
PivotOPD가 다중 턴 에이전트의 결정적 실수 복구를 학습한다
PivotOPD는 다중 턴 에이전트가 초반 결정적 실수에서 복구하도록 피벗 턴과 이후 복구 행동을 on-policy distillation으로 학습한다. ALFWorld, WebShop, SWE-Bench Verified에서 OPD·GRPO보다 성공률과 resolve rate를 높였다.
실시간 GUI 피드백으로 컴퓨터 사용 에이전트를 토큰 단위 자기증류 학습한다
컴퓨터 사용 에이전트의 온라인 학습에서 결과 보상만으로는 중간 행동을 평가할 수 없다는 문제를, 실행 후 화면 변화를 읽는 GUI 분석기로 해결한다. 단계별 가치 점수로 토큰 수준 자기증류 신호를 게이팅해 OSWorld-Verified 성공률을 GRPO 대비 최대 4.1%p 끌어올린다.
연속 확산 언어모델을 4회 평가로 증류하는 두 가지 분포 정합 기법
연속 확산 언어모델의 샘플링 비용을 줄이기 위해 학생의 확률 출력을 활용하는 분포 정합 증류 두 가지를 제안한다. OpenWebText 1,024토큰 생성에서 Simplex-DMD는 4회 평가로 생성 퍼플렉서티 45.6, Reinforce-DMD는 256회로 14.9를 기록했다.
EviRover가 한 번의 시선을 넘어 증거를 찾아 지각한다
EviRover는 이미지 한 번 보기로는 답할 수 없는 지각 문제를 증거 탐색 과정으로 재정의하고, SFT와 에이전트 강화학습으로 4B 모델을 학습시켰다. 사람이 검증한 EviLens 벤치마크에서 백본 대비 평균 30.2점 향상을 냈다.
LOCI는 영상 월드 모델의 재방문 장면 복원을 공간 메모리 혼합으로 개선한다
카메라가 이전에 본 장면으로 돌아왔을 때 영상 월드 모델이 그 내용을 다시 그려내도록, LOCI는 절반 블록에 KV 캐시를, 나머지 절반에 카메라 기하로 조건화된 순환 선형 어텐션 메모리를 둔다. MIND 벤치마크에서 동일 예산의 full-softmax보다 PSNR이 0.89dB 높고 300초 스트리밍을 상수 메모리로 처리한다.
DC-SAE가 32배 압축에서도 확산 모델 수렴을 앞당긴다
DC-SAE는 동결된 의미 인코더와 학습 가능한 픽셀 인코더를 나란히 두어 32배 압축에서도 확산 모델 학습 수렴을 앞당기고 재구성 품질을 지킨다. ImageNet 512x512에서 PSNR 29.79, gFID 3.37을 기록했다.
실패한 LLM 에이전트 롤아웃 5만 건을 진단과 수정안으로 바꿔 재학습에 쓴다
LLM 에이전트의 실패 롤아웃 5만 건에 오류 진단과 수정안을 붙인 AED 데이터셋이 공개됐다. 첫 제안 수정은 리플레이 통과율을 18.4%에서 51.1%로 끌어올렸지만, 실제 환경 전이는 벤치마크와 프로토콜에 따라 갈렸다.
월드모델이 상상한 실패로 로봇 스킬 전문가를 골라 가르친다
월드모델이 상상한 실패를 근거로 다음에 어떤 서브태스크 시연을 모으고 어느 스킬 전문가를 갱신할지 정하는 RoboCoach를 제안한다. 실제 Franka와 AgileX에서 시연 150개만으로 성공률을 75.0%와 83.8%까지 올렸고, 학습에 없던 조합에서도 평균 35.0%를 기록했다.
자기대국 게임으로 사람이 직접 조작하는 로봇 스킬을 발견한다
1대1 경쟁 게임의 자기대국으로 고자유도 에이전트가 사람이 직접 누를 수 있는 5~6개 스킬을 학습하는 GGSD를 제안한다. Ant·Franka·Unitree G1에서 의미적 다양성이 베이스라인보다 최대 2배 높았고, 사람이 추가 학습 없이 미로·물체 조작 과제를 84% 이상 성공률로 풀었다.
Galahad가 LLM의 반복 읽기를 한 번만 지불하게 만든다
Galahad는 vLLM·SGLang·llama.cpp에 붙는 메모리 계층으로, KV 상태를 바이트 단위로 저장해 같은 문서를 다시 읽지 않게 한다. 97,000토큰 코퍼스 회수 실험에서 100문항 중 100개를 정답 처리했고, 실제 데이터셋 프롬프트 토큰의 98.7%가 재계산 대신 로드됐다.
언어 모델이 외부 지침을 선택적으로 따르도록 학습시키는 Box²-Bench
언어 모델이 유용한 워크플로 지침은 활용하고 오도하는 지침은 덮어쓰는 선택적 의존 능력을 Box²-Bench로 측정하고, 나쁜 워크플로만으로 SFT와 결과 기반 RL을 적용해 견고성과 활용도를 함께 조율한 연구다. 프런티어 모델은 좋은 지침에서 이득을 봤지만 나쁜 지침에서는 최대 43.3점까지 성능이 떨어졌다.
SkillSeek이 LLM 에이전트 스킬 검색을 표준 IR 레시피로 되돌린다
Anthropic Agent Skills 풀이 23만 개를 넘어서면서 스킬 선택이 병목이 됐다. SkillSeek은 BGE 바이인코더와 소형 크로스인코더로 구성한 결정적 2단계 검색으로 LLM 매개 검색 루프와 같은 통과율을 절반 비용에 낸다.
VLM이 정책과 도구를 함께 진화시켜 초장시간 영상 구간을 찾는다
초장시간 영상에서 자연어 질의에 해당하는 구간을 찾는 문제를 다룬다. VLM의 실행 궤적에서 고수준 정책과 실행 가능한 미디어 도구를 함께 진화시켜, 모델 파라미터를 건드리지 않고도 정확도는 높이고 시각 토큰 비용은 줄인다.