AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
CUAWright가 bash 하나로 컴퓨터 사용 에이전트 성능을 높인다
컴퓨터 사용 에이전트의 행동 공간을 bash 명령 하나로 통일한 CUAWright가 웹·데스크톱·CAD 벤치마크에서 GUI 하네스를 앞선다. 파일시스템을 작업 기억이자 도구 생성 공간으로 쓰는 최소 하네스의 성능과 비용 절감을 실측했다.
수치 해석 솔버 실패 원인을 진단해 재사용 스킬로 바꾸는 ADSD
LLM이 만든 수치 해석 솔버의 성능 저하 원인을 진단하고, 문헌에서 찾은 방법을 재사용 가능한 스킬로 패키징해 솔버를 개선하는 ADSD 프레임워크를 제안한다. 전력 조류, AC-OPF, 경직 ODE, 이종 확산 PDE 네 영역에서 정확도와 효율을 함께 개선했다.
SHIFT가 쿼리마다 멀티에이전트 하네스를 검색으로 조립한다
SHIFT는 후보 하네스를 실행하지 않고 로컬 LLM 예측만으로 쿼리마다 멀티에이전트 하네스를 조립해 6개 벤치마크 평균 정확도 79.9%를 기록했다. 17개 베이스라인을 모두 앞섰고, 저비용 모드는 실행 토큰을 32% 줄이면서도 평균 정확도가 가장 높다.
고정된 언어모델이 컨텍스트 창 밖 긴 문서를 격자 탐색으로 읽는다
동결된 언어모델을 K×K 격자의 로컬·스트라이드 프로브 2K번으로 호출해 윈도 W로 W²/c 토큰까지 읽는 학습 없는 추론 기법 Periscope를 제안한다. LongBench v2에서 9k 토큰만 읽고 131k 윈도 읽기와 같은 41.9를 냈다.
KV 캐시의 출처를 학습 분포 안에 묶어 분 단위 영상 생성을 안정화한다
자기회귀 영상 확산 모델이 긴 영상을 만들 때 색·질감이 밀리고 움직임이 죽는 드리프트 문제를, KV 캐시가 기록되는 방식 자체를 학습 분포 안에 묶는 self-caching으로 해결한다. 학습 없이 테스트 타임에 적용해 5초 모델을 분 단위 생성으로 확장한다.
분할 학습에서 그래디언트는 토큰보다 문서 복원을 훨씬 크게 늘린다
분할 학습에서 클라이언트가 보내는 활성값만으로도 토큰의 94%가 복원되고, 서버가 되돌려주는 그래디언트까지 보면 정확히 복원되는 문서 비율이 13.7%에서 37.8%로 뛴다. 저자들은 유출을 토큰 단위와 문서 단위로 함께 보고하고, 분할 모델이 보내는 값을 텍스트 자체만큼 민감하게 다루라고 권고한다.
Foresight가 재학습 없이 스트리밍 VLM의 미래 지각을 계획한다
스트리밍 VLM이 스스로 다음에 언제 추론하고 무엇을 볼지 계획하도록 만든 학습 없는 이중 스트림 구조 Foresight를 제안한다. 얼린 Qwen3-VL-8B로 OmniPro Online에서 23.0 joint F1을 기록해最强 학습 베이스라인을 크게 앞섰다.
HAD는 하네스 정보 유무를 대비해 소형 에이전트의 하네스 활용 능력을 증류한다
HAD는 교사 모델을 하네스 정보가 있는 경우와 없는 경우로 각각 질의해 행동 선호를 만들고, 하네스 기록과 모순되는 쌍을 걸러 소형 언어모델 에이전트를 증류한다. ALFWorld·WebShop·ScienceWorld에서 기존 on-policy 증류보다 높은 성공률을 보였다.
학습 가능한 입력 임베딩 테이블 없이도 1.7B 언어모델이 작동한다
1.7B급 언어모델 3개를 같은 조건에서 학습시켜, 학습 가능한 입력 임베딩 테이블 없이 고정 16비트 토큰 코드만으로도 상당한 언어 능력이 나온다는 것을 보인 실험 연구다. 저자들은 임베딩 테이블이 유용하지만 필수는 아니라고 정리한다.
MoE 라우터 정렬로 디코더 전용 LLM의 다국어 성능을 높인다
MoE 라우터 출력을 시퀀스 단위로 평균 풀링해 번역 쌍 사이 KL 발산을 줄이는 것만으로 디코더 전용 LLM의 은닉 표현까지 정렬된다. 4개 MoE와 7개 언어 실험에서 14개 모델-언어 조합 중 13개가 평균 0.9점 개선됐다.
FastOPD가 대형 VLA를 2스텝 경량 학생 정책으로 증류한다
FastOPD는 대형 VLA 교사의 속도를 학생 자신의 궤적 위 단일 상태에서만 정합하고, 자기일관성 목표로 유한 구간 숏컷 전이에 전파해 1~2 스텝 경량 정책을 만든다. LIBERO에서 2 스텝으로 교사 성능의 84%를 유지하며 추론 지연을 78.1% 줄였다.
선호도와 루브릭 보상을 조합해 텍스트-이미지 모델을 사후학습한다
인간 선호 보상과 프롬프트 충실도·제약·해킹 탐지 루브릭 보상을 조합해 Flux2dev와 Ideogram-4를 RL로 사후학습하는 방법을 제안한다. Arena 리더보드에서 Flux2dev는 베이스보다 Elo 69점 높은 1202.1, Ideogram-4는 1223.5를 기록했다.
가우시안 아바타 애니메이션을 항등 공유 블렌드셰이프로 60fps까지 가속한다
사전학습된 3D 가우시안 아바타의 프레임별 신경망 디코딩을 항등 독립 블렌드셰이프 선형 근사로 대체하는 증류 기법 GALA를 제안한다. 원본 모델 재학습 없이 CPU 애니메이션 비용을 최대 1000분의 1로 줄이고 모바일에서 60fps를 달성한다.
로봇이 시뮬레이션 연습으로 스킬 코드를 스스로 고쳐 실물에서 성공한다
로봇 조작 에이전트가 오프라인 데이터셋에서 연습 과제를 만들어 시뮬레이션에서 스킬 코드와 시스템 프롬프트를 스스로 고친다. 모델 가중치를 고정한 채 22개 과제 성공률을 28.6%에서 95.0%로 올렸고, 실물 로봇에서도 30회 시행을 모두 성공했다.
디노이징 매 스텝 예측 임베딩을 조건으로 쓰는 이미지 생성
확산 트랜스포머가 매 스텝 고정된 클래스·텍스트 조건을 재사용하는 관행을 뒤집어, NEPA 모델이 노이즈 이미지로부터 예측한 깨끗한 이미지 임베딩을 조건으로 쓰는 Embedding Conditioned Generation을 제안한다. ImageNet 256×256에서 NEPA-DiT-XL+REPA가 FID 1.32를 기록하며 REPA의 약 3분의 1 학습 연산으로 달성했다.
VISTA는 무손실 시각 기억으로 멀티모달 에이전트의 장기 추론을 살린다
MIT 연구진은 원본 프레임을 그대로 보존하는 시각 기억과 능동적 재검토 도구를 묶은 VISTA 하네스를 제안해 ARC-AGI-3 25개 공개 게임을 사람보다 57.4% 적은 행동으로 완주했다. 같은 모델의 공식 베이스라인 대비 RHAE 점수를 40.68에서 100.00으로 끌어올렸다.
TACO가 옵티마이저 상태 메모리를 174배 줄여 32B 파인튜닝을 가능케 한다
1→1 연산자 노름 기하에서 유도한 열별 Top-1 삼진 업데이트로 옵티마이저 상태를 O(n)까지 줄인 TACO를 제안한다. OPT-13B에서 AdamW8bit 대비 영구 상태를 174배, 최대 학습 메모리를 2.9배 줄이면서 단일 H100 80GB에서 32B 모델 전체 파라미터 파인튜닝을 가능하게 한다.
HiPhy가 다중 물리 원리 영상 생성을 계층적 강화학습으로 정렬한다
HiPhy는 한 영상에 여러 물리 원리가 동시에 등장할 때 각 원리를 단계 트리로 분해해 보상하고, 장면 전체의 물리·의미 일관성을 함께 최적화하는 GRPO 기반 강화학습 프레임워크다. Wan2.1과 VEO3에 아키텍처 수정 없이 붙으며 다중 원리 벤치마크에서 기존 방법보다 크게 앞선다.
InterEvolve가 휴머노이드 로코매니퓰레이션 보상 프로그램을 진화시킨다
InterEvolve는 고정된 휴머노이드 컨트롤러를 두고 보상 프로그램을 테스트 시점에 LLM과 CMA-ES로 진화시켜 새로운 로코매니퓰레이션 작업을 수행한다. 시뮬레이션에서 성공률 86.5%를 기록하고 실제 Unitree G1에서도 자율 실행을 보였다.
HC-DLM이 연속 잠재와 토큰 피드백으로 병렬 디코딩의 독립성 한계를 푼다
이산 확산 언어 모델은 병렬 디코딩 때 토큰을 각자 주변분포에서 독립 샘플링해 의존성을 끊는다. HC-DLM은 연속 잠재를 유일한 지속 상태로 두고 매 스텝 토큰을 읽어 되먹이는 2단 계층 결합으로 이를 완화한다.
LLM 수학 추론의 병목은 구조 발견이며 Absorb가 이를 보강한다
정답률만으로는 드러나지 않는 LLM의 수학적 구조 이해를 네 차원으로 진단한 논문이다. 발견 실패가 추론 실패의 83.6%를 차지하며, 원시 개념을 특권 정보로 주는 Absorb가 기존 후학습의 성능 퇴행을 줄인다.
LLM 미세조정에서 1차 방향은 두고 0차 평가로 걸음 크기를 정한다
1차 옵티마이저가 정한 업데이트 방향은 그대로 두고, 같은 미니배치에서 두 번의 추가 순전파만으로 곡률을 추정해 걸음 크기를 고르는 ZFO 프레임워크를 제안한다. LLM 파인튜닝과 고전 최적화 실험에서 고정 학습률 베이스라인을 자주 앞섰고, 벽시계 기준 약 5.2%의 오버헤드만 추가된다.
DMAD가 보조 확산 모델 없이 판별기 로짓으로 몇 단계 생성을 증류한다
DMD는 학생 분포가 바뀔 때마다 보조 확산 모델을 다시 맞춰야 해 메모리와 연산이 든다. DMAD는 분포 매칭을 판별 문제로 바꿔 두 개의 판별기 헤드와 로짓 선형 손실만으로 학생을 학습하고, ImageNet-64에서 1단계 FID 1.04를 낸다.
루프 트랜스포머가 버리던 중간 반복 상태로 추론 성능을 끌어올리는 LoopCD
루프 트랜스포머가 반복 실행 중 버려지는 중간 상태를 약한 예측으로 삼아 대조 디코딩에 쓰는 LoopCD를 제안한다. 추가 학습 없이 정확도를 올리고 반복 횟수를 절반으로 줄여 순전파 연산을 최대 48.2% 절감한다.
OmniSeek이 오디오·비디오 근거를 스스로 찾아 멀티턴으로 추론한다
Omni-LLM이 긴 오디오·비디오 스트림을 한 번에 통째로 읽는 대신, 필요할 때 스스로 구간을 골라 다시 보거나 듣는 멀티턴 에이전트로 바뀐다. 17만 개 궤적 데이터와 3단계 학습, 양모달 의존을 강제하는 보상으로 10개 옴니모달 벤치마크에서 성능을 끌어올린다.
GenCine이 단일 이미지에서 카메라와 객체의 3D 운동을 함께 조율한다
단일 이미지를 3D 장면 스캐폴드로 리프팅해 카메라 경로와 국소 3D 모션 핸들을 함께 저작하는 영상 생성 시스템 GenCine을 소개한다. 배경·전경 XYZ 맵과 핸들 아이덴티티 맵을 가이던스로 쓰고, Wan 기반 모델에 LoRA와 사이드 브랜치만 학습해 이동 오차와 전경 지각 충실도에서 앞선 결과를 낸다.
다중 교사 온폴리시 증류의 교사 신호가 파라미터와 성능에 미치는 영향을 해부한다
Qwen3-1.7B와 SmolLM3-3B로 다중 교사 온폴리시 증류를 분석해 손실 평균화, Adam 모멘텀, BF16 반올림, top-64 어휘 근사가 파라미터 업데이트와 과제 성능에 어떻게 작용하는지 보여준다. 교사별 그래디언트가 비슷해 보이는 이유와 어휘 감독 확대가 항상 성능을 높이지 않는다는 점을 정리한다.
언어모델의 자기수복은 이미 있던 상쇄 가중치가 드러난 현상이다
언어모델에서 관찰되는 자기수복(self-repair)은 새로 동원된 보상이 아니라 원래부터 존재하던 상쇄 가중치가 드러난 현상이라는 주장을 실험으로 뒷받침한다. 4개 모델에서 81개 방향 중 68개가 아핀 법칙을 따르고, GPT-2 IOI 회로에서는 도달 가능한 헤드 7개가 모두 상쇄 가중치였다.
AutoCompact가 코딩 에이전트의 컨텍스트 압축 시점을 학습한다
코딩 에이전트가 스스로 압축 시점과 보존할 작업 상태, 압축 후 이어갈 행동을 결정하도록 판정자 교정 데이터와 결과 기반 강화학습으로 훈련한 AutoCompact를 제안한다. SWE-bench Verified에서 베이스 대비 9.2%p, SWE-PolyBench Verified에서 5.0%p 통과율을 올렸다.
시야 밖 세계를 파노라마 관측자로 계속 진화시키는 World Observer
비디오 월드 모델이 배우의 시야를 벗어난 객체의 상태를 잃어버리는 문제를, 행동과 관측을 분리해 파노라마 관측자를 함께 생성하는 방식으로 해결한다. 실제·합성 장면 벤치마크와 3D 월드 공간 지표를 새로 제안했다.