AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
내재적 보상이 탐험으로 이어지지 않는 조건을 형식화한다
내재적 보상 최대화가 항상 정보량 많은 경험을 주지 않는다는 것을 통계적 실험 비교로 형식화한 논문이다. 카운트·예측오차·임파워먼트 목표가 모두 열등한 정책을 최적으로 고르는 단일 환경을 구성하고, 모든 엄격한 탐험 개선을 보존하는 점수를 제안한다.
MosaiChunk가 과거 KV 조각을 모아 장기 영상 재등장 일관성을 높인다
자기회귀 영상 생성에서 슬라이딩 윈도우를 벗어난 객체의 세부 디테일을 잃는 문제를, 과거 KV를 공간·시간 단위로 골라 모자이크처럼 재구성하는 MosaiChunk로 해결한다. 생성기는 고정한 채 라우터만 학습하며, 재등장 벤치마크 RememBench에서 CLIP 일관성을 크게 올렸다.
SourceLearn은 같은 소스를 반복 학습해 재사용 역량을 쌓는다
LLM 에이전트가 같은 문서·코드·API 소스를 반복 사용할 때 이를 단순 재접근이 아니라 소스 이해를 축적하는 학습으로 바꾸는 SourceLearn을 제안한다. 5개 벤치마크와 3개 백엔드 조합 15개 중 13개 설정에서 최고 성능을 기록했다.
텍스트 임베딩을 얼려 두고 6개 모달리티를 한 벡터 공간에 묶는다
텍스트 임베딩 모델을 새 모달리티로 확장하면 텍스트 검색 성능이 무너지는 문제를, 텍스트 백본을 전혀 학습하지 않고 밀집 캡션 자기증류로 해결한 0.9B 모델이다. MTEB-v2 BEIR-8에서 49.57 nDCG@10을 그대로 유지하면서 5개 모달리티를 추가했다.
키워드 채점기가 놓친 툴 호출 실패를 값싼 진단 사다리로 잡아낸다
스페인어 보안 특화 소형 모델 두 개가 키워드 기반 툴 사용 지표에서 0.660 대 0.650으로 비슷했지만, 엄격한 재현 검사에서는 6/6 대 0/6으로 갈렸다. 저자는 CPU 몇 분짜리 진단 사다리로 이 거짓 양성을 잡고, 3.3 GPU시간짜리 재학습으로 1B 모델을 고친다.
에이전트 하네스 최적화에서 학습 시나리오 선택도 함께 진화시킨다
LLM 에이전트 하네스를 자동 최적화할 때 어떤 학습 시나리오로 피드백을 만들지도 함께 적응시켜야 한다는 연구다. GAIA2와 Terminal-Bench 2.0에서 고정 순서 대비 테스트 Pass@1을 4.4pp, 7.5pp 끌어올렸다.
이미지 생성기로 GUI 학습 데이터를 합성해 실제 앱 성능을 올린다
소프트웨어를 설치하거나 실행하지 않고 이미지 생성기로 GUI 상호작용 궤적을 합성하는 AutoGUIWorld가 제안됐다. 79,266개 샘플로 Qwen3.5-35B-A3B를 파인튜닝해 OSWorld를 33.0%에서 40.8%로, ScienceBoard를 14.0%에서 32.2%로 끌어올렸다.
더 강한 텍스트 임베딩을 증류해 확산 언어모델의 생성 품질을 높인다
연속 확산 언어모델의 잠재 공간으로 쓸 텍스트 임베딩을 T5Gemma-2로 키우고, 교사 디코더의 확률을 소프트 레이블로 증류해 더 확산하기 좋은 임베딩을 만든다. OpenWebText에서 Gen. PPL 17.8로 GPT-2-M을 앞선다.
PoS는 명시적 신념 상태로 장기 LLM 에이전트의 신뢰성을 높인다
LLM 에이전트가 상호작용 이력을 압축하는 대신 현재 세계 상태와 미해결 요구사항을 명시적 신념으로 유지하도록 하는 PoS 프레임워크를 소개한다. 일관성 검증과 정체 복구를 결합해 네 벤치마크·세 백본에서 최고 성능을 냈지만 총 토큰 소비는 5배로 늘어난다.
RL 후학습이 에이전트 해결 범위를 깎는 비용을 수치로 측정한다
RL 후학습이 단일 시도 정확도를 올리는 대신 반복 샘플링에서의 해결 범위를 줄인다는 사실을 에이전트 벤치마크 42개 조합에서 확인하고, 그 손실을 Sharpening Tax로 수치화한다. 하네스만 붙인 베이스 모델이 충분한 롤아웃 예산에서는 후학습 모델을 앞지른다.
HC-DLM이 연속 잠재와 토큰 피드백을 맞물려 병렬 디코딩의 독립성 문제를 푼다
확산 언어 모델이 병렬 디코딩에서 토큰을 주변확률로 독립 샘플링해 생기는 의존성 단절을, 연속 잠재를 유일한 지속 상태로 두고 매 스텝 토큰을 읽어 되먹이는 2단 역과정으로 해결한 HC-DLM을 제안한다. Sudoku·Countdown·LM1B에서 동일 크기 이산·연속 확산 베이스라인을 앞선다.
World Observer가 액터 시야 밖 세계 상태를 관찰자로 계속 유지한다
비디오 월드 모델은 액터 중심이라 시야를 벗어난 객체의 상태를 잃는다. World Observer는 파노라마 관찰자 스트림을 액터와 함께 생성해 시야 밖 진화를 유지하고, 3D 월드 공간 지표로 이를 평가한다.
SILSA가 슬라이스 잠재변수로 3D 생성의 위상 보존과 비용을 함께 잡는다
고해상도 3D 생성에서 복셀 토큰 대신 세 축의 겹치는 슬라이스 잠재변수 384개만 쓰는 SILSA를 제안한다. 지속적 호몰로지와 베티 전이 감독으로 얇은 구조와 연결성을 지키면서 토큰·메모리·추론 시간을 크게 줄였다.
FloWright는 워크플로를 학습 틀로 삼아 여러 에이전트 역할을 함께 진화시킨다
멀티에이전트 워크플로의 실행 결과를 역할별 보상으로 쪼개, 생성기뿐 아니라 워크플로를 만들고 실행하는 여러 에이전트를 함께 학습시키는 FloWright와 데이터 경화 기법 DataWright를 제안한 논문이다. 추가 모델이나 라벨 없이 최대 7.41% 향상을 보고한다.
라벨 없이 실행 중에 멀티에이전트 워크플로를 고치는 InFlowOp
LLM이 만든 멀티에이전트 워크플로를 정답 라벨 없이 비용 함수 하나로 구성하고, 실행 중 고장 난 하위 작업만 국소적으로 고치는 InFlowOp을 제안한다. 워크플로 수준 벤치마크 Braid에서 단일 에이전트 대비 최대 11.97%p 향상을 보고한다.
VideoLLM이 중간층에서 잃는 시간 정보를 추론 시점에 다시 주입한다
VideoLLM이 프레임 순서를 뒤집어도 답을 바꾸지 못하는 원인을 층별 표현 차이로 추적한 분석 논문이다. 중간층에서 정점을 찍고 출력으로 갈수록 사라지는 시간 정보를 추론 시점에 재주입하는 TAI로, 학습 없이 세 모델과 네 벤치마크에서 시간 추론을 개선한다.
로봇 VLM 에이전트가 코드 실행으로 토큰 65%를 줄이며 성공률을 높인다
VLM 로봇 에이전트의 도구 호출 방식을 파이썬 코드 실행 인터페이스로 바꾼 PyRUA-Lean을 소개한다. 700개 시뮬레이션 과제에서 성공률을 63.1%에서 71.7%로 올리면서, 공통 해결 과제 기준 LLM 호출 49%와 입력 토큰 65%를 줄였다.
AgSpec이 코딩 에이전트의 재사용 텍스트를 찾아 추론을 가속한다
검색 기반 추측 디코딩을 코딩 에이전트 파이프라인에 맞춰 재설계한 AgSpec을 소개한다. 세션·워크스페이스·글로벌 코퍼스와 에이전트별 드래프트 길이 제어로 자기회귀 대비 최대 4.76배 처리량을 내며, 저장소 없는 벤치마크에서도 통한다.
OneStreamer가 스트리밍 영상에서 기억 기록과 응답 시점을 함께 학습한다
OneStreamer는 스트리밍 영상 LLM이 관측 즉시 재사용 가능한 캡션 기억을 스스로 기록하고 증거가 충분해지는 시점에 응답하도록 하나의 생성 과정에서 함께 학습한다. 4B 모델로 스트리밍 영상 이해 벤치마크 8종에서 비교 방법 중 최고 점수를 냈다.
토크나이저와 흐름 예측기를 함께 학습해 잠재 세계 모델을 예측 가능하게 만든다
비전 파운데이션 모델 특징 공간에서 미래를 예측하는 기존 2단계 파이프라인은 잠재 공간이 예측에 맞게 구조화되지 않는다. 이 논문은 토크나이저와 흐름 기반 동역학 모델을 종단간 공동 학습해 붕괴 없이 예측 성능을 높이는 Latent-Foresight를 제안한다.
LLM 일반화는 정확도가 아니라 의미가 같은 입력에서의 안정성이다
테크니온 연구진이 LLM 일반화를 집계 정확도 대신 의미가 같은 입력 변형에서의 행동 안정성으로 측정하는 SAGO 프레임워크를 제안했다. 11개 모델과 6개 데이터셋 실험에서 어떤 모델도 모든 축에서 균일하게 일반화하지 못했고, 축별 불안정성은 서로 독립적인 실패 모드로 나타났다.
Where-OPD가 합성 장면의 위치 힌트로 MLLM 지각을 넓힌다
합성 장면에서 만든 텍스트 위치 힌트를 교사 모델에만 제공하는 on-policy 자기증류로 MLLM의 시각 지각을 학습시킨다. 카운팅 장면만으로 학습했는데도 실제 이미지 벤치마크 평균이 3.23점 올랐다.
OctLLM은 옥트리를 명시적 3D 언어로 써서 언어 능력을 지킨다
옥트리 점유 토큰을 명시적 3D 언어로 삼아 3D 생성과 이해를 한 모델에서 수행하는 OctLLM을 제안한다. 3D 전용 분기만 따로 학습해 백본의 언어 능력을 그대로 유지하면서 이미지→3D FID를 17.4% 낮췄다.
가중치마다 GMM 게이트를 붙여 LLM의 치명적 망각을 막는다
대규모 사전학습 모델의 치명적 망각을 각 가중치 행렬의 입력 공간 기하 문제로 분석하고, 현재 데이터 영역에서만 어댑터가 열리도록 GMM 게이트를 붙이는 Local Support Learning을 제안한다. Qwen2.5-7B에서 LoRA·OP-LoRA·LwF보다 사전학습 능력을 더 잘 보존한다.
SMI는 MLLM으로 비디오 월드 모델의 장기 공간 메모리를 관리한다
비디오 월드 모델이 장기 상호작용에서 쌓는 관측 이력을 어떻게 조직하고 압축하고 검색할지 다룬다. MLLM을 메모리 관리자로 세워 네 가지 원자 연산으로 메모리 희소도를 83%까지 높이면서 장면 일관성과 생성 안정성을 함께 개선했다.
여러 전문가의 출력과 은닉 상태를 함께 증류해 하나의 학생 모델로 통합한다
수학·코드·논리 전문가 모델을 하나의 학생 모델로 합치는 다중 교사 온폴리시 증류에서, 출력 분포뿐 아니라 은닉 상태까지 라우팅해 감독하는 Latent-MOPD를 제안한다. 동일 계열 1.5B 설정에서 9개 벤치마크 모두 기존 단일 채널 베이스라인을 앞섰다.
CANOPY는 검색된 항목 안에서 근거의 범위를 스스로 정한다
멀티모달 RAG에서 검색된 항목 안 어디까지 남길지 스스로 정하는 압축 프레임워크 CANOPY를 제안한다. 33M 항목 코퍼스의 5개 QA 벤치마크에서 리더 입력 토큰을 14.2~27.7% 줄이면서 비슷한 정확도를 유지했다.
iADD가 확산 모델 보상 미세조정에서 정렬과 다양성을 함께 높인다
확산 모델을 강화학습으로 후학습할 때 보상 정렬과 다양성 사이의 균형을 이론적으로 분석하고, 이른 타임스텝 증분 커리큘럼과 Feynman-Kac 경로 분기로 두 목표를 동시에 개선하는 iADD를 제안한다. 이미지 생성, 소실점 보정, 3D 실내 장면 합성에서 기존 DDPO·B2-DiffuRL보다 나은 보상-다양성 트레이드오프를 보고한다.
실제 데스크톱을 조합해 컴퓨터 사용 에이전트의 그라운딩을 학습시킨다
실제 리눅스 애플리케이션을 통제된 장면으로 조합해 120만 장의 조밀 주석 데스크톱 데이터를 생성한 DeskForge를 소개한다. 4개 비전언어모델을 파인튜닝해 외부 GUI 벤치마크와 장기 과제 완료율을 함께 끌어올렸다.
타입 지정 결정 모델은 정의가 아니라 옵션 라벨을 읽는다
Jev 스타일 타입 지정 결정 모델 4종을 열어보니, 모델은 옵션의 정의가 아니라 라벨을 보고 답하는 옵션-라벨 편향을 보였다. 라벨을 A·B로 바꾸면 정확도가 0.1511 오르고, 라벨을 입력 문자열에서 빼면 효과가 정확히 사라진다.