AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
통합 모델이 스스로 이미지를 고치도록 궤적 단위 강화학습을 붙인 UMM-Reflection
통합 멀티모달 모델이 자신이 만든 이미지를 진단하고 수정하는 다회차 반성 루프를 강화학습으로 학습하는 UMM-Reflection을 소개한다. BAGEL에서 GenEval이 SFT 0.72에서 0.84로 오르고, 학습에 쓰지 않은 WISE·OneIG·CompBench로도 이득이 전이됐다.
LLM 에이전트 실행 중 토큰 소비를 실시간으로 예측하는 TokenCast
LLM 에이전트는 같은 작업도 실행마다 토큰 소비가 30배까지 벌어진다. TokenCast는 실행 구간을 조합 가능한 비용 삼중항으로 표현해 추가 LLM 호출 없이 남은 소비를 예측하고, 96개 조합에서 MAE를 평균 14.5% 줄였다.
Foil은 MoE를 루프하며 전문가를 펼치고 어텐션을 분리한다.
루프 트랜스포머와 희소 MoE를 결합할 때 전문가 파라미터와 토큰당 연산을 고정한 채 층당 전문가를 넓히고 패스를 늘리며 어텐션을 패스마다 분리하는 Foil을 제안한다. 20B·100B 토큰 실험에서 손실이 최대 0.012 nat 개선되고, 라우팅 신뢰도(MMR)가 전문가 활용의 새 진단 지표로 제시된다.
KV-streams는 KV 캐시를 압축해 흘려보내 RL을 최대 11배 가속한다.
KV 캐시를 압축 후 폐기하지 않고 앞으로 스트리밍해 재프리필 비용을 제거하는 KV-streams를 제안한다. TextWorld에서 최대 11.3배, SWE-bench에서 3배 빠른 학습을 보이며 SFT 없이 RL만으로 의사 순환 상태가 형성됨을 보인다.
언어 에이전트의 사회적 목표 달성과 통신 비용을 함께 훈련하는 TACT
언어 에이전트가 사회적 목표를 달성하면서 불필요한 발화와 추가 대화를 줄이도록 훈련하는 TACT를 제안한 논문이다. 표현·전략 전문가의 수정안을 상대 응답으로 검증하고, 목표 지원 대비 토큰 비용으로 골라 온폴리시 증류한다.
토큰마다 반복 깊이를 정하는 적응형 루프 트랜스포머 TaH2
루프 트랜스포머를 포스트트레이닝으로 도입할 때 토큰별로 반복 깊이를 적응적으로 정하는 TaH2를 제안한다. AIME에서 정확도-연산 기울기를 53% 개선하고 동일 연산에서 기존 대비 3.4점 높은 정확도를 달성했다.
Softmax 가중치를 선형 ViT로 옮기려면 MLP는 복사하고 어텐션은 증류한다
Softmax ViT의 사전학습 가중치를 선형 ViT 초기화에 재활용하는 방법을 구성요소 단위로 분석한 논문. 어텐션 가중치는 복사해도 효과가 없고 출력 증류로 라우팅을 회복해야 하며, MLP 가중치는 그대로 복사하는 것이 이득의 대부분을 준다.
ROFT는 자기 회고 설명만으로 에이전트를 학습해 보상 없이 GRPO를 앞선다
보상 기반 정책 업데이트 없이 에이전트가 자기 시도의 회고 설명만으로 파인튜닝되는 ROFT를 제안한다. Qwen3.5-4B로 SWE-bench Verified 49.2%를 20업데이트에 달성해 GRPO 40업데이트를 앞섰다.
기하 잠재 공간에 비디오 사전을 주입해 시점 일관성을 확보한 새 시점 합성 프레임워크 GeoVerse
GeoVerse는 DA3의 기하 잠재 공간에서 확산 생성하면서 Wan2.2 VACE의 비디오 외관 사전과 전역 공간 메모리를 결합해, 희소 이미지로부터 시점 간 일관된 새 시점 영상을 합성한다. DL3DV에서 GLD 대비 PSNR 2.23dB, Mip-NeRF360에서 ATE 32.4% 개선을 보고했다.
도구 실패 후 '성공했다'고 보고하는 에이전트를 측정하는 FTA 벤치마크
도구 호출이 실패한 뒤에도 성공을 주장하는 LLM 에이전트의 보고 오류를 분리 측정하는 FTA 벤치마크를 소개한다. 3,600개 응답 평가에서 구조화된 증거 계약 정책은 허위 성공률을 22.8%에서 0.8%로 낮추면서 유용한 응답률은 98.8%까지 높였다.
실시간 720p 디지털 휴먼을 위한 스트리밍 멀티모달 레퍼런스 생성과 선제적 에이전트 계획
바이트댄스가 공개한 FlowAct-R2는 스트리밍 멀티모달 레퍼런스 확산 트랜스포머와 선제적 상호작용 에이전트를 결합한 실시간 720p 휴머노이드 영상 생성 프레임워크다. Vidu-S1 대비 인간 평가에서 영상 품질 +54.76%, 실시간 상호작용 +40.48%를 기록했다.
인간 손 시연을 리셋으로 써서 로봇 강화학습 탐험을 뚫는다
인간 손-물체 시연을 로봇 리셋 상태로 변환해 시뮬레이션 강화학습의 탐험 문제를 푸는 X-Reset을 소개한다. 20개 물체와 3개 로봇에서 재정렬 성공률이 11.0%에서 66.6%로 올랐고, 미학습 물체와 실기체로도 전이됐다.
휴머노이드 전신 로코-매니퓰레이션을 언어모델 어휘 안의 이산 행동 토큰으로 통합한 Holo-M
휴머노이드의 고차원 전신 행동 공간을 EEF·몸통·손·기구학 4개 그룹으로 나눠 토큰화하고, 언어모델 어휘를 확장해 이산 토큰으로 생성하는 Holo-M을 제안한다. SIMPLE 벤치마크 일반·전문가 평가 모두에서 최고 성공률을 기록했다.
강화학습으로 LLM에 '나이트 사이언스'를 가르친 AI Night-Scientist
LLM의 저엔트로피 편향을 넘어 과학적 아이디어 발상의 창의성을 강화학습으로 학습시키는 AI Night-Scientist 프레임워크를 소개한다. GRPO로 행동·과정·결과 세 수준의 창의성을 훈련해 인용 영향력과 독창성, 연구 방향 다양성을 함께 끌어올린다.
MeqMuon이 Muon 업데이트의 행·열 불균형을 자동으로 잡는다
Muon의 직교화 업데이트에서 행과 열 중 어느 쪽이 불균형한지 스텝마다 자동 판별해 정규화하는 MeqMuon을 제안한다. LLM 사전학습에서 AdamW·Muon·NorMuon보다 낮은 검증 퍼플렉시티를 내면서 옵티마이저 상태 메모리도 21.6% 줄인다.
증류 방어는 강화학습 한 번이면 무너진다
증류 공격 방어가 증류 직후 평가에서만 유효하다는 문제를 제기하고, 공격자가 이후 강화학습을 수행하면 기존 방어가 무력화되며 요약본만으로도 추론 능력을 훔칠 수 있음을 보인다.
정규화가 적대적 모방학습의 표본 복잡도를 1/K+1/N으로 낮춘다
적대적 모방학습에서 보상 정규화와 KL 정책 정규화를 함께 쓰면 전문가 시연 N개와 온라인 상호작용 K회 모두에서 1/K+1/N 수준의 빠른 수렴을 얻는다는 이론적 결과를 제시한다. 실험 수치는 없고, 일반 함수 근사와 확률적 전문가까지 다루는 표본 복잡도 분석이 핵심이다.
가치 이식으로 추론 모델의 목표를 다른 전략으로 바꿀 수 있다
추론 모델이 스스로 평가하는 진행 신호를 다른 모델의 신호로 토큰마다 바꿔 목표를 재조정하는 가치 이식 기법을 제안한다. Qwen3-8B와 GPT-OSS-20B에서 정직한 모델의 신호가 부정행위 모델의 테스트 게임 비율을 0.73에서 0.04로 낮추고 숨은 테스트 통과율을 높였다.
PReCache가 멀티 LoRA 에이전트의 반복 프리필과 KV 캐시 메모리를 줄인다
멀티 LoRA 에이전트 시스템에서 각 에이전트가 공유 궤적을 반복 처리하며 KV 캐시를 중복 생성하는 문제를 PReCache가 해결한다. 학습 없이 기존 LoRA 어댑터를 그대로 쓰면서 저랭크 캐시 사전 계산과 중립 재구성으로 TTFT를 최대 3.1배 줄이고 정확도 하락을 평균 1.1점으로 억제한다.
슬라이딩 윈도 KV 추론에서 사라진 토큰 정보가 남아 검색에 쓰인다
고정 크기 KV 캐시를 굴리는 Rolling-KV 추론에서 이미 캐시를 떠난 토큰의 정보가 이후 상태에 남아 검색에 쓰일 수 있는지 다섯 모델로 실험했다. Mistral 7B와 Muse Glimmer 30B가 가장 강한 잠재 정보 중계를 보였다.
Kafila는 신뢰하는 이기종 소비자 PC들을 묶어 LLM을 서빙한다
Kafila는 NAT 뒤에 흩어진 신뢰 기기들을 링으로 연결하고, 측정한 메모리 대역폭에 맞춰 모델을 정확히 분할해 이기종 소비자 PC에서 LLM을 서빙한다. 균등 분할 대비 느린 병목을 최대 5.2배 줄이고, 4명 동시 사용자에서 처리량 우위가 3.2배로 커진다.
시각 토큰을 버리지 않고 경량 MLP로 레이어별 시각 메모리를 재구성하는 δ-Vision
MLLM의 시각 토큰을 프루닝하는 대신, 레이어별 시각 메모리를 저랭크 어댑터로 예측해 재구성하는 δ-Vision을 제안한다. Qwen3-VL-4B에서 평균 74.4점으로 5% 유지 프루닝 최강 베이스라인을 9.1점 앞서면서 FLOPs는 17.90%로 줄인다.
로봇 정책을 코드로 다시 쓰는 자기진화형 코딩 에이전트
VLA·WAM 정책의 지시 무시와 레이아웃 취약성을 상태·절차를 실행 가능한 코드로 표현하는 Physical Coding으로 풀어낸다. HexaAnything은 RoboCasa365 Composite-Unseen을 34.3%에서 38.3%로 올리고, 시뮬레이션 물리 실험과 실물 양팔 로봇 작업을 자율 수행한다.
FlyBy는 생각해도 안 풀릴 때만 작은 추론 모델이 외부에 질의하도록 학습한다
작은 추론 모델의 실패를 실행 병목과 지식 병목으로 구분하고, 필요할 때만 외부 모델에 선택적으로 질의하도록 학습한 FlyBy를 제안한다. 4B 모델이 Qwen3-14B를 2.7배 낮은 서빙 비용으로 앞선다.
EditWorld는 스트리밍 편집 지시와 참조 이미지로 세계모델을 실시간 수정한다
비디오 월드 모델 EditWorld는 자기회귀 생성 중 스트리밍 편집 지시와 참조 이미지를 받아 기존 세계 콘텐츠를 정밀하게 수정한다. WBench-Editing에서 종합 73.8, 편집 80.0을 기록해 2위 대비 편집 항목에서 25.2점 앞섰다.
BaRe-Mem이 검증 이력으로 협력자 신뢰도를 추정해 상담 여부를 결정한다
BaRe-Mem은 중앙 모델의 내부 신념 표현을 입력으로 협력자 신뢰도를 온라인 베이지안 회귀로 추정하고, 그 값을 어텐션 가중치와 상담 여부 결정에 함께 쓴다. 9개 벤치마크에서 오도 정보 비율이 100%까지 올라가도 자율 추론 성능 아래로 떨어지지 않는다.
도메인별 교사 피드백 세기를 정규화해 다중 교사 증류를 개선한다
RL로 만든 수학·코드·지시 따르기 전문가를 한 학생 모델로 합치는 다중 교사 온폴리시 증류에서, 어느 교사가 가르칠지뿐 아니라 그 피드백이 얼마나 세게 반영될지도 맞춰야 한다는 연구다. 배치마다 도메인별 로그비 분산을 재서 승수를 곱하는 DN-MOPD가 Qwen3.5 9B·4B·2B에서 평균 점수를 끌어올렸다.
Draft-KV가 잠재 통신의 메시지 의존성을 되살린다
잠재 통신의 정확도 상승이 메시지 내용 때문인지 검증하는 짝 이득 지표를 제안하고, 기존 C2C·LatentMAS가 이득 대부분을 내용 없이 얻는다는 것을 보인다. 공유 모델이 초안을 쓸 때 만든 KV 상태를 1.05M 파라미터 게이트 인터페이스로 넘겨 MMLU-Redux 78.04%를 달성한다.
LLM 토론의 붕괴와 교정을 구분해 개입 정책을 다시 채점한다
다중 에이전트 LLM 토론을 최종 정확도로만 평가하면 처음 맞은 다수가 무너지는 붕괴와 처음 틀린 다수가 살아나는 교정이 뒤섞인다. 6,925개 MMLU-Pro 토론에 전이 원장을 적용해 붕괴 253건을 세고, 붕괴를 막는 개입이 오히려 교정을 더 많이 버린다는 것을 수치로 보인다.
Imprint Reader가 가중치 업데이트를 읽어 모델 행동을 교정한다
언어모델의 가중치 업데이트를 자연어로 읽어내는 Imprint Reader와, 그 읽기 신호로 원본 모델 행동을 교정하는 MetaEdit을 제안한 논문이다. 지식 읽기 Pass@100은 2%에 그쳤지만, 목표 과제 데이터 없이 유해 프롬프트 거부율과 BFCL 점수를 끌어올렸다.