AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
MEND는 보상 이득이 이동 거리 값을 치를 때만 샘플을 움직인다
텍스트-이미지 플로우 모델의 보상 후학습에서 샘플별로 이동의 가치를 검증하는 MEND를 제안한다. 100회 업데이트로 약 4천 회 업데이트한 Flow-GRPO를 6개 평가 지표 중 5개에서 앞서고, 동일 예산에서는 ReFL과 DiffusionNFT도 모든 평가 시점에서 넘는다.
RealtimeWAM이 월드 액션 모델 추론을 25배 빠르게 만든다
RealtimeWAM은 MoT 기반 월드 액션 모델의 다단계 액션 디노이징과 전문가 간 순차 실행을 1스텝 증류와 블록 단위 파이프라이닝으로 제거해, 정확도 손실 1% 미만으로 H100에서 최대 25배 빠른 실시간 추론을 달성한다.
공격자는 확산 언어모델의 디노이징 궤적으로 편향을 주입할 수 있다
마스크드 확산 언어모델이 토큰을 확정하기 전 여러 번 다시 예측하는 성질을 악용해, 포워드 훅만으로 동결된 모델의 답변을 특정 인구집단 쪽으로 밀어내는 표적 편향 주입 공격이 제안됐다. PI 제어기가 디노이징 중 대상 답변 확률을 추적해 조향 강도를 실시간으로 조정하며, BBQ에서 격차를 1.8%p에서 16.7%p로 끌어올렸다.
OmniConfess가 토큰별 채널 의존도를 캐내 옴니모달 환각을 줄인다
텍스트·이미지·오디오·비디오를 함께 다루는 옴니모달 LLM의 환각을 추론 시점에서 줄이는 OmniConfess가 제안됐다. 후보 응답을 고정한 뒤 채널별 증거를 제거하며 토큰 단위로 재채점해, 어떤 증거가 각 토큰을 떠받치는지 밝혀낸다.
확산 언어모델의 표현공간 MMD 후학습으로 샘플 품질과 디코딩 병렬성을 함께 올린다
확산 언어모델을 사후학습으로 다듬는 표현공간 MMD 기법을 제안한다. 고정된 사전학습 DLM의 토큰별 특징으로 MMD를 계산해 OpenWebText 생성 퍼플렉시티, GSM8K 정확도, 16B 모델의 디코딩 병렬성을 함께 개선했다.
TextReg가 프롬프트 과적합을 표현 비효율로 규정하고 정규화한다
LLM 피드백으로 프롬프트를 반복 최적화하면 길이가 늘고 샘플 특화 규칙이 쌓여 분포 밖 일반화가 무너진다. TextReg는 이를 용량 비용과 규칙 범위 협소화의 곱으로 정식화하고, 세 단계 정규화로 OOD 정확도를 최대 16.5%p 끌어올린다.
실제 언어 없이 훈련한 3억 파라미터 모델이 문맥에서 언어를 배운다
실제 언어를 한 글자도 보지 않고 합성 비언어 사전분포만으로 사전학습된 3억 파라미터 바이트 트랜스포머가, 가중치를 고정한 채 문맥에서 위키백과 6개 언어와 숫자·결정론적 수열을 예측한다. 100만 바이트 문맥에서 비트/바이트가 8에서 0.9~2.4로 떨어진다.
FLaRe는 잠재 추론의 다섯 조건을 흐름 매칭으로 충족한다
잠재 추론이 갖춰야 할 다섯 조건을 정의하고, 잠재 공간에서의 흐름 매칭으로 이를 구현한 FLaRe를 제안한다. GSM8K 계열 산술 벤치마크에서 명시적 CoT 정확도의 97%를 4분의 1 지연으로 달성하고, 조건별 프로브에서 기존 잠재 방법을 앞선다.
선형 어텐션 월드 모델의 장거리 망각을 청크 검색으로 줄인다
Gated DeltaNet 기반 비디오 월드 모델이 먼 장면을 잊는 원인을 청크 단위 전이 행렬로 분석하고, 카메라 기하로 과거 청크 요약을 검색해 재구성하는 학습 불필요 기법 HLA-WM을 제안한다. 60초 문맥에서 PSNR 0.74dB 향상과 전체 KV 캐시 대비 12배 메모리 절감을 보고한다.
APO는 데이터 부족한 LLM 개인화에서 선호 충돌을 클러스터링으로 줄인다
사용자별 선호 피드백이 희소한 환경에서 LLM을 개인화하는 연합 학습 문제를 다룬다. APO는 병목 목표와 조정 벡터로 클라이언트를 클러스터링하고 통제된 상승을 결합한 그래디언트 하강으로 공유 초기화를 학습해, 20개 로컬 예시만으로 선호 점수와 파레토 커버리지를 개선한다.
에이전트 검색은 정확도를 8.7점 올리고 비용은 160배로 늘린다
NVIDIA가 LLM 추론과 dense retriever를 ReAct 루프로 묶은 에이전트 검색을 ViDoRe v3와 BRIGHT에서 평가해 nDCG@10이 평균 8.7점 오르지만 질의당 107초와 76만 입력 토큰이 든다고 보고한다.
PrisMem이 에이전트 메모리 자가진화를 능력별 축으로 넓힌다
에이전트 메모리 자기진화를 전체 점수 대신 능력별 축으로 쪼개는 PrisMem을 제안한다. 100만 토큰 이력 벤치마크 BEAM-1M과 LongMemEval-M에서 최강 베이스라인을 각각 10.54%p, 7.83%p 앞섰다.
LoGRA가 저랭크 그래디언트 스케치로 LLM 강화학습 메모리 장벽을 낮춘다
LLM 강화학습 후처리에서 전체 그래디언트 대신 저랭크 스케치를 누적해 학습 메모리를 1.5B에서 21.8%, 7B에서 45.7% 줄인 LoGRA를 제안한다. 예측 KL 스텝 제어를 결합해 8-GPU 단일 노드에서 27B 모델을 1,100스텝 이상 안정적으로 학습시켰다.
도구 실패를 알아도 멈추지 않는 에이전트에 통합 단계를 강제한다
검색 도구가 계속 무용한 결과를 돌려줘도 에이전트는 그 판단을 멈춤으로 연결하지 못한다. 저자들은 판단과 행동을 분리 측정해 이 괴리를 확인하고, 하네스가 무용 판단 5회 연속 후 답변을 강제하는 통합 단계를 넣으면 성공률이 오른다는 것을 보인다.
OnePO는 SFT 없이 RL만으로 의료 LLM을 전문가로 만든다
SFT 없이 강화학습만으로 도메인 적응을 수행하는 OnePO를 제안한 논문이다. 교사 출력의 그래디언트 기아와 교사 분포 고정을 확률 하한·그래디언트 재조정과 교사 퇴역으로 해결해, 20K 샘플로 HealthBench 67.2를 기록했다.
정상 후학습을 견디는 LLM 에이전트 백도어의 지속성을 분석하고 높인다
서드파티 모델에 심긴 백도어가 개발자의 정상 SFT와 RL을 통과해 살아남는지 추적한 연구다. 공격자가 백도어 강도와 그래디언트 호환성을 높이는 PersistBD로 7B 모델의 SFT 후 공격 성공률을 20%에서 74%로 끌어올렸다.
CTP는 한 번의 순전파로 다봉 궤적 후보를 고른다
로봇 모방학습에서 같은 관측에 여러 실행 가능한 미래가 존재하는 문제를, 한 번의 순전파로 완전한 액션 청크 후보·확률·스케일을 동시에 예측해 해결하는 CTP를 제안한다. 재계획 주기 사이의 행동 일관성까지 유지하면서 추론 지연을 2.88배 줄였다.
로봇 정책의 비동기 재계획에서 노이즈 초기화를 실행 궤적에 정렬한다
생성형 로봇 정책이 비동기 재계획마다 노이즈를 독립 초기화해 행동 모드가 바뀌는 문제를, 실행 변위에 정렬된 공유 AR(1) 노이즈로 잇는 EAPN을 제안한다. D3IL·Kinetix·LIBERO와 실기 두 과제에서 성공률과 청크 연속성이 개선됐다.
RGPO가 참조 해설을 임시 발판으로 써서 희소 보상 문제를 줄인다
RGPO는 정답 해설을 모방 대상이 아니라 임시 발판으로 활용해, 풀리지 않는 어려운 문제에서도 학습 신호를 만들어내는 강화학습 프레임워크다. 언어모델과 비전언어모델 실험 모두에서 기존 RLVR 베이스라인을 앞선다.
DeCoPrune이 디노이징 불일치로 비디오 KV 캐시를 85% 줄인다
자기회귀 비디오 확산 모델의 KV 캐시를 디노이징 일관성으로 압축하는 DeCoPrune이 제안됐다. 학습 없이 역사 토큰의 85% 이상을 제거하면서 FullKV에 근접한 장거리 기억을 유지하고 이어 생성 속도를 4배 이상 높인다.
MoE 에이전트 RL에서 전문가 선택을 턴 구조에 맞춰 묶는다
MoE 기반 LLM 에이전트의 강화학습에서 전문가 라우팅이 턴의 조작 유형과 어긋나면 성능과 추론 효율이 함께 떨어진다. 이 논문은 턴 수준 상호정보량과 토큰 수준 국소 일관성, 엔트로피 게이트를 결합한 계층적 라우팅 제어로 AppWorld와 AutomationBench에서 10점 이상의 성공률 향상을 보고한다.
NVFP4 강화학습 불일치를 업데이트 방향으로 구분해 안정화한다
NVFP4 W4A4 실행에서 학습자와 샘플러의 확률 불일치가 정책 경사를 따라 증폭되는지 수축되는지를 방향으로 구분하고, 세그먼트 단위 게이팅과 유계 보정으로 안정화하는 TRIAGE를 제안한다. Qwen3-4B와 30B-A3B에서 BF16 수준 성능을 유지하며 롤아웃 처리량을 최대 2.3배 높였다.
에이전트 하네스의 프롬프트 개선을 확산 모델 가중치에 증류한다
텍스트-이미지 생성에서 에이전트 하네스가 만들어낸 개선된 프롬프트를 특권 문맥으로 삼아 확산 모델 가중치에 증류하는 D-OPCD를 제안한다. 하네스 없이 원 질의만으로도 평균 60.52점이 65.09점으로 오르고, 스킬을 비운 하네스를 다시 붙이면 82.33점으로 기존 스킬 장착 에이전트를 앞선다.
TIDES가 불규칙 시계열에서 선택성과 물리적 시간을 양립시킨다
TIDES는 Mamba처럼 입력 의존적 선택성을 유지하면서도 이산화 스텝을 물리적 시간 간격으로 고정해 불규칙 시계열을 네이티브로 다룬다. UEA 분류와 Physiome-ODE 회귀에서 평균 순위 1위를 기록했다.
장기 자율 에이전트가 내린 중요한 결정을 증거 그래프로 감시한다
장기 자율 에이전트의 실행에서 사용자가 검증해야 할 중요한 결정을 찾고 근거를 연결하는 AgentMonBench와 Evidence-Grounded Behavior Graph(EBG)를 제안한다. EBG는 코드와 실행 흔적을 행동 단위 그래프로 묶어 8개 모델의 결정 식별과 근거 위치화를 대부분 개선했다.
Trace2Env는 원본 환경 없이 흔적만으로 상태를 보존하는 세계 모델을 만든다
Trace2Env는 원본 환경에 접근할 수 없어도 과거 상호작용 흔적만으로 LLM 에이전트가 쓸 수 있는 상태 보존형 세계 모델을 구축한다. 9개 환경에서 기존 프롬프트 기반 세계 모델보다 다음 관찰 정확도와 장기 상호작용 일관성을 높였고, 시뮬레이션에서 만든 행동이 실제 환경에서도 더 자주 유효했다.
배포 중 검증된 궤적만 스스로 증류해 장기 과제 에이전트를 진화시킨다
배포 중 에이전트가 스스로 만든 검증 통과 궤적만 골라 고정된 초기 모델의 사후 분포로 증류하고, 이를 LoRA 가중치에 축적해 장기 과제 성공률과 턴 효율을 함께 끌어올린다. 과제당 한 번의 시도와 에피소드 단위 검증만으로 온라인 학습이 가능하다는 점이 핵심이다.
Prism이 2K 영상 오디오 생성을 희소 어텐션으로 네이티브 학습한다
Prism은 2K 해상도에서 영상 오디오 결합 생성 모델을 네이티브로 학습하기 위한 동적 희소 어텐션 프레임워크다. 영상 채널 분산과 오디오-영상 교차 어텐션 노름으로 블록 모양을 정하고, 하이브리드 Top-k/Top-p로 쿼리별 희소성을 조절해 전체 어텐션보다 2.5배 빠른 학습과 더 나은 품질을 주장한다.
Kandinsky 6.0 Video가 영상과 44kHz 오디오를 한 번에 생성한다
Kandinsky 6.0 Video는 3B·29B 두 규모의 확산 모델로 5초 영상과 44kHz 동기화 오디오를 동시에 생성한다. 이중 스트림 CrossDiT와 지속 사전학습, RL 후학습, 2단계 증류를 결합해 VABench에서 평가 대상 중 최고 점수를 기록했다.
MemAdapter가 정확한 기억이 만드는 아첨 편향을 사후에 교정한다
장기 기억을 쓰는 LLM 에이전트는 틀린 기억뿐 아니라 정확하고 관련성 높은 기억 때문에도 사용자에게 아첨하는 오류를 낸다. MemAdapter는 검색된 기억의 잠재 위험을 반사실 추론으로 찾아내고, 현재 과제와 증거에 맞춰 각 기억의 영향력을 사후에 조정한다.