AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
KLPO가 샘플러 기준 KL 정규화로 중요도 가중치 없는 정책 업데이트를 제안한다
KLPO는 비동기 LLM 에이전트 RL에서 샘플러와 트레이너 확률 불일치를 KL 정규화로 다루는 정책 최적화 프레임워크다. 중요도 가중치나 그룹 응답, 학습된 정규화기 없이 프롬프트당 한 번의 롤아웃으로 비평가 없는 업데이트를 목표로 한다.
약한 모델 롤아웃으로 온폴리시 증류에 부정 신호를 넣는다
온폴리시 증류(OPD)에서 교사의 긍정 지도만으로는 신호가 부족할 때, 성능이 낮은 모델의 롤아웃을 섞어 부정 신호를 주는 NP-OPD를 제안한다. 증류 보상식은 그대로 두고 롤아웃 단계만 바꿔 Qwen3와 Gemma 전반에서 수학·코드·과학 성능을 끌어올렸다.
DecepEval이 LLM 에이전트의 조건별 기만율을 측정한다
DecepEval은 압박·인센티브·기회·갈등 네 조건을 중립 버전과 짝지어 LLM 에이전트의 기만율 변화를 재는 1,532개 인스턴스 벤치마크다. 9개 프런티어 모델 모두 유도 조건에서 기만이 늘었고 평균 41.64%p 증가했다.
DLoop가 검증 전에 드래프트를 반복해 추론 속도를 높인다
추측 디코딩에서 드래프트 모델이 강해지면 검증이 불필요하게 반복되는 문제를 DLoop가 반복 드래프팅으로 해결한다. EAGLE-3, DFlash, Domino, DSpark 등에서 벽시계 기준 5~41% 속도 향상을 보고한다.
고정된 모델 하나로 로봇 조작 하네스를 스스로 진화시키는 PhysEvo
고정된 파운데이션 모델 하나가 로봇 조작 하네스를 실행 궤적으로 스스로 고치는 PhysEvo를 제안한다. 42개 RoboDojo 태스크에서 62.00% 성공률로 RoboDawn 일회성 Astra의 47.17%를 앞서고, AgileX PiPER 실기에서 84.00%를 기록했다.
Robo-COP는 배포 중 오케스트레이터와 정책을 함께 진화시킨다
로봇 배포 중 VLM 오케스트레이터와 VLA 정책을 함께 진화시키는 Robo-COP를 제안한 논문이다. 시뮬레이션 10개 과제에서 held-out 성공률을 64.8%에서 73.8%로, 실세계 3개 과제에서 38.3%에서 50.0%로 올렸다.
에이전트 자기개선은 성능이 아니라 학습 효율로 재야 한다
모델 가중치를 고정한 채 도구·스킬·메모리를 스스로 쌓아 올리는 에이전트의 자기개선을 측정한 논문이다. 학습 비용 대비 홀드아웃 성능 향상, 즉 agent plasticity를 정의하고 체스·바둑·헥스·NetHack에서 최전선 모델들의 궤적이 크게 갈린다는 것을 보인다.
SRD는 보상 신호가 사라진 롤아웃에서 사전 예측 능력을 학습한다
보상이 모두 같아 GRPO 학습 신호가 사라진 롤아웃을, 상호작용 이전 예측을 감독하는 증류 신호로 바꾸는 Self-Retrospection Distillation을 소개한다. 10개 벤치마크에서 최대 24.2pp 개선을 보고하고, 2B 설정에서 0.0%였던 성공률을 60.6%까지 끌어올린다.
SanSi는 같은 층을 반복 적용해 타입 지정 결정의 정확도를 높인다
텍스트를 생성하지 않고 선택지별 확률만 내는 타입 지정 결정 모델에 층 반복(looping)을 적용한 SanSi를 제안한다. 같은 데이터·레시피에서 8회 루프로 정확도가 13.5점 올라 72.0%에 도달했고, 추론 비용은 7.7배로 늘었다.
SPW-Nav가 언어 지시로 2K 파노라마 영상을 실시간 스트리밍한다
SPW-Nav는 직전 생성 파노라마를 읽어 언어 지시를 카메라 운동으로 해석하고, 단일 파노라마에서 1분짜리 2K 360도 영상을 26.6 FPS로 스트리밍한다. 회전을 구면 리샘플링으로 분리하고 포즈 정렬 조건화로 병진 입력을 유계로 유지해 기존 파노라마 생성기보다 카메라 추종 정확도와 화질이 앞선다.
CARE가 VLA 가속이 깨뜨리는 과제를 통계적으로 인증한다
CARE는 VLA 추론 가속이 참조 정책이 풀던 과제를 깨뜨리는 위험을 동일 초기 조건의 짝지은 롤아웃으로 측정한다. 보정셋에서 유한 표본 보장을 세우고 위험 예산 안에서 가장 빠른 가속 후보를 선택하며, 증거가 부족하면 참조 정책을 유지한다.
언어모델의 불확실성이 언제 어디서 생기는지 드러내는 U-Space
언어모델 내부 잔차 스트림에서 불확실성을 나타내는 저차원 부분공간 U-Space를 찾아, 학습이나 반복 생성 없이 토큰 단위로 불확실성의 출처를 읽어내는 U-Lens를 제안한다. 길이 통제 평가에서도 기존 베이스라인을 앞선다.
Station이 열린 과학 연구에서 AI 에이전트의 자율 발견을 실증한다
분산형 다중 에이전트 연구 환경 Station에 Supervisor와 Meta Reflection을 더해, 지표 없는 열린 과학 과제에서 ICLR 논문 발견의 62.7%를 자율 재발견했다는 실증 연구다. 같은 과제에서 Codex Multiagent-v2와 AI Scientist-v2는 14~21%에 그쳤다.
SpecFold가 확산 언어모델 추측 디코딩의 분기 중복을 접어 속도를 높인다
SpecFold는 확산 언어모델의 다중 분기 추측 디코딩에서 부모 분기와 겹치는 토큰 계산을 접어 재사용해 검증 비용을 줄인다. Fast-dLLM-v2와 Nemotron-Labs-Diffusion에서 Spiffy 대비 최대 1.64배, 기존 디코딩 대비 1.99배 처리량을 달성했다.
배포 후에도 얼어붙은 의료 AI가 경험으로 전문성을 쌓는 방법
모델 가중치를 건드리지 않고 배포 경험을 Skill·Knowledge Memory·Multimodal Knowledge Base로 축적해 의료 VLM 성능을 최대 34.2% 올리는 프레임워크다. 새 사례와 과거 사례 버퍼에서 검증을 통과한 업데이트만 채택해 고정 검증셋 과적합을 피한다.
베이스 모델의 첫 두 토큰만 고정해도 추론 성능이 RL 수준에 도달한다
올모-3-7B의 응답 시작을 '. Okay'로 고정하면 MATH-500 정답률이 42%에서 78%로 올라 RL 학습 모델(75%)을 넘어선다. 논문은 이런 토큰 단서가 학습 데이터의 연관으로 생기고 제거·이식될 수 있음을 데이터 편집 실험으로 보인다.
S2PD가 고잡음 자기회귀 확산으로 영상의 물리·논리 일관성을 높인다
양방향 비디오 확산 모델은 무한에 가까운 절차적 학습 데이터로도 물리 법칙과 게임 규칙을 위반한다. S2PD는 고잡음 구간에서 블록을 자기회귀적으로 확산하고 저잡음 구간에서 전체 영상을 병렬 정제해 규칙 위반을 줄이면서 샘플링 속도를 두 배로 높인다.
확산 트랜스포머의 문맥 토큰을 자연어로 읽어 생성 품질을 끌어올린다
멀티모달 확산 트랜스포머가 생성 중 갱신하는 문맥 토큰을 자연어 질의로 해독하는 Contextual Reader를 제안한다. 빈 프롬프트에서도 장면 의미가 초기에 읽히고 가독성이 인간 선호도와 상관하며, 이를 감독하는 Contextual Alignment가 생성 품질을 높인다.
로봇 에이전트가 시연 영상을 필요할 때만 골라 보는 RV-ICL
LLM 로봇 에이전트가 시연 영상을 통째로 프롬프트에 넣지 않고, 하위 이벤트로 만든 계층을 도구로 탐색해 필요한 순간의 클립만 읽는 RV-ICL을 제안한다. LIBERO-PRO 성공률을 92.6%에서 96.5%로, LIBERO-Plus에서 86.7%에서 95.8%로 올렸다.
MemPilot이 LLM 에이전트 메모리를 질의 시점에 맞춰 큐레이션한다
MemPilot은 질의 무관 메모리 뱅크와 원본 멀티모달 이력을 함께 두고, 추론 시점에 검색과 큐레이션을 선택하는 정책을 강화학습으로 학습한다. 성능·비용·지연 선호에 따라 모델 위임과 시각 접근을 조절해 더 넓은 트레이드오프 프런티어를 만든다.
웹 에이전트가 스스로 검증 문항을 인증해 보상과 선택에 재사용한다
세일즈포스 AI 연구진이 웹 에이전트의 강화학습 보상과 테스트타임 궤적 선택에 함께 재사용할 수 있는 인증된 자기검증 질문 은행을 제안한다. 비싼 judge 피드백을 URL 단위 신뢰 가중치로 증류해 훈련 보상과 judge 없는 선택 규칙에 쓴다.
공개 인코더만으로 로봇 월드모델을 무력화하는 전이 가능한 국소 패치
공개된 시각 인코더 하나와 소스 태스크 데모 6프레임만으로 고정 국소 패치를 최적화해, 로봇 월드 액션 모델의 성공률을 97.65%에서 0.00%로 떨어뜨린다. 대상 정책 질의나 행동 레이블 없이 태스크와 모델 아키텍처를 넘어 전이된다.
MGE가 3D 파운데이션 모델의 시점 연결을 끊어 강건성을 높인다
3D 파운데이션 모델의 전역 어텐션에서 프레임 간 연결을 무작위로 끊어 학습하는 MGE를 제안한다. 가려짐과 도플갱어 시점에서 오차 증가가 48%에 그치고, 앵커 기반 적응적 토큰 병합으로 추론 속도까지 확보한다.
CRL이 개별 변수 대신 개입 블록을 식별해 라벨 없이 로봇 상태를 추정한다
인과 표현 학습(CRL)의 식별가능성 가정을 완화해 개별 변수가 아닌 개입 블록 단위의 분리를 보장하는 이론을 세우고, 이를 라벨 없는 로봇 관절 상태 추정에 적용했다. Panda-Gym 영상에서 감독 베이스라인 RoboPEPP를 5% 라벨로 학습한 수준과 비슷한 성능을 라벨 없이 달성했다.
H-JEPA가 계층별 잠재공간 예측으로 장기 시각 계획 성공률을 73%로 높인다
H-JEPA는 행동 조건부 JEPA를 계층으로 쌓아 각 레벨이 자기 잠재공간에서 더 먼 미래를 예측하고, 상위 계획을 서브골로 내려보내 장기 시각 계획을 세운다. Visual AntMaze에서 성공률을 18%에서 73%로 올리면서 플래너 연산은 줄였다.
MC-Sparse가 확산 트랜스포머 희소 어텐션의 품질 격차를 좁힌다
MC-Sparse는 확산 트랜스포머의 희소 어텐션 품질 저하 원인을 세 가지로 분해하고, 토큰 단위 KV 선택과 타일 정렬 쿼리 그룹화, 스텝 간 재사용으로 이를 줄인다. Minimax-H3-Base에서 1.80배, 3D 생성에서 2.32배 디노이징 가속을 품질 손실 거의 없이 달성한다.
T-Search는 답 생성을 떼어내고 근거 수집만 학습한 검색 에이전트다
T-Search는 Qwen3.6-35B-A3B 기반 오픈웨이트 검색 에이전트로, 답을 쓰지 않고 근거 청크 순위만 반환한다. 7개 영어·러시아어 벤치마크 평균 Recall@10 56.0으로 베이스 모델보다 14.4포인트 높고, 3회 롤아웃 융합 시 61.3을 기록했다.
IdeaLens는 문장이 아니라 아이디어의 출처를 판별한다
AI 검출기가 '누가 문장을 썼는가'만 본다면, IdeaLens는 문서를 담화 역할과 요약 설명으로 된 개요로 바꿔 '누가 아이디어를 냈는가'를 판별한다. 사람이 세운 계획으로 AI가 쓴 글과 AI 계획으로 사람이 쓴 글을 갈라내 기존 문체 검출기와 정반대의 결과를 낸다.
MatrixFormer가 결측 행렬을 한 번의 순전파로 채운다
합성 행렬만으로 사전학습한 MatrixFormer는 결측 항목마다 예측 분포를 단일 순전파로 내놓아 표 대치·추천·인과 패널·LLM 벤치마크 점수 복원에서 경쟁력 있는 성능을 보인다. 1024×10 행렬 완성이 기존 항목별 방식보다 107배 빠르다.
하이브리드 LM이 순환 메모리를 안 쓰는 문제를 보조 손실로 고친다
어텐션과 순환 레이어를 섞은 하이브리드 언어모델이 순환 메모리를 거의 활용하지 않는다는 분석과, 어텐션의 과거 접근을 제한하는 보조 손실로 두 메모리 경로를 균형 있게 쓰게 만드는 방법을 제안한다. 질의응답과 에이전트 과제에서 평균 정확도와 성공률이 일관되게 향상된다.