AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
테스트타임 트레이닝이 자기 출력을 학습하면 실제 텍스트 예측이 무너진다
테스트타임 트레이닝이 자기 생성 텍스트로 가중치를 갱신하면 128K 토큰 스트림에서 사람이 쓴 텍스트 예측이 나빠진다. 논문은 되먹임 고리를 인과적으로 분해하고, 커밋 전 독립 실제 텍스트로 후보 상태를 검증하는 Settlement로 손상을 거의 제거한다.
SearchJev가 검색 에이전트의 잦은 짧은 판단을 로짓 한 번으로 대체한다
SearchJev는 검색 에이전트가 반복하는 짧은 판단을 자기회귀 생성 없이 첫 출력 토큰 로짓만으로 확률화하고, 불확실한 판단만 System 2에 넘긴다. 같은 크기 Qwen3.5 대비 판단 품질과 캘리브레이션을 개선하면서 5배 이상 빠르다.
툴 사용 AI 에이전트의 복구 능력을 과업 능력과 분리한 UndoBench 벤치마크
기존 에이전트 벤치마크는 정상 조건의 과업 완료율만 재서 장애 복구 능력을 가린다. UndoBench는 동일 시드 대조군과 장애군을 짝지어 실행하고 와이어 수준 효과 이력까지 검사해, 정상 수행률 83.54%인 에이전트의 조건부 복구율이 46.72%에 그친다는 사실을 보인다.
LLM은 이미 Jev식 결정 모델이며 파인튜닝은 언제 필요한가
Jev식 결정 모델은 자유 텍스트 없이 후보 확률분포를 반환한다. 이 논문은 Qwen3.5-4B가 학습 없이 JevBench 81.4%를 기록하며, 파인튜닝은 약한 모델과 특정 과제에만 제한적으로 이득을 준다고 주장한다.
DiVeR는 VLA 검증기 학습을 결정적 상태에 집중시켜 성공률을 높인다
DiVeR는 VLA 정책이 샘플한 행동 표현의 분산으로 결정 임계 상태를 추정하고, 검증기 학습 가중치를 그쪽으로 재분배한다. LIBERO·RoboCasa·실제 Franka 실험에서 단일 샘플 대비 최대 13.6%p 성공률을 올렸고 검증 지연은 1ms 수준이다.
AutoSciBench는 과학 에이전트 벤치마크를 스스로 어렵게 만든다
과학 에이전트 벤치마크를 자동 생성하고 solver 피드백으로 과제를 점점 어렵게 정제하는 AutoSciBench를 제안한다. 컴퓨테이셔널 바이올로지와 재료과학에서 기존 벤치마크 대비 정확도를 각각 22.4, 25.5%p 떨어뜨리면서 품질 평가는 더 높았다.
EviSkill이 LLM 에이전트 스킬 수정을 실행 재현으로 검증한다
LLM 에이전트의 스킬을 파라미터 수정 없이 진화시키되, 각 수정안을 재현 가능한 실행 증거 카드에 묶어 재실행으로 검증하는 EviSkill을 제안한다. 세 개 대화형 벤치마크에서 기존 스킬 진화 기법을 앞서고, 전역 검증에서 탈락한 수정안의 72.9%가 이후 에포크에서 채택된다.
LLM은 순차 구조를 복원하지 못하고 표면 빈도만 맞춘다
LLM이 록-페이퍼-시저스와 n-gram 이어짓기 과제에서 잠재 전략을 복원하고 조건부 규칙을 생성으로 유지하는지 통제 실험으로 분해해 평가했다. 정확히 식별해도 규칙 실행이 보장되지 않고, 고차 의존성에서 규칙 복원이 무너지며, 표면적 분포 유사성이 잘못된 생성 메커니즘을 가릴 수 있음을 보였다.
힘 센서 없이 그리퍼 변형 영상으로 접촉 힘을 추정해 조작한다
부드러운 Fin Ray 그리퍼의 변형을 카메라로 관측해 접촉 힘을 추정하고, 그 추정값으로 생성 정책의 행동 후보를 골라 접촉이 많은 조작 성공률을 크게 높인 연구다. 캔 잡기 46.7%→86.7%, 베리 따기 0%→73.3% 등 네 과제에서 개선을 보였다.
PyINE가 코드 실행 검증으로 AI 감독의 사각지대를 드러낸다
코드 실행 트레이스를 정답 라벨로 삼아 추론 모델의 지름길 의존 실패를 재현하고, 여러 감독 기법이 그 실패를 얼마나 잡아내는지 비용까지 따져 평가한 프레임워크다. 값싼 감독자는 정작 중요한 실패를 놓치고, 강한 모델 감독자는 비싸고 임계값을 잡기 어렵다는 공백을 드러낸다.
확산 없이 다음 스케일 자기회귀로 희소 시점 3D 뷰를 합성한다
NAMVIS는 반복 디노이징 없이 다음 스케일 자기회귀만으로 희소 시점 다중 뷰를 합성하는 프레임워크다. Objaverse·GSO·OmniObject3D에서 PSNR·SSIM·LPIPS 모두 확산 베이스라인을 앞서고, 뷰당 0.6초로 3.3배 빠르다.
AI 비서가 되묻는 질문을 정보가치로 학습해 사용자 부담을 줄인다
이미지 생성 요청이 불충분할 때 어떤 질문을 먼저 해야 하는지를 정보가치 문제로 정식화하고, 시뮬레이션 사용자와의 다중 턴 상호작용으로 강화학습 후학습을 수행했다. 76명 참가자 456세션 실험에서 더 적은 질문으로 더 나은 결과를 얻었고 토큰 사용량도 줄었다.
판별적 표현 기하를 함께 학습해 드리프팅 모델의 원스텝 생성을 개선한다
드리프팅 모델이 픽셀 공간에서 잘 안 되는 이유를 KDE 표현 기하로 분석하고, 생성기와 함께 판별적 표현을 지속 학습해 사전학습 인코더 없이 FID를 82~95% 낮춘다. KDE 비율 손실과 드리프트 회귀 손실의 그래디언트 동등성, 속도 클리핑도 함께 제시한다.
LLM은 어떤 규칙을 코드로 검사할 수 있는지 스스로 판정하지 못한다
에이전트 검증기가 규칙을 고정 검사로 처리할지 판정자에게 넘길지 스스로 결정할 수 있는지를 6개 코퍼스, 4개 모델, 약 2만 2천 건 레이블로 측정한 연구다. 규제 텍스트에서 모델 판정이 양방향으로 갈리고 배포된 에이전트 규칙에서는 함께 틀리는 방향으로 치우침을 보이고, 실행 기반 게이트 CoVer를 제안한다.
SCF가 정규화되지 않은 밀도 샘플링을 자기일관성으로 학습한다
SCF는 정규화되지 않은 볼츠만 밀도에서 중요도 샘플링이나 샘플링 경로 역전파 없이 흐름 모델을 학습하는 방법이다. 목표 점수와 흐름 매칭 구조를 결합한 자기일관성 조건을 세우고, 자기 생성 샘플로 회귀 목표를 만들어 온라인 강화학습 정책 학습에 적용한다.
멀티에이전트 토론이 투표를 이기는 조건은 제안 공급과 검증 읽기다
멀티에이전트 토론이 단순 다수결을 못 이기는 이유를 제안 공급과 검증 인식 읽기라는 두 조건으로 분해한 논문이다. 신경 덩어리 에이전트를 커버리지로 선별하고 답별 검증 증거를 반영하는 읽기 모델을 결합해 Qwen3-4B와 OLMo3-7B에서 바닐라 토론 대비 평균 1~2점 개선을 보고한다.
로봇 정책의 내부 표현을 추론 시점에 조향해 분포 이동 성능을 되살린다
RoboIRS는 성공·실패 롤아웃으로 선형 분류기를 학습해 로봇 정책의 내부 표현을 추론 시점에 조향한다. LIBERO-PRO에서 π0.5의 평균 성공률을 44.4%에서 66.2%로 올리고, Cosmos Policy에서도 35.4%에서 55.4%로 개선했다.
ReLU 유닛별 투영으로 파인튜닝 망각을 줄인다
ReLU 레이어를 tropical 기하로 다시 읽어, 레이어 전체가 아니라 유닛별 open 토큰에만 제약을 거는 파인튜닝 projector를 제안한다. OPT-1.3b에서 Adam-NSCL보다 적은 방향으로 망각을 절반 이하로 줄인다.
FlashSwin이 Swin의 윈도 메모리 한계를 없애 큰 창과 촘촘한 토큰을 가능하게 한다
Swin 계열 윈도 어텐션이 점수 행렬을 통째로 만들어 O(M⁴) 메모리를 쓰던 문제를 FlashAttention과 윈도 로컬 2D RoPE로 해결한 FlashSwin을 제안한다. 32×32 창에서도 학습 메모리가 12.4GB로 고정되고, p=2·M=32 구성에서 ImageNet-1K 84.1%와 COCO 44.1 box AP를 달성한다.
롱비디오 VLM 효율은 프레임·해상도·전단 지연의 공동 배분 문제다
롱비디오 VLM 효율을 토큰 선택이 아니라 프레임 수·프레임별 해상도·전단 디코딩 지연의 공동 배분 문제로 재정의한 논문이다. 학습 없이 저해상도 영상 스트림과 소수의 고해상도 이미지를 결합하는 LoHi로 동일 토큰 예산에서 평균 정확도 10.6%p를 올리고 시간 단위 영상의 전단 지연을 최대 7배 줄인다.
ALoDLM이 토큰 난이도별로 확산 언어모델의 연산량을 배분한다
확산 언어모델이 자기회귀 모델보다 품질이 낮은 원인을 '연산-난이도 불일치'로 진단하고, 쉬운 토큰은 일찍 확정하고 어려운 토큰은 잠재 상태를 반복 정제하는 ALoDLM을 제안한다. 1.7B·8B 규모에서 11개 벤치마크 평균 65.5와 80.3을 기록해 비교한 모든 확산 모델과 Qwen3 자기회귀 기준선을 앞섰다.
VLA 정책의 지름길 의존을 데이터 교란으로 줄이는 PerturBot
VLA 정책이 성공 시연의 우연한 단서에 의존하는 '모달리티 지름길' 문제를 정의하고, 학습 데이터만 바꿔 이를 깨는 PerturBot과 오프라인 진단 지표 GroundFscore를 제안한다. 실제 로봇 General PnP에서 성공률을 84%로 두 배로 올리고, 지름길 의존도 함께 낮췄다.
VLA 추론 지연을 2단계 비균일 디노이징으로 줄인다
VLA 정책의 저속 추론과 고속 로봇 실행 사이의 시간 불일치를 모델·시스템 양쪽에서 측정해 분석하고, Flow Matching 디노이징 단계별 특성에 맞춘 2단계 비균일 샘플링으로 추론 시간을 61.6ms에서 22.0ms로 줄인다. π0.5 기반 양팔 옷 접기 과제에서 6가지 실시간 실행 기법을 같은 프레임워크로 비교한다.
Magic-W0가 로봇 행동과 3D 세계 상태 변화를 함께 예측한다
Magic-W0는 로봇 상호작용을 현재 상태·전이·미래 상태로 구조화하고, 3D 기하와 3D 모션, 미래 의미를 잠재 공간에서 감독해 행동 생성과 층별로 상호 조건화하는 세계-행동 파운데이션 모델이다. RoboDojo-Sim에서 비교 WAM 중 최고 점수를 기록했고, 개입 실험으로 행동 정보가 3D 표현을 거쳐 미래 의미 예측에 전달됨을 보였다.
DiffGate가 실패 궤적에만 난이도 비례 교사 지도를 주입한다
DiffGate는 GRPO의 결과 보상과 교사 증류의 토큰 지도를 결합해, 실패한 궤적에만 난이도 비례 교사 신호를 유계로 주입한다. Qwen3 0.6B~4B 학생에서 코드 pass@8이 최대 5.7점, 수학 pass@8이 3.9점 오르고 OOD 과학 벤치마크도 개선된다.
R-Quest는 질문 유효성과 참신성 피드백으로 자기진화 추론 모델의 붕괴를 막는다
자기생성 질문으로 스스로를 학습하는 추론 모델이 반복 학습에서 성능이 무너지는 원인을 무효 질문과 동일 수학 과제의 반복으로 진단하고, 해결책 R-Quest를 제안한다. 12개 벤치마크에서 최고 평균을 기록하고 10라운드 자기진화에서도 성능을 유지한다.
디코더를 줄여 인코더에 3D 기하를 몰아넣는 자기지도 표현학습
새 시점 합성(NVS)으로 기하 표현을 학습할 때 디코더의 공간 수용장을 1×1로 제한하고 픽셀 대신 DINOv3 잠재 특징을 예측 대상으로 삼는 SNAP을 제안한다. 5개 과제에서 자기지도 베이스라인을 앞서고 3D 정답 없이 기하 지도 모델에 근접한다.
월드모델의 망각은 결함이 아니다, 불변성 시간척도로 보존과 갱신을 나눈다
월드모델의 예측 대상은 고정된 라벨이 아니라 변하는 환경이므로, 낡은 지식을 버리는 것은 결함이 아니라 필수 동작이다. 이 포지션 논문은 지식을 불변성 시간척도로 층화하고, 불변량 회귀 테스트와 수정 지연을 분리해 보고하는 평가 프로토콜을 제안한다.
EyeRobot 2.0이 손목 카메라 없이 능동 시선으로 정밀 조작을 해낸다
고정 스테레오 카메라 한 대만으로 두 눈 시점을 3D 고정점에 수렴시키는 능동 시선 프레임워크 EyeRobot 2.0을 제안한다. 손목 카메라를 뺀 정적 스테레오 정책이 실제 성공률 52%에서 27%로 떨어지는 조건에서, 능동 고정은 실환경 40%·시뮬 20% 향상을 내며 손목 카메라 정책과 대등하거나 능가한다.
DINOv2 레지스터 토큰은 의미를, 고노름 패치 토큰은 질감을 맡는다
DINOv2 내부의 레지스터 토큰과 고노름 이상치 패치 토큰에 희소 오토인코더를 적용해, 전자는 고수준 의미를 후자는 배경·질감 구조를 담당한다는 증거를 제시한 해석 연구다. 상위 레지스터 특징을 제거하면 표현 유사도가 48.17% 떨어지지만 이상치 특징 제거는 0.31%에 그친다.