AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
3D 기하 단서를 교사에게만 주는 증류로 VLM 공간 추론을 고친다
RGB만으로는 깊이와 방향을 알 수 없어 VLM의 공간 추론이 약하다는 문제를, 3D 스캔에서 뽑은 깊이·의미·BEV 단서를 교사에게만 텍스트로 주는 증류로 푼다. 4B 백본에서 VSI-Bench 57.1, 나머지 4개 벤치 평균 37.6으로 GRPO와 기존 OPSD를 앞선다.
VLM 에이전트가 성공 궤적을 시각 스킬 카드로 축적해 정책과 함께 진화한다
ViSkill은 성공 궤적을 주석 프레임과 전략 설명을 합친 시각 스킬 카드로 저장하고, 기하 기반 검색과 스킬 유도 보상으로 정책 최적화와 함께 진화시킨다. Sokoban·FrozenLake·PrimitiveSkill에서 전체 성공률 0.89, 콜드스타트 적용 시 0.91을 기록했다.
샤오미 MiMo-V2.6이 RL 컴퓨트 확장으로 자기개선 경로를 제시한다
샤오미가 MiMo-V2.6-Pro와 Flash를 공개하며 RL 컴퓨트를 배치·환경·채점 세 축으로 확장해 자기개선 성능을 끌어올렸다고 보고한다. DeepSWE 평균@3는 58.4에서 72.6으로 올랐고, 9B 증류 모델과 RL 환경·프레임워크도 함께 공개했다.
MARGIN이 이종 모델 확신 점수를 실행 중에 모델별로 보정한다
MARGIN은 여러 파운데이션 모델이 보고한 확신도를 모델별·확신 구간별로 실행 중에 보정해 코디네이터의 답 선택을 개선하는 방법이다. BigCodeBench에서 확신도와 정확도가 역상관을 보였고, 분포 이동 후 ECE를 다섯 온라인 베이스라인보다 낮췄지만 정오답 피드백이 전제다.
Remory가 요약 뒤에 학습된 잔차 메모리 토큰을 붙여 컨텍스트 압축 손실을 줄인다
Remory는 컨텍스트 압축 시 텍스트 요약 뒤에 학습된 소프트 메모리 토큰을 덧붙여, 동결된 LLM이 전체 이력을 본 것에 가까운 다음 행동을 내도록 돕는다. SummHay에서 인용 F1이 4.04점 오르고, 장기 에이전트 벤치마크에서 반복 도구 출력과 오류가 줄었다.
Memento 3가 얼린 LLM으로 세계 모델을 스스로 고쳐 쓴다
Memento 3는 LLM 가중치를 고정한 채 자연어 규칙서와 컴파일된 실행 코드를 외부 메모리로 유지하며 세계 모델을 반복 수정한다. ARC-AGI-3 공개 25개 게임 전 레벨을 사람 행동 수의 44%로 클리어하고, Atari Pong에서 21:0 컨트롤러를 학습한다.
AI 에이전트 스킬 복사망을 git 이력으로 복원해 감사 대상을 고른다
AI 코딩 에이전트의 SKILL.md 스킬이 저장소 간 복사로만 퍼지는 공급망을 git 이력으로 복원한 연구다. GitHub 전역 219만 건 채택을 추적해 스타가 아니라 복사 out-degree가 감사 우선순위를 알려주며, 상위 100개 저장소 검토로 고위험 채택 14.9%를 막을 수 있다고 주장한다.
전이법칙 격자가 디코딩 스케줄 순위를 실행 전에 예측한다
디퓨전과 자기회귀를 하나의 손상 격자 위 경로로 통합하고, 각 스케줄이 버리는 의존성을 비용으로 정의해 디코딩 전에 성능 순위를 예측한다. 텍스트·이미지·비디오 생성에서 대부분의 예측이 실측 순위와 일치했다.
Ledger가 자기중심 영상에서 3D 객체 기억을 구축해 공간 질문에 답한다
자기중심 영상에서 물체의 위치, 이동 이력, 맥락 설명을 담은 영구적 3D 객체 기억 Ledger를 오프라인으로 구축한다. HD-EPIC 정확도를 29.7%에서 42.6%로 끌어올리고 Ego4D 객체를 중앙값 0.99m 오차로 찾아낸다.
RLVR에서 탐색을 별도 정책으로 분리해 성능 저하 없이 확장한다
컬럼비아대 연구진이 RLVR에서 탐색과 최적화를 분리하는 ExpDis를 제안한다. novelty 보너스는 별도 탐색 정책에만 주고 필터링된 궤적만 학생 정책에 증류해, DAPO 대비 수학 추론 정확도와 pass@k를 함께 개선했다.
RoboPrompt는 스케치와 점 하나로 로봇 정책을 조종한다
RoboPrompt는 2D 스케치·목표점·방향 지시를 0.77B VLA로 행동 초안으로 바꾸고, 확산·플로우 정책의 디노이징에서 다듬어 파인튜닝 없이 정책을 조종한다. 세 정책에서 프롬프트 정렬 95% 이상, DAgger 반복 후 성공률 15.5~21.3% 향상과 개입 44~82% 감소를 보고한다.
EngramEdit이 조건부 메모리만 고쳐 LLM의 사실 지식을 갱신한다
DeepSeek Engram류 조건부 메모리의 n-gram 임베딩만 갱신해 LLM의 사실 지식을 백본 수정 없이 바꾸는 EngramEdit을 제안한다. CounterFact·ZsRE에서 편집 성공과 일반화가 크게 오르고, MQuAKE CoT 다중 홉 정확도는 최강 베이스라인의 약 3배다.
자동회귀 영상 사전학습이 로봇 월드액션 모델의 긴 문맥 활용을 가능하게 한다
NVIDIA 등 연구진이 제안한 Long-WAM은 로봇 영상으로 자동회귀 사전학습을 먼저 수행한 뒤 월드액션 모델로 적응시켜, 19.2초 문맥에서 GR-1 성공률을 78.7%까지 올렸다. 비동기 실행과 NVFP4 양자화로 RTX 5090에서 액션 청크당 107.4ms를 달성했다.
VLA 로봇의 지시문 표현 민감도를 재작성 규칙으로 줄인다
π0와 π0.5 같은 VLA는 지시문의 단어 하나만 바뀌어도 성공률이 수십 점 출렁인다. 이 논문은 소수의 훈련 과제에서 롤아웃 증거를 모아 LLM으로 10~20개의 재작성 규칙을 증류하고, 배포 시 지시문을 한 번만 고쳐 쓰는 무재학습 방법을 제안한다.
곡률로 GNN 지식을 MLP에 증류해 그래프 없이 추론한다
GNN 교사를 그래프 없는 MLP로 증류할 때 생기는 스펙트럼 불일치를 올리비에-리치 곡률로 진단하고, 경계와 내부 노드에 감독을 다르게 배분하는 G²MLP를 제안한다. 추론은 표준 MLP 그대로라 그래프 접근 없이 58배 빠르다.
망각 전용 언러닝은 왜 훈련 데이터 기억을 요구하는가
이 논문은 훈련된 모델과 삭제할 예시만 주어지는 forget-only 언러닝이 항상 가능하지 않음을 보이고, 성공하려면 모델이 훈련 데이터에 대해 얼마나 많은 정보를 기억해야 하는지 하한을 제시한다. threshold, PCA, ridge regression, 행렬 완성 등에서 일반 학습이 버린 정보가 삭제 요청 처리에 필요할 수 있음을 증명한다.
RoboJEPA가 로봇 월드모델의 연산량 스케일링 법칙을 세운다
메타 FAIR의 RoboJEPA는 12종 로봇 데이터로 학습한 잠재 월드모델의 상상 오차가 연산량에 대해 2차 멱법칙을 따른다는 것을 보인다. 오프라인 예측 오차가 실제 로봇 플래닝 성공률을 대신 예측하는 지표가 된다는 점이 핵심이다.
임베딩 모델이 검색 지시문을 무시하는 이유를 쿼리측 방해문으로 밝힌다
검색용 임베딩 모델에 붙이는 과제 지시문이 쿼리 벡터를 실제로 얼마나 바꾸는지 구조적으로 분석한 연구다. 의미는 비슷하지만 정답이 아닌 쿼리측 방해문을 평가에 넣으면 대부분 모델이 지시문을 무시하고, 이런 방해문으로 파인튜닝하면 다른 과제 성능 저하 없이 지시문 준수가 크게 좋아진다.
RECAST가 검색 대신 계산으로 근거를 만들어 RAG를 확장한다
RECAST는 검색만으로 답이 나오지 않는 과제를 위해 검색과 계산을 함께 쓰는 학습 기반 근거 구성 프레임워크다. 6개 벤치마크에서 평균 75.6% 성공률로 최강 베이스라인을 15.9%p 앞섰고, 미학습 벤치마크에서도 79.3%를 기록했다.
EmbodiedRSI가 물리 실험을 정보가치로 골라 로봇 스킬을 스스로 진화시킨다
로봇 파운데이션 모델을 얼려둔 채, 어떤 물리 실험을 다음에 돌릴지 정보가치로 선택해 코드와 스킬을 함께 진화시키는 에이전트 하네스 EmbodiedRSI를 제안한다. RoboCasa365에서 77.0%, LIBERO-Pro에서 86.8%, 실로봇 제로샷 전이에서 71.3% 성공률을 보고한다.
QuadTok이 쿼드트리로 이미지 토큰을 복잡도에 따라 배분한다
QuadTok은 이미지를 쿼드트리로 분해해 복잡한 영역에만 세밀한 토큰을 배분하는 시각 토크나이저다. ImageNet에서 고정 그리드 대비 약 10% 토큰을 아끼면서 rFID 1.46을 기록했고, 947M 생성기로 gFID 2.08을 달성했다.
인간 모션 데이터로 휴머노이드 보행을 자연스럽고 조종 가능하게 학습한다
인간 모션 데이터를 스타일 정규화로 활용하는 2단계 학습으로, 휴머노이드가 자연스러운 걸음걸이를 유지하면서 임의의 속도 명령에 반응하게 만든다. Atlas R1·D1과 Unitree G1에서 검증했고 약 3시간 분량의 모션캡처 데이터셋을 공개한다.
작업 영상 하나로 시뮬레이션 장면과 로봇 정책을 함께 만드는 Agentic RSR
Agentic RSR은 작업 영상 한 편에서 로봇 작업공간을 미터 단위로 재구성하고, 코딩 에이전트가 실행 가능한 정책을 개발해 실제 로봇으로 옮기는 Real-to-Sim-to-Real 프레임워크다. 18개 장면에서 Depth MAE를 0.90m에서 0.11m로 줄였고, 시뮬레이션에서 성공한 작업의 80%가 실제 로봇에서도 성공했다.
베이스 모델의 결정적 한 스텝만으로 코딩 에이전트 사후학습 성능을 예측한다
프런티어 모델의 성공 궤적에서 검증기가 처음 통과를 내는 결정적 스텝을 찾아, 그 지점에서 베이스 체크포인트의 확률 질량과 대안 구분, 생성 성공률을 재는 세 프로브를 제안한다. 열 개 베이스 모델에서 사후학습 SWE-bench Verified 순위와 ρ 0.90~0.99로 일치해 비싼 사후학습 전 스크리닝이 가능함을 보였다.
FoldBack는 놓친 파지를 되돌려 옷 접기 장기 작업을 스스로 복구한다
FoldBack은 옷 접기 같은 장기 조작에서 파지 실패를 감지해 로봇을 파지 직전 자세로 되돌리고, 실패 구간과 이후 일부 동작만 선택적으로 재생성하는 마스크 생성 정책이다. 실제 33벌 옷 실험에서 최종 접기 성공률 75.2%와 최종 마스크 IoU 0.837을 기록해 기존 최강 베이스라인 MGP-Long의 45.7%, 0.689를 크게 앞섰다.
교사의 후처리 변화만 옮기는 다중 교사 증류가 더 균형 잡힌 목표를 만든다
여러 교사 모델을 한 학생으로 증류할 때 교사의 최종 정책 대신 후처리 변화량만 옮기는 Δ-MOPD를 제안한 논문이다. 교차 기원 교사가 물려준 베이스 성향을 제거해 목표를 학생에 가깝게 만들고, 교사 3개 합성에서 수학 매크로 4.11pp를 개선했다.
MORCA가 강화학습으로 영상 확산 모델 캐시 재사용을 정밀 제어한다
영상 확산 모델의 캐시 재사용 스케줄을 강화학습으로 학습해, 사용자가 지정한 가속비를 지키면서 최종 영상 품질 손실을 줄이는 MORCA를 제안한다. Wan2.1·Wan2.2 실험에서 SeaCache 대비 PSNR을 최대 2.22dB 개선했다.
PHRBench가 환각 이후 추론을 행동 단위로 분해한다
환각이 섞인 문맥을 LLM이 어떻게 처리하는지 응답 수준에서 분해한 PHRBench가 4개 도메인 18개 모델 4820개 인스턴스로 평가한 결과, 평균 정확도가 7.7%p 떨어지고 성공적 복구는 드물게 나타났다. 프롬프트 특징만으로 성공적 복구를 AUROC 0.847로 예측할 수 있다는 것도 보였다.
RFPO가 플로우 정책의 1스텝 실행 손실을 줄인다
RFPO는 보상으로 최적화한 플로우 정책을 1스텝 오일러 실행에서도 안정적으로 동작시키는 학습 프레임워크다. Unitree Go2에서 64스텝 대비 보상 98.5%를 유지하면서 추론 지연을 4.39ms에서 0.08ms로 줄여 54.9배 속도를 냈다.
장문맥 하이브리드 모델의 성능은 위치 편향 배합이 결정한다
풀어텐션과 슬라이딩윈도·선형 어텐션을 섞은 하이브리드 모델이 왜 장문맥에서 강한지를 위치 편향 관점에서 분석한 논문이다. 위치 편향 어텐션에 슬라이딩 윈도를 걸고 NoPE 어텐션의 전역 집계를 강화하면 4k 학습으로 64k까지 16배 무학습 외삽이 가능하다고 주장한다.