AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
CSF는 장면 맥락에 따라 모션 생성기의 위험 동작을 걸러낸다
텍스트 기반 모션 생성기는 사람과 사물을 구분하지 못해 같은 동작도 장면에 따라 위험해진다. CSF는 자연어 안전 규칙을 생성기 자체가 만든 안전·위험 참조 동작에 정박시켜, 재학습 없이 CBF-QP로 위험한 동작만 최소한으로 교정한다.
자아중심 영상 3만 시간도 물체 상호작용 모델링을 못 가르친다
자아중심 인간 조작 영상 3만 시간으로 학습한 Cosmos 3 월드 모델을 직접 측정한 연구다. 데이터를 100배 늘려도 에이전트 충실도는 일찍 포화되고 조작 물체의 상호작용 충실도는 훨씬 낮은 상한에 머물러, 병목은 데이터 양이 아니라 학습 방식이라고 주장한다.
SpatialHarness가 가상 시점으로 로봇 정밀 조작 성공률을 높인다
프로즌 멀티모달 정책에 동기화된 시뮬레이션에서 렌더링한 보조 가상 시점과 객체 자세를 제공해 로봇 정밀 조작 성공률을 높인다. 실제 Franka 로봇 4개 과제에서 평균 성공률이 18.33%에서 83.33%로, 타워 오브 하노이는 0%에서 100%로 올랐다.
Bi-FORK가 고차원 분기계의 다중 해 분포를 한 번에 생성한다
Bi-FORK는 대칭 깨짐 분기에서 하나의 입력이 여러 해를 갖는 고차원 물리계를 잠재 플로우 매칭으로 학습하고, 추론 시 반발 기반 샘플링으로 서로 다른 해 분기를 한 번에 복원한다. 최대 26만 개 이산화 지점에서 기존 확률적 방법보다 수백~수천 배 빠르게 다중 모드 해 분포를 재현한다.
하나의 트랜스포머 블록을 반복 사용해 깊이별 전문가로 ViT를 대체한다
reViT는 하나의 트랜스포머 블록을 모든 깊이에서 재사용하면서, 정규화된 깊이 좌표로 FFN 전문가 뱅크를 혼합해 깊이별 변환을 복원한다. ImageNet-1k 지도학습과 DINOv2 증류에서 전체 깊이 ViT에 근접한 정확도를 훨씬 적은 저장 파라미터로 달성한다.
AdamW 4비트 옵티마이저 상태 양자화를 프리컨디셔너 공간 반올림으로 개선한다
AdamW의 1·2차 모멘트를 4비트로 저장할 때 반올림 좌표를 상태 공간에서 프리컨디셔너 공간으로 옮긴 ZIP-SR과, 0 제외 코드북에 EDEN 보정을 결합한 ZE-EDEN을 제안한다. 130M~2.7B 사전학습과 3B·8B 파인튜닝에서 TorchAO 4비트 AdamW보다 32비트 AdamW와의 검증 손실 격차를 줄였다.
GNR이 흐름 정합으로 사람 손 동작을 로봇 궤적으로 바꾼다
사람 손 시연을 로봇 궤적으로 옮기는 물리 기반 리타게팅을 조건부 흐름 정합 모델로 재정식화한 GNR을 소개한다. MPC 샘플 예산의 8.5%만 써서 성공률 56.2%를 달성하고, 3.3천 개 기하에 걸친 22.3만 궤적 데이터셋을 생성했다.
AI 에이전트 집단은 협업하면 인구 임계점을 넘어 폭주한다
AI 에이전트가 협업으로 사이버 능력을 키우면 개별 능력이 그대로여도 집단 규모가 임계점을 넘는 순간 스스로 증식하는 폭주가 시작된다는 생태학 모델을 제시한다. 소규모 레드팀 평가만으로는 생태적 안전을 보장할 수 없다고 저자들은 주장한다.
VioLA가 관절 명령 대신 동작 잠재값을 예측해 휴머노이드 제로샷 제어를 연다
VioLA는 휴머노이드 정책이 관절 명령 대신 몸과 손의 동작 잠재값을 예측하도록 바꿔, 사람 시연 93%가 섞인 1억 4천만 프레임으로 학습한다. 실제 Unitree G1에서 과제별 미세조정 없이 이동 100%, 조작 88.6% 성공률을 기록했다.
확산 궤적 모델의 불확실성을 실시간 제어에 바로 쓰게 만드는 SCOPE
확산 궤적 모델에서 Monte Carlo 샘플링 없이 제어용 불확실성을 뽑아내는 경량 모듈 SCOPE를 제안한다. 로그 밀도의 곡률을 구조적 정밀도 행렬로 증류해 1ms 미만의 가우시안 튜브를 만들고, 보행자 예측과 내비게이션, 실제 Franka 조작에서 폐루프 성능을 높인다.
RoboRSI가 실패를 스킬 단위로 귀속해 로봇 자기개선을 안정화한다
코드로 행동하는 로봇 에이전트가 실행 실패를 스킬 계층의 책임 노드에 귀속시키고 검증을 통과한 수정만 재사용하는 RoboRSI를 제안한다. 물리 로봇 104라운드 개발과 LIBERO·LIBERO-PRO·LIBERO-Plus·RoboTwin 네 벤치마크에서 최고 성공률을 기록했다.
안전 제약 강화학습을 하나의 벨만 연산자로 통합한다
안전 제약 강화학습에서 과제 성능과 안전을 하나의 벨만 연산자로 묶어 동시에 학습하는 방법을 제안한다. 두 시간 스케일 확률 근사로 안전 가치와 결합 가치를 분리 학습해 이론적 안전 보장과 최적 성능을 함께 주장하고, MuJoCo 연속 제어 실험에서 위반 비용을 거의 0으로 유지했다.
WOVEN이 시각 전이 추론을 MLLM의 공용 훈련 원시능력으로 제시한다
다중모달 LLM의 공간·물리·시간 추론 실패가 시각 전이 추론의 공통 결손에서 비롯된다는 가설을 검증한 논문이다. 비디오 생성 모델로 만든 36,076개 전이 데이터로 학습하면 26개 외부 벤치마크 중 22개가 최대 27.3%p 개선된다.
가치 파인튜닝이 다른 가치로 번지는 정도를 학습 전에 예측한다
앤트로픽 헌법의 66개 가치로 DPO·SFT 파인튜닝을 돌려 49×66 일반화 행렬을 만들고, 학습 전에 이를 예측하는 표현 방법을 벤치마크했다. 활성화 기반 페르소나 벡터가 상관 0.45로 텍스트 설명 기반 0.05를 크게 앞섰다.
HarmBench 안전 점수는 단일 속성을 측정하지 못한다
HELM Safety의 안전 점수가 'harmful refusal'이라는 단일 속성을 재는지 심리측정학으로 감사한 논문이다. HarmBench 응답은 여러 잠재 차원을 요구하고, 개발자 연계 문항 차별 기능이 단일 점수에서 나타나 단일 속성 해석이 성립하지 않음을 보인다.
LeWAM이 재구성 없는 월드액션모델로 계획 실패를 해결한다
NVIDIA가 픽셀 재구성 없이 JEPA 잠재공간에서 네 가지 모드를 함께 학습하는 월드액션모델 LeWAM을 제안한다. 추론 시 정책 헤드의 노이즈 공간에서 계획하면 동역학 오차 악용을 막아 폐루프 성공률이 크게 오른다.
AgentGarten이 코드 월드와 실시간 신경 렌더러로 에이전트 학습을 가속한다
AgentGarten은 시뮬레이터가 상태와 규칙을 유지하고 신경 렌더러가 실시간으로 관측을 합성하는 코드 월드 프레임워크다. 사전학습 에이전트가 4라운드 만에 전략을 습득하고, H100 한 장에서 480×832 영상을 초당 35프레임 이상 생성한다.
V-CoLA가 선형 어텐션 VLM의 비전 토큰을 학습 없이 압축한다
Qwen3.5 같은 선형 어텐션 하이브리드 VLM에서 기존 비전 토큰 압축 기법이 랜덤 수준으로 무너지는 문제를 분석하고, 상태 재구성 오차와 고유성 신호로 중요 토큰을 골라 압축하는 학습 불필요 프레임워크 V-CoLA를 제안한다. 토큰 50%로 원 성능의 99.5%, 12.5%로 88% 이상을 유지하며 prefill을 최대 6.15배 가속한다.
TokenRouter가 토큰 단위 LLM 라우팅 서빙 병목을 걷어낸다
토큰 단위 LLM 라우팅은 효율과 품질을 크게 높이지만 기존 단일 LLM 서빙 시스템에서는 스텝 비동기화와 배치 편입 지연이 발생한다. TokenRouter는 요청 중심 프로그래밍과 모델 중심 비동기 실행, 지연 배칭 스케줄러로 이를 해결해 최대 64.15배 처리량을 낸다.
InfiLoop는 반복 추론에서 최신 상태만 넘기지 않고 과거 계산을 선택적으로 누적한다
루프 트랜스포머가 깊어질수록 최신 상태만 다음 반복으로 넘기는 방식이 정답 중간 계산을 덮어쓰는 문제를 InfiLoop가 해결한다. 콘텐츠 점수와 학습된 시간 감쇠로 과거 후보를 가중 합산해 7M 모델로 Sudoku-Extreme 97.9%, ARC-AGI-2 13.6% pass@2를 달성했다.
VibeEdit는 이미지 위에 그린 표시와 메모만으로 편집 대상을 지정한다
VibeEdit는 이미지 위에 원·낙서·화살표와 짧은 메모를 직접 그려 편집 대상과 내용을 지정하는 인터페이스를 제안한다. 155만 쌍으로 학습해 419건 벤치마크에서 VLM 루브릭 79.9점, 외부 영역 PSNR 32.8dB를 기록했다.
공간 캔버스에 생성 의도를 조립하는 포스터 생성 모델 Compo
텍스트 프롬프트 대신 2차원 공간 캔버스에 의미·정체성·텍스트·픽셀 바인딩을 배치해 포스터를 생성하는 Compo를 제안한다. 이미지 편집 모델을 LoRA로 적응시키고 20만 쌍의 자동 생성 데이터와 바인딩별 벤치마크로 범용·전용 시스템보다 높은 조형 제어력을 보인다.
SuperNav가 MLLM 파인튜닝 없이 임의 장면 내비게이션을 수행한다
사전학습 MLLM에 내비게이션 전용 파인튜닝 없이 에이전트 하네스를 씌운 SuperNav가 단일 물체 내비게이션 78.00%, 수요 기반 59.50% 성공률을 기록했다. 이미지 위 한 점으로 목적지를 지정하는 통합 인터페이스와 교체 가능한 운동 백엔드가 핵심이다.
혼합 모달 검색기에서 텍스트가 이미지를 앞서는 편향을 Trident가 교정한다
텍스트와 이미지가 섞인 코퍼스에서 검색 성능이 V자 곡선을 그리며 무너지는 현상을 분석한 논문이다. 무관한 텍스트가 무관한 이미지보다 더 치명적인 'Chaos in the Text'를 규명하고, 세 가지 뷰를 동등한 양성으로 학습하는 Trident로 이 편향을 줄인다.
LLM 프루닝 보정을 디코딩 활성값으로 옮겨 생성 품질과 속도를 함께 잡는다
LLM 추론의 디코딩 단계에서 프루닝 보정용 활성값을 고정 텍스트 대신 모델이 스스로 생성한 토큰에서 모아 정확도를 높이고, N:M SpMV 전용 커널로 A100에서 최대 1.48배 디코딩 속도를 낸다. WritingBench와 ClassEval에서 기존 C4 보정보다 최대 15점 앞섰다.
SpatialOPSD가 코딩 에이전트 흔적을 도구 없는 공간 추론으로 내재화한다
공간 추론 코딩 에이전트의 검증된 실행 흔적을 교사의 특권 정보로 삼아, 도구 없이 동작하는 단일 멀티모달 LLM에 온폴리시 자기 증류로 내재화하는 SpatialOPSD를 제안한다. MindCube와 ViewSpatial에서 SFT·GRPO를 앞서고 도구 사용 교사 성능의 91%를 단일 추론 패스로 달성한다.
LEGO는 깊이 추정 없이 3인칭 영상에서 1인칭 영상을 생성한다
3인칭 영상 한 편과 목표 1인칭 카메라 궤적만으로 1인칭 영상을 합성하는 LEGO는 깊이 추정과 포인트클라우드 재투영을 걷어내고 학습된 뷰 합성기 렌더를 확산 모델의 조건으로 쓴다. 합성기 대응 분포에서 얻은 신뢰도로 조건을 게이팅하고 초기 디노이징 단계를 유도해 Ego-Exo4D에서 기존 파이프라인을 앞선다.
ME-World가 여러 에이전트의 1인칭 영상을 하나의 세계로 묶는다
KAIST AI 연구진이 여러 에이전트가 같은 공간에서 상호작용할 때 각자의 1인칭 영상을 하나의 일관된 세계로 동시 생성하는 ME-World를 제안했다. 손과 몸의 세밀한 동작, 공유 환경 기억, 공동 디노이징을 결합해 환경·상태 변화·정체성 일관성을 높였다.
단일 정답 대신 여러 구현으로 테스트 품질을 다시 재는 TestPrism
LLM 코딩 에이전트가 만든 테스트를 단일 정답 구현이 아니라 유효 대안과 무효 구현 패널로 평가하는 TestPrism이 제안됐다. 최고 성능 에이전트도 결합 성공률 28.00%에 그쳤고, 저자들의 TestHelix는 동일 추론 예산에서 11.67~12.00%포인트를 끌어올렸다.
SpaceCast-Bench는 예측 공간 추론에서 인간과 모델의 격차를 보여준다
개입 이후 관측되지 않은 장면 상태를 추론하는 예측 공간 추론을 평가하는 첫 벤치마크 SpaceCast-Bench를 소개한다. 182개 실제 장면의 3,862문항에서 최고 모델은 58.0%로 인간 87.2%에 크게 못 미쳤고, 공간 특화 모델은 무작위 수준에 머물렀다.