AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
수학 추론 모델의 정답은 순서에 불변하나 내부 표현은 순서에 민감하다.
수학 규칙 순서를 바꿔도 정답은 같지만, 모델 내부 표현은 순서에 민감할 수 있다는 연구다. 1B~8B 언어모델 16개에서 permutation SNR과 정확도의 양의 상관을 확인하고, 합성 함수 합성 문제로 답 불변성과 표현 불변성을 구분할 필요성을 제시한다.
장기 상상과 실시간 손 조작을 비동기 확산으로 분리한 LiMA
장기 예측과 빠른 반응 제어를 분리한 비동기 이중 시스템 생성 프레임워크 LiMA를 제안한다. 느린 시스템이 의도를, 빠른 시스템이 고주기 동작을 맡아 추론 지연을 45.8% 줄이고 양팔 조작 6개 과제에서 70.8% 성공률을 기록했다.
도구 응답 예측 대신 에이전트의 추론-행동을 판정·수정해 장기 과제 오염을 막는 AEWM
LLM 에이전트의 장기 작업에서 누적되는 작업 상태 오염을 다루며, 툴 응답을 예측하는 대신 추론·행동이 미래 작업 진행에 미치는 영향을 모델링하는 AEWM과 EditAct를 제안한다. 기존 언어 월드 모델이 환경 관측을 예측하는 방식과 달리 실제 실행 피드백을 활용해 의사결정 기반 상태를 직접 바꾸는 접근으로, 여러 벤치마크에서 개선을 보고한다.
DART가 동결 표현을 유지한 채 디코드 경로 감독으로 잊힌 운동을 되살린다.
고정된 자기지도 잠재 공간에 flow를 얹은 월드 모델이 조용히 운동성을 잃는 원인을 학습 신호에서 찾아낸다. 표현은 그대로 두고 디코드 경로 감독으로 flow만 재학습하는 DART를 제안해 운동의 시간 구조를 되살리고, 픽셀 오차만 보는 평가가 정지 예측을 보상한다는 발견도 보고한다.
어텐션 값 투영을 레이어별 토큰 메모리로 대체하는 Memory Attention
언어 모델의 어텐션 값 생성을 토큰 인덱스 메모리와 컨텍스트 키의 결합으로 대체하는 Memory Attention을 소개한다. 추론 시 정규화를 메모리 테이블에 접어 조회와 덧셈으로 줄이고, CPU 오프로딩과 프리페칭으로 GPU 파라미터 저장을 낮출 수 있다.
점 집합 하나로 강체·관절·변형 물체 조작을 예측하는 월드 모델 PointCast
PointCast는 강체·관절체·변형체 조작을 하나의 점 집합 월드 모델로 다루는 연구다. 19.8M 파라미터 diffusion transformer가 점별 궤적을 예측하며, 시뮬레이션과 실제 로봇 데이터 실험에서 여러 베이스라인을 앞선다.
UECR-GRPO는 GRPO와 온폴리시 증류를 엔트로피보정 크레딧배분으로 통합한다
검증기 보상과 교사 모델 신호를 하나의 GRPO 업데이트 안에서 응답·토큰 수준으로 결합한 UECR-GRPO를 제안한다. 교사 엔트로피로 불확실한 지도를 감쇠하고 응답별 제로섬 투영으로 총 과제 크레딧을 보존한다.
합성곱 텐서 레이아웃 재배열로 마이크로스케일링 양자화의 이중 연산과 메모리 이동을 줄이는 MicroQonv
MicroQonv는 합성곱 층의 순전파·역전파에 마이크로스케일링 양자화를 결합해 텐서를 한 번만 양자화하고, im2col 이전에 활성값을 양자화해 메모리 이동을 줄인다. YOLO 계열 검출 모델과 엣지 지속학습에서 최대 7.53배 메모리 절감과 정확도 향상을 보고한다.
미래 예측을 버리고 현재 관측 디노이징으로 생성 DiT를 로봇 제어에 적응시키는 NowWAM
생성형 Diffusion Transformer 사전학습 지식을 로봇 제어로 옮기는 방법을 다시 묻는다. 미래 예측 없이 현재 관측을 디노이징하며 행동을 예측하는 NowWAM은 LIBERO-Plus에서 87.7%를 기록했다.
실패를 기억하는 이종 그래프로 소형 언어모델 도구 에이전트의 신뢰성을 높이는 FRESH
FRESH는 소형 언어모델 도구 에이전트의 실패와 성공 이력을 이종 그래프 메모리로 구조화해, 반복 실패를 줄이고 상태 기반 도구 사용의 신뢰성을 높이는 프레임워크다. τ-Bench와 AppWorld 실험에서 기존 메모리 기반 접근보다 과제 성공률과 도구 사용 신뢰성이 개선됐다.
ViT 특징 공간의 과제 유도 리만 계량을 진단하고 저랭크로 학습하는 방법
ViT 특징 공간의 유클리드·코사인 거리 가정을 작업 민감 리만 계량으로 대체하는 방법을 제안한다. 저랭크 근사 가능성을 진단하는 κ_cap(r)와 310K 중요도 헤드, DPT 깊이 추정에서 토큰 선택 오차 25% 감소를 보고한다.
KV 캐시 축출을 배포 위험 계약으로 재정의한 위험 제어 프레임워크
KV 캐시 축출을 평균 품질-메모리 절충이 아니라 배포 위험 제어 문제로 재정식화하고, 목표 위험과 신뢰도 계약을 만족하는 보존 정책을 보정 데이터로 인증한다. 인증 실패 시 전체 KV로 폴백하며, Llama·LongBench 등에서 같은 계약이 허용하는 축출 수준이 달라짐을 보인다.
FLEET는 LLM의 무기억 샘플링을 엔트로피 기반 궤적 검색으로 바꾼다
LLM의 temperature 샘플링은 이전 생성물을 기억하지 못해 중복 답변이 늘고 효율이 떨어진다. FLEET은 엔트로피 기반 궤적과 토큰별 효용 점수로 로짓을 조정해 3배 속도와 코딩 정확도 향상을 얻는다.
InGuard는 생성 파이프라인 내부 표현으로 T2I 안전성을 높인다.
T2I 파이프라인 안쪽에서 텍스트 임베딩과 중간 latent를 검사해 NSFW 생성을 막는 InGuard를 제안한다. 5개 오픈웨이트 모델에서 안전률 97.9~98.8%를 기록하며 기존 외부 가드레일보다 파라미터와 연산을 줄였다.
Hunyuan-A13B는 80B 중 13B만 활성화하는 오픈소스 MoE LLM이다
오픈소스 MoE 언어모델 Hunyuan-A13B는 총 80B 파라미터 중 추론 시 13B만 활성화해 성능·효율·배포 비용의 균형을 노린다. 20T 토큰 사전학습과 듀얼 체인오브소트로 수학·과학·코딩·에이전트 작업에서 큰 모델에 근접한 성능을 목표로 한다.
VLA 조작 정책에 고정 크기 연상 기억과 초기 장면 앵커를 결합한 MemBodied
MemBodied는 VLA 정책이 과거 관측을 컨텍스트에 쌓지 않고 고정 크기 에피소드 기억으로 history-dependent 조작을 수행하게 한다. RMBench 5개 과제에서 stateless 대비 7.81배, vanilla recurrent memory 대비 2.98배 성공률을 냈고 LIBERO-Long에서 90.6%를 기록했다.
VHD-Play는 해를 먼저 풀어 검증 가능한 에이전트 RL 환경을 생성한다
수학 모델을 먼저 샘플링·해결한 뒤 그 해를 상태 기반 도구로 렌더링해 에이전트 RL 환경을 자동 생성하는 VHD-Play를 제안한다. 3,300개 환경을 개당 몇 센트로 만들고, Qwen3.6-35B-A3B 학습으로 진단 점수를 0.204에서 0.815로 끌어올렸다.
예측을 행동으로 잇는 비동기 물리 세계 모델 InternW0
상하이 AI 연구소가 공개한 InternW0는 비디오 예측과 로봇 제어를 비대칭 구조로 함께 학습하는 기반 물리 세계 모델이다. 7,200시간 데이터로 학습해 15단계 화학 합성과 힘 인식 조작 과제까지 평가한다.
읽기 시점에 과제별로 기억을 조립하는 LLM 에이전트 메모리, JitMem
LLM 에이전트의 기억을 쓰기 시점이 아니라 읽기 시점에 현재 과제에 맞게 압축하는 JitMem을 제안한다. ALFWorld, WebShop, τ²-bench에서 기존 write-time 메모리보다 최대 16.3%p 높은 성공률을 보고했다.
영상이 더 평등한 결합 생성에서, 한쪽으로만 흐르는 교차 어텐션을 KL로 되돌리는 RecCAR
결합 멀티모달 디퓨전 트랜스포머에서 비디오→동반 모달리티 대응은 강하지만 역방향은 약하다는 비대칭을 규명하고, 강한 방향을 정지 기울기 참조로 삼아 약한 방향을 KL로 정렬하는 RecCAR를 제안한다. 영상-모션에서 Human Anatomy 0.69→0.75, 영상-오디오에서 AV Desync 0.804→0.752를 얻었다.
관절 궤적 조건 자기회귀 확산 모델로 로봇 시뮬레이션을 스트리밍 생성하는 Uranus
Uranus는 미래 관절 위치 궤적을 조건으로 다중 시점 로봇 영상을 자기회귀 확산으로 스트리밍 생성하는 데이터 기반 시뮬레이터다. 24 FPS 추론과 RoboTwin 정책 평가 상관계수 0.98을 보고하지만 접촉·물체 상태 변화는 한계로 남는다.
미래 프레임 전체 대신 변화만 예측하는 양팔 조작용 월드-액션 모델 DeltaWAM
로봇 조작용 월드-액션 모델이 미래 프레임을 통째로 예측하던 방식을 앵커와 희소 델타로 재구성하고, 스트리밍 델타 메모리로 추론 비용을 줄인 DeltaWAM을 정리한다. RoboTwin과 실세계 양팔 조작에서 성공률과 계산 효율을 함께 개선한 결과를 다룬다.
GTR이 게이트 선형 순환으로 고해상도 밀집 예측 비용을 줄인다
GTR은 소프트맥스 어텐션 없이 게이트 선형 순환과 네 방향 스캔, Spatial SwiGLU로 밀집 예측 백본을 구성한다. COCO에서 58.9 box AP를 1.908ms에 내고, TensorRT로 차량용 엣지 칩에서도 2~9ms 추론을 달성한다.
dLLM 추론의 메모리 I/O 병목을 겨냥한 융합 KV 캐시와 자기 검증 병렬 디코딩
확산 LLM(dLLM)의 추론 비효율을 KV 캐싱과 병렬 디코딩 결합으로 풀려는 연구다. 기존 가속 기법이 따로 다루던 두 축을 I/O 병목 관점에서 함께 설계하는 접근을 제안한다.
중앙 지휘자 없이 1,024개 에이전트가 스스로 일을 나누는 자가 조직 하네스 Agensh
Agensh는 중앙 오케스트레이터의 작업 할당·조정 병목을 없애기 위해 제안된 자기조직형 멀티에이전트 하네스다. 동시 실행 워커들이 멀티에이전트 협력 루프를 수행해 복잡한 작업의 지연을 줄이는 확장 구조를 목표로 한다.
장기 코딩 에이전트의 비용을 줄이는 정밀도 우선 자동 문맥 압축, CliffCompaction
CliffCompaction은 제한된 컨텍스트에서 세션 간 압축을 자동화해 비용을 최대 50% 줄이는 기법이다. Terminal-Bench 성능을 유지하거나 개선하고 KernelBench에서 최고 성능을 냈다.
엔코더와 코드북의 얽힌 최적화를 분리해 VQ 토크나이저를 안정화하는 StableVQ
VQ 토크나이저 학습이 불안정한 근본 원인을 인코더-디코더와 코드북 훈련의 얽힘으로 지목하고, 안정적 학습을 위한 실전 지침을 제안한다. 코드북 활용도를 끌어올린 기존 공유 투영 방식의 한계를 짚는다.
MCP 에이전트를 도구 메타데이터와 반환값으로 납치하는 2단계 블랙박스 공격 프레임워크 A2M
서드파티 서버 도구를 의미 매칭으로 선택하는 MCP 에이전트의 공급망 위험을 다룬다. A2M은 도구 메타데이터 최적화와 실행 트레이스 기반 반환값 조작을 결합해 에이전트를 하이재킹하는 2단계 블랙박스 프레임워크다.
에이전트 하네스를 컨텍스트가 아니라 코드로 키우는 실패 기반 학습법
LLM 에이전트가 연속된 태스크를 처리할 때 하네스가 매번 같은 제어 결정을 컨텍스트 안에서 다시 추론하는 문제를 다룬다. 실패 피드백으로 하네스 자체를 재사용 가능한 실행 코드로 학습하는 Growing Harness 패러다임을 제안한다.
타입 안전은 오류 없음이 아니며 결정 헤드는 루브릭보다 선택지 이름을 따른다
타입 안전성은 출력 형식만 보장할 뿐, 모델이 옵션의 의미를 의도대로 해석하는지는 보장하지 않는다. Jev와 Jev류 공개 가중치 모델에서 옵션 이름과 루브릭의 연결을 바꿔, 제약된 결정 헤드가 무엇을 따르는지 분석한 연구다.