AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
비디오 확산 모델로 손 자세와 접촉력을 함께 추정해 로봇 학습에 쓴다
사람 1인칭 영상에서 손 자세와 접촉·힘을 함께 추정하는 RLHND를 제안한다. Cosmos 3 비디오 확산 백본을 특징 추출기로 바꾸고 손 모양을 영상 전체에 고정해, 로봇 학습용 동작 라벨의 떨림과 물리 정보 부재를 동시에 줄인다.
GRACE가 사전학습 DiT 호환을 지키며 영상 잠재를 8배 압축한다
KAIST와 카카오가 사전학습 영상 확산 모델의 잠재를 8배 압축하면서 생성 품질을 유지하는 GRACE를 제안했다. Wan2.1-I2V-14B에서 토큰을 8배 줄이고 지연시간을 11.1배 단축하면서 VBench 품질은 압축 전과 맞먹는다.
다중 벡터 문서 인덱스만으로 원본 페이지가 복원된다
ColPali류 다중 벡터 문서 검색기가 저장하는 페이지 인덱스만으로 원본 페이지를 복원할 수 있음을 실험으로 보인다. 원본 인덱스에서 단어 47%와 민감 토큰 45%가 복구되고, 복원 페이지가 자기 원본을 1위로 찾아내는 비율은 98.4%다.
자기회귀 영상 생성에서 문맥 쓰기와 디노이징의 파라미터를 분리한다
자기회귀 영상 확산 모델에서 문맥 쓰기와 디노이징이 같은 파라미터를 공유해 그래디언트가 90도를 넘는 각도로 충돌한다는 분석을 제시하고, 두 역할에 별도 파라미터를 부여하는 SGF+를 제안한다. 5초 롤아웃만으로 훈련해 장기 영상 파인튜닝 없이 24시간 연속 생성을 지원한다.
PersonTTS가 정확도·지연·비용 요구를 함께 만족하는 추론 정책을 찾는다
PersonTTS는 정확도·지연·비용을 함께 명시한 사용자 프로필마다 실행 가능한 테스트타임 스케일링 컨트롤러를 LLM 에이전트로 탐색한다. 소스 프로필의 정책과 절차 지식을 재사용해 탐색 비용을 줄이면서도 후보 평가는 항상 대상 프로필에서 다시 수행한다.
SkillForge가 스킬 도태와 변이로 에이전트와 스킬을 함께 진화시킨다
SkillForge는 LLM 에이전트의 스킬 라이브러리를 시험·활성·안정·퇴역 4단계 수명주기로 관리하며, 저적합 스킬을 도태시키고 경계선 스킬을 LLM으로 변이시켜 정책과 함께 진화시킨다. ALFWorld 92.4%, WebShop 78.4%로 최강 베이스라인 대비 최대 7.8% 상대 개선을 냈다.
UniSkill이 추가 롤아웃 없이 정책과 스킬뱅크를 함께 진화시킨다
UniSkill은 하나의 공유 정책이 액터와 스킬 제안자를 겸하며, 이미 수집된 궤적의 로그우도 대조만으로 스킬 제안을 평가해 추가 롤아웃 없이 정책과 스킬뱅크를 함께 진화시킨다. ALFWorld 98.4%, WebShop 84.7% 성공률을 보고했다.
SQAM이 흐름 정책 미세조정의 야코비안 곱 비용을 없앤다
흐름 정책을 오프폴리시 강화학습으로 미세조정할 때 매 흐름 단계마다 필요한 벡터-야코비안 곱을 닫힌 형태의 스칼라 어드조인트로 대체한 SQAM을 제안한다. OGBench 50개 과제에서 75% 성공률로 최강 베이스라인 68%를 앞서고, 실제 양팔 로봇의 VLA 정책 미세조정에서도 지도학습을 상회한다.
사용자 시뮬레이터 MIMESIS로 대화형 에이전트 훈련 환경을 만든다
메타가 사람 대화 로그와 사고 트레이스로 사용자 시뮬레이터 MIMESIS를 학습시켜, 기존 어시스턴트 LLM이 왜곡하던 상호작용 난이도를 실제 사용자에 가깝게 맞췄다. 동결한 시뮬레이터로 훈련한 에이전트는 9개 미학습 사용자 모델 전부에서 GPT-5.5로 훈련한 에이전트보다 높은 점수를 냈다.
온폴리시 증류는 새 사실을 못 넣고 기존 지식 조합 능력만 키운다
역KL 기반 온폴리시 증류가 학생 모델에 전이하는 것은 새로운 사실 지식이 아니라 기존 지식을 조합하는 추론 기술이라는 통제 실험 결과를 담았다. 합성 룩업 테이블과 실제 벤치마크에서 사실 전이는 forward KL에 달려 있고, 학생 롤아웃은 다단계 추론 실행을 개선한다.
QF3가 필터링한 Q 그래디언트로 흐름 정책 RL을 10배 빠르게 학습한다
QF3는 흐름 정책을 오프폴리시 강화학습으로 학습하는 알고리즘이다. 크리틱 그래디언트를 리플레이 행동 근처 차원에만 적용해 휴머노이드 보행 정책을 처음부터 학습하고 하드웨어로 제로샷 전이했으며, FPO++ 대비 10배 빠른 학습 속도를 보고한다.
IdeaAnchor가 논문 묶음에서 연구 아이디어를 뽑아내도록 LLM을 훈련한다
논문 여러 편을 입력받아 연구 공백과 방향을 합성하는 능력을 훈련시키는 IdeaAnchor 프레임워크다. 출판된 논문에서 구조화 명세를 역설계해 SFT·자기증류·GRPO 강화학습에 특권 정보로 쓰고, ICLR 2026 924편 벤치마크에서 기준선 대비 기준충족률을 최대 13.7%p 끌어올렸다.
Sherpa가 학생 성과 향상을 보상으로 LLM 교사의 적응력을 학습시킨다
LLM 교사 학습에서 미리 정한 교수법 기준 대신 학생의 문제 풀이 향상을 보상으로 쓰는 Sherpa 프레임워크를 제안한다. Qwen3-8B 교사가 MATH에서 학생 성능을 20.5%포인트 올리고 MathTutorBench 교수학 점수를 52.5%에서 79.2%로 높였다.
CtrlCache가 제어 신호로 인터랙티브 월드 모델 추론을 가속한다
CtrlCache는 사용자가 보낸 제어 신호를 미리 읽어 디노이징 재사용 시점을 정하는 학습 없는 캐싱 기법이다. Matrix-Game 2.0과 LingBot-World v1/v2에서 DiT 백본을 1.21~1.41배 가속하면서 WBench Overall 점수를 원본 추론보다 높였다.
LLM 에이전트가 반복 작업을 싼 산출물로 바꾸는 능력을 재는 BOTTLED
LLM 에이전트가 수백만 건의 반복 작업을 값싼 재사용 산출물로 바꾸는 '병입' 능력을 재는 BOTTLED 벤치마크를 소개한다. 60회 병입 중 48회가 제로샷 성능의 95% 신뢰구간에 못 미쳤고, 31회는 같은 토큰 예산의 순진한 증류 베이스라인보다 낮았다.
웹 에이전트가 적응형 프롬프트 주입을 견디도록 세계 모델 안에서 함께 진화시킨다
웹 페이지에 심긴 지시가 에이전트를 사용자 목표에서 벗어나게 하는 간접 프롬프트 주입 문제를 다룬다. 고정된 공격으로 미세조정하던 기존 방어와 달리 과제 커리큘럼과 주입 공격자, 실행 에이전트를 동결된 웹 월드 모델 안에서 함께 진화시켜 150개 과제에서 공격 하 완료율을 48.07%에서 57.48%로 올린다.
BASA가 창문 이동만으로 고해상도 생성 어텐션을 4.52배 가속한다
디퓨전 트랜스포머의 전체 어텐션 비용을 줄이기 위해, 창문 경계를 레이어와 디노이징 스텝마다 이동시키는 백엔드 독립적 희소 어텐션 BASA를 제안한다. FLUX에서 이론 대비 90% 이상의 실측 가속을, Wan에서 4.52배 어텐션 가속을 달성하면서 생성 품질을 유지했다.
VeriFine이 정책과 심판을 함께 키워 자기개선을 지속시킨다
엔비디아 연구진이 정책과 훈련 커리큘럼, 심판을 함께 진화시키는 자기개선 프레임워크 VeriFine을 공개했다. 운전 추론에서 정책 추론 점수를 60.56에서 71.61로 끌어올리고 심판-인간 상관계수도 0.82까지 높였다.
WorldSonus가 월드 모델 영상에 실시간 스테레오 사운드를 입힌다
WorldSonus는 월드 모델의 스트리밍 영상에 100ms 청크 단위로 48kHz 스테레오 사운드를 실시간 합성하는 모듈형 V2A 프레임워크다. 단일 H100에서 RTF 0.41을 달성하고, 스트림 중간 텍스트 지시 변경과 카메라 정렬 스테레오를 함께 지원한다.
EgoLAP이 언어 행동 추론으로 인간 영상을 로봇 학습에 연결한다
EgoLAP은 1인칭 인간 영상과 로봇 궤적을 언어 행동과 물리적 추론이라는 공통 텍스트 목표로 묶어 사전학습하는 VLA 프레임워크다. 실세계 양팔 조작에서 평균 80.1% 진행도를 기록해 기존 행동 토큰 표현을 크게 앞섰다.
파인튜닝 망각은 지식 삭제가 아니라 되돌릴 수 있는 접근 차단이다
파인튜닝 중 사라진 것처럼 보이는 지식이 실제로는 저장되어 있고, 새 사실만 계속 학습해도 회복될 수 있다는 '가짜 망각'의 메커니즘을 최소 연상 기억 모델과 트랜스포머 실험으로 규명한 논문이다. 망각은 공유된 방향으로 밀린 일시적 접근 상실과 사실별 침식이라는 두 과정의 합이며, 파국적인 것은 후자뿐이다.
학습 경로와 플로우를 함께 훈련해 이미지 생성 품질을 높인다
보간 경로를 고정하지 않고 경로와 플로우 네트워크를 같은 손실로 함께 학습하는 path-flow alignment를 제안한다. 정렬 손실만 낮추면 생기는 경로 과적합과 저엔트로피 병목을 진단하고, 확률적 소스 섭동으로 억제해 ImageNet-256 FID를 개선한다.
확산 생성 검색의 열세는 패러다임이 아니라 디코딩에서 온다
생성 검색에서 확산 디코더가 자기회귀보다 뒤처지는 이유를 식별자·학습 레시피·디코딩으로 분리해 통제 실험한 논문이다. NQ320K와 MS300K에서 디코딩만 바꿔도 확산 모델 Hit@1이 6.6~13.7점 움직였고, 완전 마스킹된 식별자를 한 번에 채점하는 one-pass scoring이 12개 설정 중 11개에서 기존 확산 디코딩을 앞섰다.
SpaTime이 스트리밍 VLM에 3D 기하를 넣고 응답 시점까지 학습한다
Purdue 연구진이 스트리밍 VLM에 인과적 3D 기하 토큰을 융합하고 응답 시점 자체를 미분 가능한 손실로 학습하는 SpaTime을 제안했다. StreamVSTI-Bench에서 49.2% 정확도와 0.12초 응답 시점 오차를 기록했다.
MoE 강화학습에서 FP4 롤아웃과 학습 경로의 양자화 불일치를 맞춘다
TRACE는 롤아웃 단계의 FP4 양자화 결과를 학습 단계의 반올림 결정에 직접 반영해 학습-롤아웃 불일치를 줄이는 MoE 강화학습용 FP4 프레임워크다. BF16 롤아웃에 준하는 성능을 유지하면서 최대 5.4배 롤아웃 가속과 7.4%의 학습 오버헤드를 보고한다.
토크나이저가 다른 증류에서 넓은 정렬보다 믿을 만한 감독이 낫다
토크나이저가 다른 교사-학생 쌍의 온폴리시 증류를 재검토한 논문이다. 정렬 범위를 넓히는 스팬 MSE 감독은 정확도를 떨어뜨렸고, 학생이 고른 공유 어휘 top-16만으로도 전체 개선폭의 96% 이상이 유지됐다.
도구를 쓰는 AI 에이전트의 실패는 실행 전 근거 확보에서 갈린다
도구를 쓰는 LLM 에이전트가 정답을 내더라도 실행 전에 필요한 근거를 실제로 확보했는지는 보장되지 않는다. 656개 케이스의 SafeActBench로 10개 모델-하네스 구성을 평가한 결과, 실패는 실행 단계가 아니라 조사와 근거 확립 단계에서 주로 시작됐다.
UNREAL은 하나의 고정 LLM 내부 표현으로 검색과 롱컨텍스트 증거 선택을 통합한다
NVIDIA 연구진은 고정된 디코더 전용 LLM의 내부 표현만으로 코퍼스 검색과 롱컨텍스트 증거 선택을 함께 수행하는 UNREAL을 제안한다. 500K 미만 파라미터 추가로 21M 청크 위키 인덱스에서 검색 성능을 높이고, 128K·256K 롱컨텍스트에서도 정확도와 효율을 개선한다.
에이전트가 스스로 만든 과제로 재사용 메모리를 부트스트랩한다
학습 과제나 오라클 검증기 없이 에이전트가 스스로 생성한 과제로 재사용 가능한 메모리를 구축하는 DAEDALUS를 제안한다. AppWorld 등 3개 벤치마크에서 무메모리 대비 평균 성공률을 최대 15.9점, pass^5를 최대 2.2배 높였다.
토큰마다 디코더 상태를 되먹이는 순환 루프 트랜스포머가 긴 시퀀스를 일반화한다
트랜스포머의 층을 병렬 인코더와 순환 디코더로 나누고, 매 토큰마다 직전 디코더 최종 상태를 게이트로 합치는 Recurrent Looped Transformer를 제안한다. 40비트까지만 학습하고도 256비트 패리티에서 100% 정확도를 내는 등 고정 깊이 트랜스포머를 크게 앞선다.