AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
MoME는 같은 토큰을 문맥별 메모리 슬롯으로 보내는 조건부 메모리 기법이다.
MoME는 토큰 표면형에 고정된 기존 메모리 임베딩 조회가 문맥별 의미를 하나로 뭉개는 문제를 지적하고, 메모리 임베딩을 혼합해 문맥 인식 조회를 하는 접근을 제안한다. 초록은 문제 정의와 방법의 이름·동기까지만 담고 정량 결과는 제시하지 않는다.
critic 없이 Bellman 방정식으로 정책 미러 하강을 재구성한 BPO
RLVR로 LLM 추론을 개선하는 흐름에서, 중간 상태 가치 추정 없이 궤적 수준 목적함수로 정책을 최적화하는 critic-free 기법 BPO를 제안한다. Policy Mirror Descent에서 출발해 Bellman 방정식으로 재정식화하며, 초록은 동일한 유일 최적해를 갖는다는 증명을 언급한다.
얼린 Gemma 4 위 34M 보정 모듈로 오류를 고치고 성능을 지킨다
Gemma 4 E2B를 완전히 얼린 채 34M 파라미터 로짓 보정 모듈만 학습해 도메인 오류 53.3%를 고치면서 MMLU·BoolQ·car-wash 성능은 전혀 떨어뜨리지 않은 연구다. 같은 예산의 LoRA는 83.3%를 고치지만 17~75%p 성능이 무너져 보정과 능력 보존의 맞교환을 실측으로 보여준다.
Gated DeltaNet의 감쇠 스펙트럼을 재배치해 문맥 창을 늘리는 SpectralShift
선형 어텐션 계열 Gated DeltaNet의 장문맥 확장을 전이 행렬의 스펙트럼 관점에서 분석하고, 스펙트럼 재매개변수화로 컨텍스트 창을 늘리는 SpectralShift를 제안한다. 기존처럼 continued pretraining만 돌리는 대신 층 자체를 수정하는 접근이다.
StepAudio 3 Realtime은 말하며 추론하는 실시간 음성 모델이다.
StepAudio 3 Realtime은 듣기·대화·사고·행동을 하나의 연속 루프로 묶은 오디오-언어 기반 모델이다. 깊은 음향 이해와 전이중 스트림 처리, 사고와 발화를 겹치는 방식으로 실시간 음성 상호작용의 지연 문제를 겨냥한다.
구조 일반화가 어려운 이유는 트랜스포머가 아니라 학습 데이터의 타입 다양성 부족이다
트랜스포머가 구조적 일반화에 약하다는 통념에 반론을 제기한 arxiv 논문이 나왔다. 저자들은 원인이 모델 구조가 아니라 학습 데이터의 타입 다양성, 특히 구조 타입의 빈약함에 있다고 본다.
LIT는 자세 감독 잠재 인터페이스로 시각-행동 지름길을 끊는다
로봇 파운데이션 모델이 시각적 분포 변화에 무너지는 '시각-행동 지름길' 문제를 겨냥한 학습 기법이 나왔다. 이미지 없이 목표 자세로 행동을 먼저 학습시킨 뒤 잠재 인터페이스로 시각 조건을 제한하는 LIT는 LIBERO-Plus와 실환경 과제에서 성공률을 크게 끌어올렸다.
SAS는 언어모델 손실로 문맥 순위를 직접 학습하는 사후 어텐션 희소화다.
트랜스포머의 2차 어텐션 비용을 줄이는 희소화 기법 SAS가 arXiv에 공개됐다. 선택기의 연속 점수를 어텐션 로짓에 주입해 언어모델 손실로 컨텍스트 순위를 종단간 학습하고, Triton 커널로 긴 시퀀스 학습을 지원한다.
StepAudio 3 Gen은 TTS·음악·효과음 RVQ AR 오디오 LLM이다.
StepAudio 3 Gen은 제로샷 TTS부터 음악·효과음까지 하나의 모델로 생성하는 범용 오디오 모델이다. 확산 트랜스포머 대신 RVQ 토큰 기반 이산 자기회귀 구조를 택해 TTS와 보이스 디자인에서 최고 성능을 주장한다.
7.39B 오픈 모델로 256K 문맥의 수학 추론과 에이전트 검색을 겨냥한 ZGCM-1
ZGCM-1은 수학과 에이전트 검색을 겨냥해 처음부터 학습한 7B 완전 오픈 파운데이션 모델이다. 256K 컨텍스트에서 내부 추론과 외부 도구 호출을 결합하는 고효율 학습 레시피를 함께 공개해, 소형 모델의 한계를 도구 사용으로 우회하는 전략을 제시한다.
재귀적 자기개선과 반복적 정책개선을 하나의 순환으로 묶는 GAI 프레임워크
재귀적 자기개선(RSI)은 현상인지 메커니즘인지 정의가 모호한 채 여러 규모에서 주장되고 있다. 이 논문은 고전적 반복 정책 개선을 설명하는 GPI를 확장해, 두 개념을 하나의 형식 프레임워크로 묶는 방법을 제안한다.
AI 벤치마크를 매일 발견하고 점수의 출처까지 검색하는 살아있는 데이터베이스
AI 벤치마크를 매일 수집해 검색·비교할 수 있게 만든 'Benchmark Radar'가 공개됐다. 37개 소스에서 모은 1,283개 벤치마크 레코드와 12,916개 점수 관측치를 웹 대시보드와 CLI로 제공한다.
출력 Fisher-Rao 기하학으로 언어모델의 공유 구조·학습·최소 교란 제어를 통합한 연구
다음 토큰 확률의 Fisher-Rao 기하학으로 언어모델이 공유하는 행동 구조를 설명하고, 한 행동만 바꾸는 제어 가능성을 다룬 연구다. 트랜스포머·상태공간·순환 모델에서 출력 기하학이 활성값 기하학보다 더 강하게 일치한다고 보고한다.
다운스트림 태스크를 모른 채 환경을 미리 공부해 재사용 자원을 만드는 메타 에이전트
다운스트림 과제를 모르는 상태에서 LLM 에이전트가 환경을 미리 탐색해 인덱스·스크립트 같은 재사용 자원을 만드는 '과제 무관 환경 전처리' 기법이 arXiv에 공개됐다. 6개 벤치마크 중 5개에서 메타 에이전트가 최고 성능을 냈고, 테스트 시점 샘플링을 줄이는 효과도 확인됐다.
GVA는 값만 캐시하고 키를 필요할 때 복원해 GQA 캐시를 절반으로 줄인다
GQA가 KV 헤드를 공유해 캐시 비용을 줄이는 것과 달리, GVA는 값만 그룹으로 저장하고 학습된 선형 맵으로 키를 복원한다. 추론 시 이 맵을 쿼리에 흡수해 키를 메모리에 만들지 않는 방식이다.
100개 태스크를 순차 학습하는 언어모델의 장기 기억, 메커니즘 조합으로 망각을 늦추다
언어 모델이 시간차를 두고 들어오는 100개 질의-응답 과제를 순차 미세조정으로 익히는 장기 기억 설정이 제안됐다. 개별 연속 학습 기법만으로는 치명적 망각을 막지 못해, 여러 기법을 조합하는 접근이 대안으로 떠오른다.
하이브리드 LLM의 KV 너머의 기억을 4B에서 9B로 프리픽스 재생 없이 넘긴다
Qwen3.5 4B 하이브리드 모델의 살아 있는 추론 메모리를 9B 모델로 접두사 재처리 없이 넘기는 LatentPort 연구를 정리한다. 번역된 KV에 Gated DeltaNet 영속 상태를 더해 NLL을 0.747 nats/token 낮췄다.
얕은 프롬프트를 3계층 심리 구조로 바꾼 역할극 에이전트 아키텍처 Deep Persona
LLM 페르소나 시뮬레이션이 장기 상호작용에서 캐릭터 일관성을 유지하지 못하는 문제를 짚는다. Deep Persona는 관찰 가능한 표현·잠재 신념·핵심 동기라는 3계층 구조와 평가 프레임워크로 역할극 에이전트를 설계하는 방법을 제안한다.
RLVR 데이터 정책 13종을 같은 GRPO 레시피에서 재검증한 결과, 균일 샘플링을 이기는 재현 가능한 개선은 없었다
검증 가능한 보상 기반 강화학습(RLVR)의 데이터 정책을 동일한 GRPO 조건에서 비교하는 평가 플랫폼 DataFlex-RL이 공개됐다. 12개 시드와 12개 벤치마크 실험에서 어떤 롤아웃 선택·재가중 기법도 균등 샘플링을 안정적으로 앞서지 못했다.
MLLM 환각을 시너지 헤드의 정보 분포 이탈로 진단하고 추론 시 보정하는 HEAL
멀티모달 LLM의 환각을 시너지 헤드의 정보 분포 이동으로 설명하고, 헤드 단위 정보 분리·보정 기법 HEAL을 제안한다. 기존 어텐션 가중치 기반 완화가 놓치는 실제 정보 이동을 정면으로 겨냥한다.
OLLM의 모달리티 편향과 증거 형태 편향을 분리한 Tri-PvP 벤치마크
Tri-PvP는 비전·오디오·텍스트가 충돌하는 8,000개 샘플 벤치마크로, 기존 평가가 뒤섞어 온 양상 편향과 증거 형태 편향을 분리해 측정한다. 5개 OLLM을 평가한 결과 비전 편향과 증거 형태별 비대칭이 드러났다.
35B 코워크 Occamy-1.0은 성능·비용 파레토를 낮춘 실행특화 후속학습이다
협업 에이전트 워크플로를 겨냥한 35B 오픈 모델 오캐미-1.0이 공개됐다. 정보 수집과 도구 호출, 코딩, 파일 조작을 반복하는 작업에서 최고 성능보다 에피소드 전체의 비용과 지연을 줄이는 파레토 프런티어를 목표로 한다.
GitHub 코드에서 실행 근거가 있는 에이전트 스킬을 대규모로 합성하는 Code2Skill
코드에서 재사용 가능한 스킬을 대규모로 합성해 에이전트가 이전 경험을 넘어서도록 하는 방법을 다룬다. 궤적 기반 합성의 환경 의존성과 문서 기반 스킬의 검증 부족을 코드의 실행 가능한 근거로 보완하려는 접근이다.
VLA 안전 정렬을 Lagrangian 페널티 대신 Hamilton-Jacobi 도달가능성으로 다시 짠 ShieldVLA
로봇 조작·내비게이션에 쓰이는 VLA 모델의 파인튜닝 안전성을 다룬 ShieldVLA를 소개한다. 기존 라그랑주 페널티 방식의 제약 위반과 과보수 문제를 지적하고, 시각 도메인의 안전 라벨 부재를 핵심 난제로 짚는다.