AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
Queen은 4B 파라미터로 그랜드마스터급 체스 실력과 수 설명을 함께 달성한다
체스 엔진은 초인적 실력에도 이유를 말하지 않고, 언어모델은 그럴듯한 설명을 내놓아도 실력이 약하다. 프린스턴 연구진은 침묵하는 체스 인코더 Leela와 3B 언어모델을 크로스어텐션으로 연결하고 반복 증류로 학습해 2697 Elo와 유창한 설명을 동시에 얻은 Queen을 제안한다.
FrugalEvo가 LLM 프로그램 진화의 비용당 성능을 높인다
LLM 기반 프로그램 진화 연구는 반복 횟수당 성능에 집중했지만, FrugalEvo는 비용당 성능을 최대화하는 프레임워크를 제안한다. 고비용 모델이 전략을 탐색하고 저비용 모델이 코드를 구현·개선하며, BA-AUC 지표로 예산 내 품질을 측정한다.
마스크 확산 언어모델에서 결정적 토큰만 골라 학습하는 Pivot-SD
마스크 확산 언어모델의 디노이징 궤적에서 남은 마스크 위치의 불확실성을 가장 크게 줄인 소수의 커밋만 골라 오프라인 자기증류로 학습하는 Pivot-SD를 제안한다. 200문항만으로 LLaDA-8B-Instruct의 수학·코드 벤치마크 평균 정확도를 전체 시퀀스 SFT와 온라인 RL보다 높인다.
MRVQ는 하나의 인덱스로 차원과 비트레이트를 모두 커버한다
고정된 임베딩 위에 사후 학습한 잔차 양자화기 MRVQ를 소개한다. 잔차 단계를 버리면 비트레이트가, 임베딩 좌표를 버리면 차원이 줄어들어 하나의 상주 코드가 모든 (차원, 비트레이트) 조합을 처리하며, 평가한 구성 중 상주 메모리가 가장 낮다.
역증류 정규화로 마스크 확산 모델 보상 튜닝을 소수 스텝으로 단축한다
IDRF는 마스크 이산 확산 모델의 보상 파인튜닝에서 계산 불가능한 시퀀스 수준 KL 정규화를 역증류 손실로 대체한다. DNA·이미지·텍스트 실험에서 기준 모델보다 최대 32배 적은 디노이징 스텝으로 높은 보상을 얻으면서 리워드 해킹을 줄였다.
LoGo가 3D 복셀 단위 보상으로 장기 영상 생성의 국소 불일치를 잡는다
카메라 제어 영상 모델의 장기 생성에서 생기는 3D 불일치를 잡기 위해, LoGo는 3D 복셀 단위 국소 보상과 전역 보상을 섞어 파인그레인드 credit assignment를 수행한다. 최대 +2.7dB PSNR과 에피폴라 오류 37% 감소를 보고했고, 400프레임에서 오류 감소폭이 62%까지 커진다.
터미널 에이전트 강화학습에서 명령 의존관계로 보상을 재분배한다
터미널 에이전트 강화학습에서 GRPO는 궤적 단위 보상을 모든 스텝에 똑같이 나눠준다. DepGPO는 실행 트레이스에서 명령 간 읽기·쓰기 의존 그래프를 만들어 검증기가 실제로 확인한 자원에 닿는 명령에만 보상을 재분배한다.
일단계 생성 모델은 디노이징 궤적을 깊이 방향으로 펼친다
다단계 확산 모델을 한 번의 순전파로 압축한 일단계 생성 모델에서, 디노이징 계산이 네트워크 깊이를 따라 펼쳐진다는 'depth as time' 관찰을 제시한다. 중간 레이어를 자체 출력 헤드로 디코딩하면 드리프팅 모델과 달리 MeanFlow 계열에서 신호-노이즈 혼합 구조가 복원되고, 이를 이용해 SiT-L/2를 파라미터 기준 16.6배 압축한다.
DEPICT가 답 일치로 텍스트-이미지 정렬을 채점한다
이미지-텍스트 정렬 평가에서 고정 정답 대신 이미지 답변과 캡션 답변의 기대 일치도를 쓰는 DEPICT를 제안한다. 부정문 정확도를 19%에서 88%로 끌어올리고, 5개 벤치마크·11개 백본에서 학습 없는 지표 중 최고 성능을 낸다.
JOVE가 LLM 태스크 그래프에서 실행과 유료 검증을 함께 최적화한다
복잡한 추론 질의를 DAG로 쪼개 여러 LLM에 배정할 때, 어떤 모델이 어떤 하위 작업에 맞는지 모르는 상황을 다룬다. JOVE는 실행기 선택과 유료 검증 대상을 매 질의마다 함께 결정하는 온라인 프레임워크로, 네 개 벤치마크에서 비용과 지연을 크게 줄였다.
MLLM은 아키텍처에 따라 비전과 텍스트를 다른 순서로 융합한다
MLLM이 시각과 텍스트를 층별로 어떻게 융합하는지 CKA, 어텐션 라우팅, 내재 차원, 인과 개입으로 분석한 연구다. 결합 아키텍처는 텍스트가 먼저 변하고 시각이 늦게 재편되며, 네이티브 아키텍처는 초기층부터 시각-텍스트가 함께 적응한다.
SPADE가 조합적 인과 발견의 확장성 한계를 밀어낸다
비선형 인과 발견의 네 알고리즘 계열을 런타임·정확도 축에서 비교한 결과, 조합적 탐색이 가장 정확하지만 반복적 국소 점수 계산에 발목이 잡힌다는 점을 확인했다. 저자들은 고정 기저 스플라인 점수를 한 번 컴파일해 재사용하는 SPADE로 복잡도를 O(nd^3)에서 O(nd^2+d^3)로 낮추고 1600변수 문제를 분 단위에 푼다.
사실 학습과 그 사실을 꺼내는 방법 학습은 분리된다
언어모델이 사실 자체를 배우는 것과 특정 요청 형식으로 그 사실을 꺼내는 법을 배우는 것은 별개라는 것을 2단계 학습 실험으로 분리해 보인 논문이다. 답변 직전 은닉 상태인 문맥 상태를 조작하면 이미 학습된 사실의 검색 성공과 실패가 뒤바뀐다.
여러 LLM을 골라 협업시켜 편향을 줄이는 집단적 편향 완화 기법
LLM 하나의 자기 교정에 기대지 않고, 라우터가 쿼리마다 여러 LLM을 골라 토론·투표·위원회 구조로 협업시켜 편향을 줄이는 집단적 편향 완화(CBM)를 제안한다. BBQ 기반 CrowdEval로 라우터를 학습해 나이 편향 점수를 0.25에서 0.10으로 낮췄다.
AdaStep이 에이전트 강화학습의 스텝 신용 배분을 신뢰도에 맞춰 조절한다
AdaStep은 GRPO·GiGPO가 쓰는 스텝 단위 어드밴티지를 상태별 신뢰도에 따라 축소하는 계수를 MSE 목표에서 유도한다. 비평자나 추가 롤아웃 없이 계산 약 1%만 더 쓰고 세 벤치마크에서 GiGPO를 앞선다.
VDOT++가 비대칭 불균형 최적수송으로 4스텝 영상 생성을 통합한다
VDOT++는 비대칭 불균형 최적수송과 ℓ1 비용으로 4스텝 영상 생성기를 T2V·I2V·조건 기반 생성 전반에서 many-step teacher에 견줄 수준으로 끌어올린다. 학습 시에만 큰 score network를 쓰는 cross-scale 증류도 함께 제안한다.
VisionMX가 비전 모델의 MX 4비트 사후 양자화 손실을 되돌린다
Arm AI Research가 블록 스케일 기반 MX 포맷의 비전 모델 사후 양자화를 분석하고, RangeRound와 활성값 아핀 보정을 결합한 VisionMX를 제안한다. ImageNet 분류와 COCO 검출·분할에서 직접 변환 및 기존 PTQ 베이스라인을 앞선다.
작은 언어모델로 에이전트 도구 호출의 의도 일치를 검증한다
도구를 쓰는 AI 에이전트의 모든 호출이 과제 의도에 맞는지 작은 언어모델로 검증하는 연구다. Gemma 3 4B를 프롬프트 최적화와 SFT, GRPO로 특화해 96.13% 정확도를 달성했고 1B는 89.60%에 머물렀다.
CoFlow가 프롬프트마다 스텝 수를 골라 플로우 모델 추론 비용을 줄인다
플로우 매칭 기반 이미지·영상 생성에서 프롬프트 특징을 보고 스텝 수를 매번 다르게 고르는 CoFlow를 제안한다. 사전 학습 없이 온라인으로 정책을 학습해 2.5배 이상 속도를 내면서 품질을 유지한다고 주장한다.
태스크 벡터 분산으로 모델 병합 붕괴를 미리 예측하고 PRISM으로 복구한다
공유 베이스에서 파인튜닝한 특화 모델들의 태스크 벡터 분산이 곧 간섭이며, 이 통계량으로 병합 붕괴를 평가 전에 예측할 수 있다. PRISM은 간섭이 큰 레이어의 평균 벡터를 소프트 임계처리해 데이터나 튜닝 없이 붕괴를 막는다.
KV²가 전체 문맥 재계산 없이 KV 캐시를 압축한다
KV 캐시를 두 단계로 압축하는 KV²를 소개한다. 가벼운 프록시 점수기로 고른 소수 토큰만 재구성 질의로 재처리해 전체 문맥 재계산 없이 압축하며, RULER 16K 2% 예산에서 차선 기법보다 40%p 이상 높은 평균 점수를 낸다.
LLM 에이전트가 출처만 보고 상품을 고르는 편향을 실측한다
12개 LLM 에이전트가 쇼핑·숙박·학술 검색에서 같은 조건의 항목을 고를 때 특정 출처를 선호하고 다른 출처를 피하는 현상을 실측했다. 선호 출처 항목은 요구사항을 하나 덜 충족해도 68% 확률로 선택됐고, DPO 학습 데이터 균형과 누락 정보 보완으로 편향을 줄일 수 있었다.
MetaRubric이 근거 없는 루브릭 점수를 정책 학습에서 제거한다
루브릭 기반 강화학습에서 심사 모델이 응답에 없는 내용에도 점수를 주는 '공허한 점수' 문제를 분석하고, 증거 인식 보상과 루브릭 적응을 번갈아 수행하는 MetaRubric을 제안한다. PubMedQA 정확도를 최대 20.40퍼센트포인트 올렸다.
여러 하네스의 성공 궤적을 일반 하네스용 학습 데이터로 다시 쓴다
여러 하네스에서 얻은 성공 궤적을 일반 하네스용 학습 데이터로 재작성해 Qwen-3.8-27B를 파인튜닝한 Recursive Self-Rewrite 논문 정리. Terminal-Bench 2 pass@3이 57.0%에서 74.2%로 올랐다.
시뮬레이션에서 배운 로봇 스킬을 공용 코드 API로 실기체에 그대로 옮긴다
시뮬레이션에서 학습한 로봇 조작 스킬을 공용 코드 API로 표현해 실기체에 무보정 전이하는 Skill2Real을 제안한다. LIBERO-90에서 배운 스킬이 학습하지 않은 LIBERO-Pro Long 성공률을 2.0%에서 56.3%로 끌어올리고, 실제 UR5e에서도 78.75% 완료율을 기록했다.
ProAR가 자기회귀 비디오 모델에 목표 지향 추론을 심는다
자기회귀 비디오 모델은 다음 청크만 예측하는 근시안적 구조 때문에 목표 지향 추론에서 실패한다. ProAR는 목표 프레임 예측과 미래 표현 자기정렬을 결합해 VBVR 평균 점수를 0.663에서 0.801로 올리고 학습 스텝도 25%로 줄였다.
행동 라벨 없이 관찰 영상만으로 로봇 정책을 직접 사전학습하는 NAVA-WAM
행동 라벨 없이 관찰 영상만으로 로봇 행동 정책을 직접 사전학습하는 NAVA-WAM을 제안한다. Video-DiT를 동결하고 Action-DiT만 미래 영상 흐름 매칭으로 최적화해, LIBERO-Plus와 RoboTwin 2.0의 분포 이동 환경에서 기존 방법을 앞선다.
추론 토큰을 줄여도 CoT 모니터링 능력은 대체로 살아남는다
효율적 추론 학습이 CoT 충실성과 감시 가능성에 미치는 영향을 세 가지 길이 압력 기법과 세 모델로 측정한 연구다. 충실성은 모델 일관성이 낮아지면서 대부분 떨어지지만, 감시 가능성은 CoT가 베이스 대비 크게 압축될 때만 무너진다.
다국어 수학 벤치마크로 언어 간 능력 전이의 결정 요인을 정량화한다
15개 언어 3만 개 문항을 문항 단위로 맞춘 Multilingual GSM-Symbolic을 만들어, 모델 크기·언어 자원·추론·유형론적 거리가 언어 간 성능 이전을 어떻게 결정하는지 하나의 통계 모형으로 추정했다. 보지 못한 언어의 성능을 6pp 이내로 예측하고, 템플릿 10개만 있으면 오차를 4.19pp까지 줄인다.
RoPE 위치 교란으로 지식 편집의 문맥 의존을 줄이는 FOVEATED
비구조적 지식 편집에서 편집 문단은 재현하지만 개별 사실을 회상하지 못하는 문맥 의존 문제를 다룬다. 선행 문맥의 RoPE 위치를 무작위로 흔든 집중 뷰로 편집하는 FOVEATED를 제안한다.