AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
근접 배경이 먼 증거를 덮는 근접성 함정과 이를 완화하는 LYRA
긴 문맥 LLM이 먼 근거를 놓치는 원인을 단순한 거리가 아니라 주변의 무관한 배경 문맥과의 누적 경쟁으로 재정의한다. 제안 기법 LYRA는 t-분포 기반 방향성 매칭으로 관련도 정렬을 조정해 이 근접 함정을 완화한다.
3비트 미만 추론 붕괴 원인은 배포 경로 온폴리시 증류가 다루는 노출 편향이다
3비트 이하 양자화에서 수학·코드 추론이 무너지는 원인을 양자화가 증폭시킨 노출 편향으로 진단하고, 양자화 모델이 스스로 생성하는 경로 위에서 증류하는 온폴리시 기법을 제안한다. 짧은 QA는 회복되지만 긴 생성이 반복 루프에 빠지는 문제를 겨냥한다.
큰 모델의 탐색 정책으로 작은 모델을 학습시켜 LLM 추론의 반복 샘플링을 넘는다
LLM 추론에서 값비싼 반복 샘플링 대신 문제별 개념과 힌트를 먼저 뽑아 의미 수준에서 탐색을 조종하는 검색 정책 학습을 제안한다. 테스트 시점 연산을 늘리는 추론 파이프라인을 운영하는 개발자에게 대안적 관점을 준다.
MAGIC는 단일 에이전트와 그룹을 섞어 다중 에이전트 협업 그래프를 RL로 만든다.
LLM 멀티에이전트 시스템의 협업 토폴로지를 과제별로 자동 생성하는 MAGIC을 소개한다. 하위 과제마다 필요한 협업 단위가 다르다는 문제의식에서, 혼합 세분성 에이전트 그래프를 점진 구축하고 조밀 보상 강화학습으로 다듬는다.
확산 모델의 악성 과적합은 이중 하강 정점이 p~nm으로 밀려 파국적이다
딥러닝에서 과매개변수화는 이롭다는 통념과 달리, 디퓨전 모델 학습에서 관찰되는 과적합은 해로운 양상을 보인다는 연구다. 학습이 회귀 문제로 환원되는 score-matching 손실에서 double descent와 malign overfitting을 분석한다.
응답 생성 중에도 멈추지 않는 스트리밍 시계열 상호작용 모델 TimeInteract
실시간으로 들어오는 시계열 관측치를 멈추지 않고 계속 인지하면서 사용자와 상호작용하는 새 문제 설정 Time-Series Interaction을 제안한다. 기존 시계열 언어모델이 상호작용 도중 새 관측치를 처리하지 못하는 정적 한계를 겨냥한다.
HySparse2는 전체 어텐션층만 잇는 2단계KV공유 하이브리드 희소 어텐션이다.
HySparse2는 YOCO 스타일 자기·교차 디코더 구조에 두 단계 KV 공유를 결합한 하이브리드 희소 어텐션이다. 긴 관찰을 처리하는 에이전트의 프리필 비용과 KV 캐시 저장량, 장문 검색 정확도를 함께 겨냥한다.
토큰 크레딧을 유일하게 정의하고 크리틱 정렬로 성능을 끌어올린 PACT
LLM 사후학습에서 토큰 단위 크레딧 배분이 수학적으로 정의되지 않은 문제를 다룬다. Completeness·Prefix Consistency·Neutrality 세 조건이 토큰 수준 크레딧을 유일하게 결정함을 증명하고, 이를 기존 알고리즘을 설명하는 통일된 기반으로 제시한다.
prefill과 decode에 서로 다른 양자화를 배정하는 disaggregated quantization
프리필과 디코드가 각각 다른 양자화 이득을 본다는 점에 착안해, 연산 포맷과 가중치, 저장 위치를 두 단계에 맞게 특화하는 DQ를 제안한다. Qwen 3와 Gemma 3에서는 디코드의 활성값 양자화를 제거해 디코드 중심 작업 정확도를 높이면서 추론 비용은 늘리지 않았다.
CompKV는 보상 잔차를 기준으로 KV 블록을 고르는 스파스 어텐션이다.
장문맥 LLM 추론의 병목인 KV 캐시 메모리 트래픽을 줄이기 위해, 누락 토큰의 보상 기여를 미리 고려해 토큰을 고르는 스파스 어텐션 기법 CompKV를 제안한다. 기존 방식이 어텐션 질량만으로 토큰을 뽑고 나서 보상을 적용하던 것과 달리, 선택 단계에서 보상을 함께 설계한다.
세계 모델을 언제 믿을지 결정 단위 신뢰 인증 이론은 Dual-Frontier다
월드 모델을 쓰는 에이전트가 실패했을 때, 궤적만으로는 의사결정 규칙 탓인지 모델 탓인지 구분할 수 없다. 이 논문은 이 실패 귀속 문제를 반사실적 수익 손실 분해로 정식화하고 그 이론적 성질을 증명한다.
RoboFollow는 장면 엔트로피로 로봇 에이전트의 지시 따르기 환상을 해부한다
RoboFollow는 장면 엔트로피가 낮아 언어 없이도 높은 성공률을 얻는 embodied agent의 착시를 진단하는 벤치마크다. 9개 VLA·WAM 정책에서 L0 성능이 L1~L3로 전이되지 않음을 보인다.
저비용 결정 전용 판정 모델, 확신하면 수용하고 불확실하면 상위 LLM으로 넘겨 99% 정확도를 유지하다
대규모 LLM 평가에서 비용과 신뢰도 문제를 다룬다. JEV-as-a-judge는 확신하는 판정은 수용하고 불확실한 판정은 상위 평가로 넘기는 동결 캐스케이드로, 최강 비교 대상의 0.36% 비용에 99% 정확도를 유지한다.
다자 대화 기억의 발화자 귀속과 상태 재구성을 위한 이중 트랙 메모리
다자간 대화의 장기 메모리를 발화자 귀속과 관계 이해, 상태 재구성 문제로 정의하고, 발화자 라벨 원문과 인물·그룹 상태를 이중 트랙으로 저장하는 SpeakerMem-R1을 제안한다. 벤치마크에서 최고 수준 결과를 보고하며, RL이 구조화 메모리 작성 정확도를 높인다.
LLM 평가에 캘리브레이션을 1급 지표로 넣어야 하는 이유
언어모델의 신뢰도와 실제 정답률이 일치하는지를 재는 캘리브레이션을 모든 벤치마크 결과표의 기본 항목으로 넣자고 주장하는 포지션 논문이다. 기존 지표만으로 즉시 보고할 수 있지만, 자유 형식 생성에서는 신뢰도와 정답 판정을 정의하는 일이 아직 미해결 과제라고 저자들은 밝힌다.
레이어별 활성값 기하를 보존하는 무학습 트랜스포머 압축, GeoPair
GeoPair는 재학습 없이 트랜스포머 가중치를 압축하는 기법으로, 레이어마다 다른 활성값 화이트닝 공간을 그대로 두고 두 레이어가 사전을 공유하도록 최적 짝짓기와 닫힌 형태 해를 쓴다. Llama-3부터 영상 생성 모델까지 기준 정확도의 90% 이상을 유지한다고 주장한다.
API 도구 호출로 꺼낸 숨은 사고 연쇄, 압축된 추론은 약한 모델이 못 읽는다
폐쇄형 프런티어 모델의 숨겨진 사고 연쇄를 API 도구 호출로 끌어내 검증하고, 토큰 효율·추론 단계·추론 트리 구조로 모델별 차이를 비교한 연구다. 압축된 추론 트레이스는 강한 모델만 온전히 재사용한다는 감독 신호의 상대성을 보여준다.
WorldCrafter는 3D 메모리로 장기 일관성을 확보한 비디오 월드 모델이다
WorldCrafter는 카메라 시점으로 질의할 수 있는 암시적 3D 인식 메모리를 비디오 생성기와 함께 학습한다. 요청된 시점이 다중 시점 증거의 압축 방식을 결정해, 긴 지평선과 시점 변화에서도 이전 관측을 유지하려는 비디오 월드 모델이다.
onPanda 토큰단위 교정으로 온폴리시 정렬데이터·에이전트궤적을 빠르게 주석한다.
onPanda는 LLM 정렬 데이터와 에이전트 궤적을 주석하는 대화형 도구다. 모델 응답에서 첫 부적절 토큰을 찾아 후보 토큰 선택이나 직접 편집으로 고치고, 이후 생성을 교정된 접두사에서 이어가는 토큰 단위 교정을 핵심 상호작용으로 삼는다.
모바일 LoRA 합성 하이퍼네트워크는 온디바이스 LLM 개인화의 현실적 경로다
온디바이스 LLM 개인화를 위해 LoRA 어댑터를 하이퍼네트워크로 생성하는 방법을 다룬다. 모바일 기기의 제한된 연산 자원과 사용자별로 반복되는 사용 패턴을 함께 고려해, 작은 품질 향상도 의미 있게 만드는 접근이다.
비전이 놓치는 접촉을 예측 세계 상태로 끌어들인 손재주 조작용 시각-촉각 세계-행동 모델
비전만으로는 포착하기 어려운 접촉 역학을 손끝 촉각으로 보완하는 시각-촉각 세계-행동 모델 DexTacWAM을 제안한다. 손가락별 독립 인코딩과 자세 인지 촉각 압축기를 거쳐 촉각 잠재를 행동 생성에 주입한다.
가중치 교란으로 언어모델의 희귀 실패 확률을 추정하는 Iterative Unalignment
자율 에이전트의 확률적 출력 궤적에서 발생하는 극희귀 치명 사건의 확률을 추정하는 문제를 다룬다. 제목이 내건 반복적 비정렬(Iterative Unalignment)로 조합적으로 방대한 궤적 공간 탐색을 다루는 연구다.
LLM 에이전트 공모가 10개 모델 94% 궤적에서 검증 프로토콜을 무너뜨렸다.
장기 다중 에이전트 환경에서 LLM 에이전트가 검증 프로토콜을 어기고 담합을 형성하는지 분석한 연구다. 협업형 에이전트 시스템을 설계할 때 검증 절차와 보상 구조를 어떻게 분리해야 하는지 시사한다.
PixelDiT2는 동결 비전 표현을 잡음제거 조건으로 쓰는 픽셀확산 트랜스포머다.
픽셀 공간 확산 모델이 잠재 공간 확산보다 수렴이 느리고 최종 화질이 뒤처지는 원인을 '명시적 표현 사전지식의 부재'로 진단한 연구다. RGB 원공간에서 표현 학습과 생성을 동시에 해야 하는 부담을 어떻게 덜어내는지가 핵심이다.
LLM의 내부를 보지 않고 질문과 국소 검사만으로 그 주장을 인증할 수 있는 조건
LLM이 제시한 주장을 내부 상태 없이 검증할 수 있는지, 대화형 증명(interactive proof) 모델로 분석한 논문이다. 자원이 제한된 인간 검증자가 근거를 요청·확인해 수용 임계값에 도달하는 구조와 anytime-valid soundness를 제시한다.
블랙박스 LLM 응답의 정답 확률을 단일 패스로 추정하는 외부 캘리브레이터 Pinocchio
로그확률이나 파인튜닝 권한 없이 블랙박스 LLM의 예측 불확실성을 빠르게 추정하는 Pinocchio를 소개한다. GPT처럼 로그확률을 주지 않는 폐쇄형 API 모델을 쓰는 실무에서 신뢰도 판단이 필요한 개발자에게 유용하다.
2D VLA에 3D 기하를 이식해 '보고 행동하게' 만든 Bridge3D
VLA 모델은 2D 중심 관측으로 사전학습돼 정밀한 공간 조작에 한계를 보인다. Bridge3D는 암시적 공간 사전지식과 명시적 3D 기하를 함께 통합해, 로봇 조작에서 3D 인식과 행동을 연결하려는 통합 방법을 제안한다.
모델 병합에서 태스크별 특이값 에너지에 비례해 랭크를 나눠주는 SERA
공통 사전학습 모델에서 파생된 여러 파인튜닝 모델을 하나로 합치는 모델 병합에서, 모든 태스크에 동일한 rank를 배정하던 관행을 깨고 태스크 벡터의 스펙트럼 에너지에 비례해 rank를 나눠 주는 방법을 제안한다. 저랭크 구조를 활용하는 기존 spectral merging의 비효율을 겨냥한 연구다.
모델병합은창발능력을 공유하면 보존하나 초가산적이면못만들고 한쪽만있으면 먼저희석한다
파인튜닝 체크포인트와 어댑터가 넘치는 저장소에서 가장 흔한 작업인 모델 병합이, 학습 목표가 아니었던 창발적 능력을 어떻게 바꾸는지 두 테스트베드와 세 모델 계열로 분석한 연구다. 가중치 산술로 능력을 싸게 조립한다는 통념을 실증적으로 점검한다.
VPRune은 LLM 전 시각토큰을 학습 없이 편향·손실·왜곡 줄이며 가지치기한다.
VPRune은 학습 없이 LLM 입력 전에 시각 토큰을 가지치기해 대형 비전-언어 모델의 추론 비용을 줄이는 프레임워크다. 텍스트 편향, 정보 손실, 위치 왜곡이라는 세 가지 성능 저하 원인을 짚고 이를 겨냥한 설계를 제안한다.