AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
음성 LLM은 명령을 알아도 실행할지 판단하지 못한다
VGBench는 측화·독백·화자 전환 1,018개 항목으로 음성 LLM이 명령을 알아듣고도 실행 여부를 음향 맥락으로 판단하는지 진단한다. 최고 원시 모델의 화자 전환 침묵률은 14%에 그쳤고, 사후학습으로 91.3%까지 끌어올렸다.
X-Tree가 에이전트 궤적을 재사용 가능한 스킬 트리로 토큰화한다
X-Tree는 LLM 호출 없이 궤적에서 반복·성공하는 액션 구간을 재사용성 점수로 병합해 스킬 트리를 만들고, 이를 오프라인 RL·온라인 RLVR·자기증류 세 방식으로 학습에 넣어 WebArena·ScienceWorld·WebShop에서 성공률을 최대 5.8%p 올린다.
LLM 스코어러는 순위 품질이 같아도 순서가 바뀌면 다른 결정을 내린다
여러 후보를 한 프롬프트에서 채점하는 LLM 스코어러는 순위 품질이 같아도 후보 순서가 바뀌면 임계값이 남기는 문서, 리더의 답, 선호쌍이 달라진다. 논문은 순서 일관성 SFT(OC-SFT)로 순위 품질을 유지한 채 세 결정의 재현성을 높인다.
KeyRec가 고정 예산 시각 메모리로 스트리밍 영상 이해 비용을 줄인다
VLM이 긴 영상과 스트림을 처리할 때 시각 토큰이 무한정 쌓이는 문제를, 최근 캐시와 이벤트 뱅크로 나눈 고정 예산 메모리로 해결하는 KeyRec을 제안한다. 학습 없이 밀집 토큰의 10%만 디코더에 노출하고도 15개 설정 중 13개에서 최고 압축 성능을 냈다.
Extender가 어텐션 KV 캐시를 104분의 1로 줄인다
Extender는 어텐션 KV 캐시 대신 로그 구조로 쌓은 확장 임베딩 x를 공유 캐시로 사용해 턴 사이 어텐션 메모리를 104분의 1로 줄인다. 199M~924M 구간에서 짧은 문맥 정확도는 Transformer와 비슷하고 긴 문맥에서는 앞선다.
PluginRSI가 에이전트 하네스를 재사용 플러그인으로 진화시킨다
에이전트 하네스를 원자적 플러그인 조합으로 표현하고, 플러그인 변이와 하네스 재조립을 반복해 성능을 올리는 PluginRSI를 제안한다. SWE-bench Verified에서 기존 하네스 탐색 기법보다 held-out 해결률을 6~10%포인트 높였다.
월드모델이 넓은 잠재벡터에서 예측 정보를 앞쪽 좌표에 몰아넣는 방법
JEPA 기반 월드모델 ALeWM은 시퀀스별로 활성 프리픽스 길이를 학습해 넓은 잠재벡터의 앞쪽 좌표에 예측 정보를 집중시킨다. MixSIGReg 정규화로 플래닝 차원을 크게 줄이면서 성공률을 높였다.
FuseReg는 인코더 층 융합을 무작위화해 재구성과 생성 격차를 줄이는 정규화다.
RAE에서 어떤 인코더 층을 융합할지 고정하면 재구성과 생성이 서로 다른 층을 원해 성능이 갈린다. FuseReg는 학습 중 무작위 층 부분집합을 샘플링해 디코더와 DiT를 층 융합 변화에 강건하게 만들고, DiT-Base에서 gFID를 13.96에서 9.93으로 낮춘다.
정답 없이 신뢰도만 학습시켜 추론 토큰을 줄이는 ConfSFT
추론 모델의 긴 사고 과정을 줄이기 위해, 정답 없이 모델 스스로 만든 신뢰도 라벨만으로 파인튜닝하는 ConfSFT를 제안한다. 추론 길이를 겨냥한 목적함수 없이도 생성 토큰을 최대 25% 줄이면서 정확도를 유지했고, 수학에서 학습한 효과가 과학·코딩으로 전이됐다.
블랙박스 생성 AI의 속성 분포를 목표에 맞추는 후처리 알고리즘
블랙박스 생성 AI의 출력 속성 분포를 사용자가 지정한 목표에 맞추는 후처리 알고리즘 RDC, TA-RDC, CA-RDC를 제안하고 모델 호출 비용 최적성을 증명한 논문이다. 텍스트-이미지와 페르소나 생성 실험에서 정렬 오차를 크게 줄였다.
LLM이 사용자에 대해 품은 믿음을 128차원 벡터로 읽고 쓰는 BSD 프레임워크
LLM이 대화에서 추론한 사용자 믿음을 128차원 벡터로 증류해 읽고 쓸 수 있게 만든 BSD를 제안한다. 이 벡터를 조작하면 요청은 그대로 둔 채 거부율이 98%에서 62%로 바뀌고, 세 모델이 유사한 사용자 표현 기하를 공유한다는 결과도 제시한다.
여러 LoRA 스킬을 하나의 모델로 접는 읽기 전용 결합 연산자 READ
LoRA 어댑터를 균형 정준형으로 재인수분해하고, 새 스킬이 기존 스킬의 입력 부분공간만 읽고 출력에는 쓰지 못하게 결합하는 READ를 제안한다. 32개 리니지에서 14개 병합 베이스라인의 최강 대비 평균 +0.073을 기록했고, 추론 비용은 기본 모델과 같다.
전략의 다양성은 자기학습 데이터 샘플링에서 정답보다 더 중요하다.
자기학습 데이터에서 정답 필터링보다 접근법의 전략적 다양성이 더 중요하다는 연구. GROOT와 Verbalized Sampling으로 다양한 풀이 전략을 뽑아 학습하면 4B 모델이 235B 교사 증류를 능가한다.
가중치 자체를 작은 문법으로 표현하도록 파인튜닝하는 WeightPE
가중치를 int8로 양자화해 하나의 문자열로 만든 뒤, 손실 Re-Pair 압축기를 straight-through estimator 안에 넣어 문법 크기 자체를 학습 목표로 삼는다. CIFAR-10 파인튜닝에서 Re-Pair 문법이 int8 QAT 대비 0.43배·0.38배로 줄고 정확도 손실은 1.9점·1.1점이었다.
LLM 멀티에이전트 성능은 팀 크기가 아니라 과제 구조가 결정한다
LLM 멀티에이전트 확장을 Steiner의 과제 분류로 분석한 논문. 분리형 과제에서는 다수결이 모델의 최빈 답에 수렴하고, 보상형 과제에서는 항목별 편향이 오차의 87%를 차지해 평균내도 6%밖에 줄지 않는다.
OPTQ 양자화의 일반화 오차와 정규화 λ 선택법
OPTQ(GPTQ) 양자화의 일반화 오차를 정규화 λ의 역할로 분석한 이론 논문이다. 캘리브레이션 데이터가 적을 때 과적합을 막는 새로운 λ 스케일링을 제안하고, 세 가지 분포 실험에서 기존 추천보다 낮은 오차를 보인다.
저차원 잠재공간 칼만 추적으로 다시 설계한 온라인 학습, AURA
비정상 환경 온라인 학습을 저차원 잠재공간의 확장 칼만 필터 추적으로 바꾼 AURA를 제안한다. 오프라인 메타학습으로 적응에 특화된 잠재 동역학과 lifting map을 함께 학습해, 샘플당 한 번의 업데이트로 이미지 분류와 무선 수신기 적응에서 기존 베이스라인을 앞선다.
EAServe는 인코딩을 EPD 파이프라인 제어점으로 재배치한 MLLM 서빙이다.
멀티모달 LLM 서빙에서 인코딩 단계를 파이프라인 제어점으로 재배치한 EAServe를 제안한다. GPU 할당·배치 크기·오프로드 비율을 자동 탐색하고 세 가지 런타임 기법을 결합해, 동일 SLO에서 Dynamo 대비 최대 4.3배, vLLM 대비 1.7배 높은 goodput을 냈다.
문서 내 AI 텍스트 스크리닝에서 검사 경로 전체의 오경보를 통제하는 두 가지 conformal 구성
여러 prefix와 탐지기를 골라 검사하는 AI 텍스트 스크리닝에서, 문서 수준 교환가능성만으로 검사 경로 전체의 오경보 확률을 α 이하로 묶는 두 가지 conformal 구성을 제안하고 필요한 캘리브레이션 문서 수를 유도한 이론 논문이다.
로컬 SLM 신뢰 여부는 검증 가능성으로 그은 네트워크 자동화 경계로 정해진다.
네트워크 자동화 입력을 프런티어 LLM에 보내면 설정·토폴로지·로그가 유출된다. 이 논문은 값싼 결정론적 검사로 걸러낼 수 있는 작업만 로컬 SLM에 맡기고 나머지는 프런티어로 에스컬레이션하는 Touchstone을 제안한다.
하이퍼그래프 골격을 고정해 협동 MARL의 크레딧 할당 흔들림을 잡는 HySTAR
HySTAR는 겹치는 희소 하이퍼그래프를 시간적으로 일관된 가치 분해 골격으로 고정하고, 표현만 적응시켜 동적 그룹핑이 만드는 구조적 타깃 드리프트를 줄이는 MAPPO 기반 협동 MARL 프레임워크다. SMAC·GRF·Traffic Junction·MPE에서 기존 베이스라인을 앞선다.
실제 이미지만으로 AI 생성 이미지를 잡는 자기지도 잔차 학습, Forensic Twins
실제 이미지만으로 학습해 AI 생성 이미지를 탐지하는 자기지도 잔차 학습 프레임워크다. 잔차 추출기와 공간적으로 겹치지 않는 두 크롭, Barlow Twins 목적함수를 결합해 27개 미학습 생성기에서 평균 97.99% AUC를 기록했다.
PISA는 피라미드 블록 선택으로 긴 문맥 주의 비용을 로그 선형으로 줄인다.
PISA는 블록 희소 주의에서 모든 쿼리-블록 쌍을 점수화하는 병목을 피라미드 Top-K 선택으로 줄인다. O(N log N) 복잡도의 계층적 키 구조와 학습·추론용 Triton 커널을 제안해 긴 문맥 언어모델의 효율을 겨냥하며, 기존 블록 선택의 제곱 비용을 로그 선형으로 낮추는 접근이다.
MMORPG 샌드박스로 장기 협업을 측정하는 AgentWorld 벤치마크
MMORPG 샌드박스에서 3~20개 에이전트가 25~55라운드 동안 협업하는 장기 과제 벤치마크 AgentWorld와 행동의 인과 기여도를 재는 CCE 지표를 제안한다. 최고 모델도 성공률 52.0%, CCE 0.320에 그쳤다.
루프 언어모델의 깊이 적응 추론을 루프 스텝 사이 배칭으로 실현한 첫 종단간 구현
토큰마다 루프 깊이가 달라 표준 배칭으로 처리할 수 없던 루프 언어모델을, 루프 스텝 사이에 배치를 재구성하는 연속 깊이 배칭(CDB)으로 해결한 첫 종단간 구현 연구다. Ouro 1.4B에서 최대 1.53배 처리량을 내며 추정 상한의 99%를 달성했다.
도메인 라벨 없이 토큰마다 교사를 고르는 다중 교사 온폴리시 증류
다중 교사 온폴리시 증류에서 프롬프트 단위 도메인 라벨 하드 라우팅을 토큰 단위 라우팅으로 바꾸는 MOPD-Router를 제안한다. 특화 방향 정렬을 재는 ExpertAlign이 라벨 없는 혼합 데이터와 라벨 데이터, 네 가지 설정 모두에서 최고 점수를 기록했다.
출력 헤드의 softmax 등가성으로 저비트 양자화 손실을 줄이는 재매개변수화
출력 헤드의 softmax 등가성을 이용해 양자화 전에 스칼라 이동 계수를 검증 KL로 고르는 사후 학습 기법을 제안한다. Phi-4-mini에서 W4 AW-MSE KL을 0.936에서 0.256으로 낮추고, 패킹된 W4 실행에서 배치1 생성 지연을 10.8% 줄였다.
G²PTQ가 블록 단위 전역 감독으로 LLM 사후 양자화 오차를 줄인다
GPTQ 계열 사후 양자화의 지역 목표와 고정 헤시안 한계를 블록 단위 전역 감독과 1·2차 정보 갱신으로 해결하는 G²PTQ를 제안한다. 2비트 가중치 양자화에서 KL 발산을 절반으로 줄이고 QA 정확도를 6.45%p 높였다.
자기대국 탐색 기록을 사고 사슬로 바꿔 LLM 추론을 학습시킨다
보드게임 자기대국 탐색 기록을 초인적 사고 사슬로 변환해 LLM을 학습시키는 SPSD를 제안한다. Qwen3-4B-Base에서 수학 벤치마크 평균을 24.1에서 36.6으로, 보지 못한 게임 승률을 15%에서 45%로 올렸다.
Omni-IO Skills가 기존 에이전트를 재학습 없이 옴니네이티브로 확장한다
Omni-IO Skills는 기존 범용 에이전트를 재학습 없이 텍스트·이미지·오디오·비디오·문서·3D·코드 작업에 연결하는 플러그앤플레이 하네스다. UniM-90에서 입력 지원률을 100%로 올리고 상대 SQCS를 26.99→74.94, 27.82→77.78로 개선했다.