AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
Org-Agent가 조직용 LLM 에이전트의 다중 사용자 조율을 의존성 그래프로 푼다
Org-Agent는 여러 사용자의 요청과 분산된 지식을 조직 제약에 맞춰 조율하는 LLM 에이전트 프레임워크다. GroupMemBench에서 44.03%, MUSES-Bench에서 72.39%를 기록해 기존 검색·메모리 베이스라인을 앞섰다.
장기 LLM 에이전트 기억이 대화 이력에서 도출되는지 감사한다
장기 실행 LLM 에이전트가 대화 이력을 압축해 저장하는 기억이 실제로 그 이력에서 도출되는지 감사하는 DerivAudit을 제안한다. 인용만 보면 근거가 없어 보이는 기억의 약 60%가 더 넓은 이력에서 지지되지만, 지원되지 않는 기억의 승인률은 여전히 59~89%에 달한다.
좁은 파인튜닝이 안전성을 무너뜨리는 경로를 헤시안 곡률로 찾아낸다
안전 정렬된 LLM이 좁은 도메인 파인튜닝만으로 전역 안전성이 붕괴하는 창발적 오정렬(EM)을, 학습 궤적의 2차 곡률과 그래스만 부분공간 겹침으로 진단하고 파라미터 공간에서 억제하는 방법을 제안한다. Qwen2.5-14B-IT에서 자유생성 EM을 최대 80.0% 줄였고, 행동상 EM이 0에 가까운 모델에서도 잠복 위험 벡터가 남아 있음을 보였다.
SlideDP가 여러 GPU의 공유 호스트 자원에서 계층 스트리밍 파인튜닝을 겹쳐 돌린다
호스트 메모리에 옵티마이저 상태를 두고 계층을 GPU로 흘려보내는 파인튜닝을, 한 노드의 여러 GPU에서 동기 데이터 병렬로 돌릴 때 생기는 중복 전송과 파이프라인 노출을 줄이는 런타임 SlideDP를 제안한다. 4개 H100에서 Qwen3-14B로 FSDP2 대비 최대 11.2% 높은 처리량을 냈다.
규제 도메인 에이전트의 자율 범위를 측정하는 진단 하네스 RegLLM
규제 산업용 LLM 에이전트에서 언제 답하고 언제 사람에게 넘길지를 측정 가능한 학습 신호로 만든 진단 하네스 RegLLM을 제안한다. 저자는 동일 설정의 두 GPU 파일럿이 전혀 다른 지표를 내는 분산을 핵심 결과로 보고한다.
NavHarness가 새 대화로도 탐색 기억을 이어 붙여 lifelong navigation을 만든다
학습 없이 여러 번의 내비게이션 과제를 연속 수행하는 NavHarness를 제안한다. 지도·과제 기록·집 지식을 대화 밖에 두고 검증·요약으로 이어 붙여 GOAT-Bench s-SR을 최대 34.8점 올렸다.
ReaLVR가 잠재 시각 추론을 이미지 근거에 묶는다
ReaLVR는 잠재 시각 추론 토큰이 정답에 필요한 이미지 근거를 보존하도록 정답·오답 대비와 시각 대비 감독을 추가한다. Qwen2.5-VL-7B에서 5개 과제 평균 63.7%로 LVR-SFT를 4.0점 앞섰고 235B까지 확장했다.
SeLMRoute는 질의가 요구하는 능력을 확률적 의미 증거로 먼저 뽑는다
LLM 라우팅에서 질의 임베딩 대신 해석 가능한 16개 의미 질문의 확률분포를 중간 표현으로 쓴다. 후보 모델과 무관한 의미 증거를 먼저 뽑아 성능 학습과 배포 목표를 분리하고, LLMRouterBench에서 평균 72.08% 정확도를 낸다.
모델 이름을 숨기면 다중 에이전트 협력이 좋아진다
이질적인 LLM 에이전트들에게 서로의 모델 계열을 알려주면 과제에 아무 이득이 없어도 라벨을 따라 파벌이 갈라지고, 합의에 더 많은 라운드와 토큰이 들며 성공률이 떨어진다. 저자들은 정체성 라벨을 숨기는 것만으로 이 비용을 없앨 수 있다고 주장한다.
문항반응이론으로 루브릭 보상을 다시 설계해 판정 비용을 줄인다
루브릭 기반 강화학습에서 배점 합산 대신 문항반응이론으로 롤아웃 품질을 추론하는 RRT를 제안한다. Qwen3.5-4B에서 GRPO보다 매크로 기준 점수가 1.7점 높고, 절반의 판정 예산으로도 동등한 성능을 유지한다.
FAR는 미래 예측 유용성으로 세계 모델의 기억 검색과 단서 선택을 학습한다
FAR는 훈련 중 관측된 미래의 예측 유용성을 보상으로 삼아, 추론 시에는 미래 없이도 에피소드 기억을 검색하는 검색기를 학습한다. 시간·자세·시각·오디오 단서별 관련도와 질의별 신뢰 가중치를 함께 학습해 고정 규칙보다 나은 장기 예측을 보인다.
APPL은 스킬 학습에 쓴 구조적 사전확률을 런타임 조합 인터페이스로 재사용한다
로봇이 소수 시연으로 배운 스킬을 새 상황에서 쓸 때, 학습 시 사용한 구조적 사전확률을 런타임 인터페이스로 노출해 조합 에이전트가 정책 선택과 연결을 더 정확히 하도록 만든 APPL을 제안한다. MetaWorld 6개 과제에서 OOD 성공률 89.58%를 기록했고, ManiSkill 장기 과제에서도 베이스라인 대비 크게 개선됐다.
도구 사용 LLM의 내부 개입이 실제 수리인지 판정하는 SAKIKO
도구를 쓰는 LLM의 실행 전 행동 선택을 내부 활성화 조향으로 바꿀 때, 그 변화가 진짜 수리인지 목적지 도달·담보 손상·통계적 유의성까지 감사하는 SAKIKO 프레임워크를 제안한다. 7개 모델 실험에서 집계 이득이 측면 오류 이동과 기존 정답 파괴를 가린다는 사실을 보인다.
온폴리시 학습이 정말 유리한지 증류 실험으로 분리해 검증한다
강한 교사에서 약한 학생으로 증류할 때 롤아웃 정책과 KL 방향, 학습률을 분리해 비교한 결과 온폴리시 데이터의 이점은 일관되지 않았고, KL 방향이 성능을, 학습률이 망각과 업데이트 희소성을 좌우했다. 어려운 과제 일반화에서만 온폴리시가 도움이 됐지만 이후 RLVR을 거치면 그 우위가 사라졌다.
PersonaDose가 활성화 조향 강도를 페르소나 점수 단위로 보정한다
PersonaDose는 트레이트 설명과 요청 평균 점수만으로 언어모델의 페르소나 발현 강도를 조절하는 방법이다. FLAS 컨트롤러를 페르소나 응답에 특화한 뒤 flow time을 측정된 발현 점수에 캘리브레이션해, 세 모델 패밀리에서 CAA 대비 최대 33.2점 높은 발현을 일관성 75 이상에서 달성했다.
비디오 월드 모델 2비트 KV 캐시 양자화의 깜빡임을 잡는 QuantWM
비디오 월드 모델에서 2비트 KV 캐시 양자화가 VBench 점수는 지켜도 시간적 깜빡임을 만든다는 원인을 Key가 어텐션 로짓을 흔든다고 규명하고, Query 민감도 기반 클러스터링과 저랭크 보상으로 이를 줄인다.
VLM에 내부 월드모델을 붙여 공간 추론을 시각 상태로 푼다
VLM에 얕은 생성 브랜치를 붙여 중간 시각 상태를 예측하는 내부 월드모델 WM-VLM을 제안한다. Tetris-2D·3D 정신 회전 과제에서 SFT 베이스라인을 최대 39.25%p 앞서고, 생성 토큰을 제거하면 성능이 급락해 실제로 쓰인다는 것을 보인다.
역증류 프레임워크가 한 단계 생성 모델의 망각과 증류를 동시에 처리한다
IDU는 사전학습된 다단계 확산·플로우 교사와 잊을 데이터 샘플만으로 한 단계 생성기를 증류하면서 해당 데이터 생성을 억제하는 역증류 프레임워크다. MNIST와 CIFAR-10 실험에서 망각 클래스 생성률을 최대 1.25%까지 낮추면서 남은 클래스 품질을 유지했다.
컨텍스트 예산이 좁으면 원문 턴 선택이 LLM 추출 메모리를 대체한다
LLM 추출 없이 원문 대화 턴을 그대로 저장하고 검색 시점에 한 번의 결정 모델 호출로 고르는 것만으로 추출 기반 메모리에 비열등하다는 사전 등록 연구다. 리랭킹의 이득은 컨텍스트 예산이 커질수록 줄어든다.
SlimWise가 MoE 프리필은 전체로 두고 디코드 전문가만 잘라 처리량을 높인다
MoE 서빙에서 프리필은 전체 전문가로, 디코드는 가지치기한 전문가로 처리하고 KV 캐시를 변환 없이 넘기는 SlimWise를 제안한다. 50% 전문가 가지치기에서 디코드 처리량을 최대 1.81배 높이면서 정확도 손실과 생성 길이 왜곡을 줄였다.
다국어 LLM은 첫 레이어를 풀 어텐션으로 시작할 때 더 빨리 배운다
하이브리드 어텐션 LLM이 다국어 표현을 어떻게 조직하는지 처음 분석한 연구다. 첫 번째 풀 어텐션 레이어에서 언어 간 표현 정렬이 급변하며, 첫 레이어를 풀 어텐션으로 두는 배치가 기존 주기적 배치보다 최대 2.5배 빠르게 학습한다.
RLVR 학습 이득을 저차원 활성화 벡터로 재현하고 붕괴를 예측한다
RLVR로 얻은 추론 성능 향상이 활성화 공간의 저차원 고정 벡터만으로 85% 이상 재현된다는 것을 5개 LLM과 6개 과제에서 확인하고, 주성분 부분공간 침입을 조기 경보로 삼아 학습 붕괴를 막는 Alpha-Stabler를 제안한다.
ReSPO가 오프폴리시 학습의 부호별 경사 기아를 두 갈래 커널로 해소한다
GRPO·GSPO의 클리핑이 양성 응답의 저중요도 꼬리 신호를 지우고 음성 응답의 고중요도 꼬리를 폭주시키는 문제를 분석하고, α-발산과 지수 틸트로 유도한 두 갈래 시퀀스 커널 ReSPO로 해결한다. Qwen3-1.7B와 30B-A3B에서 롤아웃 재사용이 클수록 개선폭이 커진다.
불확실한 턴만 골라 교사가 대신 행동하는 온폴리시 증류, UOPD
다중 턴 에이전트의 온폴리시 증류에서 교사 불확실성이 높은 턴을 골라 교사 행동으로 개입하는 UOPD를 제안한다. ALFWorld·WebShop·Search에서 기존 OPD보다 높은 성공률과 적은 상호작용 턴을 보고했다.
AVPO는 LLM 활성화를 질문 없이 텍스트로 복원하고 선호최적화로 환각을 줄인다
LLM의 은닉 활성화를 자연어로 해석하는 기존 방법은 불완전하거나 환각된 설명을 낸다. AVPO는 질문 비의존 인버터로 텍스트를 복원한 뒤 별도 QA 모델로 평가하고, DPO로 의미 복원력과 어휘 충실도를 함께 최적화해 여섯 텍스트 패밀리에서 최대 17.1%p 향상을 보고한다.
LQN이 한 번의 순전파로 VLM을 테스트 시점에 적응시킨다
기존 테스트 시점 학습은 증강 뷰마다 VLM 전체를 순전파해 계산 비용이 컸다. LQN은 중간층 특징을 3D 좌표로 질의하는 25M 경량 학생망으로 단 한 번의 순전파에 CLIP을 OOD ImageNet에서 9.8%p 개선한다.
결정론적 계약 검증으로 멀티에이전트 LLM 핸드오프 오류 전파를 막는 Maat
LLM 멀티에이전트 워크플로의 에이전트 간 핸드오프를 버전 관리된 계약으로 결정론적으로 검증하는 Maat을 소개한다. 6개 도메인 522회 시행에서 귀속 가능한 중단은 5개 워크플로에서 7.7~29.1% 개선을 보였지만, 94개 중단 중 37%가 검증기 결함에 의한 오경보였다.
FIRE가 자기증류 학습의 불안정성을 피셔 정보로 잡는다
FIRE는 피드백 기반 온폴리시 자기증류가 학습 중 붕괴하는 문제를 정답·오답 이중 분기와 소프트맥스 피셔 흔적에서 유도한 반경으로 억제한다. Qwen2.5 1.5B·3B 실험에서 평균 성능과 그래디언트 안정성을 동시에 개선했다.
반사실 선호 피드백으로 보상 모델의 채점 근거를 학습하는 설명기 RewardExplainer
보상 모델의 스칼라 점수만으로는 어떤 응답 행동이 점수를 좌우하는지 알 수 없다. 반사실 재작성 피드백을 선호 학습으로 바꿔 재사용 가능한 설명기를 훈련하고, 이를 편향 탐지와 보상 해킹 완화에 활용하는 폐루프 프레임워크를 제안한다.
코딩 에이전트의 수정 피드백을 '지속 노트'로 관리하는 Opera critic 프레임워크
Opera는 코딩 에이전트의 수정 피드백을 지속적 노트로 관리해 언제 개입할지 정하고, 근거를 감사하며, 실제 해결 여부까지 추적하는 verbal critic 프레임워크다. 세 벤치마크에서 최대 15.0%p 해결률을 올렸고, critic 없이도 통하는 on-policy 학습 데이터 생성 효과를 보였다.