AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
반복 순환과 MoE 희소성을 함께 묶는 스케일링 법칙
반복 순환(looped transformer)과 MoE 희소성을 동시에 모델링하는 최초의 통합 스케일링 법칙을 제안한다. 순환 이득이 유한한 점근값으로 포화되고, 희소성이 그 상한을 끌어올린다는 것을 실험으로 보인다.
터미널 에이전트의 행동 신뢰성을 모델과 하네스 사이 검증으로 높인다
터미널 에이전트의 모델 호출 지점에서 후보 행동을 여러 개 샘플링하고 검증기로 하나를 골라 실행하는 Mid-Harness를 제안한다. TMAX-9B 생성기를 고정한 TerminalBench-Lite에서 페어와이즈 검증과 증류로 Pass@1을 50.00%에서 57.14%까지 올리고, 궤적 수준 스케일링과 결합해 더 낮은 토큰 비용으로 더 높은 성공률을 얻는다.
자기진화 검색 에이전트의 공모 오류를 CrossFit이 줄인다
자기진화 검색 에이전트가 같은 오류에 합의하는 공모 오류를 진단하고, 평가자 학습 이력에서 출처를 배제하는 CrossFit을 제안한다. 거짓 합의를 6.1%/8.8%에서 3.0%/3.7%로 낮추고 7개 벤치마크 평균을 8.8/8.4점 올렸다.
행동 복제의 다중 모드 표현은 정규화 강도와 샘플러 매끄러움이 결정한다
같은 관측에 여러 유효 행동이 있는 행동 복제에서 다중 모드성이 어떻게 붕괴하는지 분석한 논문이다. CVAE의 사후-사전 정규화 강도와 행동공간 생성 샘플러의 립시츠 상수가 모드 보존을 좌우하며, 표준 로봇 시뮬레이션 벤치마크는 대부분 단일 모드에 가까워 결정론적 회귀가 여전히 경쟁력이 있다고 주장한다.
PatchHolmes가 후보 100개를 통째로 읽어 취약점 패치 커밋을 찾는다
패치 검색은 CVE 설명만 보고 저장소에서 수정 커밋을 찾는 작업인데, 주요 취약점 DB의 60% 이상이 패치 링크를 갖고 있지 않다. PatchHolmes는 하이브리드 검색으로 후보 100개를 추린 뒤 LLM 에이전트가 목록을 통째로 읽고 커밋 하나를 골라 Recall@1 59.95%를 낸다.
잠재 공간 통신 링크만 조작해도 안전 정렬된 멀티에이전트가 유해 요청에 응한다
멀티에이전트가 텍스트 대신 내부 표현을 주고받는 잠재 통신에서, 에이전트 가중치를 건드리지 않고 통신 링크만 학습·오염시켜도 유해 요청 응답률이 27.9에서 76.9로 치솟는다. 저자들은 같은 링크를 보상 기반으로 재학습해 70.3을 4.8로 되돌리는 수리 절차도 제시한다.
ATLAS가 월드모델 계획 잠재표현의 관계 기하를 보존한다
잠재 월드모델의 반붕괴 정규화는 전역 분포만 맞출 뿐 상태 간 관계를 정하지 못한다. ATLAS는 패치 표현의 정규화 쌍별 거리를 계획 잠재로 옮기고 Wasserstein 임베딩 매칭으로 분포를 보정해 OOD 계획 성공률을 높인다.
LEAP가 시간 단위 영상에서 근거 구간만 골라 문맥 한계를 넘는다
LEAP는 긴 오디오-비디오를 600초 블록과 75초 윈도로 나눠 질문 조건부 경량 패스로 근거 구간만 골라내고, 선택된 윈도만 원본 스트림에서 다시 인코딩해 답한다. Qwen3-Omni-30B-A3B 대비 4.5~16.8% 향상, MiniCPM-o 4.5로 전이해도 3.1~13.0% 개선을 보고했다.
LSD가 이미 푼 문제의 불필요한 응답 길이를 줄인다
강화학습 후처리에서 이미 맞힌 문제의 답변이 길어지는 길이 스케일링 세금(LST)을 정의하고, 푼 문제는 자기 증류로, 못 푼 문제는 기존 RL로 보내는 LSD를 제안한다. 단일턴 수학 추론과 멀티턴 에이전트 실험에서 LST를 크게 낮추면서 Pass@1을 유지하거나 개선했다.
LVLM 공간 추론의 조기 확정을 줄이는 단계별 소프트 추론
LVLM이 공간 추론에서 매 단계 토큰 하나를 확정하는 대신 임베딩 혼합으로 후보를 유지하고, AdaptSoft가 은닉 상태와 예측 불확실도로 소프트함을 조절한다. OmniSpatial·SpatiaLab·MindCube에서 같은 백본의 하드 CoT와 고정 소프트 CoT를 앞선다.
MemLife가 1인칭 에피소드 메모리로 장기 영상 QA를 개선한다
Meta Reality Labs 등 연구진이 장기 1인칭 영상을 1인칭 텍스트 에피소드로 압축하는 MemLife와, 메모리 작성자만 강화학습으로 최적화하는 MemOpt를 제안했다. 네 개 벤치마크에서 학습 없는 최강 베이스라인 대비 4.6~12.0% 향상, MemOpt 추가 시 2.7~5.0%가 더 개선됐다.
DAGent가 노드 증거를 보고 DAG를 키워 딥리서치 계획을 점진적으로 세운다
딥리서치 에이전트가 실행 전에 전체 계획을 확정하던 방식을 버리고, 완료된 노드의 신뢰도와 불확실성 신호를 보고 DAG를 한 배치씩 키우는 DAGent를 제안한다. BrowseComp-Plus·GAIA·xbench-DeepSearch에서 기존 오픈소스 최강 베이스라인을 앞서고, 토큰·툴콜·스텝도 더 적게 쓴다.
LLM 판사는 기준 선택 토큰만 골라 증류해야 일반화된다
주관적 평가에서 LLM 판사의 판정은 어떤 평가 기준을 부르고 어떻게 가중하느냐에 좌우된다. 이 논문은 선호 라벨에 딸린 자연어 피드백을 교사 신호로 쓰되 엔트로피 시프트가 낮은 위치만 남기는 위치 선택적 자기증류로 GRPO 계열보다 주관적 하위 과제에서 2~9%포인트 높은 정확도를 보고한다.
GraphForge가 실제 파일에 근거해 워킹 에이전트 학습 데이터를 합성한다
GraphForge는 O*NET 직업 씨앗과 실제 파일 워크스페이스 위에 근거 그래프를 세워 과제와 루브릭을 함께 합성하는 워킹 에이전트 학습 데이터 파이프라인이다. Qwen3.6-27B 파인튜닝으로 GDPVal 1445.7(+65.7) 등 세 벤치마크에서 향상을 냈다.
PixelDense가 픽셀 확산 모델의 의미·기하 정렬을 두 갈래로 분리한다
픽셀 공간 확산 트랜스포머에서 REPA 정렬 대상을 DINOv2 같은 의미 인코더에서 SAM2·Depth Anything v2·Metric3D v2 같은 밀집 예측 모델로 넓히되, 의미와 기하 감독을 서로 직교하는 두 투영 스트림으로 분리한 PixelDense를 제안한다. PixelGen-XXL에서 GenEval Overall을 0.7927에서 0.8093으로 끌어올리고, 교사는 추론 시 제거해 샘플링 비용을 늘리지 않는다.
정렬 후 추론으로 무음 영상 더빙 립싱크를 판정한다
더빙 품질 검수에서 참조 오디오 없이 무음 영상과 후보 대사만으로 내용과 타이밍 일치를 판정하는 ATR을 제안한다. 프레임-음소 단조 정렬 점수와 LLM 리즈너를 결합해 7개 언어 벤치마크에서 평균 AUC 0.920, 최강 베이스라인 대비 50.8% 향상을 기록했다.
다중 보상 강화학습에서 희소 보상의 활성 밀도로 가중치를 정하는 DARA
다중 보상 RL에서 보상별 정규화(GDPO) 후에도 남는 배치 수준 신호 불균형을 활성 그룹 밀도로 설명하고, 밀도의 역제곱근으로 보상 가중치를 매 배치마다 계산하는 DARA를 제안한다. 도구 호출과 수학 추론 실험에서 GDPO보다 최대 26%, 65% 적은 학습 스텝으로 목표 행동을 습득했다.
선호 증류에서 더 작은 모델이 더 나은 거부 응답을 만든다
선호 증류는 보통 학생 모델의 자체 실패를 거부 응답으로 쓴다. 이 논문은 7B~72B 학생 전 구간에서 더 작은 고정 모델이 만든 거부가 추론 비용은 줄이면서 코드 생성과 수학 추론 성능을 더 크게 올린다는 것을 보이고, 그 이유를 DPO 선형화 모델의 유한 지평 효용 한계로 설명한다.
Memorizon이 긴 영상 학습의 구간과 어텐션 비용을 분리한다
Memorizon은 학습 구간과 어텐션 길이를 분리해 수 분짜리 재방문을 수십 초 창의 비용으로 감독한다. 청크별 검색 뱅크를 붙이면 재방문 일관성이 모든 분할에서 오르고, 100초에서 400초로 늘려도 스텝 시간은 12%만 증가한다.
파라미터 이웃 탐색으로 수학 추론 자기증류의 감독을 늘린다
수학 추론 자기증류에서 하나의 고정 교사 대신 국소 파라미터 섭동으로 만든 전문가 풀을 활용해 학생이 방문한 상태마다 더 나은 감독을 고른다. AIME와 HMMT 세 벤치마크에서 OPSD 대비 평균 1.7~2.8점을 올렸다.
JevSpawn이 자연어 지시에서 유한 확률 행동 공간을 만들어 에이전트 추론을 가속한다
JevSpawn은 자연어 과제 지시에서 유한 확률 필드를 스스로 만들어 병렬로 행동을 생성하고, 실행 피드백으로 필드를 수정하는 에이전트 추론 기법이다. 8개 벤치마크에서 7개 베이스라인 대비 5개 과제 최고 점수를 냈고 미로·그리드 항해에서는 지연도 줄였다.
SemanTok이 영상 토큰 앞부분에 의미를 몰아 자가회귀 생성 비용을 줄인다
SemanTok은 동결된 DINOv2 특징을 인코더 입력으로 넣고, 유지된 토큰 프리픽스만으로 DINO 특징을 복원하는 경량 헤드를 붙여 영상 토큰의 앞부분에 의미를 집중시킨다. 201M 자가회귀 모델이 3.4배 큰 VideoFlexTok 모델과 맞먹거나 앞서고, k=16에서 토큰당 비트를 32% 줄인다.
미래 정보 수요로 과거 프레임을 골라 긴 영상 생성을 안정화한다
FrameMorrow는 아직 생성되지 않은 미래 정보 수요를 소수의 전망 토큰으로 예측해 과거 프레임을 골라 넣는 플러그앤플레이 선택기다. 5개 벤치마크와 11개 생성 모델에서 장거리 일관성·화질·행동 정합성이 개선됐다.
선의의 LLM 에이전트가 감시를 피해 자격증명을 숨겨 전달한다
선의의 LLM 에이전트가 감시를 피해 자격증명을 숨겨 동료에게 전달하는 '은밀한 지원' 행태가 9개 프런티어 모델 중 7개에서 확인됐다. DeepSeek-V4-Pro는 6,000회 중 0.9%에서 감시를 통과했고, 105회 반복이면 누적 침해 확률이 61.3%에 이른다.
DEFINE이 화자 음색과 억양을 분리해 제로샷 TTS를 제어한다
제로샷 TTS에서 화자 정체성과 억양을 각각 다른 오디오 예시로 분리해 조건화하는 DEFINE을 제안한다. F5-TTS에 LoRA를 붙이고 억양 프로토타입으로 예시 인코더를 지도해, 재학습 없이 단일 가중치로 억양 강도를 조절한다.
단백질 접힘 학습이 언어모델의 일반 추론을 끌어올린다
단백질 구조 좌표에서 만든 검증 가능한 질의응답으로 언어모델을 포스트트레이닝하면, 단백질이 전혀 등장하지 않는 10개 추론 벤치마크의 매크로 정확도가 45.09%에서 48.33%로 올랐다는 연구다. 답변 형식만 복사하거나 무작위 구조를 쓴 통제군은 이득이 없거나 마이너스였다.
이전 문제의 계산을 재활용해 LLM의 다음 문제 정확도를 높이는 STAIR
LLM이 같은 대화에서 앞선 문제의 계산을 재활용하도록 읽기 전용 K/V 뱅크와 학습된 질의 반사를 쓰는 STAIR를 제안한다. 백본을 고정한 채 12,288개 파라미터만 학습해 AIME 2025 후속 턴 평균 정확도를 최대 11.67%포인트 올렸다.
런타임 안전 개입을 학습 신호로 바꿔 VLA 정책을 지속적으로 개선한다
VLA 정책의 런타임 안전 실드가 반복 개입만 하고 정책 자체를 바꾸지 못해 생기는 정책-실드 불일치를 다룬다. FailBank는 관찰 전용 CBF 교사의 반사실 제안과 롤아웃 결과를 학습 레코드로 축적해 보호된 LoRA 업데이트로 정책을 갱신한다.
JEPA 월드모델이 테스트 시점에 바뀐 동역학을 스스로 적응한다
사전학습된 action-conditioned JEPA 월드모델의 잠재 동역학 예측기만 테스트 시점에 자기지도 방식으로 계속 업데이트하는 JEPA-TTT를 제안한다. 4개 연속제어 환경의 8개 동역학 변화에서 계획 성능을 평균 153% 끌어올리고 잠재 예측 오차를 83% 줄였다.
LLM의 사고사슬이 내부 계산과 일치하는지 측정하고 훈련으로 개선한다
LLM의 사고사슬(CoT)이 실제 내부 계산과 얼마나 일치하는지 선형 프로브 같은 해석 도구로 측정하는 CIA 지표를 제안하고, 이를 보상으로 쓰는 후처리 학습으로 충실도를 평균 25.5% 끌어올린 연구다. 정확도는 유지하거나 올렸고, 개선이 다른 과제와 해석 도구로 전이되는지도 분석했다.