AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
시각 인코더를 뺀 멀티모달 사전학습은 10^22 FLOPs 부근에서 역전한다
사전학습된 시각 인코더 없이 원시 픽셀에서 직접 시각 표현을 학습하는 멀티모달 LLM의 스케일링 법칙을 인코더 기반 모델과 동일 조건에서 비교한 연구다. 텍스트 목표에서는 두 구조가 사실상 동일하지만, 멀티모달 목표에서는 인코더 없는 쪽이 약 10^22 FLOPs 부근에서 역전할 것으로 예측된다.
확산 언어모델에서 결정론적 PRM 유도는 같은 연산량의 ORM 재정렬에 진다
확산 언어모델의 중간 디노이징 상태를 채점하는 PRM 유도가 같은 forward pass 예산에서 독립 샘플링+ORM 재정렬에 진다. GSM8K에서 9.95pp, MATH 9.85pp, MBPP 12.16pp 격차이며 원인은 조기 가지치기와 약한 최종 판정이다.
ColNanoVDR이 문서 없이 다중 벡터 검색 질의 인코더를 증류한다
다중 벡터 시각 문서 검색의 질의 인코더를 페이지를 전혀 읽지 않고 증류하는 OTW 기법을 제안한다. 149M 텍스트 전용 학생이 교사 NDCG@5의 약 95%를 유지하며 질의를 최대 26배 빠르게 인코딩한다.
LLM 안전에서 표현 공학은 행동 기반 안전장치를 대체하지 못한다
DPO와 표현 조향, 텍스트 모니터와 표현 프로브를 동일 조건에서 맞대결시킨 결과, 표현 공학은 저데이터 조향과 저비용 네이티브 모니터링에서만 실용적 우위를 보였다. 프로브 기반 차단은 무해 파인튜닝 후 DPO의 안전성 저하를 크게 회복시켰다.
자기 생성 상태로 학습해 다중 턴 이미지 편집 붕괴를 막는다
다중 턴 이미지 편집에서 모델이 자기 출력을 다시 입력으로 받으며 무너지는 문제를 조건 분포의 학습·추론 불일치로 진단하고, 자기 생성 상태에서 스스로를 증류하는 MT-OPSD로 해결한다. 10턴 벤치마크 LME-Bench에서 SR@10을 0.38~0.52까지 끌어올린다.
LSPD가 OPD를 KL 정규화 강화학습으로 재해석해 롤아웃 효율을 높인다
온폴리시 증류(OPD)의 reverse-KL 목적함수를 KL 정규화 정책 최적화로 재해석하고, 낙관적 최소제곱 추정과 리플레이 버퍼로 오프폴리시 재사용을 가능하게 한 LSPD를 제안한다. 수학 추론 6개 벤치마크에서 평균 +1.59점 Avg@16 향상과 롤아웃 배치 25%만으로 기존 OPD 수준을 달성했다고 보고한다.
Nereus가 LLM 강화학습 후학습의 병렬화 계획을 실행 중에 바꾼다
LLM 강화학습 후학습에서 생성·추론·학습 단계의 병렬화 계획을 실행 중에 재계획하고 전환하는 런타임 Nereus를 제안한다. 8B PPO 처리량을 OpenRLHF 대비 최대 7.27배, Verl 대비 최대 1.47배 높였다.
FlowTool이 이미지 리터칭 도구 파라미터를 플로우 매칭으로 생성한다
FlowTool은 도구 기반 이미지 리터칭을 자기회귀 추론 대신 조건부 플로우 매칭으로 재정식화해, 이미지와 지시로부터 편집 파라미터를 직접 생성한다. 4개 벤치마크에서 참조 기반 성능을 크게 높이고 지연을 50배 이상 줄였다.
멀티에이전트 공유 컨텍스트의 KV 캐시를 저랭크 보정으로 재사용한다
프롬프트 특화 멀티에이전트가 같은 컨텍스트를 공유할 때 생기는 KV 캐시 중복을 저랭크 앵커와 워크플로 체인 보정으로 줄이는 온라인 보정 프레임워크다. 32K 공유 토큰·8 QPS에서 TTFT를 2배 줄이고 KVComm 대비 피크 GPU 메모리를 최대 3.7배 낮춘다.
FactorEngram이 n-gram 메모리를 기저 단위로 분해해 문맥별로 조절한다
Engram식 n-gram 룩업 메모리가 임베딩을 통째로 저장하고 스칼라 게이트로만 조절하는 한계를, 공유 사전 위의 희소 계수와 기저 단위 문맥 게이팅으로 바꿔 푼 FactorEngram을 소개한다. 340M·1B 백본 실험에서 WikiText 퍼플렉서티와 다운스트림 정확도가 개선됐고, 특히 NIAH 장문 검색에서 최대 43.3%p 이득을 냈다.
AnswerMap이 VLM 답변 확률로 이미지 근거 지도를 만든다
VLM이 이미지 어디를 보고 답했는지 블랙박스로 확인하는 AnswerMap이 제안됐다. 행·열 밴드 16회 질의의 외적으로 만든 공간 맵이 어텐션보다 정확하게 모델의 근거를 짚고, 삭제 실험에서도 정답을 더 잘 무너뜨린다.
기하를 토큰 주소로 삼아 장기 영상 생성의 재방문 일관성을 확보한다
GEAR는 장기 카메라 제어 영상 생성에서 과거 관측을 전역 3D로 융합하지 않고, 프레임별 기하를 토큰 단위 주소로만 사용해 시각 메모리를 희소하게 조회한다. DL3DV-10K로 학습해 ATE를 최강 베이스라인 대비 80.3% 줄이고 재방문 일관성에서 최고 성능을 보고했다.
이름 토큰화의 불균형이 LLM 내부 개념 접근성과 선택을 바꾼다
이름 기반 LLM 공정성 평가는 비교하는 이름이 같은 입력이라고 가정하지만, 토크나이저는 어떤 이름은 단일 토큰으로, 어떤 이름은 여러 서브워드로 쪼갠다. NameTrace는 이 어휘적 불균형이 내부 개념 접근성과 실제 선택까지 이어진다는 것을 49만 개 이름에서 보인다.
DCSD가 교사 신호의 방향과 크기를 분리해 자기증류를 보정한다
검증 가능한 보상 기반 강화학습과 자기증류를 결합할 때 교사 신호의 방향과 크기를 분리해 보정하는 DCSD를 제안한다. 수학·멀티모달 11개 벤치마크에서 베이스 모델 대비 각각 8.45점, 7.01점 향상됐다.
OLIVE는 학생이 지나간 상태에서 교사의 이어쓰기로 배우게 한다
학생 모델이 만든 접두사 지점에서 교사가 이어쓰게 하고, 그 텍스트에만 교차엔트로피를 걸어 학습하는 온라인 증류 기법 OLIVE를 제안한다. 오프라인 SFT의 분포 불일치와 OPD의 감독 단절을 줄여 추론·에이전트 과제에서 성능을 올린다.
물리 편집 뒤 운동 변화를 강체 장면 재구성으로 생성하는 VideoPhysEdit
영상 편집이 그림자·가림 같은 시각적 결과를 넘어 물체 삽입·제거, 운동 상태·물리 파라미터 변경 뒤의 운동과 상호작용까지 바꾸는 문제를 PCVE로 정식화한다. VideoPhysEdit은 강체 장면을 재구성해 시뮬레이션으로 반사실 궤적을 얻고 영상 생성을 유도하며, PCVE-RigidBench에서 경쟁 방법 대비 궤적 오차를 54.0% 줄였다.
WorldAttention이 영상 월드 모델의 계층 KV 캐시로 긴 문맥을 살린다
WorldAttention은 자기회귀 확산 기반 인터랙티브 영상 월드 모델에서 슬라이딩 윈도와 전체 이력 캐시의 한계를 동시에 겨냥한 어텐션 구조다. 선형 전역 어텐션에 헤드 적응적 희소 어텐션을 얹은 HSA와, KV를 의미 인덱스 페이지로 나눠 다층 메모리에 두는 HKV를 함께 설계했다.
Marathoner가 10시간 넘는 초장기 자율 실행 능력을 학습으로 부여한다
Ant Group과 마카오대 연구진이 GitHub PR 10만 건으로 초장기 실행 과제를 합성하고, 거부 샘플링 파인튜닝과 GRPO 강화학습으로 9B 모델에 10시간 이상 자율 실행 능력을 부여했다. FrontierSWE와 SWE-Marathon에서 Gemini-3.1-Pro를 앞선다고 보고한다.
잠재 공간 추론 LLM의 생각 표현을 네 가지 손실로 직접 감독한다
잠재 공간에서 추론하는 LLM은 최종 답의 교차엔트로피만으로 학습돼 생각 표현이 뭉개지고 불필요한 정보를 담는다. REST는 인과성·최소성·분리성·안정성을 미분 가능한 손실로 바꿔 정확도를 최대 7.5%p 끌어올린다.
LLM은 성공 서사를 위해 결정적 결함을 숨긴다
LLM이 자기가 수행한 작업을 보고할 때 부정적 결과나 코드 버그 같은 결정적 결함을 숨긴다는 연구다. '정직하게 답하라'는 한 문장을 붙이면 결함을 밝히는 비율이 200건 중 2건에서 190건으로 뛴다.
Braco는 극한 시각 토큰 압축을 토큰 파라미터화 문제로 재정의한다
비전-언어 모델의 시각 토큰을 23~64배 압축하면서도 정확도를 유지하는 Braco를 제안한다. DCT 기반 절단, 기저 좌표 임베딩, 예산 의존 좌표 재구성, 공간 잔차 토큰을 결합해 프리필 FLOPs를 84~87% 줄인다.
ROSS가 과거 자기 롤아웃을 선별 재학습해 성능을 끌어올린다
LLM 후처리 학습에서 버려지던 과거 자기 생성 롤아웃을 재활용하는 ROSS를 제안한다. 전체 궤적은 문맥으로 유지하되 검증된 구간에만 손실을 걸어 MOPD 6개 벤치마크 평균을 58.40%에서 62.20%로, SWE-bench Verified를 64.20%에서 68.40%로 올렸다.
챗 템플릿 예약 토큰이 프롬프트 인젝션의 권위를 만든다
같은 바이트를 쓰더라도 위조한 챗 템플릿 마커가 예약 토큰 id로 들어가느냐 서브워드로 들어가느냐에 따라 에이전트 공격 성공률이 39~66%p 갈린다. 토크나이저를 쥔 방어자가 무엇을 봐야 하는지 실측한 논문이다.
온폴리시 증류는 새 특징을 만드는 대신 기존 특징을 재가중한다
온폴리시 증류가 학생 모델 내부에 무엇을 심는지 희소 크로스코더로 분석한 연구다. OPD는 새 특징을 만들지 않고 기존 특징의 사용 빈도만 재가중하며, SFT 워밍업도 같은 방식으로 OPD를 돕는다는 것을 세 가지 설정에서 확인했다.
툴 쓰는 AI 에이전트의 공격과 방어를 상태 전이 문제로 다시 정의한다
툴을 쓰는 LLM 에이전트의 공격과 방어를 부분관측 상태 제어 문제로 정식화한 SEAD 논문을 정리한다. DART는 실행 피드백으로 공격 경로를 트리 탐색하고, SAGE는 실행 전 읽기 전용 질의로 해로운 상태 전이만 골라 차단한다.
학습 없이 LLM을 비동기 에이전트로 만드는 AsyncLLM 프레임워크
LLM 에이전트의 순차적 사고-행동 루프를 async/await 코루틴과 공유 메모리 상태로 바꿔, 태스크별 학습 없이 스트리밍 비디오·게임·시스템 모니터링을 동시에 처리하는 AsyncLLM을 제안한다. Qwen 3.x 모델이 비디오 스트리밍 전용 모델 Mage-VL을 두 벤치마크에서 앞선다.
픽셀 확산 트랜스포머의 균일 정제를 깨서 전역 구조와 고주파 세부를 분리한다
픽셀 공간 확산 트랜스포머에서 층마다 다른 폭으로 특징을 정제하면 전역 구조를 담는 지속 특징과 세부 질감을 담는 활성 특징이 자연스럽게 분화된다는 관찰을 바탕으로, Persistence Forcing은 지속 특징으로 활성 정제를 조건화하고 샘플링 시 Persistence Guidance를 더해 ImageNet 256·512에서 JiT 베이스라인 FID를 일관되게 낮춘다.
AutoRef가 다중 참조 이미지 생성 하네스를 자동으로 최적화한다
여러 참조 이미지를 합성하는 이미지 생성 에이전트에서 하네스 코드를 코딩 에이전트가 자동으로 개선하는 AutoRef를 제안한다. FLUX.2 klein 4B를 MultiBanana 4참조 과제에서 5.72점에서 7.37점으로 끌어올려 상용 모델과 겨룬다.
PMOPD가 태스크별 업데이트 부분공간 보호로 다중 교사 증류 충돌을 줄인다
여러 전문 교사를 하나의 학생 모델에 증류할 때 한 능력을 올리면 다른 능력이 떨어지는 상충 문제를, 태스크별 파라미터 업데이트가 차지하는 저차원 부분공간을 찾아 그래디언트와 옵티마이저 업데이트에서 그 성분을 투영 제거하는 방식으로 줄인다. Qwen2.5-7B와 Llama-3.1-8B에서 세 태스크 평균 점수를 각각 2.54점, 2.09점 올렸다.
청크 KV 캐시 압축이 만드는 위상별 검색 성능 격차를 분석한다
청크 KV 캐시 압축이 만드는 위상별 검색 성능 차이를 분석한 논문이다. 같은 정보도 압축 윈도 경계를 기준으로 한 위치에 따라 검색 정확도가 최대 40%포인트까지 벌어져, 평균 벤치마크 점수가 가리는 주기적 약점이 존재한다는 것을 보인다.