AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
분산 강화학습의 경험 경로를 런타임 최적화 대상으로 끌어올린 Conduit
분산 강화학습에서 Experience Buffer가 단순 재생 큐를 넘어 대용량·지연 민감 경험 경로의 저장 기반이 된다는 문제를 다룬다. Conduit은 이 경로를 데이터 플레인으로 분리하려는 연구로, 초록에는 구체 설계와 정량 평가가 아직 제시되지 않는다.
ActGov는 LLM 도구호출을 실행 전에 결정론 검증하는 권한집행 프레임워크다.
LLM 에이전트가 외부 도구를 쓰며 장기 워크플로를 수행할 때 권한을 넘어서는 행동을 런타임에 검증으로 막는 ActGov 프레임워크 소개다. 정적 정책·사전 계획 기반 방어의 한계를 지적하고, 동적 워크플로와 확장 가능한 도구 생태계를 겨냥한다.
Jev-Mem은 메모리 제어에서 LLM 생성을 뺀 에이전트 메모리다.
자기회귀 LLM이 메모리 조직·검색·활용을 제어하면서 생기는 지연과 비용을 줄이기 위해, System-One/System-Two 인지 구조를 차용한 에이전트 메모리 아키텍처 Jev-Mem을 제안한다. 빠른 판단과 숙고 추론을 분리해 메모리 연산 경로에서 비싼 생성을 걷어내는 것이 목표다.
하네스 성능을 모델 가중치로 옮기는 agent-as-harness 증류
에이전트 하네스는 성능을 높이지만 배포 시점에 종속되고, 도메인·인스턴스·모델마다 최적 하네스가 달라 일반 에이전트는 공유 하네스나 라우팅에 의존한다. 이 논문은 최적화된 하네스를 학습 시점 가이드로 쓰는 에이전트 하네스 증류를 연구한다.
양방향 확산 모델만 학습해 재학습 없이 스트리밍 비디오 편집으로 전이하는 SVEET
사전학습된 양방향 비디오 확산 모델을 학습만으로 자기회귀 스트리밍 비디오 편집기로 전환하는 SVEET를 제안한다. 백본 특징 분리와 조건부 프레임 독립성이라는 두 원칙을 도출하고 이를 바탕으로 새 적응 패러다임을 설계한다.
행동에 쓸모 있는 미래만 압축하는 월드 액션 모델용 예측 상태, ARPS
생성 없이 동작하는 월드 액션 모델에서 추론 시 쓰이는 내부 비디오 특징이 제어를 위해 무엇을 담아야 하는지 진단한다. 미래 변화의 예측 가능성과 선형 행동 디코딩 난이도가 일치하지 않으며, 행동 정보가 공간적으로 집중된다는 점을 보인다.
ValueDiff는 값벡터 기하로 약한 어텐션 싱크 LLM의 KV캐시를 축출한다.
QK 정규화·게이트 어텐션·학습된 어텐션 싱크·로짓 소프트캡을 쓰는 LLM은 어텐션 싱크가 약해 기존 KV 캐시 축출이 잘 듣지 않는다. ValueDiff는 값 벡터의 분산에 주목해 토큰을 순위화하는 축출 기법이다.
비디오 확산 모델 물리 위반 원인은 RoPE 기반 어텐션감쇠와 운동계획 해석이다.
비디오 확산 모델이 물리 법칙을 어기는 원인을 모델 내부 어텐션 메커니즘에서 찾은 첫 해석가능성 연구다. 기존 접근이 외부 사전지식이나 특수 데이터에 의존하는 것과 달리, 텍스트-투-비디오 생성의 초기 디노이징 단계에서 운동 궤적이 어떻게 형성되는지 내부 동작을 들여다본다.
사용자는 클러스터로 묶고 개인차는 디코딩에서만 주입하는 계층적 개인화 프레임워크 CARD
CARD는 사용자를 스타일별 클러스터로 묶어 클러스터별 LoRA를 학습하고, 개인차는 디코딩 시점의 초경량 사용자 벡터로만 주입하는 계층적 개인화 기법이다. LaMP와 LongLaMP 12개 설정 중 10개에서 1위를 기록하며 사용자당 저장·추론 비용을 크게 낮췄다.
스타일 지시와 개인화 충돌을 분리하는 경량 플러그인 PsPLUG
개인화 LLM이 명시적 스타일 지시를 따를 때 사용자 특성이 무너지는 개인화 붕괴 문제를 다룬다. PsPLUG는 스타일을 제거한 잔차로 개인화를 학습하고 추론 시 α로 개인화 강도를 조절하는 경량 플러그인을 제안한다.
문단 경계는 공백이 아니며 계층 구조의 서명은 압축의 깊이다.
문단·문장·토큰 좌표를 별도 채널로 분리한 hRoPE로 토큰을 고정한 채 문단 좌표만 바꾸면 어텐션이 실제로 압축된다. 진짜 문단 구조와 무작위 대조군을 가르는 것은 압축의 위치가 아니라 깊이이며, 그 깊이는 코퍼스마다 다르게 나타난다.
프롬프트에 267단어 명세를 앞세우면 LLM 생성 코드 결함이 줄어든다
LLM 생성 코드의 보안 통과율이 4년째 제자리인 가운데, 267단어짜리 고정 명세 프레임을 프롬프트 앞에 붙이면 금액·시간·재시도·접근 제어 결함이 5개 모델 모두에서 줄었다는 사전등록 실험 결과다. 모델 기본값이 약할수록 효과가 컸고, 어떤 모델과 도메인에서도 악화되지 않았다.
루브릭을 중간 표현으로 넣어 비디오 보상 모델의 스칼라 드리프트를 잡는 RewardVerse
비디오 생성 RL의 보상 모델이 프롬프트마다 점수 스케일이 흔들리는 스칼라 드리프트 문제를 루브릭 중간 표현으로 해결한다. RGPO 2단계 학습으로 스코어러를 인간 평가에 정렬하고, EvalVerse 벤치마크에서 pointwise·pairwise 최고 성능을 보고한다.
AI 에이전트 팀이 스스로 팀워크 전략을 학습해 함께 추론한다
고정된 AI 에이전트 팀이 이전 협업 기록에서 재사용 가능한 팀워크 전략을 학습해, 개별 멤버가 혼자 풀지 못한 문제를 함께 추론해 푼다는 연구다. 수학·물리 5개 벤치마크에서 평균 66.7%로 최강 멤버 48.8%와 완벽 라우팅 오라클 59.0%를 넘었다.
파라미터 수 대신 특이값 스펙트럼으로 Transformer 구조를 채점하는 NSC
Transformer 구조 설계와 압축을 파라미터 수·FLOPs 대신 가중치 특이값 스펙트럼으로 측정하는 NSC를 제안한다. 아키텍처 명세만으로 계산되고, 동적계획법으로 자원 제약 하 최적 구조를 CPU에서 수 초에 찾는다.
MintAct는UI그라운딩·모바일·데스크톱·웹내비·툴사용을통합한2B~8BVLM이다
모바일·데스크톱·웹을 아우르는 UI 그라운딩과 다단계 내비게이션, 시각 도구 사용을 하나로 묶은 비전-언어 모델 MintAct를 2B·4B·8B 규모로 학습시킨 연구다. 환경과 RL 인프라 설계로 도메인별 전문 모델 성능에 맞춘다.
소스 코드만으로 코딩 에이전트 RL 환경을 자동 구축하는 CodeMidas
오픈소스 코드베이스의 구현된 기능을 실행 가능한 RL 환경으로 바꾸는 에이전트 파이프라인 CodeMidas를 제안한다. 이슈·커밋 같은 개발 산출물에 의존하던 기존 방식의 한계를 넘어 RL 환경 규모를 키우는 것이 목표다.
멀티홉 RAG의 자신감 있는 오답을 검색 시점 특징만으로 줄이는 기권 프레임워크
멀티홉 검색 실패가 예측 가능한 하위 집단에 몰린다는 관찰을 형식화한 논문이다. 검색 특징이 성공에 대한 상호정보를 가질 때만 confident-failure 감소가 가능함을 증명하고, LLM-judge와 dense-only 체제의 격차를 설명한다.
검색된 기억을 그대로 믿지 않게 만드는 0-파라미터 메모리 결정 계층
LLM 메모리 시스템은 검색 효율에 집중해 왔지만, 검색된 기억을 신뢰할지 판단하는 문제는 상대적으로 다뤄지지 않았다. 이 논문은 상충하는 기억이 RAG 환각을 키우는 문제를 세 신호 기반의 해석 가능한 결정 컨트롤러로 다룬다.
소프트맥스 어텐션의 두 결손, 기권과 잡음 필터링을 분리해 측정한 연구
어텐션 value 경로 게이팅이 언어모델 사전학습을 개선하는 이유를 소프트맥스 어텐션에 빠진 두 원시 연산, 즉 기권과 노이즈 필터링으로 설명한 연구다. 가중치 합이 1이어야 하는 제약을 우회하는 설계와 잡음 억제 관점을 정리한다.
LLM 사회 시뮬레이션에 명시적 베이지안 신념층을 얹어 의견 역학을 조종한다
LLM 에이전트가 사회 시뮬레이션에서 의견을 바꾸는 방식을 확률 신념 계층으로 분리해 다룬 논문이다. 발화마다 베이지안 갱신을 적용하고, 단일 파라미터로 고집 정도를 지정해 설득 개방성을 명시적으로 통제한다.
모델이 숨긴 정답을 내부 활성화에서 읽는 PIR
대형 언어모델이 내부적으로 아는 지식을 출력하지 않을 때, 답을 숨기는 것인지 애초에 모르는 것인지 구분하는 문제를 다룬다. 포렌식의 은닉 정보 검사(Concealed Information Test)를 차용해 모델 내부 표현을 탐침하는 방법을 제안한다.
NemotronLabs VoiceChat은 전이중 대화 도구 호출 오픈 모델이다.
NemotronLabs가 스트리밍 음성 인코더와 디코더 전용 언어모델을 결합한 오픈 풀듀플렉스 음성-음성 모델을 공개했다. 사용자 전사와 툴 호출을 병렬 스트림으로 처리해 듣기·추론·발화를 하나의 흐름에서 수행한다.
역할 상대적 역량 확률로 미지의 전문가에게 위임 여부를 정하는 RACER
사람 전문가에게 언제 위임할지 판단하는 learning to defer 문제에서, 처음 보는 전문가에게도 소량의 행동 컨텍스트로 역량을 추정하는 RACER를 제안한다. 기존 IFD가 클래스 내에서 추정치가 일정하다는 한계를 겨냥한다.
포아송 과정으로 워터마크 강도를 지키며 추측 샘플링을 가속하는 다중 드래프트 기법
LLM 배포에서 추론 효율과 출력 출처 표시는 각각 추측 샘플링과 워터마킹으로 접근해 왔지만, 두 목표를 함께 달성하는 것은 매우 어렵거나 불가능할 수 있다는 지적이 있었다. 이 논문은 포아송 과정에 기반한 새로운 멀티 드래프트 추측 샘플링 알고리즘으로 이 문제를 다룬다.
작은 인코더와 양자화·가중치 스트리밍으로 소비자 GPU에서 대화형 확산 생성 구현하기
온디바이스 추론의 흐름이 언어 모델에 쏠린 가운데, 이 논문은 소비자용 GPU에서 디퓨전 파이프라인을 돌리기 위한 성능·품질·모델 크기 간의 균형을 다룬다. 임베딩 변환기를 포함한 세 가지 기여를 제안한다.
확률적 디코딩에서 동적 트리 추측 디코딩의 원-핫 붕괴를 푸는 이중 확률 설계
동적 트리 추측 디코딩은 그리디 디코딩에서는 잘 작동하지만 T>0 확률적 디코딩에서는 드래프트 분포가 원-핫으로 붕괴해 수용률이 급락한다. RheoSampling은 이 딜레마를 겨냥한 샘플링 기법을 제안한다.
객체 탐지 벤치마크의 진짜 결함은 빠진 라벨이다
COCO, Pascal VOC, Cityscapes, KITTI를 다시 주석한 결과 라벨이 빠진 객체가 KITTI에서 최대 60%, COCO에서 40% 늘었다. 객체 탐지 벤치마크의 품질이 주석 불완전성 때문에 제한된다는 증거를 네 데이터셋에서 제시한다.
탈옥 방어 단계별 조합을 CASCADE가 통제된 공격·방어 평가로 제안한다.
LLM 탈옥 방어를 입력 변형·출력 가드 등 파이프라인 단계별로 어떻게 배치하고 조합할지 체계적으로 비교한 연구다. 통제된 공격-방어 평가로 단계 내·단계 간 방어 조합을 다루는 CASCADE를 제안한다.
IntBMoE는 블록 수준 조건화로 전문가 참여·실행·메모리를 분리하는 MoE다.
MoE에서 토큰별 전문가 참여도·실행량·파라미터 저장량을 독립적으로 정하지 못하는 문제를 다룬다. 블록 수준 조건화를 전문가 구성에 통합해 전원 참여를 목표로 하는 IntBMoE를 제안한다.