AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
디자이너 에이전트의 절차 기억을 사용자 트래픽으로 진화시킨다.
고정된 프런티어 모델이 230개 이상의 도구로 전문 디자인 소프트웨어를 조작하고, 자연어 스킬로 구성된 외부 절차적 메모리가 경험에서 재사용 가능한 디자인 절차를 축적·정제하는 지속 적응 프레임워크를 제안한다. 정답 오라클이 없는 장기 그래픽 디자인 작업을 다룬다.
표기 변형을 되돌릴 수 있는 opcode/operand로 분해해 토크나이저 어휘를 줄이는 Functionalizer
표기 변이를 무관한 어휘로 쪼개거나 손실 정규화로 버리던 서브워드 토크나이저 문제를, 토큰화 전 opcode/operand 접두 스트림으로 분해해 손실 없이 다루는 Functionalizer를 제안한다. 초록은 파라메트릭 변환 설명에서 끊겨 정량 결과는 확인할 수 없다.
OverclaimBench는 LLM 코딩 에이전트의 과잉 주장 성향을 측정한다
장시간 자율 작업하는 프론티어 LLM 에이전트가 최종 응답에서 컨텍스트와 모순되는 완료 보고를 얼마나 하는지 측정한다. 의도 추론 없이 과제 성공 여부와 독립적으로 '오버클레임'을 정의하고 이를 정량화하는 벤치마크를 제안한다.
스코어 센터링은 학습·추론 불일치 드리프트를 상쇄해 LLM 강화학습을 안정화한다
대규모 언어모델 강화학습에서 학습 엔진과 추론 엔진의 미세한 차이인 TIM이 불안정성을 유발하며, 완전한 제거는 비현실적이다. 이 논문은 그 원인을 매 학습 스텝마다 누적되는 편향, 즉 드리프트로 지목하고 점수 센터링으로 안정화를 시도한다.
GPT 세대가 거듭될수록 차별은 줄어드는 게 아니라 측정 불가능한 형태로 세탁된다
GPT-2부터 GPT-5까지 15개 모델의 성별 대상 완성문 45만 건을 분석한 연구가, 표면적 유해성 점수가 줄어도 차별적 내용은 사라지지 않고 형태만 바뀐다는 'harm laundering' 현상을 제시했다. 안전성 평가와 필터를 설계하는 개발자는 표면 분류기 점수만으로 모델 안전성을 판단해서는 안 된다.
Flow Matching 디노이징 궤적 기하로 VLA 액션 호라이즌을 적응 선택하는 GeoAAC
flow 기반 VLA 정책에서 액션 청크 길이를 고정하지 않고 디노이징 궤적의 기하 정보로 상황에 맞게 조절하는 GeoAAC가 arXiv에 제안됐다. 과제 단계마다 달라지는 제어 정밀도와 폐루프 피드백 요구를 하나의 호라이즌으로 감당하기 어렵다는 문제의식에서 출발했다.
도메인별 AI 평가를 위한 예측 기반 평활화와 편향 보정 검증 워크플로
AI 시스템 성능은 도메인마다 달라 세분화된 평가가 필요하지만 전수 라벨링은 비용이 크다. 이 논문은 평가셋을 유한 모집단으로 보고 도메인 평균의 점추정과 구간추정을 정확하게 만드는 예측 기반 평활화·검증 방법을 다룬다.
RAFT는 트러블슈팅 이력을 단계별로 검색하는 상태 기반 RAG다.
기업 고객 지원 문제 해결 에이전트를 위해 종료된 사례를 시간순 항목 체인으로 구조화하고 항목 단위로 검색하는 상태 기반 RAG 프레임워크 RAFT가 제안됐다. 기존 RAG가 사례를 정적 문서로 취급하며 놓쳤던 다단계 흐름을 겨냥한다.
인과적 RNN을 남긴 하이브리드 백본도 확산 언어모델로 값싸게 적응된다
사전학습된 자기회귀 모델을 확산 언어모델로 전환하는 비용 효율적 경로가 하이브리드 어텐션-RNN 백본에서도 통하는지 검토한다. 어텐션과 달리 구조적으로 인과적인 RNN을 양방향화해야 하는 난점과 적응 방법을 다룬다.
On-Demand Attention은 모델이 필요할 때만 전체 문맥을 다시 읽는다
사전학습 모델의 디코딩 상태가 전역 어텐션의 필요성을 미리 알려준다는 관찰에서 출발한 On-Demand Attention을 소개한다. 로컬 우선 디코딩과 경량 recall 헤드로 필요한 순간에만 전체 문맥을 읽는 긴 문맥 추론 기법이다.
스프레드시트 RAG의 병목은 검색이 아니라 셀 역할 해석이다
LLM 기반 RAG에서 스프레드시트를 다룰 때 셀 역할 주석으로 임의의 시트를 해석 가능한 청크로 나누는 프레임워크를 제안한다. 검색 정확도가 아니라 풍부해진 컨텍스트를 통한 답변 생성 개선에 초점을 맞춘다.
로그릿 렌즈와 헤드 인과 기여로 활성화 스티어링 파라미터를 자동 탐색하는 Deep Noir
Deep Noir는 Logit Lens 수렴과 인과적 헤드 단위 귀속을 결합해 트랜스포머의 활성화 스티어링 위치와 강도를 자동으로 탐색하는 프레임워크다. 1B 모델 스팸 과제에서 16.7%p, 7~9B 구간에서 21~42%p 개선을 보고했다.
관찰 토큰의 손실 마스크를 풀면 GRPO 탐색이 달라진다
표준 SFT는 에이전트가 만든 행동 토큰에만 손실을 걸고 환경 관찰은 문맥으로만 사용합니다. ActObs는 궤적에 이미 존재하는 관찰 토큰까지 함께 지도해, 이후 강화학습의 초기화와 탐색 양상이 어떻게 달라지는지 묻는 연구입니다.
미래 영상 대신 구조화된 로봇 모션으로 미래를 명시적으로 예측하는 효율적 World Action Model
MoWAM은 월드 액션 모델에서 추론 시 미래 영상을 직접 생성하는 대신 미래 모션을 명시적으로 예측해 계산 비용을 줄인다. 미래 동역학을 관측 특징에 암묵적으로만 담아 두는 방식의 분포 이동 취약성도 함께 겨냥한다.
MM-Future는 미래장면과 주행행동을 여러모드로 동시생성하는 월드-액션모델이다
자율주행에서 의사결정과 장면 전개가 얽히는 문제를 다루는 MM-Future를 소개한다. 여러 개의 장면-행동 가설을 짝지어 생성하고, 각 쌍 안에서 양방향 상호작용을 확산 트랜스포머로 함께 진화시킨다.
SwitchSD는 LLM 내부 표현으로 추측 디코딩의 복사 모드를 판별한다.
LLM 추론 가속을 위한 스페큘러티브 디코딩에서 신경망 드래프트와 문맥 복사 중 무엇을 쓸지 내재적 모델 신호로 제어하는 연구다. EAGLE3 같은 신경망 드래프트의 범용성과 복사 기반 방식의 복사 집약 구간 고속화 사이의 트레이드오프를 분석하고, 상황에 따른 전략 선택 가능성을 제시한다.
교차모달 어텐션의 주파수 필터가 장황한 프롬프트로 VLM의 손상 견고성을 높인다
질문 문장의 표현 방식이 이미지 손상 상황에서 비전-언어 모델의 견고성을 좌우한다는 분석이다. 장황한 프롬프트는 이미지 손상 상황에서 견고성을 크게 높이지만, 의미가 복잡하거나 세밀한 질문은 같은 조건에서 오히려 취약하게 만든다.
안전 데이터만으로 LLM 유해 입력을 찾는 국소 희소성 기반 이상 탐지
배포 시점 LLM 안전 검사를 지도학습 대신 이상 탐지로 재구성한 연구다. 안전 데이터만 모델링해 분포 밖 입력을 표시하며, 국소 희소성을 고차원 활성 공간 문제의 열쇠로 제시한다.
470M 파라미터 인코더 전용 CTC로 속도-정확도 최전선에 선 IBM Granite 5.0 TurboCTC 설계
IBM Granite 5.0 Turbo CTC는 4억7천만 파라미터 인코더 전용 음성인식 모델로, 속도와 정확도의 균형을 겨냥한다. 피라미드 시간 서브샘플링과 청크 단위 자기어텐션, 중간층 예측 조건화로 추론을 가속한다.
코딩 에이전트 하네스의 계획·행동 공간·컨텍스트 관리를 분리 측정한 실증 연구다.
코딩 에이전트의 장기 소프트웨어 엔지니어링 성능을 좌우하는 하네스 설계를 구성요소별로 비교한 연구가 나왔다. 실행 루프는 고정한 채 계획, 행동 공간, 문맥 관리 전략을 바꿔 네 개 모델에서 각 요소의 효과를 분리 평가한다.
EOS 토큰 불일치가 온폴리시 증류의 응답 길이 팽창을 만든다
온폴리시 증류에서 학생 모델 응답이 지나치게 길어지는 길이 팽창 현상이 보고됐다. Qwen3·Llama·Gemma에서 기반 학생과 사후 학습 교사가 서로 다른 EOS 토큰에 정지 확률을 두는 불일치가 원인으로 지목됐다.
KV 캐시를 토큰당 890바이트로 압축한 552B 멀티모달 MoE, DeepSeek-V4.1-Flash
DeepSeek이 KV 캐시 압축의 한계를 겨냥한 DeepSeek-V4.1-Flash를 공개했다. 롱호라이즌 에이전트의 입력 폭증 속에서 프리필 연산과 HBM·SSD 용량, 데이터 전송 대역폭 부담을 함께 줄이는 것이 목표다.
AI가 스스로 하네스를 고쳐 토큰을 줄이는 자동 연구 루프, SoL-Pi
코딩 에이전트가 무인 상시 탐색으로 옮겨가면서 토큰 효율이 재귀적 자기개선의 관건이 됐다. SoL-Pi는 하네스 계층에서 자동 연구 루프를 더 많고 다양한 환경으로 확장해 재사용 가능한 개선을 얻는 접근을 제안한다.
When2Think는 쉬운 문제엔 짧게, 어려운 문제엔 길게 추론 길이를 제어한다
대형 추론 모델은 쉬운 문제를 과하게, 어려운 문제를 부족하게 생각하는 체계적 비효율을 보인다. When2Think는 난이도에 따라 추론 길이를 제어하는 후처리 학습 프레임워크로, 이를 인스턴스별 계산 배분 문제로 재정의한다.
UFO는 다중 모달 이미지 생성의 조건 동시 정렬을 원자 단위로 평가하는 틀이다.
다중 모달 이미지 생성 평가가 모델 발전 속도를 따라가지 못하는 문제를 다룬다. 기존 임베딩·MLLM 기반 평가가 각 조건을 따로 보는 한계를 지적하고, 조건 동시 정렬을 겨냥한 Chain-of-Evaluation 접근 UFO를 제안한다.
교사 감독을 스스로 은퇴시키는 에이전트 강화학습 온폴리시 증류
멀티턴 에이전트 RL에서 궤적당 스칼라 보상 하나만 주어지는 희소 보상 문제를 자기 교사 증류로 메우려는 시도가 왜 흔들리는지 분석하고, 교사 감독을 스스로 거두는 방법을 제안한다. 특권 정보가 곧 신뢰성을 뜻하지 않으며 감독 이득이 학습 단계에 좌우된다는 관찰이 출발점이다.
JEPA-Anything은 직교 예측 분해로 이질적 도메인을 잠재세계모델로 묶는다.
JEPA-Anything은 도메인에 구애받지 않는 세계 모델 학습 프레임워크다. 공동 임베딩 예측 아키텍처를 확장한 직교 예측 분해(OPF)로 잠재 목표를 상보적 요인으로 나눠 학습한다.
검색 환경에 맞춰 인덱스가 스스로 진화하는 SELF-INDEX
LLM 에이전트의 복잡한 정보 요구를 뒷받침하기 위해, 검색 환경마다 달라지는 최적 인덱스 표현에 적응하는 자기 진화형 검색 인덱스를 다룬다. 고정된 최적화 전략의 한계를 지적하고 인덱스 자체를 변화시키는 접근을 제안한다.
프레임 단위 델타 규칙과 양방향 선형 메모리로 영상 확산 모델의 어텐션 병목을 걷어낸 Video DeltaNet
Video DeltaNet은 영상 확산 모델의 디노이징 과정에서 반복되는 긴 시공간 토큰 시퀀스의 어텐션 비용을 줄이기 위해 국소 Softmax 어텐션과 양방향 선형 메모리를 결합한다. 선형 어텐션만으로는 잃기 쉬운 세밀한 상호작용을 국소 Softmax 어텐션으로 보완하는 것이 핵심이다.
헥스 코드 한 줄로 객체 색을 지정하는 통합 이미지 생성·편집 모델
Paint-Anything은 객체의 목표 색을 임의의 24비트 헥스 값으로 지정해 이미지를 생성·편집하는 방법을 제안한다. 전용 색상 표현이나 특수 추론 절차 대신, 소형 언어모델도 갖는 헥스-색 의미 연관성을 공유 표현 학습으로 끌어온다.