AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
GRN의 반복 정제를 편집 인터페이스로 활용한 학습 없는 프롬프트 기반 이미지 편집
확산 모델과 자기회귀 편집기의 한계를 짚고, 학습 없이 프롬프트 대 프롬프트 방식으로 이미지를 편집하는 RefineEdit을 제안한다. 생성 정제 네트워크 위에서 원본 보존과 요청 반영을 함께 노리는 것이 목표다.
토크나이저 성능을 가르는 것은 최적화 목표가 아니라 탐색 절차다
BPE와 UnigramLM의 차이를 최적화 목표와 탐색 절차라는 두 축으로 분리해 분석한 연구가 나왔다. 기존 비교가 뒤섞어 놓았던 두 요인을 각각 통제해, 토크나이저 성능 차이가 어디서 오는지 밝히려는 시도다.
노이즈 선호 쌍을 비교 신호로 재활용하는 zeroth-order LLM 정렬 기법 ComPO
직접 선호 정렬의 우도 이동 문제를 지적하고, 비교 오라클 기반 제로차 방법 ComPO를 제안·분석한 논문이다. 우도 마진이 작은 선호 쌍에서 정보를 얻는 대안적 경로를 모색한다.
아키텍처는 모델 성장, 재귀 깊이, 경계 연산자로 스케일링 지수를 바꾼다.
스케일링 법칙의 지수 자체를 아키텍처 개입으로 바꿀 수 있다는 주장을 루프 트랜스포머를 기준점으로 다룬 논문이다. 재귀적 깊이를 모델 성장 메커니즘으로 재해석하고, 연산량 증가에 따른 성능 개선 양상을 논의한다.
LLM 평가에서 보상 해킹은 내부 활성화의 단순 차이 벡터로 탐지할 수 있다
LLM 평가에서 보상 해킹이 모델 내부 표현에 어떤 흔적을 남기는지 분석한 연구다. 단순한 평균 차이 벡터가 Kimi K3, GLM 5.2, Qwen에서 보상 해킹을 일관되게 표현하며, 이를 탐지와 이해에 활용할 수 있음을 보였다.
희소 앵커링 선형모델로 분류와 회귀를 아우르는 확률적 설명 프레임워크
형식적 설명가능성의 한계를 보완하려는 확률적 설명 프레임워크를 다룬 arXiv 논문이다. 기존 귀추적 설명이 너무 많은 특징을 포함해 인간 인지 한계를 넘고, 확률적 완화가 범주형 분류에 치우쳐 있던 문제를 이진 분류와 연속 회귀까지 넓힌다.
MoE expert를 개별 점수가 아니라 쌍 상호작용까지 고려해 잘라내는 2차 프루닝, HOPE
MoE 언어 모델의 메모리 병목을 줄이려고 전문가를 2차 목적함수로 프루닝하는 HOPE를 제안한 논문이다. 전문가를 독립적으로 다루던 기존 가정 대신 협력적 사용을 반영한다.
결과 점수만 보던 벤치마크 압축에 실행 과정 신호를 더한 DualViewEval
에이전트 벤치마크는 일반 LLM 벤치마크보다 평가 비용이 커서 압축이 필요하지만, 기존 방법은 최종 점수 분포의 중복만 모델링한다. 이 논문은 대규모 궤적에서 찾은 6개 과정 신호와 최종 결과를 함께 보는 이중 관점 관계 학습을 제안한다.
분산 sign 학습의 다수결 편향을 제거하는 전역 그래디언트 추적 기법
데이터가 이질적인 분산 환경에서 로컬 부호를 모으면 편향이 생겨 기존 sign 기반 분산 감소 기법은 최적 수렴률을 얻지 못한다. 이 논문은 그 실패를 보여주는 반례를 제시하고, 비볼록 확률적·유한합 최적화에서 최적 수렴률을 달성하는 방법을 다룬다.
STRETCH는 모델 실력에 맞춘 난이도 상승 단일 파라미터 자기학습 프레임워크다.
고정된 난이도 때문에 자기개선 학습이 정체되는 문제를, 모델의 해결 능력에 맞춰 난이도를 계속 재조정하는 '스트레치 존' 메커니즘으로 푼다. 인지적 비계 이론에서 착안한 STRETCH 프레임워크의 방법과 남은 확인 지점을 정리했다.
신뢰도 순위가 선택적 예측 모델 비교 확정에 필요한 레이블 수를 결정한다.
분류기가 같은 예측을 내도 신뢰도 순위에 따라 선택적 성능 비교에 필요한 라벨이 달라진다는 문제를 AUGRC로 정량화한다. 사전 라벨 하한으로 예산 부족을 걸러내고, 커버링 선형계획으로 승자를 확정하는 최소 라벨 수(인증서 크기)를 K-1개 이내로 제한한다.
트랜스포머 뉴런의 읽기-쓰기 관계로 분류한 약화 뉴런과 그 과대한 영향력
GLU 기반 뉴런의 입력·출력 가중치 벡터 사이 코사인 유사도를 계산해, 잔차 스트림에서 특정 방향을 약화시키는 '약화 뉴런'을 찾아내는 분석법이 arXiv에 공개됐다. 트랜스포머 내부 해석에 뉴런 단위 진단 지표를 더한 접근이다.
PACT 벤치마크는 압박 속 기업용 AI 비서의 규칙 준수를 측정한다.
기업용 LLM 에이전트가 채용·의료·금융에서 시스템 규칙을 지키는지, 사용자·관리자의 압박까지 포함해 측정하는 평가 프레임워크 PACT를 제안한다. 어떤 모델이 규정을 잘 위반하는지 비교할 기준이 없던 공백을 겨냥한다.
스스로 분석 도구를 만들고 자기 가설을 반증하는 LLM 에이전트, 자율 실험의 산출물을 최적 샘플에서 '이해'로 바꾸다
자율 실험실의 의사결정 계층을 블랙박스 최적화기 대신 LLM 에이전트로 대체하는 SynAgent를 제안한다. 합성 과정에 대한 명시적이고 수정 가능한 이해를 유지하며 가설 기반으로 실험을 운영하는 것이 핵심이다.
라벨 없이 10만 개 편향 파라미터만 학습해 추론을 끌어올리는 테스트타임 강화학습
테스트타임 강화학습(TTRL)에서 보상과 학습 공간을 극단적으로 제한해도 적응이 가능한지 묻는다. 다수결 의사 라벨을 보상으로 쓰고 bias 계열 파라미터만 최적화하는 label-free bias-only TTRL을 제안한다.
해시 충돌을 계산해 주파수 대역별 해상도를 재배분하는 이미지 피팅 기법 CARA
다중해상도 해시 인코딩은 모든 해상도 레벨에 같은 해시 테이블 용량을 배정해 충돌과 파라미터 낭비를 동시에 겪는다. CARA는 충돌 정보를 활용해 레벨별 해상도 배분을 적응적으로 조정하는 이미지 피팅 기법을 제안한다.
과학 코드를 검증 가능한 에이전트 학습 환경으로 컴파일하는 ScienceIDE
과학 코드 저장소를 AI 에이전트가 실행하며 배울 수 있는 프로그래머블 환경으로 바꾸는 인프라 ScienceIDE가 제안됐다. 파편화된 툴체인과 암묵적 도메인 관례, 분야별 정확성 기준이 만든 '과학적 경험 병목'을 겨냥한다.
Agora는 Git 커밋 DAG를 공유 기억으로 쓰는 비동기 AI 연구 에이전트 커뮤니티다.
자율 연구 에이전트들이 같은 탐색을 반복하는 문제를 풀기 위해, 연구 기록을 Git에 append-only DAG로 남기는 공유 메모리 Agora가 제안됐다. 모든 주장이 커밋으로 남아 누구나 체크아웃해 재실행할 수 있다.
ActionPiece는 MSE 너머 물리적 거리 순서를 보존하는 행동 토크나이저다
자기회귀 VLA 모델의 행동 토크나이저를 다시 설계하자는 ActionPiece가 제안됐다. MSE 같은 점별 재구성 지표만으로는 시연 간 행동 조정이 압축 후에도 얼마나 충실히 보존되는지 평가하기 어렵다는 문제의식이 출발점이다.
SSD 가중치층으로 35B MoE를 라우팅 예측으로 24GB 데스크톱에서 서빙한다
소비자 하드웨어에서 35B급 MoE 추론은 가중치 메모리에 묶이며, 4비트로도 19.5GB가 필요하고 희소성은 연산만 줄인다. Edge0는 다음 레이어의 전문가 선택을 미리 예측하는 프리라우터로 SSD 스트리밍 읽기를 연산 뒤에 숨기는 추론 엔진이다.
후보개수N은실행방식이아니며N=8도생성스케줄에따라GPU에너지가4.6~4.9배다르다.
LLM 테스트타임 스케일링에서 후보 수 N만으로는 추론 비용과 성능을 설명할 수 없다는 문제를 다룬다. 같은 후보 예산을 한 번의 배치 생성으로 만들지, 작은 배치의 순차 호출로 나눌지에 따라 에너지와 성능이 달라진다고 분석한다.
라우터와 에이전트를 한 학습 루프에서 함께 진화시키는 MoA 프레임워크, CERA-MoA
MoA에서 질의 라우팅과 에이전트 파인튜닝을 분리된 과정으로 다루던 관행을 깨고, 라우터와 에이전트를 반복적으로 함께 진화시키는 CERA-MoA를 제안한다. 학습이 진행되는 동안에도 라우팅 전략이 에이전트 능력 변화에 적응하도록 만드는 것이 목표다.
그래프 월드 모델로 LLM 장기 로봇 계획을 실행 전에 검증하고 수리하는 GAVEL
GAVEL은 명시적 그래프 월드 모델을 기반으로 LLM의 장기 로봇 계획을 검증하고 수리하는 프레임워크다. 객체 관계와 행동의 사전조건·효과, 미관측 객체 위치에 대한 확률적 믿음을 그래프로 표현해 부분 관측 환경의 계획 오류를 다룬다.
에이전트 사회에는 개인 하네스가 아니라 사회적 하네스가 필요하다
여러 주체를 대신하는 AI 에이전트들이 신뢰 경계를 넘어 협업할 때 기존 하네스와 메시징 프리미티브로는 정직한 에이전트조차 원하는 결과에 도달하지 못한다는 실험 결과를 다룬 논문이다. 악의적·결함 있는 에이전트가 협업을 지연시키고 결과에 영향을 미칠 수 있음도 함께 지적한다.
PhysStream 생성영상 자체서 장면기억 갱신하는 물리기반상호작용비디오생성기다
PhysStream은 생성 전 전체 제어 스케줄이나 픽셀 위치 신호에 의존하지 않고, 구조화된 장면 메모리를 갖춘 자기회귀 모델로 물리 기반 이미지-투-비디오 합성을 수행하는 방법을 제안한다. 세밀한 모션 제어와 물리적 동역학 조작을 목표로 한다.
자기 질문 사슬 프롬프트는 LLM의 답 보류 시점을 정해 선택적 위험을 제어한다.
프롬프트만으로 LLM이 답변 전에 필요한 정보를 스스로 점검하게 만드는 CoSQ 프레임워크를 제안한다. TruthfulQA 817문항 다지선다 검증셋에서 17개 조건과 11개 모델군으로 세 가지 변형을 평가했다.
LACE는 양자화 계층별 독립 압축 경계를 정하는 동적 프레임레이트 오디오코덱이다
신경 오디오 코덱의 높은 프레임레이트를 낮추기 위해 양자화 레이어별로 압축을 따로 적용하는 LACE 기법이 arXiv에 공개됐다. 기존 동적 프레임레이트 코덱이 모든 레이어에 같은 분할을 강제하던 제약을 푸는 접근이다.
LimiX-2는 목표예측 넘어 변수간결합구조 학습하는 표형데이터파운데이션모델이다.
LimiX-2는 기존 스케일링 법칙에 따라 모델과 데이터를 확장한 LimiX 계열의 새 모델이다. 인컨텍스트 학습을 타깃 예측이 아닌 메커니즘 중심 결합 모델링으로 재구성하는 CMN 패러다임과 CCMM 사전학습을 채택했다.
JustFit은 24GiB 맥북에서 27B 256K 윈도우를 적시 상태 관리한다.
오픈 웨이트 모델의 로컬 실행을 노트북 메모리 한계 안에 넣기 위해, JustFit은 압축 KV 실행과 컴포넌트 상주, 상태 보존 전환을 결합한 MLX 기반 추론 런타임을 제안한다. 가중치 양자화와 무관하게 상태를 적시에 만들고 해제하는 것이 핵심이다.
LLM 증류는 보정과 학습을 결합해 타깃 보상 없이 교사 편향을 걷어낸다.
LLM 증류는 강한 교사 모델의 능력을 작은 학생 모델로 옮기는 기법이지만, 교사의 체계적 편향까지 함께 전이될 수 있다. 목표 도메인 보상 피드백이 없는 공변량 이동 상황에서 교사 보정과 학습을 결합해 이 문제를 줄이는 CCL을 제안한다.