AI 논문 한국어 정리·요약 LLM 추론·서빙·에이전트 학습 논문
표 이미지를 이중으로 분리해 이해하는 DELTA와 OTSL 기반 LLM TarQA
표 이해를 이미지 기반 VLM 대신 구조적 텍스트 표현으로 처리하는 연구가 arxiv에 공개됐다. 표 구조 재구성용 DELTA와 표 시각 질의응답용 TARQA가 제안되며 LLM 정합성과 확장성을 앞세웠다.
완전·장기 가림 대응 추적은 YOLOv11n·칼만 필터·OAMN 재식별을 결합한다
완전·장기 가림으로 표적이 카메라 시야에서 사라져도 정체성과 궤적 연속성을 유지하도록 설계된, 국방·감시용 실시간 다중 객체 추적 프레임워크를 제안한 연구다. 기존 추적기가 가림 시 궤적을 조기에 끊어 ID를 잃는 문제를 겨냥하며, 초록 공개분에서는 구체적 방법과 정량 평가 수치가 확인되지 않는다.
로봇 확산 트랜스포머의 잠재 공간을 객체 슬롯으로 바꾼 SlotDiT
SlotDiT는 장면을 객체 단위 잠재 표현인 슬롯으로 분해해 디퓨전 트랜스포머에 결합한 연구다. 픽셀·VAE 잠재 공간에 의존해온 텍스트 조건부 영상 생성 모델의 표현 구조를 객체 중심으로 바꾸려는 시도다.
SWE-bench 상위권 코딩 에이전트는 수렴했고, 리더보드는 순위 대신 비교집합별 해상도와 모델-스캐폴드 출처를 보고해야 한다
SWE-bench 제출물 254건을 모델 실행 없이 감사한 연구가 나왔다. 상위 두 항목이 500개 중 396개를 똑같이 해결하는 등 최상위권 성능이 수렴해, 리더보드 순위가 더는 시스템 간 우열을 뜻하지 않는다는 분석이다.
FlashVector는 모델 서빙 스택 전체를 자동 최적화하는 LLM 에이전트다.
추천 시스템 서빙 비용을 줄이기 위해 GPU 커널, 프레임워크 계산 그래프, 모델 서버, 온디맨드 피처 처리를 아우르는 계층적 최적화 에이전트 FlashVector를 제안한다. 여러 계층에 걸친 전문 지식 없이도 서빙 처리량을 끌어올리는 것이 목표다.
테스트 시점 프롬프트 튜닝의 과신을 제로샷 신뢰도로 보정하는 사후 온도 스케일링
테스트 시점 프롬프트 튜닝(TPT)은 정확도를 높이지만 확률 보정 성능을 희생한다. 이 논문은 제로샷 예측이 잘 보정되어 있다는 관찰에서 출발해, 사후 온도 스케일링 기반 보정 기법 CoTS를 제안한다.
비트 단위 재현으로 학습 전 과정을 감사 가능하게 만든 Open-1B
오픈소스 언어모델은 가중치와 학습 데이터, 레시피를 모두 공개해도 부동소수점 연산의 비결합성 때문에 재현성을 증명하지 못한다. OPEN-1B는 프레임워크의 결정론 모드가 하드웨어를 넘지 못하는 한계를 짚고, 감사 가능한 학습 실행을 목표로 내세운다.
LLM 신뢰도 추정을 현재 추론이 아니라 과거 채점 경험에서 얻는 XConf 제안
언어모델의 신뢰도 추정을 현재 추론 과정이 아니라 축적된 경험에서 끌어내자는 연구가 나왔다. 기존 자기성찰·토큰 확률·리샘플링 방식의 한계를 지적하고 추론에서 에이전트로 확장되는 새 방향을 제안한다.
배포 후 실행 피드백으로 GUI 에이전트 스킬을 고쳐 쓰는 학습 없는 자기진화 프레임워크
동적 GUI에서 팝업·지연 로딩·위젯 이동은 실행 전에 고정한 계획을 무효화한다. 이 논문은 배포 전에 고정되는 정적 스킬 대신, 학습 없이 실행 중 반영·수정·재사용으로 스킬을 진화시키는 방법을 제안한다.
생성된 루브릭의 보상 신호 취약성을 불가능 과제 169개로 스트레스 테스트한다.
언어모델이 생성한 루브릭을 강화학습 보상, LLM 심사, 자동 채점에 쓰려면 적대적 답변보다 정직한 답변을 보상해야 한다. 이 논문은 불가능 과제를 최난도 구간으로 설정해 루브릭 보상 신호의 견고성을 스트레스 테스트한다.
질의마다 키 채널의 읽는 비트 수를 정해 오프로드 KV 캐시의 희소 디코딩 병목을 줄이는 Fathom
에이전트 세션이 백만 토큰까지 길어지고 여러 세션이 동시에 상주하면, 호스트 메모리의 KV 캐시를 훑는 top-k 스캔이 디코딩 병목이 된다. Fathom은 4비트 K 캐시를 비트 플레인으로 저장하고 쿼리마다 읽을 비트 깊이를 정해 스캔 트래픽을 줄인다.
FLAT은 이미지·텍스트를 1D 가변길이 정렬토큰으로 리샘플링해 검색·생성에 쓴다.
멀티모달 표현 학습과 생성을 분리된 2단계로 다루던 관행을 뒤집고, 이미지와 텍스트를 선형 보간 가능한 1D 가변 길이 토큰으로 정렬해 생성 디코더가 바로 쓰는 방법을 제안한다. 검색과 생성 양쪽을 겨냥한 FLAT의 문제의식과 구조를 정리했다.
16일·8개 세계 멀티에이전트 적대적 스트레스 테스트에서 모델 정렬≠시스템안전이다
상시 배포된 다중 에이전트의 실패가 메모리·도구·다른 에이전트·환경 상태로 전파되는 문제를 다룬다. 동일 조건에서 10개 에이전트로 구성된 8개 월드를 병렬로 돌리는 상시 가동 적대적 스트레스 테스트 환경 Emergence World를 제안한다.
ReImaGin은 이미지 생성 모델을 시각 추론 도구로 쓴다
멀티모달 LLM이 텍스트 대신 이미지를 생성해 추론하는 ReImaGin이 여섯 개 시각 추론 과제에서 고정 도구 기반 베이스라인을 앞섰다. 경로 추적에서 최대 25%, 가림 물체 세기에서 상대 40% 개선을 보였고, 추론 전략 자동 탐색도 사람이 설계한 것에 근접했다.
새 환경을 스스로 탐색해 재사용 가능한 기억을 쌓는 멀티에이전트, RSIAgent
학습 없이 낯선 환경을 탐색하며 스스로 지식을 축적하는 멀티에이전트 프레임워크 RSIAgent가 공개됐다. 커리큘럼·액터·검증 에이전트가 협업해 행동과 조건 사이의 재사용 가능한 인과관계를 기억으로 남긴다.
탐색 기록을 리플레이 시뮬레이터로 바꾼 재귀적 자기개선 프레임워크 Dream-RSI
자율 AI 에이전트의 재귀적 자기개선을 다루는 Dream-RSI가 탐색 전략 관리라는 병목을 정면으로 겨냥한다. 검색 공간이 커질수록 고정 전략은 무너지고, 온라인 정책 최적화는 지연되고 값비싼 피드백에 묶인다는 딜레마를 푸는 것이 핵심이다.
Orthrus의 '무손실' 추측 디코딩은 BF16에서 성립하지 않았다
Orthrus의 무손실 추론 주장을 독립 재현한 연구가 수치 정밀도별로 검증에 나섰다. BF16 추론 환경에서 자기회귀 백본과 완전히 동일한 출력 시퀀스가 나오는지가 이번 분석의 핵심 쟁점으로 떠올랐다. 추론 정확도와 처리량의 균형을 따지는 개발자라면 주목할 만하다.
조기 시각 확신이 스트리밍 메모리를 오염시키는 문제를 미래 검증 주장으로 해결하는 OST
영상과 오디오를 동시에 처리하는 스트리밍 멀티모달 모델이 시각 단서만으로 성급하게 결론을 굳히는 '조기 교차 모달 확정' 문제가 제기됐다. 관찰된 증거를 구조화해 출력하는 Omni-Streaming Thinking(OST)이 대안으로 제안됐다.
값 토큰 재배열과 E4M3 직접 인코딩으로 비디오 DiT 어텐션을 가속하는 VC-Attention
디퓨전 트랜스포머 영상 생성의 최대 병목인 어텐션을 저비트로 처리하는 VC-Attention이 제안됐다. 값(value) 이상치를 스무딩하고 소프트맥스를 캐스팅해 정확도 손실을 줄이는 접근이다.
하나의 어휘로 이해·행동·미래 예측을 묶은 8B 물리 파운데이션 모델 PhysBrain 1.5
PhysBrain 1.5는 물리 환경 이해, 행동 생성, 미래 상태 예측을 하나의 학습 틀로 묶는 모델이다. 일반 시각언어모델에서 출발해 언어 응답과 엔드이펙터 움직임, 시각 목표를 이산 시퀀스로 인코딩하고 자기회귀 다음 토큰 예측으로 공동 최적화한다.
컴퓨터 사용 에이전트의 실행 행동을 공통 이벤트로 정규화해 런타임 안전을 판정하는 HazardAuditor
컴퓨터 사용 에이전트의 위험은 생성 콘텐츠가 아니라 런타임 행동에서 나온다. 정적 프롬프트용 가드 모델과 판정만 내놓는 실행 안전 플랫폼의 한계를 지적하며, 이기종 프레임워크에 통용되는 정규화 감독 신호를 목표로 HazardAudit을 제안한다.
LLM 에이전트 테스트타임 확장은 토큰을 더 써도 성능이 꺾이는 변곡점을 갖는다.
LLM 에이전트가 테스트 시점 연산을 어떻게 배분하는지 측정하기 어렵다는 문제를, 토큰 예산별 최선 해를 추적하는 Elo-per-token 분석으로 다룬다. 중간 제출물에 연속 점수를 주는 개방형 과제에서 성능 확장을 관찰한다.
인간이 정한 문제를 넘어 발견 과정 자체를 학습·실행·평가하는 Discovery Foundation Models
기존 지식의 학습·추론을 넘어 행동과 도구 사용, 결과 피드백으로 학습하는 파운데이션 모델의 다음 단계로 '발견 지능'을 제안한다. 인간이 정의한 문제를 푸는 데서 나아가 새 문제와 표현, 설명, 지식이 만들어지는 과정에 참여하는 능력이다.
SAILS는 세트단위 학습선택으로 백도어 독극물을 강화해 최악 취약성을 드러낸다.
백도어 독성 공격 평가에서 독성 예시를 무작위로 고르면 최악의 취약성을 과소평가할 수 있다는 문제를 다룬다. LLaMA-3-8B 세 가지 설정에서 독성 개수를 고정해도 공격 성공률이 크게 달라짐을 보이고, 독성 집합을 학습으로 선택하는 방법을 제안한다.
프롬프트별 학습가치 다른 멀티모달 RL 후학습은 EPS로 저효율 프롬프트 재작성함
온라인 강화학습 후학습에서 프롬프트마다 학습 신호의 유용성이 다른데도 동일한 롤아웃 예산을 쓰는 문제를 다룬다. 멀티모달 대형 언어모델의 훈련 프롬프트 분포를 탐색 기반 스캐폴딩으로 동적으로 조정하는 방법을 제안한다.
Gavel은 고정 LLM의 순전파에서 스킬 라우팅 신호를 읽는 라우터다.
LLM 에이전트가 스킬을 고르는 일을 컨텍스트 사전 로딩이나 외부 검색에 맡기지 않고, 얼린 모델의 forward pass 안에 이미 있는 라우팅 신호를 두 개의 선형 맵으로 읽어낸다는 연구다. 스킬 라이브러리가 커질 때의 주의 분산과 선택 능력 상실 문제를 겨냥한다.
사용자 정신 상태 시뮬레이션으로 인간 인지형 언어 모델을 훈련하는 Mind2Dialogue
언어 모델이 사용자의 말하지 않은 믿음과 목표를 이해하도록, 사용자 정신 상태를 시뮬레이션해 학습 감독을 만드는 Mind2Dialogue를 소개한다. 장기 협업에 필요한 인간 인식 능력을 기존 어시스턴트 데이터의 감독 공백 문제와 함께 다룬다.
트랜스포머 업데이트를 평행·수직 성분으로 분해해 편집 취약성, 압축 진단, 사전학습 개입을 하나의 기하학으로 설명한 연구
Transformer의 표현 진화를 평행·수직 성분으로 분해해, 잔차 경로를 넘어선 병렬 성분이 존재함을 보이고 attention과 MLP 업데이트 분석에 적용한다. 표현 변화의 방향성과 구성 요소를 이해하려는 개발자에게 유용한 해석 프레임을 제시한다.
평가 벤치마크와 분리된 데이터로 에이전트 하네스를 다섯 모듈로 나눠 진화시키는 ModularRSI
장기 코딩·터미널 작업용 에이전트 하네스의 재귀적 자기개선(RSI)을 다룬다. ModularRSI는 벤치마크 특화 적응과 재사용 가능한 개선을 구분하고, 단일 궤적 업데이트의 혼동 문제를 줄이려는 접근이다.
스스로 진화하는 온톨로지 계층으로 데이터 에이전트의 에이전트-데이터 간극을 메우기
데이터 에이전트가 테이블·파일·DB 같은 이종 데이터를 다룰 때 생기는 접근 격차를, 스스로 진화하는 온톨로지 계층으로 해결하려는 연구다. 기존의 원시 데이터 직접 탐색이나 수동 시맨틱 계층 주입이 대규모 이종 환경에서 확장되지 않는다는 문제를 짚는다.