선제적 LLM 에이전트를 과업·시간·신뢰로 평가하는 Proactivity-Gym

Foundations of Proactive Agents: Principles, Technical Layers, and Proactivity-Gym

HF Daily2609.37267

Jio Oh, Seunghyun Do, Young-Jun Lee2026-09-29

무엇인가

이 논문은 사용자가 요청하기 전에 먼저 움직이는 선제적(proactive) LLM 에이전트를 어떻게 설계하고 평가할 것인가를 다룬다. 현재 에이전트 연구와 배포는 대부분 반응적(reactive)이어서 작업이 사용자 요청에서 시작되고, 그 요청을 얼마나 잘 수행했는지로 성과를 잰다. 그러나 놀고 있는 컴퓨트를 활용해 먼저 도움을 주는 것은 자동으로 유용해지지 않는다. 관련 없는 제안, 잘못된 타이밍의 개입, 품질 낮은 산출물은 검토·수정 비용을 만들어 이득을 상쇄하고, 반복된 실패는 신뢰와 의존을 깎는다. 저자들의 출발 관찰은 선제성은 사용자의 니즈·자원·신뢰가 시간에 따라 변하는 동안 에이전트가 사용자와 동기화된 상태를 유지하는 일이라는 것이다. 요청되지 않은 일이므로 '올바르게 수행'만으로는 부족하고, 무엇을·언제·어떻게 할지도 판단해야 한다.

어떻게 동작하나

이를 위해 논문은 세 가지 결합 설계 원칙 3T를 제안한다. Task Capability(TC)는 관련 니즈를 예측하고 유용한 일을 정확히 수행하는 능력이고, Temporal Allocation(TA)은 자원 가용성과 결과가 필요한 시점에 맞춰 컴퓨트를 시간에 배분하는 능력이며, Trust(TR)는 사용자의 선호를 존중하면서 신뢰와 적절한 의존을 유지하는 것이다. TR은 선행 연구의 다섯 가지 신뢰 구성개념(이해 가능성, 기술적 역량, 신뢰성, 개인적 유대, 믿음)을 채택한다. 저자들은 이 셋을 가중 합으로 묶은 목적식을 제시한다. 에이전트 설계 A에 대해 λ_TC·S_TC(A) + λ_TA·S_TA(A) + λ_TR·S_TR(A)를 최대화하며, 가중치 λ는 양수이고 합이 1이다. 세 목표가 별개라는 점이 핵심이다. 유용한 작업도 타이밍이 나쁘거나 과하면 사용자의 신뢰를 넘어설 수 있는데, 기존 평가는 이런 실패를 과업 성공이나 개입 성공으로 뭉개 진단을 어렵게 만든다.

무엇과 다른가

설계 공간은 다섯 차원으로 정리된다. 무엇을 할지에 해당하는 task scope(현재 과업 내 대 별도 과업)와 anticipation horizon(즉시, 현재 상호작용 내, 상호작용 밖), 언제 시작·처리할지를 정하는 activation trigger(사용자·이벤트·에이전트 트리거)와 processing timing(상호작용 시간 대 수면 시간), 그리고 얼마나 나아갈지를 정하는 intervention depth(prepare·suggest·execute)다. 수면 시간은 사용자가 비활성인 구간으로, 사용자의 진행 중 과업과 컴퓨트를 두고 경쟁하지 않고 백그라운드 작업을 할 수 있는 시기다. 이를 구현하기 위한 시스템 모델링은 상황 모델링과 시스템 모델링으로 나뉜다. 상황 모델링은 상호작용 이력·메모리·외부 관찰을 통합해 사용자 목표, 주의, 선호, 신뢰와 과업 진행, 의존성, 마감, 자원 가용성을 표현하고, 명시적으로 관찰된 사실과 추론해야 하는 잠재 상태를 구분해 새 증거로 갱신한다. 시스템 모델링은 백본 LLM과 하네스가 이 표현을 사용해 작업을 예측·수행하고, 상호작용·수면 기간에 걸쳐 대기 작업과 중간 결과를 추적하며 컴퓨트를 배분하고 개입 깊이를 통제하도록 규정한다. 의사결정은 z_t = R(c_t), a_t ~ π_A(·|z_t, c_t), c_{t+1} = U(c_t, a_t, o_{t+1})로 형식화된다. 상황 표현 z_t를 만들고, z_t와 문맥 c_t로 행동을 고르고, 행동 이력과 새 관찰(사용자 피드백 포함)로 문맥을 갱신한다.

어떻게 쓰나

평가를 위해 Proactivity-Gym을 제안한다. 7~10일의 시뮬레이션 일자로 구성된 10개의 다일 시나리오를 손으로 만들고, 각 시나리오마다 과업별 선호 개입 깊이가 다른 3개의 사용자 페르소나를 둔다. 시뮬레이션 시계, 예약된 이벤트와 행동 의존적 결과를 가진 상태 기반 도구 환경, 페르소나 조건화된 사용자 시뮬레이터가 있어 과업 진행·자원·상호작용이 에이전트 행동에 반응해 변한다. 명시적 요청 외에 이전 상호작용으로 추론해야 하는 잠재 니즈, 자원·가용성·마감 제약 아래의 경쟁 과업, 그리고 개입이 더 이상 필요 없는 NOOP 사례도 포함된다.

전제와 한계

실험은 9개 모델(GPT 5.6-Luna/Sol, Claude Sonnet 5/Opus 5, Qwen 3.5 2B·9B·27B, Gemma 4 12B·31B)을 세 하네스(OpenClaw, Claude Code, Codex)에 조합한 23개 구성으로 수행했고, 시나리오-페르소나 쌍마다 3회 실행했으며 본 실험에서는 추론을 비활성화했다. 지표는 TC 점수(0~100, 규칙 기반과 LLM-as-a-Judge 결합), TA(%), 개입 깊이가 사용자 선호와 일치하는 비율인 TR-D(%), 다섯 신뢰 구성개념 평균인 TR-J(1~5)다. 결과적으로 가장 강한 에이전트도 큰 결손을 남긴다. Claude Opus 5가 평균 TC 65.1로 가장 높지만 TA는 51.7%, TR-D는 52.4%에 그쳤고, 나머지 모델은 모두 TA 20% 미만, TR-D 39~51% 구간이었다. 모델 패밀리 내에서는 큰 모델이 네 지표 모두 높았다. 하네스 효과는 모델과 목표에 따라 달랐다. 오픈웨이트 5개 모델에서 Claude Code를 OpenClaw로 바꾸면 TC가 평균 3.6점 하락했지만 변화 폭은 Gemma 4 12B의 -11.1에서 Qwen 3.5 27B의 +0.5까지 벌어졌다. Claude Opus 5는 같은 교체로 TC가 4.6%, TA가 21.1% 오르는 대신 TR-D가 3.8%, TR-J가 0.20 내려갔다. TC는 TA·TR-D와 약하게 상관(r=0.31, 0.34)되지만 TR-J와는 강하게 상관(r=0.70)됐다. GPT 5.6-Sol의 추론 노력을 none에서 xhigh로 올리면 TC는 50.0에서 58.9로 올랐으나 두 TR 지표는 정체했다. 또한 LLM 심사자는 개입 깊이 불일치에 관대했다. Claude Opus 5는 TR-D가 52.4%인데도 이해 가능성 4.72, 기술적 역량 4.60을 받았다.

30명의 학생·실무자를 대상으로 한 인간 연구는 3T 구분의 중요성을 뒷받침한다. 참가자는 비교의 92.2%에서 올바른 행동·응답(TC 상승)을 선호했고, 콘텐츠 품질을 고정했을 때는 88.3%에서 사용자 개입 선호에 맞는 에이전트(TR 상승)를 불일치 에이전트보다 골랐다. 선제적 도움 수용 의향은 진행 중 과업과 경쟁하는 정확한 도움에서 26.7%였으나, 다음 날 수정이 필요하더라도 수면 시간 도움에는 97.8%로 뛰었다. 즉시 도움이 10분 검토만 필요하고 자원·마감 충돌도 없는 경우에도 64.4%가 수면 시간을 택했다. 신뢰는 잃기 쉬웠다. 정렬에서 불일치로 가는 전환은 평균 1.86점 하락을, 역방향 전환은 1.27점 상승을 낳았다. A-M-A 순서에서 신뢰는 3.43까지만 회복해 초기 4.43에 못 미쳤고, 참가자들은 마지막 개입 자체는 4.71로 적절하다고 평가했다.

개발자 관점에서 이 논문의 실무적 함의는 명확하다. 에이전트를 백그라운드에서 먼저 일하게 만들 때 TC만 올리는 최적화(모델 키우기, 추론 예산 늘리기)는 TA와 TR을 함께 개선하지 못할 수 있고, 특히 LLM 심사자를 평가자로 쓰면 개입 깊이 불일치를 놓쳐 신뢰 문제를 과소평가한다. 하네스 선택도 중립적이지 않다. 같은 모델이라도 하네스를 바꾸면 TC와 TA가 오르는 대신 TR-D가 내려가는 교환이 생기므로, 어떤 지표를 우선하는지 먼저 정해야 한다. 또한 개입 깊이 선호는 과업마다 다르고 이력에 따라 변하므로, 사용자별·과업별 위임 수준을 상태로 추적하고 수면 시간 같은 비경쟁 구간에 작업을 미루는 스케줄링을 설계에 넣는 것이 실질적인 이득으로 이어진다.

저자들이 밝힌 한계는 분명하다. Proactivity-Gym은 자원 제약과 사용자 모델이 단순화된 초기 동적 테스트베드이며, 결합 3T 최적화, gym 확장, 장기 실세계 평가는 향후 연구로 남긴다. 또한 사용자 시뮬레이터 응답은 LLM으로 생성된 합성 데이터이고, 인간 연구는 30명 규모의 시나리오 기반 비교라는 점을 전제로 읽어야 한다.