HABIT과 AgentHabit은 LLM 에이전트를 23개행동축으로 프로파일링한다

AgentHabit: Characterizing Distinct Behaviors of Agents on Everyday Tasks

arXiv2609.32795v1

Woojung Song2026-09-26조회 2

무엇인가

LLM 에이전트는 이메일 초안 작성, 개념 학습, 조언 구하기 같은 일상 과제를 돕는다. 이런 과제는 여러 합리적 방식으로 완수될 수 있고, 최종 답이 유용하더라도 수행 과정이 사용자의 선호와 맞지 않을 수 있다. 예를 들어 태블릿 사용 제한 방법을 물었을 때 Claude는 기기를 되묻지만 GPT는 묻지 않고 여러 기기용 지침을 한꺼번에 준다. 개인화된 조언을 원하는 부모에게는 질문이 반갑지만, 빠른 답을 원하는 사용자에게는 불필요한 지연이다. 기존 에이전트 평가는 코딩·컴퓨터 사용·웹 탐색 같은 영역의 과제 성공률이나 중간 진행도, 완료 효율을 측정할 뿐, 작업을 검증하는 정도나 모호한 지시를 다루는 방식 같은 수행 중 행동은 잘 드러내지 않는다. 이 논문은 과제 성공 너머의 행동 성향을 체계적으로 기술하고 비교하는 틀을 제안한다.

어떻게 동작하나

핵심 자원은 HABIT이라는 분류체계다. 5개 범주(사용자 상호작용과 협업, 정보 수집과 도구 사용, 의사결정과 근거 제시, 과제 관리와 검증, 출력 설계와 전달) 아래 23개 행동 축을 두고, 각 축마다 행동 정의와 범주형 라벨, 그리고 라벨을 정할 때 어떤 증거를 우선할지 규정하는 decide-by 규칙을 붙였다. 예컨대 Ask-user timing 축은 에이전트가 첫 답변 전에만 질문하는지(Before only), 후에만 하는지(After only), 양쪽 다 하는지(Both phases), 아예 안 하는지(Not asked)를 구분한다. 구축은 5단계다. Anthropic Economic Index의 요청 범주에서 다양한 접근이 가능한 17개 도메인을 도출하고, 각 도메인마다 사용자 목표·사실·제약을 담은 과제를 만든 뒤, 5개 모델군에서 고른 8개 모델을 17개 과제에 3회씩 돌려 408개 궤적을 수집했다. 에이전트는 웹 검색(Tavily), 파이썬 실행, 사용자에게 질문, 답변 확정 네 도구를 쓰며, GPT-5.6 Sol 기반 사용자 시뮬레이터가 WildChat-1M에서 추정한 페르소나 문체와 피드백 성향에 따라 응답한다. 시뮬레이터 사실성은 사람 3명이 발화 74개를 평가해 5점 만점에 4.55, 4.68, 4.57을 받았고 평가자 간 일치도(Gwet's AC1)는 0.62~0.71이었다. 이후 저자 3명이 20시간 이상 408개 궤적을 검토하고 서로 다른 모델군의 LLM 3개가 같은 작업을 병행해 716개의 후보 축을 뽑았고, 중복을 병합하고 과제 특수성을 제거해 23개 축으로 정리했다.

무엇과 다른가

HABIT은 구축에 쓰지 않은 17개 과제의 새 궤적 408개에서 검증됐다. 비교 대상은 심리측정에 쓰이는 Schwartz의 10개 인간 가치와 Act·ONOMY의 46개 에이전트 하위 행동이다. 과제를 하나씩 빼는 교차검증으로 28개 모델 쌍의 모델 식별 정확도를 재면 HABIT이 92.2%로 Schwartz 72.8%, Act·ONOMY 87.2%, 무작위 50%를 앞섰다. 같은 모델의 반복 실행 간 라벨 일치도가 다른 모델 간 일치도보다 얼마나 높은지를 나타내는 Gap 값도 HABIT이 0.114로 두 기준 분류체계의 두 배를 넘었다. 주석 일관성은 평가자 내 AC1 0.851, 평가자 간 AC1 0.718로 Schwartz(0.650/0.383)보다 높고 Act·ONOMY(0.830/0.755)에 근접했다. 라벨 다양성(정규화 엔트로피)은 0.653으로 Schwartz 0.491, Act·ONOMY 0.387보다 라벨이 고르게 쓰였다.

어떻게 쓰나

이 위에 세운 것이 AgentHabit 벤치마크다. 17개 도메인의 하위 도메인마다 하나씩, HABIT 구축·평가에 쓴 34개 과제와 겹치지 않는 86개 일상 과제를 만들고, 18개 모델(GPT-OSS 120B, GPT-5.6 Sol·Terra·Luna, Claude Opus 5·Sonnet 5·Haiku 4.5, Qwen 3.7 Max·Plus·Flash, DeepSeek V4 Flash-0731, Gemini 3.7 Flash, Gemma 4 31B·26B-A4B·12B, Nemotron 3.5 Lightning 30B-A3B, Muse Spark 1.3, Solar Pro 4)을 과제마다 3회 실행해 4,644개 궤적을 모았다. 모델을 가린 LLM 판정자가 축 하나씩 라벨을 붙이는데, 사람 3명의 다수 라벨과 비교해 Qwen3.8-27B를 판정자로 선택했고 364개 사례에서 83.52% 일치(Cohen's κ=0.8282)를 얻었다. 궤적마다 3회 주석해 확률성을 줄였다. 결과적으로 GPT·Claude 계열은 요구사항이 충돌할 때 가정을 밝히고 대안을 제시하는 반면, Qwen과 Google 모델은 가정이나 요구 변경을 밝히지 않고 넘어가는 경우가 많았다. 코드 실행 도구는 GPT·Gemma가 쓰지 않고 끝내는 편이고 Claude·Qwen은 첫 결과물 전후로 자주 쓴다. GPT-5.6은 결론에 불확실성을 명시하는 편이고 Qwen은 그렇지 않다. Claude는 다음 단계를 여러 개 구체적으로 제안하지만 Qwen은 제시하지 않는 경우가 많다. 같은 모델군 안의 프로파일 유사도는 GPT-5.6 0.93, Qwen 0.91, Gemma 0.91로 전체 평균 0.80을 웃돌았지만 Claude는 0.77로 낮았고, 특히 Opus와 Haiku 차이가 컸다.

전제와 한계

프로파일이 과제 특수적인지도 확인했다. 86개 과제에서 1%, 10~90%, 99%를 샘플링해 나머지 과제로 만든 프로파일과 매칭하는 실험을 비율마다 1,000회 반복한 결과, 과제의 10%만 써도 80.21%가 같은 모델로, 98.90%가 같은 모델군으로 매칭됐고 50%를 쓰면 각각 89.86%, 100.00%로 올랐다. 반면 모델에게 자기 행동을 직접 보고하게 하면 23개 축에서 가장 흔한 행동을 맞히는 비율(Mode Agreement)이 평균 50.9%에 그쳐, 균등 무작위 기준선 33.3%보다는 높지만 절반가량은 어긋났다. 축 간 중복도 제한적이어서 253개 축 쌍 중 20.9%만 중간 이상 연관(Cramér's V)을 보였고, 한 축을 알아서 다른 축의 불확실성이 줄어드는 비율(불확실성 계수)은 평균 3.40%에 불과했다.

행동 성향을 바꿀 수 있는지도 실험했다. 프롬프트로 각 축의 가장 드문 행동을 요구했을 때 목표 행동 빈도는 Gemma 4 31B에서 3.6%→23.0%, 12B에서 3.3%→21.5%로 올랐다. 장식 기호 사용 지시는 효과가 컸지만 출처를 답변 전체에 인용하라는 지시는 효과가 작았고, 한 모델에서 크게 변한 축은 다른 모델에서도 크게 변하는 상관(Pearson r=0.909)이 관찰됐다. 반면 다른 모델의 궤적으로 SFT·DPO 파인튜닝한 경우는 달랐다. Gemma 4 12B를 프로파일이 가장 먼 Claude Opus 5에 맞추려 했지만 Opus와의 유사도는 0.604에서 SFT 후 0.601, DPO 후 0.607로 통계적으로 유의한 변화가 없었고, 원래 Gemma 프로파일과의 유사도는 0.908(SFT), 0.932(DPO)로 여전히 높았다.

개발자 입장에서 이 논문은 모델 선택과 에이전트 설계의 판단 근거를 제공한다. 벤치마크 점수가 비슷한 모델이라도 되묻는 시점, 가정을 명시하는지, 코드 실행 도구를 언제 쓰는지, 답변 후 다음 단계를 제안하는지가 체계적으로 다르며, 이 차이는 과제 집합을 바꿔도 유지된다. 따라서 서비스 요구사항(빠른 단답 vs 개인화된 대화, 출처 중시 vs 간결함)에 따라 모델을 고르고, 23개 축 중 사용자 경험에 직접 영향을 주는 축을 골라 프롬프트로 조정하는 접근이 현실적이다. 다만 프롬프트로 잘 바뀌는 축과 거의 안 바뀌는 축이 있고, 다른 모델 흉내를 내는 파인튜닝만으로는 프로파일이 잘 이동하지 않는다는 점을 전제로 삼아야 한다. 자기보고로 모델 성향을 파악하는 방식은 절반 정도만 실제 행동과 맞으므로 대체재로 쓰기 어렵다.

저자들이 밝힌 한계도 분명하다. API 기반 모델의 변경·서비스 종료, 언어모델 출력의 확률성, 검색 결과의 시간에 따른 변화 때문에 완전한 재현은 어려울 수 있으며, 이를 완화하려고 모델-과제 쌍마다 궤적 3개, 궤적마다 주석 3회를 수집했다. Tavily 검색 결과는 저작권 문제로 원문 대신 출처 URL만 공개할 계획이다. 또한 스티어링 실험의 파인튜닝은 가용 컴퓨팅 자원상 Gemma 4 12B에서만 수행됐고, 사용자 시뮬레이터가 실제 사용자보다 협조적일 경우 에이전트 행동이 실제와 다르게 나타날 수 있다는 전제를 깔고 있다.