AI 비서가 되묻는 질문을 정보가치로 학습해 사용자 부담을 줄인다
Learning to Clarify Underspecified Intents Under Limited Interaction
무엇인가
AI 비서는 사용자 요청에서 결과 품질을 좌우하는 정보가 빠져 있는 상황을 자주 만난다. 이 논문은 이 상황을 추측으로 메우거나 무작정 되묻는 문제로 보지 않고, 정보가치(value-of-information) 문제로 다시 정식화한다. 즉 비서는 자신이 얻을 수 있는 정보 중, 그것이 없을 때 사용자 효용에서 가장 큰 회피 가능한 손실을 만드는 정보를 먼저 확보해야 한다. 문제는 이 가치가 사전에 알려져 있지 않다는 점이며, 그래서 비서는 제한된 상호작용 예산을 최적으로 배분하기 위해 이 가치를 예측하도록 학습되어야 한다. 논문은 이 문제를 텍스트-투-이미지 생성에 구체화한다.
어떻게 동작하나
방법의 핵심은 완전한 명세를 인위적으로 훼손해 '빠진 정보'를 정답으로 남겨두는 데이터 구성 절차다. 먼저 완전한 자연어 명세 s*를 분해 모델로 원자적 디테일 집합 D={d1,…,dm}로 쪼갠다. 각 디테일 di는 내용 δi, 결과에 미치는 중요도 가중치 wi∈[0,1], 그리고 심사 모델이 평가 신호로 쓰는 이진 질문 χi로 이루어진다. 다음으로 중요도 가중치에 비례하는 확률로 k개의 디테일을 순차적으로 가려낸다(redaction). k 자체도 매 인스턴스마다 1부터 K까지 균등분포에서 뽑히므로, 비서가 고정된 질문 개수에 의존할 수 없게 만든다. 남은 디테일만으로 자연스러운 요청문 x를 다시 쓰고, 비서는 x만 보고 사용자 시뮬레이터에게 질문해 가려진 디테일을 최대한 복원해야 한다. 사용자 시뮬레이터는 완전한 명세 s*에 접근할 수 있지만 실제로 질문된 것만 답하도록 지시되며, 묻지 않은 정보를 먼저 흘리지 않는다.
무엇과 다른가
보상은 복원된 효용 u_rec로 정의된다. 전체 효용을 중요도 가중 디테일 충족 비율로 두고, 그중 가려진 부분만 정규화한 값이다. 남은 디테일은 요청문에 보존되므로 상수로 취급되고, 결국 u_rec을 최대화하는 것이 사용자 효용을 최대화하는 것과 같아진다. 비서는 Qwen3-8B 하나의 가중치를 공유하되 시스템 프롬프트만 다른 세 가지 역할(질문 생성, 추가 질문 여부 결정, 최종 명세 작성)로 동작한다. 질문 정책은 세 가지 모드로 나뉜다. 아예 묻지 않는 no-asking, 정확히 k개를 묻는 fixed-asking, 그리고 매 턴 스스로 멈출지 결정하며 예산 2k까지 쓸 수 있는 open-asking이다. 사용자 시뮬레이터도 두 종류다. 인내심 많은 사용자는 모든 질문에 답하고, 성급한 사용자는 Pr(p≤b)=(b/B)^α (α=1.5) 분포에 따라 도중에 답변을 중단한다. 학습은 다중 턴 상호작용에서 얻은 복원 효용을 보상으로 삼아 그룹 상대 정책경사(GRPO) 업데이트로 이뤄진다.
어떻게 쓰나
실험은 DOCCI 데이터셋의 초고밀도 이미지 설명으로 구성했다. 2,000개 설명 중 K+5(=20)개 이상의 디테일로 분해되는 것만 남겨 479개 인스턴스를 만들고, 소스 이미지 기준으로 학습 290개, 검증 111개, 테스트 78개로 나눴다. 최대 가려내기 수 K는 15다. 사전 등록된 인간 대상 연구는 76명 참가자, 456개 상호작용 세션으로 진행됐다. 결과적으로 학습된 비서는 참조 이미지와의 일치도에서 유의하게 더 나은 성능을 보이면서 질문 수, 총 상호작용 시간, 비용을 모두 줄였다. 질문 개수를 자연 삼차 스플라인으로 통제한 분석에서 학습 이점은 답변 3~5개 구간에서 네 가지 품질 지표 모두 양의 유의값을 보였다(모두 p_BH<.05). 답변 4개 지점에서 텍스트-텍스트 이점은 0.057 [0.026, 0.088], 이미지-이미지 이점은 0.023 [0.009, 0.038]이었다. 반대로 답변 0개나 1개 구간에서는 어떤 비교도 유의하지 않았는데, 저자들은 이것이 실제로 효과를 만드는 것이 상호작용 자체임을 시사한다고 본다.
전제와 한계
실제 사용자 부담은 오히려 줄었다. 참가자들은 학습된 비서와 더 나은 결과를 얻으면서도 질문에 더 적게 답했다(조정된 차이 −2.27개 답변 [−2.82, −1.72], p_BH<.0001; 관측 평균 2.81 대 4.90). 다만 개별 교환은 길어져 질문은 평균 20.9단어 [19.1, 22.7], 답변은 16.8단어 [11.4, 22.2] 더 길어졌다. 동일한 질문 개수 기준으로는 총 대화 단어가 189.8개 늘지만, 실제 관측된 대화는 상호작용 횟수 자체가 적어 실현된 차이는 72.3단어(평균 266.8 대 194.5)에 그쳤다. 라운드 소요 시간도 학습된 비서가 평균 439.9초로 기준 모델의 533.7초보다 짧았다. 토큰 비용도 줄어, 질문 개수와 소스 이미지를 통제한 뒤에도 라운드당 1,420토큰을 덜 썼다([1,146, 1,695], p_BH<.0001). 이 감소는 주로 내부 추론 토큰이 라운드당 1,551개 줄고 가시 출력 토큰은 131개 늘어난 데서 나온다. 관측 총 사용량은 학습 모델 2,698토큰 대 기준 5,563토큰이었다.
개발자 관점에서 이 논문의 실용적 가치는 '무엇을 물을지'를 휴리스틱 프롬프트가 아니라 측정 가능한 보상으로 최적화했다는 점이다. 완전한 명세를 알고 있는 특권 사용자 시뮬레이터를 두고, 가려낸 정보를 정답으로 남겨 복원률을 직접 계산하는 구조는 사람 라벨링 없이도 되묻기 정책을 학습시킬 수 있는 확장 가능한 경로를 제시한다. 특히 질문 개수 k를 인스턴스마다 무작위로 뽑고 사용자 인내심까지 확률적으로 흔들어, 정책이 특정 예산에 과적합되지 않도록 만든 설계는 다른 도메인의 대화형 에이전트에도 그대로 옮길 수 있는 패턴이다. 학습된 정책이 내부 추론 토큰을 줄이면서 더 나은 결과를 냈다는 관찰은, 되묻기 능력이 추론 시점 연산을 늘리는 대신 오히려 줄일 수 있음을 보여준다. 코드는 공개 저장소로 제공된다.
저자들이 밝힌 한계는 분명하다. 효용을 '처음 명시되지 않은 디테일의 복원'으로 조작화했는데, 이것은 하나의 선택일 뿐이며 복원된 각 디테일의 상대적 가치나 점수가 높을수록 주관적 만족이 올라간다는 것을 입증하지는 못한다. 평가도 참조 이미지와의 임베딩 유사도에 의존한다. 또한 실험 과제는 참가자가 상호작용 내내 참조 이미지를 자유롭게 볼 수 있는 '참조 재구성' 과제로, 안정적인 목표가 주어졌다. 실제 위임 상황에서는 선호가 불확실하거나 진화하고, 어느 정도의 변이는 용인되며, 사용자가 명시적으로 비서에게 맡기고 싶어 하는 결정도 존재한다. 저자들은 이런 설정으로 결론을 확장하려면 추가 실험이 필요하다고 말한다. 더 넓게는 단일 과제 도메인, 단일 비서 모델, 그리고 학습되지 않은 대응 모델과의 비교라는 경계 안에서 얻은 전이 효과라는 점을 인정하며, 이 작업이 이 경로의 첫걸음일 뿐 거의 확실히 전역 최적해는 아니라고 밝힌다.