음성 LLM은 명령을 알아도 실행할지 판단하지 못한다

Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents

HF Daily2609.32536

Yanjie Zhang, Nanchen Hu, Yushi Sun2026-09-26

무엇인가

음성 에이전트는 약속을 잡고, 메시지를 보내고, 주문하고, 물리 시스템을 제어한다. 이런 발화에는 두 종류의 정보가 함께 실린다. 무엇을 하라는지 알려주는 텍스트 내용과, 그 발화가 애초에 어시스턴트에게 향한 것인지를 알려주는 음향·대화 맥락이다. 옆 사람이 사용자와 똑같은 명령을 말할 수 있고, 사용자가 혼잣말로 명령을 언급할 수도 있다. 텍스트만 보는 에이전트는 요청된 동작을 정확히 인식하면서도 실행 여부를 잘못 결정한다. 기존 시스템은 키워드 스포팅, 기기 지향 발화 검출, 화자 검증을 에이전트 앞단에 배치해 왔지만, 엔드투엔드 Audio LLM은 침묵·응답·도구 호출을 하나의 정책으로 노출한다. 그런데 기존 평가는 잘 정돈된 요청에 응답이나 도구 레이블을 짝지어 왔기 때문에, 도구 선택 정확도가 높다는 사실만으로 음향 맥락이 실행을 통제한다고 말할 수 없다. 이 논문은 "지정된 단어는 그대로 두고 트리거가 다른 음향 소스와 장면에서 오면, 모델은 행동하는가 침묵하는가"라는 좁고 실행 수준의 질문을 던진다.

어떻게 동작하나

이를 위해 VGBench라는 1,018개 항목 진단 벤치마크를 만든다. 구성은 측화(side-talk) 395개, 독백(self-talk) 223개, 화자 전환(speaker-switch) 쌍 400개다. 모든 항목은 [Mute], 도구 호출, 자연어 답변이라는 하나의 공유 행동 공간에 매핑된다. 측화는 같은 저장 화자의 연속 두 발화로 구성되는데, 하나는 어시스턴트를 향하고 하나는 옆 사람을 향하며 순서는 균형을 맞춘다. 같은 음성을 쓰기 때문에 화자 정체성이 설명 변수에서 제거되고, 순수하게 화용적 귀속만 시험된다. 독백은 계획, 후회, 인용, 비꼬기, 수사적 질문 같은 담화 틀로 포장된 명령형 독백 223개이며, 단어 안에 사용 가능한 도구로 매핑되는 명령이 들어 있어도 목표는 전부 [Mute]다. 화자 전환은 결과가 큰 10개 도구에 걸친 400개 반사실 쌍으로, 저자들은 보수적인 웨어러블 인가 규칙을 채택한다. 즉 도구 호출은 동일한 인가 소스이면서 근거리일 때만 허용되고, 다른 소스거나 원거리 트리거면 [Mute]가 목표다. same-speaker 조건에서는 소스 A가 맥락과 근거리 트리거를 말해 도구 호출이 목표가 되고, switch 조건에서는 A가 맥락을 말한 뒤 600ms 경계를 두고 방관자 소스 B가 같은 트리거를 고정된 원거리 룸 변환으로 말해 [Mute]가 목표가 된다. text-only 조건은 같은 단어를 쓰되 도구 목표를 유지한다. 즉 텍스트를 고정한 채 소스, 거리 렌더링, 시간 경계를 동시에 바꾸는 개입이며, 저자들 스스로 이것이 고립된 화자 정체성이 아니라 착용자에서 방관자로의 소스·장면 이동을 통제한 것이라고 규정한다. 데이터는 시드 100개와 생성 300개, 도구당 40개, 8개 음성 합성, -20dBFS 정규화, 5ms 페이드, 16kHz 모노로 만들었다.

무엇과 다른가

평가 계약은 모든 시스템에 동일하다. 같은 도구 목록과 세 가지 행동 형식 중 정확히 하나를 내라는 지시를 주고 그리디 디코딩을 쓴다. 정규 침묵 출력은 [Mute]이고, 도구 행동은 <|TOOL|>{"name": ..., "params": {...}}</|TOOL|> 형태의 단일 구조 객체다. 화자 전환 평가는 switch 조건의 침묵률과 same-speaker·text-only 통제에서의 목표 도구 선택을 함께 보고한다. 항상 침묵만 내는 퇴화 정책이 좋은 점수를 받지 못하게 하려는 설계다. 측화의 자유 응답은 Qwen3.5-35B-A3B 판정자가 어시스턴트 대상, 방관자 대상, 둘 다, 어느 쪽도 아님의 네 레이블로 분류하고 어시스턴트 대상 단독일 때만 정답으로 친다.

어떻게 쓰나

원시 모델 6개(Qwen3-Omni-30B, Nemotron-3-Nano-Omni-30B, Gemini-3.8-flash, Kimi-Audio-7B, Step-Audio-R1.1, Audio Flamingo 3)와 학습 없는 적응 3개(AURA, Thinking with Sound, SHANKS를 Qwen 백본에 얹은 구현)를 같은 계약으로 평가한 결과는 뚜렷하다. Step-Audio-R1.1은 same-speaker 통제의 96%, text-only 통제의 97%에서 목표 도구를 선택하면서도 전환된 명령은 1%만 침묵시킨다. Kimi가 원시 모델 중 최고 전환 침묵률 14%를 기록하지만, 정작 도구 선택은 두 통제에서 53%와 44%에 그친다. Audio Flamingo 3는 다른 괄호 형식의 행동 언어를 내서 정규 도구 선택 크레딧이 0이고, 독백 침묵률 1%, 전환 침묵률 0%다. 실패 방식도 제각각이다. Qwen은 측화에서 첫 발화에, Gemini는 나중 발화에, Step은 양쪽 모두에 반응하는 경향을 보인다. 학습 없는 적응들도 오류 프로파일만 바꿀 뿐이다. AURA는 측화를 39.0%에서 46.6%로, 독백을 57.0%에서 63.2%로 올리지만 전환 명령은 하나도 침묵시키지 못한다. TwS는 독백 침묵을 85.7%까지 끌어올리는 대신 측화가 23.0%로 떨어지는데, 침묵을 남용한 결과다. SHANKS는 청크 출력이 행동 문법을 자주 위반해 same-speaker 도구 선택이 1%로 남는다.

전제와 한계

저자들은 이 경계가 학습 가능한지 확인하려고 VoxGate라는 사후학습 사례 연구를 붙인다. Qwen3-Omni-30B-A3B-Instruct에 LoRA rank 32, alpha 64를 48개 층의 q·k·v·o 프로젝션에 적용하고 오디오 인코더와 얼라이너는 동결한 뒤, 3 에폭, 학습률 1e-4, 유효 배치 32, H200 8장으로 학습한다. 데이터는 VGBench 훈련 분할과 WearVox의 답변·기권·도구 사용·번역 예시를 섞는다. 지도학습 결과는 홀드아웃 전환 명령 80개 중 73개(91.3%)를 침묵시키면서, 근거리 same-speaker와 text-only 통제에서는 전부 정확한 도구를 고른다. 이어 붙인 탐색적 GRPO 단계는 전환 결과를 74/80으로 유지하고, 독백 침묵을 52.0%에서 60.0%로, 측화 정확도를 68.4%에서 70.9%로 올린다. GRPO는 화자 전환 쌍 q=(x+, x-)에서 각 조건마다 K/2개 완성을 뽑아 하나의 롤아웃 그룹에 넣고, 그룹 내 보상 정규화 A=(r-μ)/σ를 쓴다. 보상 분산이 0인 그룹, 즉 모든 샘플이 같은 보상을 받는 그룹은 업데이트에서 제외한다. 정답 침묵이나 일치하는 도구는 +1, 오답은 -1, 도구 문법 오류는 추가로 -0.2다.

요인 분해 실험이 이 결과의 정체를 밝힌다. 같은 80개 명령에서 소스, 거리, 600ms 경계를 하나씩 바꿔 본다. 근거리 렌더링과 고정 갭을 두고 트리거 소스만 바꾸면 침묵률이 1.25%에서 SFT 50.0%, GRPO 53.75%로 뛴다. 소스와 갭을 고정하고 근거리 트리거를 원거리로 바꾸면 두 모델 모두 60.0%로 오르는데, 이는 근접 규칙상 적절하다. 반대로 갭만 바꾸면 same-speaker 근거리 침묵률은 1.25포인트밖에 변하지 않는다. 즉 91.3~92.5%라는 주 전환 결과는 소스 의존성과 거리 의존성이 결합된 값이다. 큐 균형 SFT 통제 실험도 흥미롭다. 5,748행 혼합에서 화자 전환 오디오 훈련 슬롯 1,212개만 교체하고 540 최적화 스텝을 유지한 채, 도구와 [Mute] 레이블 양쪽 안에서 근거리/원거리 렌더링을 0/600ms 분리와 교차해 균형을 맞춘다. 원래 검증 WAV에서 재시험하면 same/far/600 침묵이 60.00%에서 90.00%로, different/near 침묵이 35.00%/50.00%에서 66.25%/82.50%로 오른다. 하지만 장면 일관 원거리 오디오를 쓰는 8조건 연구에서는 same/far 트리거 침묵이 3.75%/5.00%에 그친다. 서로 다른 WAV이므로 거리 거부가 장면 의존적이라는 뜻이다. 이 통제 실험에서 원래 화자 전환 침묵은 73/80에서 70/80으로, WearVox 도구 호출 정확도는 90.18%에서 83.04%로 떨어진다.

사후학습이 다른 능력을 지우지 않았는지도 확인한다. WearVox의 고정 384예시 프로토콜(폐쇄형 답변 59, 근거 기반 답변 55, 기권 58, 도구 사용 112, 실시간 번역 100)에서 태스크 전용 SFT는 63.28%, 태스크 전용 GRPO는 67.71%를 기록한 반면, 공동 학습한 SFT는 72.14%, 공동 GRPO는 76.30%를 낸다. 공동 GRPO는 기권 정확도 100.00%까지 도달한다. 답변 집계 점수는 베이스 모델을 포함한 모든 시스템에서 다른 태스크군보다 낮게 남는다. 저자들은 이를 두고 학습된 게이트가 보유 태스크의 전반적 붕괴에서 나온 것이 아니라고 주장한다.

개발자 관점에서 실무적 결론은 분명하다. 첫째, 음성 에이전트 평가에서 도구 선택 정확도만 보면 안 된다. 같은 단어에 대해 실행과 침묵이 갈리는 텍스트 매칭 대조를 만들어 오탐 실행(false execution)과 오탐 거부(false rejection)를 분리해 보고해야 한다. 둘째, 행동 게이트에는 근접성과 소스 증거가 모두 필요하다. 거리만으로는 가까이 있는 방관자를 걸러낼 수 없다. 셋째, 출력 형식 정규화가 성능 비교를 좌우한다. Audio Flamingo 3처럼 다른 행동 언어를 내는 모델은 정규 파서에서 크레딧을 전혀 받지 못했고, 저자들도 이것이 형식 불변의 잠재 능력이 아니라 배포 가능한 행동을 진단한 것이라고 못 박는다. 넷째, 사후학습으로 이 게이트를 학습시킬 수는 있지만, 큐 균형 실험에서 보듯 장면이 바뀌면 거리 거부 성능이 무너지므로 실제 배포 환경의 룸·마이크 조건에서 다시 검증해야 한다.

저자들이 명시한 한계도 분명하다. 결과는 설정당 하나의 데이터 분할과 한 번의 실행에 기반하며, 균형 테스트는 착용자 음성은 바꾸지만 방, 템플릿, 자연스러운 방관자 발화, 오픈셋 화자는 바꾸지 않는다. 측화 평가는 인간 일치도가 보고되지 않은 LLM 판정자를 쓰고, 도구 정확도는 인자가 아니라 이름만 확인한다. 프로토콜은 항목 수준 분리만 확립할 뿐 홀드아웃 음성·템플릿 패밀리·도구 패밀리 일반화를 보장하지 않는다. GRPO 단계에는 비쌍 GRPO나 반복 시드 통제가 없어서, 쌍 인식 그룹화가 SFT 대비 향상의 원인이라고 단정할 수 없다.