Qwen Office, 기업용 에이전트에 승부수… 컨텍스트 인프라와 녹음 카드 QwenNote A2 공개
알리바바의 Qwen Office(千问办公)가 9월 22일 알리바바 클라우드 연례 행사인 Apsara Conference에서 기업용 에이전트를 겨냥한 두 가지 결과물을 내놨다. 기업 컨텍스트 인프라 'Enterprise Context'와 명함 크기의 AI 하드웨어 'QwenNote A2'다.
## 문제 정의부터 시작한다
발표의 출발점은 현실적인 관찰이다. 두 시간짜리 고객 방문에서 오간 대화는 만 자를 넘지만, 영업 담당자가 기억을 더듬어 CRM에 입력하는 내용은 보통 300자도 되지 않는다. 회의실의 논쟁, 고객 사무실에서 흘린 한마디, 숙련자의 노하우처럼 정보 밀도가 가장 높은 발화는 대부분 화면 밖에서 발생하고 어떤 기업 시스템에도 들어가지 않는다.
반대쪽 문제도 있다. 이미 문서와 그룹 채팅, 업무 시스템에 쌓여 있는 데이터는 구조화가 안 됐거나 부피가 너무 커서 컨텍스트 윈도우에 들어가지 않는다. 에이전트가 아예 호출할 수 없는 상태다.
## Enterprise Context: 연결하고, 정리하고, 재사용한다
Enterprise Context는 그룹 채팅, 문서, 지식베이스, 업무 시스템에 흩어진 기업 정보를 압축·구조화하고 업무 변화에 맞춰 계속 갱신하면서, 에이전트가 언제든 꺼내 쓸 수 있는 지식으로 바꿔주는 인프라다.
핵심 난제는 '얼마나 줄 것인가'다. 한 회사가 수년간 쌓은 자료는 수십만 건에 달하지만, 직원이 특정 업무를 시작할 때 필요한 것은 전부가 아니라 지금 그 일에 가장 관련 있는 작은 조각이다. Enterprise Context는 매번 가장 관련성 높은 부분만 넘기고, 내장된 전용 모델로 토큰 비용을 최대한 낮추는 방식을 택했다.
절차는 세 단계다. 첫째는 연결이다. 기업 지식이 사방에 흩어져 AI가 닿지 못하므로, 프로젝트에 누가 연관돼 있고 어떤 채널을 거치며 보고 라인이 어떻게 흐르는지를 먼저 한곳에 모은다. 둘째는 정리다. 대형 모델로 사내 지식을 호출 가능한 엔티티로 정제한다. 사람의 속성, 프로젝트 진행 상황, 프로세스 규칙을 계층별로 정리하고 상위 계층이 하위 계층을 요약하는 구조를 만든다. 텍스트뿐 아니라 그동안 정리되지 않았던 이미지와 영상도 멀티모달 모델로 인식·분류해 컨텍스트에 넣는다. 셋째는 재사용이다. 업무가 들어오면 필요한 부분만 불러와 컨텍스트 윈도우와 모델의 주의를 낭비하지 않는다.
권한은 이 체계 안에 내장된다. 컨텍스트는 모든 사람과 모든 에이전트에 열려 있지 않다. 메신저에 있는 조직·신원·권한 체계를 그대로 상속해서, 누가 무엇을 볼 수 있고 어떤 직무가 무엇을 보면 안 되는지를 데이터가 에이전트에 들어가기 전에 미리 정해둔다.
사례로 제시된 Guming Tea는 신제품 출시가 잦아 운영 표준을 매장에 빠르게 내려보내야 하는 회사다. 문서, 지식베이스, 질의응답 채팅방, 교육 일정에 흩어진 내용을 '매장 운영 지식 공간'으로 묶어 약 1만 명의 현장 직원에게 제공한다. 레시피, 설비 점검, 개점·폐점 항목이 각각 엔티티와 관계로 쪼개지고 점장·트레이너·슈퍼바이저가 서로 다른 권한을 갖는다. 직원이 포스터 부착 규정을 물으면 에이전트는 운영 매뉴얼 전체를 쏟아내지 않고 지금 필요한 구간만 준다.
## QwenNote A2: 화면 밖 대화를 컨텍스트로
QwenNote A2는 오프라인에서 오간 말을 녹음해 텍스트로 바꾸고 에이전트에 넘겨 후속 작업을 처리하게 하는 하드웨어다. 딩톡이 2025년 선보인 녹음 카드 A1을 업그레이드한 제품으로, Plaud 같은 녹음 카드 제품과 외형은 비슷하다.
차이는 그다음이다. QwenNote A2는 Qwen Office와 연결돼 단순한 녹음기가 아니라 에이전트 진입점 역할을 한다. AI 버튼을 길게 누르고 음성으로 바로 작업을 지시할 수 있고 실시간 음성 대화도 된다. 잠금을 풀고 앱을 여는 것보다 빠르고 자연스럽다는 것이 회사 측 설명이다.
하드웨어 사양은 대회의실을 겨냥한다. 마이크 6개, 최대 8m 집음, 전사 정확도 98%, 120개 언어와 41개 방언 자동 인식이다. 거리가 멀어지고 발언자가 늘어나면 일반 녹음 장비는 실패하기 시작하는데, 마이크 어레이의 가치가 여기에 있다. 4G IoT 카드를 내장해 SIM을 따로 꽂지 않아도 되고 스마트폰 없이 독립적으로 쓸 수 있다.
녹음 이후의 처리도 다르다. 녹음 하드웨어의 종착점이 전사 원고라면, QwenNote A2는 일을 넘겨받는 에이전트다. 예를 들어 면접을 마친 사업 책임자가 회의실을 나서며 AI 버튼을 눌러 방금 지원자의 장단점을 분석하고 적합도를 평가해 인사팀에 공유해달라고 말하면, Qwen Office가 방금 전의 면접 전사 내용을 불러 분석하고 평가 결과를 딩톡으로 보내고 협업 상대에게 메시지를 보내고 일정을 잡는다.
장기 기억도 갖췄다. Qwen Office의 클라우드 정보와 함께 진화하면서 사용자의 습관과 일하는 방식을 점점 더 잘 이해한다. 데이터 보호 측면에서는 전사 결과로 텍스트와 요약만 남기고 원본 오디오는 보관하지 않는다. 녹음 시나리오에서 가장 민감한 부분을 제품 설계 단계에서 제거한 셈이다.
## 배경: 모델이 아니라 컨텍스트가 병목이라는 판단
Qwen Office의 진단은 명확하다. 모델 능력은 더 이상 병목이 아니며, 에이전트가 기업에서 실제로 일할 수 있느냐는 그 회사만의 컨텍스트를 확보했느냐에 달려 있다는 것이다.
지난 1년 넘게 모델 성능은 빠르게 올랐지만, 역설적으로 모델이 강해질수록 기업은 부족함을 느낀다. 같은 '기획안 하나 써줘'라는 요청도 빈 대화창에 던지면 일반론이 나오고, 에이전트 옆에 지난 석 달치 그룹 채팅과 문서, 회의록, 고객 파일이 있으면 답의 품질이 몇 단계 올라간다. 기반 모델이 에이전트의 하한을 정하고 컨텍스트 엔지니어링이 상한을 정한다는 표현이 나오는 이유다.
시장 신호도 있다. 기업 컨텍스트를 다루는 Glean은 지난해 6월 1억 5천만 달러 규모의 F라운드 투자를 유치하며 기업가치 72억 달러를 인정받았고, 올해 ARR은 3억 달러를 넘어섰다. 컨텍스트를 정리하는 회사에 72억 달러의 가치를 매긴다는 것은 기업용 에이전트에 부족한 것이 모델이 아니라 기업 자신의 정보라는 점을 시장이 이해했다는 뜻이다.
규모의 격차도 근거로 제시된다. 알리바바 그룹 부사장 겸 Qwen Office CEO인 Chen Yusen은 연설에서 딩톡 통계를 인용해 중대형 기업의 내부 등록 데이터 규모가 약 150PB 수준인 반면 현재 가장 강력한 컨텍스트 윈도우는 백만 토큰 수준이라 몇 자릿수 차이가 난다고 비교했다. 그래서 질문은 데이터를 에이전트에 먹일지 말지가 아니라, 어느 부분을 어떻게 먹일지가 된다.
경쟁 구도에 대한 해석도 덧붙였다. Doubao나 ChatGPT 같은 개인용 에이전트는 한 사람을 서비스하고 컨텍스트도 그 사람의 입력에서만 나온다. 반면 기업이 원하는 것은 조직을 이해하고 조직에 의해 관리될 수 있는 시스템이며, 제각각 일하는 개인 비서 1만 개를 모아도 그 시스템은 만들어지지 않는다. 구글과 마이크로소프트가 자사 오피스 제품군을 축으로 폐쇄형 생태계를 구축하는 것과 달리, Qwen Office는 딩톡 생태계와 기존 ERP·CRM 시스템을 깊게 연결하는 쪽을 택했다. 딩톡의 8억 사용자, 2700만 기업 조직, 알리바바 클라우드의 500만 고객이 그 배경이다.
## 개발자에게 어떤 의미인가
첫째, 컨텍스트 파이프라인이 제품의 본체가 된다. 이번 발표에서 눈여겨볼 지점은 모델이 아니라 연결·정리·재사용이라는 세 단계 구조다. 사내 데이터를 엔티티와 관계로 정제해 계층화하고, 작업 단위로 필요한 조각만 로딩하는 방식은 사내 RAG나 에이전트 메모리를 설계할 때 그대로 차용할 수 있는 골격이다.
둘째, 권한 모델을 컨텍스트 계층에서 다룬다. 조직·신원·권한 체계를 상속해 데이터가 에이전트에 들어가기 전에 경계를 확정하는 접근은, 에이전트가 사내 시스템에 접근하는 구조를 만들 때 반드시 마주치는 문제다. 사후 필터링이 아니라 사전 경계 설정이라는 점이 실무적으로 중요하다.
셋째, 토큰 비용이 아키텍처 결정 변수다. 전용 모델을 붙여 토큰 비용을 낮추고 컨텍스트 윈도우를 아끼는 설계는, 대규모 사내 데이터를 다루는 에이전트에서 비용이 곧 지속 가능성이 된다는 점을 보여준다.
넷째, 입력 채널이 화면 밖으로 확장된다. 회의실·차량·고객 사무실의 음성을 컨텍스트 소스로 편입하는 시도는, 텍스트 기반 파이프라인만으로는 커버되지 않던 데이터 공백을 메우는 방향이다. 음성 전사와 멀티모달 인식을 전제로 한 파이프라인 설계가 필요해진다.
## 한계와 주의
우선 이번 내용은 벤더 발표와 중국 매체 보도를 바탕으로 한 것으로, 전사 정확도 98%나 8m 집음 같은 수치는 실제 대회의실 환경에서 검증된 독립 벤치마크가 아니다. 발언자 분리, 중첩 발화, 소음 환경에서의 성능은 별도로 확인해야 한다.
생태계 종속도 고려할 지점이다. Enterprise Context와 QwenNote A2의 가치는 딩톡과 알리바바 클라우드, Qwen Office 조합 안에서 극대화된다. 다른 메신저나 클라우드를 쓰는 조직에는 그대로 이식되지 않는다.
비즈니스 모델의 미성숙도 지적된다. 이름은 분명 기업용이지만 현재 이 계열 제품을 쓰는 주체는 주로 개인 사용자이고, 기업 확산도 포인트 지급이나 출석 체크식 한도 제공 같은 소비자용 방식을 쓰고 있다. 기업 내부 컨텍스트가 연결되지 않으면 에이전트 도입 효과가 체감되지 않고, 효과가 없으면 기업이 기업용 방식으로 비용을 지불하지 않는다는 순환이 아직 남아 있다.
마지막으로 원본 오디오를 남기지 않는다는 설계는 프라이버시 리스크를 줄이는 대신, 전사 오류가 발생했을 때 원본으로 되돌아가 검증할 수 없다는 트레이드오프를 만든다. 규제 산업이나 감사 요건이 있는 조직이라면 이 지점을 먼저 따져봐야 한다.
관련 글
- Stripe, 사내 지식 계층을 다루는 Knowledge AI Platform 공개Stripe가 개발자 블로그를 통해 자체 Knowledge AI Platform을 소개했다. 에이전트용 Checkout, WebMCP, 사내 프로토타이핑 도구 Harbor에 이어 지식 계층까지 아우르는 행보다.
- 구글 딥마인드, 클라우드에 '기기급 프라이버시' 영구 메모리 얹는다구글 딥마인드가 Private AI Compute에 서버 측 영구 메모리를 추가한다. 암호화 키는 사용자 기기에 남기고 클라우드 보안 엔클레이브에서만 일시 복호화해, 기기 수준 프라이버시를 유지하며 여러 기기에 걸친 AI 기억을 이어주는 구조다.
- 콰이쇼우, 복잡한 커머스 Agent 운영법 공개…QCon 상하이서 'Harness Loop' 사례 발표콰이쇼우 전자상거래 AI 기반 팀장이 QCon 상하이 2026에서 복잡한 커머스 Agent 운영 경험을 발표한다. 검색·추천부터 사후 서비스까지 여러 도메인을 넘나드는 Agent를 실행 궤적 기반으로 지속 개선하는 Harness Loop 방법론이 핵심이다.
- 알리바바, AI폰용 풀스택 솔루션 'Qwen Intelligence' 공개…시스템급 Agent Harness 내장알리바바가 9월 22일 윈치 콘퍼런스에서 AI 스마트폰용 풀스택 솔루션 Qwen Intelligence를 공개했다. 하드웨어는 직접 만들지 않고 모델·플랫폼·시나리오를 묶어 제조사에 제공하며, 시스템급 Agent Harness와 3개 에이전트가 핵심이다.
- Infinite-Parameter LLM은 프롬프트 대신 가중치에 기억한다MoE에서 착안한 'Infinite-Parameter LLM' 아키텍처가 arXiv에 공개됐다. 하이퍼네트워크가 런타임 데이터를 저랭크 가중치 변조로 바꿔, 프롬프트 대신 모델 가중치에 지식을 축적하는 방법을 탐구한다.