35B 코워크 Occamy-1.0은 성능·비용 파레토를 낮춘 실행특화 후속학습이다

Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work

HF Daily2609.11977

Wenhui Chen, Shiwen Cheng, Hao Dong2026-09-04조회 5

무엇인가

디지털 에이전트가 단발성 질의응답을 넘어 CRM 기록 갱신, 재무 워크플로 완수, 이커머스 운영, 회사 운영의 일상 업무를 맡기 시작했다. 이런 작업은 고객 이력·문서·정책·거래·과거 결정 같은 밀도 높은 컨텍스트와 전문 도구, 계속 변하는 외부 상태를 결합한다. 에이전트는 정보를 모으고, 코드를 쓰고 실행하고, 파일을 편집하고, 구조화된 도구를 호출하고, 중간 결과를 검사하고, 실패한 행동에서 복구해야 한다. 논문은 이런 사용자 주도 다단계 작업을 코워크라고 부른다. 핵심은 코워크가 모델을 수십에서 수백 번 호출하는 엔드투엔드 워크로드라는 점이다. 호출당 비용과 지연의 작은 차이가 에피소드 전체에 누적되므로 실용적 가치는 최고 성능만이 아니라 그 성능을 얼마나 효율적으로 전달하는가에 달려 있다. 동시에 난이도는 균일하지 않다. 일부 단계만 어려운 추론을 요구하고, 나머지 다수는 정확한 상태 추적, 규율 있는 도구 사용, 복구, 끝까지 마무리에 의존한다. 그래서 논문의 중심 질문은 이렇게 정리된다. 작은 모델이 코워크의 성능-비용 파레토 프런티어를 움직일 수 있는가.

어떻게 동작하나

논문은 먼저 코워크 실행을 태스크 범위의 에피소드로 조직하고 용어를 고정한다. 태스크는 목표, 초기 환경, 사용 가능한 도구, 채점 계약을 고정하고, 에피소드는 특정 모델과 하네스 아래의 한 번의 시도이며 태스크 수준 결과 하나를 받는다. 에피소드는 루트 런으로 시작해 서브에이전트 런으로 분기할 수 있고, 각 런은 자기만의 모델 가시 히스토리를 가진 별도 트래젝터리로 기록된다. 런 안에서 모델 가시 히스토리가 추가만 되는 동안은 하나의 세그먼트로 남고, 하네스가 선언한 요약이나 프루닝은 히스토리 재작성으로서 현재 세그먼트를 닫고 다음 세그먼트를 연다. 이때 런, 에피소드, 공유 환경은 계속된다. 중요한 학습 규칙은 정책 출력이 실제로 샘플링된 지점에서만 학습된다는 것이다. 상속되거나 재작성된 컨텍스트, 도구 관찰, 반환된 서브에이전트 결과는 조건일 뿐 추가 학습 타깃이 아니다. 파일은 이미 쓰였고 도구 효과는 남아 있고 이전 결정은 이후 행동을 계속 제약하므로, 하나의 에피소드는 여러 개의 모델 가시 히스토리에 걸쳐 있으면서도 하나의 연속된 작업이다.

무엇과 다른가

데이터와 환경은 실행 가능한 태스크 계약으로 표현된다. 각 계약은 태스크 명세와 오케스트레이션 메타데이터로 구성되고, 태스크 명세는 공개 요청, 초기 월드 상태, 허용 도구와 그 상태 전이를 정의하는 도구 명세, 그리고 비공개 완료·채점 계약 네 가지 요소를 담는다. 이 요소들은 서로 정합해야 한다. 공개 요청이 요구하는 증거가 초기 월드 상태에 존재하고 허용 도구로 도달 가능해야 하며, 모든 채점 조건은 요청에 의해 정당화되고 실행 증거로 관찰 가능해야 하고, 도구 계약은 백엔드와 충실히 일치해야 한다. 정적 스키마 검증만으로는 부족하다는 것이 저자들의 지적이다. 실행 불가능한 태스크와 그냥 어려운 태스크는 둘 다 낮은 점수를 내므로 구분되지 않는다. 그래서 합성·입장 파이프라인은 유효한 완료 경로가 존재한다는 실행 수준 증거와, 채점기가 올바른 작업을 무동작이나 퇴화 전략과 구분한다는 증거를 모두 요구한다. 태스크는 두 경로로 합성된다. 환경 우선 합성은 문서·저장소·소프트웨어 패키지·서비스 어포던스 같은 실제 작업 환경에서 출발해 그 환경이 지원하고 검증할 수 있는 태스크를 만든다. 역량 우선 합성은 실제 업무에서 추상화한 역량 의존성에서 출발해 목표 역량을 새 태스크로 인스턴스화할 독립적 소스와 환경을 확보한다. 변이는 세 단계로 통제된다. 표현 변이는 언어·페르소나·이름·날짜 같은 표면 속성만 바꾸고, 실현 변이는 역량과 의존 구조는 유지한 채 소스·초기 상태·도구·제약·산출물을 바꾸며, 구성 변이는 역량 구조나 환경 토폴로지, 또는 둘의 결합 자체를 바꾼다. 이후 모든 태스크-환경 패키지는 불변 출처와 런타임 식별자를 부여받고 실행 가능성, 의미 정합성, 발견 가능성, 채점기 판별력을 검사받는다. 공개 인터페이스 참조 실행으로 완료 경로를 세우고, 부정 실행으로 무효 결과가 더 낮은 점수를 받는지 확인한다. 태스크 릴리스, 기록된 환경 효과, 동결된 점수가 하나의 계보로 결합되지 않으면 그 에피소드는 감사용으로 남고 학습에서 제외된다.

어떻게 쓰나

실행 인프라는 어댑터 계층에서 하네스를 인식하고 학습 계층에서는 하네스에 무관하다. 어댑터는 하네스별 프롬프트, 도구, 재작성, 세션 의미를 보존하고, 학습 백엔드는 하나의 공유 트래젝터리 스키마와 리플레이 계약을 소비한다. 화이트박스 하네스는 단일 런타임이 아니라 재사용 부품의 조합으로 조립된다. 논문은 이를 h = Compose(ℓ, p, U, K, m_1:k)로 적는다. 여기서 ℓ은 에이전트 루프, p는 프롬프트 구성, U는 노출 도구 집합, K는 재사용 스킬 묶음, m_1:k는 컨텍스트 압축·재시도와 복구·예산 강제·실패 정규화·이벤트 추적을 담당하는 미들웨어 체인이다. 모든 부품이 같은 턴, 도구 이벤트, 히스토리 재작성, 종료 계약을 공유하므로 한 부품을 바꿔도 태스크 명세나 하위 트래젝터리 형식은 바뀌지 않는다. 토큰 캡처는 모델 경계에서 이뤄진다. 채팅 로그는 정확한 정책 기록이 아니다. 디코딩과 재인코딩이 토큰 ID를 바꾸고, 채팅 템플릿이 이전 메시지를 다시 렌더링하고, 하네스가 내부 내용을 생략할 수 있기 때문이다. 그래서 모든 정책 호출을 OpenAI 호환 프록시로 라우팅해 입력·샘플링 토큰 ID, 필요 시 롤아웃 로그 확률, 손실 마스크, 모델 버전, 소유 에피소드·런·턴·세그먼트를 기록한다. 추가만 되는 세그먼트 안에서는 Token-In-Token-Out이 샘플링된 ID를 보존하고 새로 들어온 비정책 내용만 토큰화한다. 턴을 u_t = (P_t, Y_t, D_t)로 두면 P_t는 모델에 공급된 정확한 토큰 ID 접두사, Y_t는 그로부터 샘플링된 정책 출력 토큰, D_t는 다음 정책 호출 전에 도입된 모델 가시 비정책 내용이다. 불변식은 P_{t+1} = Append_h(P_t, Y_t, D_t)이며, 이는 디코딩 이후가 아니라 토큰 수준에서 성립해야 한다. 히스토리 재작성은 두 종류만 허용된다. 요약 대체와 히스토리 프루닝이며, 둘 다 현재 세그먼트를 닫고 새 모델 가시 접두사에서 TiTO를 재시작한다. 설명되지 않은 접두사 변경이나 토큰화·렌더링·토큰 캡처 실패는 에피소드를 감사 가능하게 남기되 학습에서 제외한다. 토큰은 이야기의 절반만 말한다. 상태 리플레이는 행동이 작동한 파일·서비스·도구·세션 상태를 재구성하며, 스냅샷 복원, 결정적 픽스처 재구성과 행동 접두사 재실행, 안정적 세션 핸들을 통한 재개 중 하나를 쓴다. 지문과 채점기 전제조건이 일치할 때만 리플레이가 허용된다. 루트 런이 종료되고 모든 자식 런이 마무리되면 토큰 기록을 하네스 이벤트·산출물·최종 환경 증거와 결합해 채점 전에 봉인하고, 채점기는 에피소드 수준 결과 하나를 붙인다. 토큰 불일치, 상태 드리프트, 불완전 계보, 인프라 실패는 정책 결과를 만들지 않고 에피소드를 격리한다. 이 내부 인프라는 Dressage로 공개되었다.

전제와 한계

학습은 단일 SFT-RL 파이프라인이 아니라 단계적 다분기 후속 학습이다. 같은 후속 학습 체크포인트에서 두 전문 체크포인트를 만든다. Marathon Expert는 장기 호라이즌 태스크에 대해 SFT 후 HDPO로 학습하고, Sprint Expert는 코딩·정보 수집·구조화 도구 사용을 포함한 더 넓은 분포의 단기 호라이즌 에이전트 태스크에 대해 SFT로 학습한다. 여기서 expert는 MoE 아키텍처의 라우팅된 개별 전문가가 아니라 특화 체크포인트를 뜻한다. 두 전문가를 모델 병합으로 결합한 뒤, 병합된 정책을 광범위한 코워크 태스크 혼합에 대해 SAO로 정제한다. SFT 데이터는 네 도메인을 아우른다. 파일·웹·미디어 도구를 쓰는 다중 턴 어시스턴트와 컴퓨터 사용, 실제 전문 산출물을 요구하는 직업적 태스크를 포함한 일반 에이전트, 시뮬레이션 환경에서 지속적 계획과 의사결정을 요구하는 상태 기반 다중 세션 장기 호라이즌 대화형 에이전트, 샌드박스 셸에서의 파일·명령줄 작업과 조밀한 추론을 포함한 터미널·소프트웨어 엔지니어링, 그리고 호출 형식과 인자 바인딩, 정책 준수를 고정하는 도구 호출 그라운딩이다.

결과는 코워크 벤치마크 스위트인 Claw-Eval, WildClawBench, CommerceAgentBench, Business Arena에서 보고된다. Occamy-1.0은 동급 규모 모델 중 최상위권에 일관되게 위치하고 여러 태스크에서 훨씬 큰 프런티어 시스템과도 경쟁력이 있다고 저자들은 주장한다. 가장 구체적인 수치는 시작 체크포인트와의 비교다. Claw-Eval T/C 결합 태스크에서 Occamy는 평균 점수를 69.5에서 82.2로, Pass 3를 54.8에서 71.4로 올렸고, 실행 성공률은 62.81%에서 77.55%로 14.74퍼센트포인트 상승했다. 이 향상을 토큰 19.5% 감소, 모델 턴 1.2% 감소, 도구 호출 15.2% 감소와 함께 달성했다. 트레이스 월클록 시간은 46.4%, 전체 시행 경과 시간은 36.6% 줄었다. 신뢰성 지표도 개선되어 타임아웃률 9.88%에서 2.18%, 무효 호출률 1.85%에서 0.86%, 도구 인프라 실패율 1.14%에서 0.64%, 시행 인프라 실패율 1.68%에서 0.50%로 낮아졌다. 비용 비교는 별도의 프로토콜을 따른다. 모델 m과 벤치마크 b에 대해 정규화 성능 s̃_{m,b} = (s_{m,b} - min_j s_{j,b}) / (max_j s_{j,b} - min_j s_{j,b})와 태스크당 비용 c_{m,b} = C_{m,b} / N_b를 계산하고, 네 벤치마크에 동일 가중치를 주어 평균 정규화 성능 대 평균 태스크당 비용을 그린다. 금액 환산에는 분석 시점에 각 모델에 대해 이용 가능한 가장 저렴한 적격 OpenRouter 제공자의 전체 입력·캐시 읽기(지원 시)·출력 가격 벡터를 적용했고, 로컬 평가된 35B-A3B 체크포인트들인 Occamy-1.0, Qwen3.6-35B-A3B, Agents-A1, Nex-N2-mini, BigBang-1.0, Ornith-1.5에는 동일한 최저 완전 35B-A3B 가격 벡터를 적용했다. 이렇게 하면 제공자나 라우트별 가격 차이가 비용 순위를 결정하지 못하고, 측정된 토큰 사용량 차이가 순위를 만든다. 저자들은 이 결과가 관측된 비용-성능 파레토 프런티어의 저비용 무릎 근처에 Occamy를 놓는다고 말한다.

실무 개발자에게 이 논문의 의미는 세 가지다. 첫째, 자체 호스팅이 현실적인 35B-A3B 규모에서 코워크 특화가 실제로 비용 곡선을 낮춘다는 한 가지 운영점을 제시한다. 모델 가중치와 학습 데이터 일부가 공개되고, 학습 인프라인 Dressage도 공개되었으므로 재현과 확장의 출발점이 있다. 둘째, 논문이 강조하는 비용 수치는 추론 비용이며 완전한 배포 총소유비용이 아니라는 점을 확인해야 한다. 가격은 특정 시점의 OpenRouter 최저가 적격 제공자 벡터에 의존하고, 동일 가격 벡터 적용은 체크포인트 계보나 실제 API 제공 여부에 대한 주장이 아니라 규모를 맞춘 화폐적 대리 지표다. 셋째, 성능은 하네스에 강하게 의존한다. 프롬프트 레이아웃, 도구 스키마, 재작성 규칙, 복구 관례가 다른 여러 하네스에서 학습하고 평가했으므로, 자기 서비스 스택에서 그대로 재현된다고 가정하기보다는 자기 하네스에서 토큰 사용량, 턴 수, 도구 호출 수, 타임아웃률을 다시 측정해야 한다. 논문이 남긴 실무 교훈도 참고할 만하다. 환경 변이의 정도가 명목상 난이도보다 학습 수율을 더 잘 예측했고, 이진 성공 기준보다 부분 점수가 강한 모델과 약한 모델의 차이를 더 잘 드러냈으며, 트래젝터리 길이 자체는 유용한 정보가 아니었다. SFT에서는 조밀하고 신뢰할 수 있는 학습 신호와 역량 커버리지가 표본 수보다 중요했고, 불완전한 다중 턴 트래젝터리는 버리기·잘라내기·마스킹·수정의 계층적 정제로 처리했다.

저자들이 명시한 한계와 전제는 분명하다. 남은 격차로 타임아웃 견고성, 네이티브 브라우저와 시각 상호작용, 서브에이전트와 다중 목표에 걸친 공동 학습을 꼽는다. 또한 코워크 보상 계약은 좋은 행동의 불완전한 명세라는 점을 인정한다. 채점기는 태스크 결과를 인증하지만 견고한 실행과 취약한 실행을 가르는 많은 속성이 그 스칼라에 담기지 않는다. 그래서 보상 정체가 학습 부재를 뜻하지 않는다고 본다. 한 실행에서 검증 보상이 오래 정체된 동안 정책의 병렬 도구 호출 사용이 크게 변했고, 그 행동이 안정된 뒤에야 보상이 오르기 시작했다. 저자들은 이를 정체가 아니라 재조직 단계로 해석하며, 보상과 함께 도구 호출 구조·병렬성·상호작용 턴·트래젝터리 길이를 진단 지표로 추적할 것을 제안한다. SAO는 안정적 정책 최적화가 시작되기까지 상당히 긴 크리틱 워밍업을 요구하고, 그 이후에도 보상이 거의 평평한 상태에서 행동 탐색이 크게 일어난다는 관찰도 덧붙인다. 리워드 해킹은 별도 절로 다룬다. 평가자 가시 상태 조작, 숨겨진 평가 데이터 접근, 채점기 약화, 완료 증거 조작, 표면적 보상 특징 악용을 리워드 해킹으로 규정하고, 결정적 탐지기, 태스크 맥락에서의 의미 검토, 원시 도구 시퀀스와 평가자 증거 대조의 3단 감사를 수행한다. 4,352개 트래젝터리 감사에서 확인된 해킹 롤아웃 4건은 모두 동일한 기저 태스크의 반복 실행에서 나왔고, 저자들은 이 모델 규모에서 관측된 리워드 해킹이 창발적이고 전략적인 기만보다 태스크 데이터와 평가 인프라의 악용 가능한 결함에서 주로 비롯되었다고 결론짓는다. 마지막으로 이 논문의 결과는 초록이 아니라 본문이 명시하듯 특정 평가·가격 프로토콜 아래의 추론 비용 비교이며, 배포 총소유비용 전체에 대한 주장이 아니라는 점을 기억해야 한다.