50개 샘플로 에이전트 스킬 최적화 비용 55% 절감, COBRA-Skills 공개
홍콩중문대(선전), 톈진대, 홍콩과기대(광저우), 싱가포르국립대 공동 연구팀이 논문 「COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization」을 공개했다. 핵심은 에이전트 스킬의 자동 생성·개선을 '예산이 제한된 컨텍스트 멀티암드 밴딧(contextual bandit)' 문제로 다시 정의한 것이다. 저자들은 50개의 최적화 샘플만 사용해 기존 최상위 방법 대비 총 최적화 비용을 55~58% 줄였다고 밝혔다.
구조는 두 축이다. 밴딧이 '무엇을 평가할지'를 고르고, 진화 메커니즘이 '스킬을 어떻게 고칠지'를 담당한다. 시스템은 고정 크기의 스킬 집단을 유지하며, 매 반복마다 밴딧이 각 스킬에 점수를 매겨 최고점 하나만 실제 평가에 투입한다. 평가 결과는 이력에 쌓여 점수 예측 모델을 다시 적합하는 데 쓰인다. 예측은 스킬을 의미 임베딩으로 바꾼 뒤 2층 MLP가 스칼라 보상을 내놓는 경량 구조다. 탐색 항은 LinearUCB로 계산한다. 저자들은 처음에 NeuralUCB를 시도했지만, 같은 스킬이 연속 선택됐을 때 불확실성 감소가 다른 스킬과 거의 구분되지 않았고 계산량도 컸다고 설명했다. 반면 LinearUCB는 임베딩 공간에서 이미 충분히 탐색된 영역을 민감하게 식별해 탐색 보상을 낮춘다고 한다. 논문에 따르면 탐색 계수 v는 0.1일 때 평균 성능 73.5%로 최적이었다.
진화는 매 반복이 아니라 로그 스케줄로만 발동한다. 3, 6, 9, 13, 19번째 반복처럼 간격을 벌려 호출한다. 평가 점수가 낮은 스킬을 제거하고 세 가지 연산자로 빈자리를 채우는데, 초기 무스킬 실행 궤적에서 독립 전략을 새로 뽑는 재생(Regeneration), 최신 성공·실패 사례만 반영하는 궤적 변이(Rollout Mutation), 고성능 스킬을 골격으로 삼아 실패 패턴을 피하는 교차 재조합(Crossover)이다. 저자들은 스킬을 전면 재작성하거나 과도하게 융합하면 이미 작동하던 구조가 깨져 성능이 흔들린다며, 국소적이고 보수적인 수정을 택했다고 밝혔다.
실험은 이질적인 6개 에이전트 벤치마크에서 이뤄졌다. 단일 턴과 다중 턴 상호작용, 외부 파일 처리, 도구 호출, 지속 환경과의 상호작용을 포함한다. 타깃 모델은 Qwen3.6-35B-A3B, GPT-5.4-Nano, Gemma-4-26B-A4B-it 세 종이며 교사 모델은 GPT-5.5를 썼다. 논문에 따르면 무스킬 기준선 대비 평균 성능 향상은 각각 13.1, 26.9, 22.5%p였다. 최강 기준선인 SkillOpt와 비교해 교사 모델 토큰 소비는 67~80%, 단위 성능 향상당 비용은 60~69% 줄었다. 절제 실험에서는 밴딧을 빼면 2.2점, 진화를 빼면 2.4점이 떨어졌고, 같은 방식으로 30개 스킬을 만들어 전부 평가한 뒤 최고를 고르는 Best-of-30 기준선보다도 2.5점 높았다. 교사 모델을 GPT-5.5 대신 타깃 모델 자신으로 바꾸면 평균 점수는 73.5에서 72.5로 소폭 내려가지만 비용은 절반이 됐다. GPT-5.5로 최적화한 스킬 라이브러리를 다른 모델로 옮긴 36회의 전이 실험 중 34회가 기준선을 넘었다.
배경에는 스킬 자동화의 비용 구조가 있다. 스킬을 사람이 직접 작성하면 시간이 들고 실제 환경을 넓게 덮기 어렵다. 그래서 LLM으로 스킬을 자동 생성·개선하는 방식이 대안으로 떠올랐지만, 생성된 스킬이 쓸모 있는지 확인하려면 실제 과제에 투입해 실행해야 하고 그때마다 토큰과 다중 턴 상호작용 비용이 발생한다. 게다가 결함이 있는 후보를 사전에 걸러낼 수단이 없어 저품질 후보가 예산을 소진하고, 유효한 새 근거가 없어도 반성-재작성 파이프라인이 고성능 LLM을 계속 호출하는 문제가 있었다. 이 연구는 그 지점을 '평가 전 수익 예측'으로 우회한다.
개발자 입장에서 눈에 띄는 부분은 데이터 요구량이다. 비교 대상인 SkillOpt는 SearchQA에서 400개 학습·200개 검증 샘플을, Trace2Skill은 200개 샘플을 썼지만 COBRA-Skills는 모든 벤치마크에서 50개로 통일했다. 저자들은 20개는 피드백이 크게 흔들리고 50개는 안정적인 신호를 준다고 설명하며, 진화 시에는 50개 중 8개 실행 궤적을 무작위로 뽑아 근거로 쓴다고 밝혔다. 프레임워크 이식성도 확인됐다. Qwen을 Claude Code와 Codex 환경에서 돌렸을 때 각각 68.2, 72.4의 평균 점수를 기록해 특정 에이전트 인터페이스에 의존하지 않는다는 결과를 제시했다.
한계도 분명하다. 저자들은 현재 범위가 태스크 수준 스킬 진화에 머물러 있으며, SQL을 실행하면서 Python 스크립트를 동적으로 호출하거나 인덱스로 다른 SQL 스킬을 연결하는 식의 다중 스킬 연동 구조는 다루지 못한다고 밝혔다. 전이 실험에서 기준선을 넘지 못한 2건은 각각 무스킬 기준선보다 약 0.3%p, 1.7%p 낮았는데, 모델마다 능력 구조와 오류 패턴이 달라 한 모델에서 최적화한 스킬이 다른 모델에 그대로 맞지 않을 수 있다는 설명이다. 위 수치는 모두 저자들이 논문에서 제시한 값이며, 독립적인 재현 결과는 아직 확인되지 않았다.