다운스트림 태스크를 모른 채 환경을 미리 공부해 재사용 자원을 만드는 메타 에이전트

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing

HF Daily2609.10824

Vinay Samuel, Varun Ursekar, Vijay S. Kalmath2026-09-09조회 5

무엇인가

LLM 에이전트의 성능은 모델 자체보다 프롬프트, 도구, 컨텍스트와 메모리 관리, 코퍼스·데이터베이스·외부 서비스의 구조 같은 주변 선택에 크게 좌우된다. 예컨대 파일 이름이 없고 정리되지 않은 대형 파일시스템에서 검색을 수행하는 에이전트는 파일 내용에 대한 단서를 전혀 받지 못하고 값비싼 전수 탐색에 의존하게 된다. 그래서 실무자들은 에이전트 하네스와 환경 구성 요소를 예상 태스크에 맞게 조정해 왔고, 프롬프트 최적화·하네스 최적화·적응형 메모리 같은 자동화 연구가 늘었다. 문제는 기존 자동 적응 방법 대부분이 태스크 예시, 궤적, 평가 피드백에 의존해 무엇을 바꿀지 결정한다는 점이다. 에이전트가 새 환경에 처음 진입하는 시점, 특히 대표 태스크를 확보하는 비용이 클 때는 이런 감독 신호가 없다. 기존의 태스크 비의존(task-agnostic) 접근들도 이 감독을 피하는 대신 특정 환경 유형에 맞는 준비 전략을 미리 고정해 버린다. 이 논문은 더 개방적인 질문을 세운다. 다운스트림 태스크 분포를 모르는 상태에서, 에이전트가 스스로 환경을 탐색하고 무엇을 어떻게 준비할지 선택할 수 있는가.

어떻게 동작하나

논문은 이 설정을 태스크 비의존적 환경 전처리(task-agnostic environment preprocessing)로 정식화한다. 연구 시스템 S는 환경 E와 에이전트 π를 입력받아 수정된 환경 E_studied를 출력하는 함수 S: Π × ℰ → ℰ이며, 목표는 S* = argmax_S E_{E~p}[R_{π_solver}(S(π_solver, E), D_E)]를 C_study(S, E) ≤ B_study 제약 아래 최대화하는 것이다. 여기서 비용은 API 달러로 측정한 연구 예산이고, R은 고정된 솔버 π_solver가 환경 E'에서 태스크 분포 D_E에 대해 얻는 평균 보상이다. 핵심 정의는 태스크 비의존성이다. S는 실제 다운스트림 태스크 인스턴스나 그 분포에서 파생된 신호, 즉 궤적·라벨·검증기 출력·평가 피드백을 받지 않는다. 대신 환경과 상호작용하고 그 상호작용 기록(합성 연습 포함)을 활용할 수 있다. 산출물은 솔버가 샌드박스 안에서 접근 가능한 파일 형태라면 무엇이든 허용되며, 인덱스, 지식베이스, 스크립트, 실행 가능한 도구, 또는 하네스 쪽에 전달되는 프롬프트 기반 지침·스킬·플레이북이 될 수 있다. E_studied는 원본 환경의 아티팩트를 모두 보존한 채 추가 자원만 얹는다. 솔버의 가중치와 하네스는 고정되어 있고, 환경은 Harbor 프레임워크와 호환되는 격리된 Docker 샌드박스, 하네스는 Claude Code로 구현된다.

무엇과 다른가

비교 대상은 고정 전략 두 개와 개방형 메타 에이전트 두 개, 그리고 아무 준비도 하지 않는 No Study 기준선이다. PREPING은 환경에 접지된 합성 연습을 사이클로 돌린다. Proposer가 사용 가능한 도구를 바탕으로 태스크 묶음을 만들고, 연습용 Solver가 대상 하네스에서 시도하고, Validator가 실행 불가능한 궤적을 걸러낸다. 그다음 reflector와 curator가 성공과 실패에서 교훈을 뽑아 전략, 함정, 인터페이스 노트, 재사용 코드를 담은 절차적 플레이북으로 증류한다. 테스트 시에는 플레이북 항목 일부를 검색해 태스크 지시문 앞에 붙인다. 역할·호출 순서·출력 형식은 고정되어 있다. Corpus2Skill은 문서 코퍼스를 탐색 가능한 스킬 디렉터리로 재구성한다. 문서를 요약·임베딩하고, 라벨이 붙은 계층으로 클러스터링하고, 토픽을 원본 문서로 매핑하는 인덱스를 만든다. 에이전트적이지 않은 고정 파이프라인이며, 테스트 시 다운스트림 에이전트는 탐색 지침과 생성된 계층적 파일시스템을 받는다. 반면 Meta-Agent w/o Archive는 안내 없이 스스로 환경을 탐색하고 연구 절차를 고르고 유용하다고 판단한 파일 기반 아티팩트를 만든다. Meta-Agent w/ Archive는 여기에 더해 실행 가능한 스크립트와 설명으로 구성된 시드 아카이브를 샌드박스 파일시스템에 마운트받는다. 이 아카이브에는 PREPING과 Corpus2Skill을 구현한 스킬, 그리고 Meta-Agent w/o Archive와 유사한 일반 탐색 워크플로가 들어 있으며, 에이전트는 셸 도구로 이들을 호출하거나 조합하거나 무시할 수 있다.

어떻게 쓰나

실험은 성격이 다른 6개 에이전트 벤치마크, 총 36개 고유 환경에서 이뤄졌다. BCP-Grep(BCP-G)은 BrowseComp-Plus를 변형해 830개 질문과 고정된 100,195개 문서 코퍼스를 쓰되, 원래의 BM25 검색기 대신 각 문서를 셸 검색용 파일로 노출한다. OfficeQA와 Harvey LAB도 문서 컬렉션을 노출하며, Harvey LAB은 가상 회사의 문서관리 시스템을 공유하는 250개 firm-knowledge 태스크만 사용한다. DABStep은 태스크 데이터, 정답이 담긴 참조, 파이썬 처리 프로토콜 지침을 결합한 7개 파일을 제공한다. APEX-Agents는 452개 태스크를 31개 월드(투자은행 8, 법률 12, 경영컨설팅 11)로 나누고, 각 월드를 별도 환경으로 취급해 독립적으로 연구한다. AppWorld는 다중 애플리케이션 도구 인터페이스를 노출한다. 고정 솔버는 Claude Code 하네스에 Claude Haiku 4.5를 temperature 1.0으로 붙인 에이전트다. 연구 단계 모델로는 Meta-Agent 연구와 PREPING의 제안·검증·성찰·큐레이션에 Claude Opus 4.8, Corpus2Skill의 클러스터 요약·라벨링·재분할·엔티티 추출에 Claude Sonnet 4.6을 쓴다. PREPING은 원래 10사이클×10태스크 대신 5사이클×10태스크, 즉 환경당 50개 연습 태스크로 줄여 돌렸다. 각 연구 시스템은 환경당 3회(N_study=3) 독립 실행되어 3개 아티팩트 세트를 만들고, 각 세트마다 다운스트림 평가를 3회 반복한다. No Study는 아티팩트 세트 차원이 없어 10회 반복하며, K=3일 때 Avg@3과 Best@3은 10개 중 3개를 고르는 120개 부분집합에 대해 계산된다.

전제와 한계

결과의 핵심은 개방형 메타 에이전트가 환경 전반에서 가장 강한 방법군이라는 것이다. 메타 에이전트 변형이 6개 벤치마크 중 5개에서 최고 Avg@3와 Best@3를 기록했고, Meta-Agent w/ Archive는 두 지표 모두에서 모든 벤치마크에서 1위 또는 2위에 올랐다. 고정 전략 중 PREPING은 6개 벤치마크 모두에서 두 지표 모두 No Study를 넘었지만 한 번도 1위는 아니었다. Corpus2Skill은 특화가 뚜렷해서 BCP-G에서는 가장 강했지만 OfficeQA, Harvey LAB, DABStep에서는 No Study 아래로 떨어졌다. 아카이브 접근의 효과는 긍정적이지만 균일하지 않다. Avg@3 기준으로 아카이브가 도움이 된 4개 벤치마크에서 평균 0.046 개선, 해가 된 2개에서 평균 0.021 하락이었고, 최대 이득은 DABStep의 0.129, 최대 하락은 0.023이었다. Best@3도 같은 비대칭으로 도움이 된 곳 평균 +0.041, 해가 된 곳 평균 -0.017이었다. 즉 아카이브는 전반적인 일괄 향상이 아니라 가끔 큰 개선을 만들되 그에 상응하는 큰 퇴행은 만들지 않는 방식으로 작동한다.

연구 예산을 늘리는 것이 다운스트림 성능을 안정적으로 높여 주지는 않는다. OfficeQA, Harvey LAB, Apex Agents에서 PREPING과 두 메타 에이전트를 대상으로 예산을 1달러에서 50달러까지 늘려 본 결과, OfficeQA와 Apex Agents에서는 어떤 방법도 지속적인 상승을 보이지 않았고 곡선은 평평하거나 비단조였으며 대부분 구간이 겹쳤다. 예외는 Harvey LAB으로, Meta-Agent w/o Archive가 0.271에서 0.348로, w/ Archive가 0.249에서 0.332로 올랐고 PREPING은 5달러 이후 거의 평평했다. 반면 연구는 테스트 타임 샘플링을 줄이는 데 뚜렷한 효과가 있다. 연구 아티팩트를 가진 에이전트의 Best@1(태스크당 1회 롤아웃, 오라클 선택 불필요) 점수를 넘기 위해 No Study가 필요한 롤아웃 수는 BCP-G 8회, OfficeQA 2회, Harvey LAB 3회, DABStep 5회, Apex Agents 2회, AppWorld 4회였다. No Study의 Best@K는 이 출력들 중 오라클 선택을 가정하므로 이 교차점은 No Study에 유리한 낙관적 수치인데도, 롤아웃당 평균 추론 비용을 적용하면 No Study가 해당 지점에 도달하는 데 연구된 롤아웃보다 1.6배에서 5.5배 많은 태스크 타임 추론 비용이 든다. 다만 이 비교는 사전 연구 비용을 제외하므로, 연구가 총비용을 절약하려면 아티팩트가 충분히 많은 다운스트림 태스크에 재사용되어 그 비용을 상각해야 한다.

해석 실험은 연구가 어떻게 이뤄지고 언제 도움이 되거나 해가 되는지 들여다본다. 탐색을 넓게 하는 것이 좋은 아티팩트로 이어진다는 가설은 지지되지 않는다. OfficeQA에서 Corpus2Skill은 697개 파일을 전부 처리했지만 더 적게 살펴본 방법들보다 뒤처졌다. Harvey LAB에서는 두 메타 에이전트가 이 벤치마크의 유일한 전용 도구인 labread를 발견해 0.35~0.38을 기록한 반면, 이 도구를 호출하지 않은 방법들은 0.22~0.31에 머물렀다. 연구 행동 자체는 환경별로 갈린다. 인벤토리 작성, 사용 불가 자원 추적, 예산을 의식한 추출은 여러 환경에서 공통으로 나타났고, 테스트 예상 행동은 Apex Agents와 AppWorld에 집중됐으며, 병렬 위임은 Harvey LAB과 Apex Agents에서만 관찰됐다. 아카이브 활용도 환경에 민감하다. BCP-G, OfficeQA, DABStep의 모든 아티팩트 세트에는 개방형 연구와 PREPING 산출물이 함께 등장했지만, AppWorld의 모든 세트와 Apex Agents의 93개 중 86개 세트에는 Corpus2Skill이 들어갔다. 그런데 BCP-G에서는 메타 에이전트가 단독으로 가장 강한 방법인 Corpus2Skill을 오히려 생략했다. 이득은 특정 태스크 계층에 몰린다. DABStep에서 Meta-Agent w/ Archive는 어려운 태스크에서 0.185를 개선했지만 쉬운 태스크에서는 0.015만 개선했는데, 쉬운 태스크는 No Study가 이미 0.792를 기록하고 있었다. BCP-G에서 Corpus2Skill은 10개 토픽 모두를 개선했고, 개선폭은 gold 문서가 1개일 때 0.224에서 4개 이상일 때 0.293으로 커졌다. 아티팩트가 솔버를 적극적으로 오도할 수도 있다. DABStep에서는 아티팩트가 사기 경계에 관한 빠진 정보를 채워 솔버가 올바르게 활용한 반면, Apex Agents에서는 불완전한 아티팩트가 솔버를 일반 가격 문서 쪽으로 유도하고 필요한 입력이 담긴 태스크 전용 파일 두 개에서 멀어지게 만들었다.

저자들이 밝힌 한계는 분명하다. 24개 방법-벤치마크 비교 중 21개가 No Study보다 개선되었지만, 동적으로 연구 방식을 고르는 것이 견고할 뿐 보편적으로 최적은 아니다. 예산 스케일링은 Harvey LAB에서, 그것도 메타 에이전트에서만 나타났는데, PREPING의 경우 원 논문이 AppWorld에서 합성 태스크를 늘릴수록 꾸준히 개선된다고 보고한 것과 다르다. 예산이 프롬프트에 명시되더라도 효과적 스케일링은 소비량 추적과 예산에 따른 계획 변경을 요구하는데 현재 모델은 둘 다 어려워할 수 있어, 예산을 늘려도 질적으로 다른 전략이 아니라 같은 전략이 길어질 뿐일 수 있다. 또한 연구자와 솔버가 같은 모델 패밀리, 같은 Claude Code 하네스를 쓰기 때문에 아티팩트가 다른 솔버로 전이되는지, 솔버 독립적 개선인지는 확인하지 못했다. 워크플로 아카이브도 하나만 평가했고, 같은 아카이브에서 환경 설명만 보고 고정 워크플로 하나를 고르는 비에이전트적 분류기와 비교하지 않아 에이전트적 의사결정과 워크플로 조합의 가치를 분리하지 못한다. 6개 벤치마크로는 에이전트 환경이 달라지는 모든 축을 커버할 수 없다. 비용을 달러로 재는 것은 서로 다른 모델을 쓰는 전략들을 비교하는 공통 화폐이긴 하지만 이질적인 연산을 제공자 의존적 프록시 하나로 접는 것이며, FLOPs 같은 모델 독립적 지표가 더 낫겠지만 폐쇄형 모델에서는 일관되게 얻기 어렵다. 마지막으로 저자들은 책임 있는 사용과 관련해 탐색 부작용, 민감 정보가 남은 아티팩트, 오해를 유발하는 지침, 아카이브 오용이라는 네 가지 위험을 명시하고 샌드박스·최소 권한·승인 게이트·출처 표시와 사람 검토를 권고한다.

관련 논문