ClawProBench
무엇인가
ClawProBench는 LLM 에이전트 평가 하네스 계열에 속한다. 모델의 최종 답변만 채점하는 정적 벤치마크 대신 OpenClaw 런타임에서 일어나는 실제 실행을 측정 대상으로 삼는다. 저장소의 주 언어는 Rust이고, 실행 진입점은 python3 run.py다.
어떻게 동작하나
시나리오 단위로 과제를 정의하고, 각 시나리오를 OpenClaw 런타임에서 실행한 뒤 결정적 채점기로 통과 여부를 판정한다. 실행 추적을 함께 수집해 trace-aware 평가를 수행하고, 결과는 구조화된 리포트로 출력한다. 시나리오 묶음은 프로필로 나뉘며 기본 랭킹 경로는 core다. intelligence, coverage, native, full 프로필이 더 넓은 활성 범위를 담당한다. 현재 활성 시나리오는 102개, 카탈로그 전체는 164개이고 그중 62개가 incubating 상태다. 인벤토리는 python3 run.py inventory --json으로 확인한다. 점수 지표 FinalScore는 pass^3, pass@3, average_score를 조합해 계산한다.
무엇과 다른가
정적 벤치마크는 한 번의 실행 결과만 기록한다. ClawProBench는 같은 시나리오를 반복 시행해 pass^3 같은 재현성 지표를 산출한다. 런타임 커버리지와 동결된 workplace-style 홀드아웃을 함께 다룬다. 공개 데이터셋만으로는 벤더의 벤치마크 최적화를 막을 수 없어 별도의 closed-dataset 리더보드를 운영한다. 교차 하네스 평가를 위해 IronClaw와 NanoClaw 하네스 소스를 저장소에 vendoring한다.
어떻게 쓰나
저장소를 받은 뒤 python3 run.py inventory --json으로 시나리오 목록을 확인한다. python3 run.py inventory --benchmark-status all --json은 incubating을 포함한 전체 카탈로그 상태를 보여준다. 프로필을 지정해 평가 범위를 정하고 결과를 구조화 리포트로 제출한다. 리더보드와 벤치마크 케이스는 suyoumo.github.io/bench에서 열람한다. 데이터셋은 Hugging Face의 xyh110sym/clawprobench에 공개되어 있다. 결과 제출과 리더보드 관련 연락은 [email protected]으로 받는다.
전제와 한계
평가는 OpenClaw 런타임 안에서 실제로 실행되므로 해당 런타임과 대상 모델의 접근 권한이 전제다. 라이브 실행은 모델 호출 비용을 발생시킨다. 카탈로그 164개 중 62개는 incubating이라 활성 평가 대상이 아니다. 기본 랭킹은 core 프로필 기준이며 나머지 프로필은 별도로 선택한다. closed-dataset 결과는 공개 데이터셋과 분리해 공개한다. README에는 설치 명령이 없다.
관련 논문 4
유사 도구
- giskard-ossLLM 에이전트의 평가와 레드팀 스캔을 한 저장소에서 다루는 Python 라이브러리다. v3는 의존성을 쪼갠 모듈 패키지와 비동기 다중 턴 시나리오를 기반으로 한다.
- opikLLM 호출과 에이전트 실행을 추적·평가·모니터링하는 오픈소스 관측성 플랫폼이다. 서버와 웹 앱까지 Apache-2.0으로 자체 호스팅한다.
- RagaAI-CatalystLLM과 에이전트 실행을 트레이싱하고 평가·가드레일·레드팀까지 한 SDK에서 처리하는 Python 관측 프레임워크다.
- evalscopeLLM·VLM·임베딩·AIGC 모델의 벤치마크 평가와 추론 성능 스트레스 테스트를 명령 하나로 실행하고 웹 대시보드로 시각화하는 Python 프레임워크다.
- tensorzeroLLM 게이트웨이·관측성·평가·최적화·실험을 하나의 자체 호스팅 서버로 묶은 Rust 기반 LLMOps 플랫폼이다.
- jcodeRust로 작성된 터미널 코딩 에이전트 하네스다. 세션당 메모리 사용량을 수십 MB로 줄이고, 턴마다 임베딩으로 기억 그래프를 검색한다.