ClawProBench

LLM FrameworksCLIRust

★ 823조회 4

무엇인가

ClawProBench는 LLM 에이전트 평가 하네스 계열에 속한다. 모델의 최종 답변만 채점하는 정적 벤치마크 대신 OpenClaw 런타임에서 일어나는 실제 실행을 측정 대상으로 삼는다. 저장소의 주 언어는 Rust이고, 실행 진입점은 python3 run.py다.

어떻게 동작하나

시나리오 단위로 과제를 정의하고, 각 시나리오를 OpenClaw 런타임에서 실행한 뒤 결정적 채점기로 통과 여부를 판정한다. 실행 추적을 함께 수집해 trace-aware 평가를 수행하고, 결과는 구조화된 리포트로 출력한다. 시나리오 묶음은 프로필로 나뉘며 기본 랭킹 경로는 core다. intelligence, coverage, native, full 프로필이 더 넓은 활성 범위를 담당한다. 현재 활성 시나리오는 102개, 카탈로그 전체는 164개이고 그중 62개가 incubating 상태다. 인벤토리는 python3 run.py inventory --json으로 확인한다. 점수 지표 FinalScore는 pass^3, pass@3, average_score를 조합해 계산한다.

무엇과 다른가

정적 벤치마크는 한 번의 실행 결과만 기록한다. ClawProBench는 같은 시나리오를 반복 시행해 pass^3 같은 재현성 지표를 산출한다. 런타임 커버리지와 동결된 workplace-style 홀드아웃을 함께 다룬다. 공개 데이터셋만으로는 벤더의 벤치마크 최적화를 막을 수 없어 별도의 closed-dataset 리더보드를 운영한다. 교차 하네스 평가를 위해 IronClaw와 NanoClaw 하네스 소스를 저장소에 vendoring한다.

어떻게 쓰나

저장소를 받은 뒤 python3 run.py inventory --json으로 시나리오 목록을 확인한다. python3 run.py inventory --benchmark-status all --json은 incubating을 포함한 전체 카탈로그 상태를 보여준다. 프로필을 지정해 평가 범위를 정하고 결과를 구조화 리포트로 제출한다. 리더보드와 벤치마크 케이스는 suyoumo.github.io/bench에서 열람한다. 데이터셋은 Hugging Face의 xyh110sym/clawprobench에 공개되어 있다. 결과 제출과 리더보드 관련 연락은 [email protected]으로 받는다.

전제와 한계

평가는 OpenClaw 런타임 안에서 실제로 실행되므로 해당 런타임과 대상 모델의 접근 권한이 전제다. 라이브 실행은 모델 호출 비용을 발생시킨다. 카탈로그 164개 중 62개는 incubating이라 활성 평가 대상이 아니다. 기본 랭킹은 core 프로필 기준이며 나머지 프로필은 별도로 선택한다. closed-dataset 결과는 공개 데이터셋과 분리해 공개한다. README에는 설치 명령이 없다.

관련 논문 4

유사 도구