evalscope

LLM FrameworksCLIPython

★ 3,408주당 +32조회 4

무엇인가

EvalScope는 평가 하네스(harness) 계열 도구다. 벤치마크 데이터셋, 모델 어댑터, 채점 메트릭을 조합해 실행 단위를 만들고, 모델 능력 측정과 서빙 성능 측정을 같은 CLI 진입점에서 처리한다. MMLU, C-Eval, GSM8K 같은 벤치마크가 내장되어 있고, LLM뿐 아니라 VLM, Embedding, Reranker, AIGC 모델을 대상으로 한다.

어떻게 동작하나

실행 구조는 백엔드 통합으로 이루어진다. OpenCompass, VLMEvalKit, RAGEval을 백엔드로 호출해 벤치마크를 수행하고, 에이전트 벤치마크는 플러그 가능한 전략과 도구, Docker 샌드박스를 가진 멀티턴 AgentLoop 안에서 구동한다. 샘플별 Agent Trace가 기록되어 시각화된다. 성능 측정 모듈은 TTFT, TPOT 같은 지표를 수집하고, 결과는 웹 대시보드에서 모델 비교·리포트 개요·예측 상세로 나뉘어 표시된다.

무엇과 다른가

개별 벤치마크 하네스를 각각 설치해 따로 실행하던 방식과 다르다. OpenCompass, VLMEvalKit, RAGEval을 흡수해 하나의 CLI에서 호출하고, 평가와 추론 성능 스트레스 테스트를 같은 프레임워크에서 수행한다. Arena 모드의 Pairwise Battle로 여러 모델을 맞붙여 순위를 매기는 것도 같은 도구 안에서 처리한다.

어떻게 쓰나

사용은 CLI에서 벤치마크와 모델을 지정해 실행하는 방식이다. perf 모듈은 --data-source로 데이터 소스를 통일하고 요청 생성을 병렬화하며, --duration으로 실행 시간 예산을 건다. RAG 평가는 Pydantic 기반 설정으로 정의한다. 커스텀 데이터셋·모델·메트릭은 등록해 추가하고, 결과는 Web Dashboard에서 확인한다.

전제와 한계

Python으로 작성된 패키지이며, 에이전트 벤치마크는 Docker 샌드박스를 요구한다. SWE-bench_Pro는 인스턴스별 Docker 이미지를 DockerHub에서 직접 받는다. MCP 서버는 stdio, HTTP, SSE를 지원하고, Claude Code나 Codex 같은 외부 에이전트 CLI는 External Agent Bridge로 연결한다. RAG 평가 모듈은 MTEB 2.x와 RAGAS 0.4.x를 전제로 한다.

관련 논문 5

유사 도구