prometheus-eval
무엇인가
prometheus-eval은 다른 언어 모델의 응답을 채점하는 평가자 언어 모델(Prometheus)을 실행하기 위한 Python 패키지다. 모델 학습·평가·추론을 한 저장소에서 함께 다루는 평가 도구 모음에 속한다. 평가 파이프라인에서 폐쇄형 모델 심판이 차지하던 자리를 오픈소스 모델로 대체하는 것이 목적이다.
어떻게 동작하나
채점은 두 가지 모드로 나뉜다. absolute_grade는 지시문·응답·점수 루브릭을 받아 1~5점을 출력한다. relative_grade는 같은 지시문에 대한 두 응답을 비교해 A 또는 B를 출력한다. 프롬프트에는 지시문, 응답, 점수 루브릭을 채우고 참조 답변을 선택적으로 덧붙인다. 추론은 vLLM으로 로컬에서 돌리거나 LiteLLM을 통해 LLM API로 보낸다. 모델 가중치는 Hugging Face Hub에서 내려받는다.
무엇과 다른가
폐쇄형 모델 심판과 달리 평가에 외부 API를 요구하지 않는다. GPT 버전이 바뀌어 점수 기준이 흔들리거나 프롬프트와 데이터가 외부로 나가는 일이 없다. GPU를 이미 보유했다면 평가 비용이 추가로 들지 않는다. Prometheus 2부터는 직접 평가와 쌍대 랭킹을 같은 모델로 모두 처리한다.
어떻게 쓰나
pip로 패키지를 설치하고, 로컬 추론이면 vLLM을 함께 설치한다. API 경로를 쓰려면 LiteLLM이 지원하는 프로바이더 자격 증명을 설정한다. 여러 응답을 채점할 때는 single_absolute_grade나 single_relative_grade 대신 absolute_grade와 relative_grade를 쓴다. 저장소에는 평가 데이터셋과 학습·파인튜닝 스크립트도 함께 들어 있으며, 학습 코드는 Hugging Face의 Alignment Handbook에서 출발했다.
전제와 한계
패키지는 베타 단계다. 로컬 추론에는 vLLM이 필요하고 Prometheus 2 7B는 16GB VRAM을 요구한다. API 경로는 LiteLLM이 지원하는 프로바이더로 제한된다. 직접 평가 점수는 1~5 스케일, 상대 평가 결과는 A/B 두 값으로 고정된다.
관련 논문 1
유사 도구
- OpenJudgeAI 애플리케이션의 출력 품질을 채점하는 Python 평가 프레임워크다. 50여 종의 즉시 사용 가능한 grader와 루브릭 자동 생성, RL 보상 신호 변환을 제공한다.
- evalscopeLLM·VLM·임베딩·AIGC 모델의 벤치마크 평가와 추론 성능 스트레스 테스트를 명령 하나로 실행하고 웹 대시보드로 시각화하는 Python 프레임워크다.
- giskard-ossLLM 에이전트의 평가와 레드팀 스캔을 한 저장소에서 다루는 Python 라이브러리다. v3는 의존성을 쪼갠 모듈 패키지와 비동기 다중 턴 시나리오를 기반으로 한다.
- litellm100개 이상 LLM 제공자를 OpenAI 포맷 단일 엔드포인트로 중계하는 오픈소스 AI 게이트웨이다. 가상 키·비용 추적·로드밸런싱을 프록시 계층에서 처리한다.
- LLM-API-Key-ProxyOpenAI·Anthropic 호환 엔드포인트를 하나 띄워 여러 LLM 제공자를 provider/model 형식으로 중계하는 자체 호스팅 FastAPI 프록시다.
- lotus데이터셋에 LLM 기반 map·filter·reduce 시맨틱 연산자를 적용해 대량 처리하는 Python 라이브러리다. 옵티마이저가 호출 배칭과 모델 캐스케이드로 비용을 줄인다.