prometheus-eval

LLM FrameworksCLIPython

★ 1,115주당 +1조회 4

무엇인가

prometheus-eval은 다른 언어 모델의 응답을 채점하는 평가자 언어 모델(Prometheus)을 실행하기 위한 Python 패키지다. 모델 학습·평가·추론을 한 저장소에서 함께 다루는 평가 도구 모음에 속한다. 평가 파이프라인에서 폐쇄형 모델 심판이 차지하던 자리를 오픈소스 모델로 대체하는 것이 목적이다.

어떻게 동작하나

채점은 두 가지 모드로 나뉜다. absolute_grade는 지시문·응답·점수 루브릭을 받아 1~5점을 출력한다. relative_grade는 같은 지시문에 대한 두 응답을 비교해 A 또는 B를 출력한다. 프롬프트에는 지시문, 응답, 점수 루브릭을 채우고 참조 답변을 선택적으로 덧붙인다. 추론은 vLLM으로 로컬에서 돌리거나 LiteLLM을 통해 LLM API로 보낸다. 모델 가중치는 Hugging Face Hub에서 내려받는다.

무엇과 다른가

폐쇄형 모델 심판과 달리 평가에 외부 API를 요구하지 않는다. GPT 버전이 바뀌어 점수 기준이 흔들리거나 프롬프트와 데이터가 외부로 나가는 일이 없다. GPU를 이미 보유했다면 평가 비용이 추가로 들지 않는다. Prometheus 2부터는 직접 평가와 쌍대 랭킹을 같은 모델로 모두 처리한다.

어떻게 쓰나

pip로 패키지를 설치하고, 로컬 추론이면 vLLM을 함께 설치한다. API 경로를 쓰려면 LiteLLM이 지원하는 프로바이더 자격 증명을 설정한다. 여러 응답을 채점할 때는 single_absolute_grade나 single_relative_grade 대신 absolute_grade와 relative_grade를 쓴다. 저장소에는 평가 데이터셋과 학습·파인튜닝 스크립트도 함께 들어 있으며, 학습 코드는 Hugging Face의 Alignment Handbook에서 출발했다.

전제와 한계

패키지는 베타 단계다. 로컬 추론에는 vLLM이 필요하고 Prometheus 2 7B는 16GB VRAM을 요구한다. API 경로는 LiteLLM이 지원하는 프로바이더로 제한된다. 직접 평가 점수는 1~5 스케일, 상대 평가 결과는 A/B 두 값으로 고정된다.

관련 논문 1

유사 도구