예산별 최적 LLM, 매일 다시 계산되는 가성비 프런티어

Hacker News16일 전조회 12

LLM을 고를 때 "가장 똑똑한 모델"과 "가장 싼 모델"은 보통 다른 답이다. 그 사이에서 예산에 맞는 최적점을 매일 다시 계산해 보여주는 페이지가 공개됐다. Artificial Analysis의 무료 데이터 API를 GitHub Actions 크론으로 하루 한 번 가져와, 가격 대비 성능 지형을 갱신하는 방식이다.

핵심 지표는 두 개다. 하나는 100만 토큰당 블렌디드 비용으로, 입력과 출력을 3:1로 섞어 계산한다. 다른 하나는 Artificial Analysis의 Intelligence Index 점수다. 이 둘을 로그 스케일 축에 놓고 모델을 점으로 찍으면 "이 가격이면 이 정도 성능"이라는 분포가 한눈에 들어온다.

여기서 '가성비 프런티어(value frontier)'를 뽑는 규칙은 단순하다. 가격 오름차순으로 정렬한 뒤, 자기보다 싼 모든 모델보다 점수가 높은 모델만 남긴다. 가격이 같으면 점수가 높은 쪽, 점수가 같으면 더 싼 쪽이 살아남는다. 결과적으로 프런티어에 남는 것은 "이보다 싸게 이 점수를 낼 방법이 없는" 항목들이다.

반대 개념도 있다. 어떤 모델보다 싸면서 점수가 같거나 더 높은 모델이 존재하면, 그 모델은 '지배(dominated)'된 것으로 취급돼 선택지에서 밀려난다. 더 비싸면서 더 나은 것도 없는 모델을 고를 이유는 없다는 뜻이다.

실사용에 가까운 건 예산 구간별 조회표다. 쓸 수 있는 단가 구간을 찾으면 그 가격 안에서 살 수 있는 최고 점수 모델이 '픽'으로, 그다음으로 좋은 모델이 '러너업'으로 제시된다. 순위표를 처음부터 훑는 대신 예산을 기준으로 답을 얻는 구조다.

페이지는 하루 단위 변화도 함께 보여준다. 전날과 비교해 새로 들어온 모델, 빠진 모델, 점수가 다시 매겨지거나 가격이 바뀐 모델이 무엇인지 확인할 수 있다. 표의 열 제목을 누르면 정렬이 되고, 모델 이름을 누르면 Artificial Analysis의 해당 모델 페이지로 이동한다.

세부 옵션도 실무적이다. 'One row per model'을 켜면 같은 이름의 모델 중 가장 높은 점수를 낸 추론 강도 변형 하나만 남고(동점이면 더 싼 쪽), 끄면 low·medium·high·xhigh·max effort처럼 별도로 벤치마크된 모든 변형이 펼쳐진다. 'Min score'는 특정 지수 아래 모델을 차트와 프런티어 계산에서 아예 제외한다. 아주 싸고 아주 오래된 소형 모델이 기준선을 끌어내리는 것을 막기 위한 장치다.

배경에는 LLM 시장의 잦은 변동이 있다. 새 모델이 나오고 가격이 내려가며, 같은 모델도 추론 강도 설정에 따라 점수와 비용이 달라진다. 정적 벤치마크 순위표 하나로는 "내 예산에서 무엇을 써야 하나"라는 질문에 답하기 어렵다. 매일 갱신되는 프런티어는 그 질문에 대한 자동화된 답이다.

개발자 입장에서는 모델 라우팅과 폴백 전략을 세울 때 참고 자료가 된다. 비용 상한을 정해두고 그 안에서 최고 점수 모델을 고르거나, 반대로 목표 점수를 정하고 가장 싼 모델을 찾는 식이다. 다만 이 표는 순수 API 단가 기준이므로 실제 청구서와는 차이가 날 수 있다.

한계도 분명하다. 블렌디드 가격에는 캐시 입력 할인, 배치 가격, fast 모드가 반영되지 않는다. 또 점수는 고정값이 아니다. Artificial Analysis가 버전 간에 인덱스 기준을 다시 잡기 때문에, 이 페이지의 수치는 과거 스냅샷과 비교하면 안 되고 오직 이 페이지 안에서만 비교해야 한다.

관련 글