브라우저에서 소형 LLM을 Q4로 돌려 속도·정확도를 재는 MicroLLM Lab

Hacker News12일 전조회 5

MicroLLM Lab은 브라우저 안에서만 동작하는 소형 언어모델 벤치마크 도구다. 별도 설치 없이 WebGPU 엔진을 초기화하고 모델 카탈로그를 불러온 뒤, 원하는 모델을 골라 추론을 돌리고 그 결과를 숫자로 확인할 수 있다. 서버로 데이터를 보내지 않고 측정이 끝난다는 점이 이 도구의 기본 전제다.

모델은 4비트 양자화(Q4) 형태로 내려받아 브라우저의 IndexedDB 캐시에 저장된다. 한 번 받아둔 모델은 다음 방문 때 다시 내려받지 않고 그대로 재사용된다. 카탈로그에는 1억3500만 파라미터급을 포함한 여러 초소형 모델이 올라 있고, 사용자가 원하는 조합을 직접 선택해 실행하는 방식이다.

측정 항목은 두 갈래다. 하나는 256개 토큰을 연속 생성하면서 재는 지속 디코딩 속도(초당 토큰 수)이고, 다른 하나는 정규식과 정확 토큰 일치로 채점하는 객관 테스트의 통과율이다. 문장이 얼마나 잘 쓰였는지는 평가하지 않는다. 생성 품질이 아니라 정해진 답을 맞히는지를 본다는 뜻이다.

벤치마크 자체를 사용자가 JavaScript로 작성할 수도 있다. 편집기에 넣은 코드는 해당 페이지의 오리진에서 eval()로 실행되고, 그 안의 각 검사가 모델 출력에 대해 돌아간다. 즉 모델과 채점 기준을 함께 실험할 수 있는 구조다.

결과는 기기 밖으로 나가지 않는다. 화면에 뜨는 차트는 모델별로 가장 최근에 실행한 스위트 결과를 사용한다. 여기에 더해 기기 하드웨어 정보와 피크·지속 토큰/초를 담은 검증용 성능 인증서를 생성해 PNG 이미지로 내려받고 공유할 수 있는 기능도 제공한다.

배경에는 브라우저에서 직접 모델을 돌리려는 흐름이 있다. WebGPU가 브라우저에서 GPU 연산을 열어주면서, 클라우드 API를 거치지 않고 사용자 기기에서 추론하는 선택지가 현실적인 범위에 들어왔다. 모델 크기를 줄이고 양자화하는 기법이 함께 발전하면서, 수억 파라미터 이하의 모델은 노트북이나 모바일에서도 시도해볼 만한 수준이 됐다. MicroLLM Lab은 그 지점에서 "내 기기에서 실제로 얼마나 빠른가"를 재는 데 초점을 맞춘다.

개발자 입장에서 이 도구가 주는 것은 추상적인 벤치마크 표가 아니라 자기 하드웨어의 실측치다. 같은 모델이라도 GPU와 브라우저 조합에 따라 체감 속도가 크게 갈리기 때문에, 배포 대상을 정하기 전에 직접 재보는 편이 낫다. 브라우저에서 소형 모델을 돌리는 기능을 기획하고 있다면 속도 하한선을 가늠하는 출발점으로 쓸 수 있다.

다만 전제를 분명히 해둘 필요가 있다. 이 도구는 작성 품질을 평가하지 않으며, 1억3500만 파라미터급 모델이 테스트에서 실패하는 것은 오히려 정상적인 측정 결과로 취급된다. 모델의 유용성을 판정하는 지표가 아니라, 주어진 객관 과제를 얼마나 맞히고 얼마나 빠르게 생성하는지를 기록하는 도구라는 뜻이다. 또한 사용자가 작성한 벤치마크 코드가 페이지 오리진에서 eval()로 실행되는 구조이므로, 신뢰할 수 있는 코드만 넣어야 한다.