llmfit
무엇인가
llmfit은 로컬 LLM 실행 가능성을 판정하는 절차를 에이전트에 주입하는 도구다. 모델 파라미터 수·컨텍스트 길이·양자화 형식과 CPU 코어·시스템 RAM·GPU VRAM·통합 메모리 구성을 대조해 메모리 발자국과 초당 토큰 수를 추정하고, 적합도·속도·품질·컨텍스트 네 축으로 점수를 매긴다. 에이전트가 "이 모델이 이 장비에서 돌아가는가"를 감으로 답하지 않도록 판정 근거를 실행 시점에 생성한다.
어떻게 동작하나
규칙 파일 형태가 아니라 설치형 실행 파일이다. SKILL.md·CLAUDE.md·AGENTS.md 같은 규칙 파일에는 llmfit 호출 절차와 출력 해석 규칙을 적고, 실제 판정은 바이너리가 수행한다. 인자 없이 실행하면 대화형 TUI가 뜨고, `llmfit recommend`는 하드웨어 텔레메트리와 추천 모델을 표준 출력으로, `--json`은 시스템 프로필과 추천을 원시 JSON으로 낸다. REST 엔드포인트 `/api/v1/system`, `/api/v1/models`를 노출해 오케스트레이터·대시보드·배포 파이프라인이 HTTP JSON으로 소비할 수 있다. TUI에서 `b`는 커뮤니티 벤치마크, `I`는 실측 추론 벤치마크를 열고, `/`는 이름·계열·양자화로 목록을 필터링한다.
무엇과 다른가
프롬프트에 "VRAM 8GB면 7B Q4" 같은 정적 규칙을 적어 두는 방식과 다르다. llmfit은 실행 시점에 CPU 코어·RAM·GPU·VRAM·통합 메모리 구조를 탐지하고 NVIDIA CUDA·Apple Silicon·AMD ROCm·Intel OneAPI를 구분한다. 모델 목록도 고정이 아니라 GGUF·AWQ·GPTQ·EXL2 양자화별로 메모리 발자국과 속도를 다시 계산하며, MoE 아키텍처와 다중 GPU 구성을 반영한다. 벤치마크를 제출하면 동일 하드웨어 사용자의 추정치가 실측값으로 대체된다.
어떻게 쓰나
설치 후 첫 사용은 인자 없이 `llmfit`을 호출해 TUI를 띄우는 것이다. 상단에 탐지된 사양이, 아래에 적합도·속도·품질·컨텍스트 점수순으로 모델이 나온다. 에이전트에 붙일 때는 규칙 파일에 `llmfit recommend --json`을 실행해 JSON을 읽고 그 결과로 모델과 양자화를 고르라는 절차를 명시한다. 로컬 런타임 제공자로 Ollama·llama.cpp·MLX·Docker Model Runner·LM Studio를 다룬다. 컨테이너에서는 `ghcr.io/alexsjones/llmfit` 이미지를 쓰고 대화형은 `--tui`, 비대화형은 `recommend`를 인자로 넘긴다.
전제와 한계
macOS(Apple Silicon·Intel), Linux(x86_64·ARM64), Windows(x86_64)에서 동작한다. 속도 수치는 추정이며 실측값은 모델을 내려받아 서빙하고 벤치마크를 돌려야 얻어진다. Windows 바이너리는 해당 릴리스의 서명 작업이 성공한 경우에만 서명되므로 서명이 필요하면 실행 파일 서명을 직접 확인해야 한다. 지원 양자화 형식은 GGUF·AWQ·GPTQ·EXL2로 한정되고, GPU 가속 감지 범위는 CUDA·ROCm·OneAPI·Apple Silicon이다.