Rapid-MLX
무엇인가
Rapid-MLX는 Apple Silicon Mac에서 로컬 모델을 실행하고 그 앞에 OpenAI·Anthropic 호환 HTTP 엔드포인트를 세우는 추론 엔진이다. 로컬 러너와 API 게이트웨이가 한 프로세스에 합쳐진 구조로, 에이전트·IDE·스크립트가 원격 API 대신 이 엔드포인트를 바라보게 만드는 자리에 놓인다.
어떻게 동작하나
`rapid-mlx serve`가 `http://localhost:8000`에 서버를 바인딩한다. OpenAI 규격 클라이언트는 `/v1`, Claude Code와 Anthropic SDK는 같은 호스트의 `/v1/messages`를 쓴다. 가중치는 로컬에 캐시되고 첫 실행 시 약 3GB를 진행률 표시와 함께 내려받는다. 프롬프트 캐시, 17개 도구 호출 파서, 추론 분리(reasoning separation), 클라우드 라우팅이 엔진에 포함된다. 이미지는 OpenAI 호환 Images API로 생성하며 동시 실행 없이 한 번에 하나만 처리한다. 비디오는 Wan 2.1/2.2, CogVideoX-Fun, LTX-2.3 백엔드와 8개 체크포인트를 등록해 두었다.
무엇과 다른가
Ollama와 같은 로컬 러너 계열이지만 측정 기준 처리량이 최대 3배, 캐시 적중 시 TTFT 0.08초다. 클라이언트가 OpenAI 또는 Anthropic 엔드포인트를 받아들이면 어댑터 없이 그대로 연결된다. Claude Code, Cursor, Aider를 포함한 Tier-1 에이전트 5종을 실제 가중치로 릴리스 전에 종단 테스트한다.
어떻게 쓰나
`rapid-mlx` CLI 하나로 설치된다. 인자 없이 실행하면 `qwen3.5-4b-4bit`로 REPL이 열리고 `/help`, `/exit` 슬래시 명령을 쓴다. `rapid-mlx launch claude-code`는 `~/.claude/settings.json`을 패치해 로컬 서버를 가리키게 한다. `rapid-mlx launch list`가 이 머신에서 감지된 클라이언트를 보여주고, `cline`·`continue-dev`도 같은 방식으로 지정한다. 더 큰 모델은 `rapid-mlx recipe`와 모델 선택기로 받는다.
전제와 한계
데스크톱 앱과 CLI 모두 macOS Apple Silicon 전용이며 Windows·Linux 데스크톱 빌드는 없다. 기본 설치 약 460MB는 텍스트 전용이고 비전·오디오·비디오·임베딩·DFlash 추측 디코딩은 선택 extras다. 비디오 런타임은 Python 3.11 이상을 요구하고, 코어 텍스트·오디오는 3.10에서도 동작한다. Cursor는 BYOK 요청을 자체 서버로 보내므로 localhost 엔드포인트에 닿지 못한다. 공개 HTTPS 터널로 노출할 때는 `RAPID_MLX_API_KEY`를 설정해야 하며 이 경우 완전한 로컬 연결이 아니다. 모델 가중치는 자체 라이선스를 따르므로 상업적 배포 전 업스트림 모델 카드를 확인해야 한다.
관련 논문 2
유사 도구
- vllm-mlxApple Silicon에서 MLX로 LLM을 구동하며 OpenAI와 Anthropic API를 한 프로세스에서 제공하는 추론 서버다. continuous batching과 paged KV 캐시를 갖췄다.
- mlx-serveApple Silicon에서 MLX와 GGUF 모델을 실행하는 Zig 네이티브 추론 서버다. OpenAI·Anthropic·Ollama API를 한 포트에서 동시에 제공한다.
- claude-code-localApple Silicon에서 MLX로 로컬 모델을 돌려 Claude Code에 연결하는 Anthropic API 네이티브 서버다. 번역 프록시 없이 한 프로세스로 동작한다.
- MTPLXApple Silicon에서 모델 자체의 MTP 헤드로 Qwen 3.8을 가속 실행하는 Mac 앱·CLI다. OpenAI·Anthropic 호환 서버를 로컬에 띄운다.
- Atomic-Chat오픈웨이트 LLM을 로컬에서 실행하고 OpenAI 호환 서버로 노출하는 데스크톱 앱이다. llama.cpp와 MLX 엔진을 앱 안에서 전환한다.
- LLM-API-Key-ProxyOpenAI·Anthropic 호환 엔드포인트를 하나 띄워 여러 LLM 제공자를 provider/model 형식으로 중계하는 자체 호스팅 FastAPI 프록시다.