lemonade

Local AI RunnersCLIC++

★ 5,700주당 +49조회 4

무엇인가

Lemonade는 사용자 PC에서 모델을 실행하고 그 결과를 HTTP API로 내보내는 로컬 추론 서버다. 클라우드 LLM API가 차지하던 자리를 같은 프로토콜로 대체하는 계층에 속한다. 배포 형태는 두 가지다. 서비스로 설치되어 여러 앱이 접속하는 Lemonade Server와, 자체 애플리케이션에 넣는 이식 바이너리 Embeddable Lemonade다.

어떻게 동작하나

서버 프로세스가 모델 관리자와 백엔드 선택기, 추론 엔진을 묶는다. 모델은 `lemonade pull`이나 내장 Model Manager로 내려받아 로컬에 저장하고, GGUF·FLM·ONNX 포맷과 whisper·stable diffusion 계열을 함께 다룬다. 커스텀 GGUF/ONNX는 Hugging Face나 ModelScope에서 가져오며 출처를 보관해 이후 업데이트에 쓴다. 실행 시 하드웨어에 맞는 엔진이 선택된다. llamacpp는 metal·cuda·vulkan·rocm·cpu, flm과 ryzenai-llm은 XDNA2 NPU, vllm과 ds4는 Strix Halo iGPU, whispercpp·moonshine은 음성 인식, kokoro는 TTS, sd-cpp는 이미지 생성, trellis는 3D 생성을 맡는다. 모델 별칭으로 환경 독립적 이름과 active-standby 페일오버를 구성하고, Cloud Offload로 OpenAI 호환 클라우드 제공자에 요청을 돌릴 수 있다.

무엇과 다른가

클라우드 API와의 차이는 실행 위치다. 같은 OpenAI·Anthropic·Ollama 엔드포인트를 노출하지만 토큰이 외부로 나가지 않고 과금도 발생하지 않는다. 단일 엔진 실행기와의 차이는 백엔드 계층이 분리돼 있다는 점이다. llama.cpp 계열뿐 아니라 NPU용 FLM·RyzenAI-LLM, ROCm용 vLLM, 이미지·음성 엔진을 같은 서버 아래 두고 모달리티별로 라우팅한다. Embeddable 빌드는 서버 설치 없이 애플리케이션에 바이너리로 포함되어 사용자 PC 성능에 맞춰 백엔드를 자동 선택한다.

어떻게 쓰나

설치는 Windows·Linux·macOS·Docker·소스 빌드 경로를 제공한다. 설치 후 `lemonade pull`로 모델을 받고 CLI에서 바로 대화하거나 코딩에 쓴다. 내장 인터페이스로 채팅·이미지 생성·음성 생성을 시험할 수 있고, iOS·Android 클라이언트로 같은 서버에 붙는다. 외부 앱은 OpenAI·Anthropic·Ollama 호환 엔드포인트를 지정하는 방식으로 연결한다.

전제와 한계

백엔드마다 OS와 하드웨어 제약이 다르다. NPU 경로는 XDNA2 NPU를 요구하고 ryzenai-llm은 Windows 전용이다. vllm과 ds4는 Linux에서 gfx1151 Strix Halo iGPU만, CUDA 백엔드는 Turing 이상 NVIDIA GPU만 지원한다. metal은 macOS, vulkan은 x86_64 CPU와 AMD iGPU/dGPU 및 Linux ARM64를 대상으로 한다. 실험 단계로 표시된 엔진이 여럿 있다: llamacpp-hrx, vllm, ds4, openmoss, thinksound, acestep, thenoise, trellis. Cloud Offload도 실험 기능이다. 모델 다운로드에는 네트워크와 로컬 저장 공간이 필요하다.

관련 논문 2

유사 도구