Atomic-Chat
무엇인가
Atomic Chat은 오픈웨이트 LLM을 사용자 컴퓨터에서 돌리는 데스크톱·모바일 애플리케이션이자 추론 엔진이다. 클라우드 LLM 제공자가 앉아 있던 자리에 로컬 프로세스를 대신 앉히는 도구다. 앱이 로드한 모델을 OpenAI 호환 엔드포인트로 노출한다. Tauri 기반이며 주 언어는 TypeScript다.
어떻게 동작하나
앱은 세 가지 추론 엔진을 내장한다. atomic-llama-cpp-turboquant는 TurboQuant KV 캐시(turbo3/turbo4)를 넣은 llama.cpp 포크다. 업스트림 llama.cpp는 ggml-org 공식 빌드로 Windows·Linux의 기본 엔진이다. MLX-VLM은 Apple Silicon 네이티브 엔진으로 비전-언어 모델을 Neural Engine과 통합 메모리에서 실행한다. 세 엔진 모두 http://localhost:1337/v1 하나의 OpenAI 호환 API로 노출된다. 기본 바인딩은 127.0.0.1이고 host를 0.0.0.0으로 두면 LAN에 열린다. 추측 디코딩은 드래프트 모델이 앞서 예측하고 본 모델이 한 번에 검증하는 MTP와 블록 확산 방식의 DFlash로 나뉜다. Flash Attention은 설정에서 on/off/auto로 전환한다.
무엇과 다른가
OpenAI SDK를 쓰는 클라이언트 입장에서 Atomic Chat은 클라우드 제공자와 같은 프로토콜을 말하는 로컬 대체재다. base URL만 바꾸면 되고 별도 어댑터가 필요 없다. 순수 llama.cpp 서버와 달리 모델 로딩, 엔진 전환, 에이전트 실행을 GUI에서 처리한다. 다른 로컬 채팅 UI와 달리 API 서버와 에이전트 런처를 함께 갖는다. OpenAI, Anthropic, Mistral, Groq, MiniMax, Qwen, Moonshot 키를 넣으면 같은 채팅에서 로컬 모델과 클라우드 모델을 섞어 쓸 수 있다.
어떻게 쓰나
데스크톱 앱 또는 iOS·Android 앱을 설치하고 모델을 로드한다. 클라이언트의 base URL을 http://localhost:1337/v1로 지정하면 OpenAI SDK, CLI, IDE 플러그인이 그대로 붙는다. Integrations 탭에서 Claude Code, Codex CLI, Cline, OpenCode, Goose, OpenHands, Copilot CLI, Zed 같은 에이전트를 한 번에 실행한다. MCP 서버를 여러 개 연결해 도구와 파일 접근을 붙인다. 소스에서 빌드할 때는 make dev가 의존성 설치, 코어 빌드, 앱 실행을 한 번에 처리한다.
전제와 한계
지원 범위는 macOS 13.6+, Windows 10/11 x64, Linux x86_64(glibc 2.35 이상), iOS, Android다. 권장 RAM은 3B 모델 8GB, 7B 16GB, 13B 32GB다. Linux에서는 GGUF 모델만 실행되고 .AppImage 단일 파일로 배포되며 첫 실행 시 FUSE가 필요하다. DFlash는 Apple Silicon 전용이고 MTP와 동시에 켤 수 없다. 소스 빌드에는 Node.js 20 이상, Yarn 4.5.3 이상, Make 3.81 이상, Rust가 필요하다.
관련 논문 2
유사 도구
- jan로컬 LLM을 내려받아 오프라인으로 실행하고 대화하는 Tauri 데스크톱 앱이다. localhost:1337에 OpenAI 호환 API 서버를 열고 MCP로 도구를 연결한다.
- Rapid-MLXApple Silicon에서 MLX로 모델을 돌리며 OpenAI·Anthropic 호환 엔드포인트를 여는 로컬 추론 서버다. 클라이언트 수정 없이 교체한다.
- gpt4all데스크톱과 노트북에서 LLM을 API 호출이나 GPU 없이 로컬로 실행하는 C++ 추론 클라이언트다. llama.cpp를 백엔드로 쓴다.
- vllm-mlxApple Silicon에서 MLX로 LLM을 구동하며 OpenAI와 Anthropic API를 한 프로세스에서 제공하는 추론 서버다. continuous batching과 paged KV 캐시를 갖췄다.
- lemonade로컬 GPU와 NPU에서 LLM·음성·이미지 모델을 실행하고 OpenAI·Anthropic·Ollama 호환 API로 노출하는 C++ 추론 서버다.
- atomic-agent로컬 llama.cpp로 오픈웨이트 모델을 돌리며 브라우저·파일·셸을 조작하는 로컬 우선 AI 에이전트 CLI다. 상태와 제어 루프가 전부 사용자 디스크에 남는다.