Magnitude, 내 하드웨어에 맞춰 스스로 튜닝하는 에이전트 추론 엔진 공개
YC S25 배치에서 나온 Magnitude가 오픈소스 추론 엔진을 공개했다. 에이전트용으로 만든 엔진이며, 특징은 이름 그대로 자기 최적화다. 모델을 실행하기 전에 커널을 사용자의 실제 기기에서 컴파일하고 튜닝한다. 미리 만들어진 바이너리를 내려받는 방식이 아니라, 그 칩에 맞는 코드를 그 자리에서 생성하는 구조다.
성능 수치는 llama.cpp와의 비교로 제시된다. 디코드 단계에서 Metal 백엔드는 92%, CUDA는 19% 더 빠르며, 최대 2배까지 차이가 난다고 한다. 여기에 더해 에이전트 하나당 메모리 사용량을 27% 줄였고, 에이전트가 멈추면 그 메모리를 반환한다. 여러 세션을 동시에 돌릴 때는 세션들이 프리픽스 캐시를 공유해 속도 저하를 막는다.
하드웨어 요구 사항은 사실상 없다. Apple Silicon, NVIDIA, AMD GPU를 모두 지원하고 GPU 없이 CPU만으로도 동작한다. 고정된 최소 사양이 없어서 작은 기기는 작은 모델을, 메모리가 넉넉한 기기는 더 큰 모델을 돌리는 식이다. 배포 형태는 macOS, Windows, Linux용 데스크톱 앱이며 magnitude CLI가 앱에 포함되어 별도 설치가 필요 없다.
기존에 쓰던 에이전트를 그대로 붙일 수 있다는 점도 내세운다. Pi, OpenCode, Hermes, Codex, Claude Code, OpenClaw, Oh My Pi, Cline 등이 클릭 한 번으로 연결되고, 목록에 없는 도구는 OpenAI 호환 API로 연동한다. 앱에서 추천 모델을 골라 내려받고 연결 설정만 하면 바로 쓸 수 있는 흐름이다.
배경에는 범용 추론 엔진들의 구조적 한계가 있다. llama.cpp, Ollama, LM Studio 같은 도구는 넓은 범위의 하드웨어 클래스를 대상으로 미리 컴파일한 커널을 배포한다. 어디서나 돌아가야 하니 특정 칩에 극단적으로 맞춘 코드를 넣기 어렵다. Magnitude는 이 지점을 뒤집어, 배포 시점의 범용성을 포기하는 대신 실행 시점에 그 기기에 맞춰 튜닝한다. 인기 있는 오픈웨이트 모델 계열에는 손으로 최적화한 커널을 따로 작성해 범용 엔진을 앞선다고 설명한다.
개발자 입장에서 달라지는 것은 로컬 추론의 비용 구조다. 토큰 비용이 들지 않고, 프롬프트와 파일, 모델이 모두 기기를 떠나지 않으며, 모델을 한 번 내려받으면 인터넷 없이도 동작한다. 라이선스는 Apache 2.0이다. 사내 코드나 민감한 데이터를 외부로 보내지 않고 에이전트를 돌려야 하는 팀에게는 선택지가 하나 늘어나는 셈이다.
다만 전제는 분명하다. 최적화 커널은 가장 많이 쓰이는 오픈웨이트 계열에 한해 직접 작성되므로, 어떤 모델이 지원되는지는 프로젝트가 공개한 모델 목록에서 확인해야 한다. 또 기기에서 커널을 컴파일하고 튜닝하는 과정이 모델 실행 전에 들어가기 때문에, 첫 실행에서 어떤 비용이 발생하는지는 실제로 써보며 판단할 부분이다.