Strata가 125B급 Qwen 모델을 12GB GPU에서 실행한다

Hacker News6일 전

오픈소스 추론 엔진 Strata가 125B 파라미터 규모의 Qwen3.8-Flash-Next를 일반 게이밍 PC에서 구동한다. Windows와 Linux용 원클릭 설치를 제공하고, 로컬호스트에 OpenAI·Anthropic 호환 API를 띄우며 이미지 입력도 선택적으로 켤 수 있다. VRAM 12GB 이상이면 출발선에 설 수 있다는 것이 이 프로젝트의 핵심 주장이다.

요구 사양은 구체적으로 명시돼 있다. 그래픽카드는 NVIDIA RTX 20·30·40·50 시리즈 또는 AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700, RX 6800/6900 계열이고 VRAM은 12GB 이상이어야 한다. 시스템 RAM은 32GB 이상, 모델 크기를 결정하는 것은 RAM 용량이며 64GB면 모든 크기를 감당한다. 디스크는 약 80GB를 비워 두는 것이 권장되고 SSD를 쓰면 첫 시작이 훨씬 빠르다. 측정 환경은 RTX 5070 12GB + Ryzen 5 7600 + 64GB RAM, 그리고 RX 9070 XT 16GB + Ryzen 9 3900X + 47GB RAM 두 대였다. VRAM이 넉넉한 카드일수록 유리해서, RTX 3090 24GB에서는 초당 100~140 토큰 정도가 나올 것으로 예상한다.

설치 과정에서 모델 약 70GB를 내려받고, 구동 시 35~55GB를 RAM에 적재한 뒤 일부를 그래픽카드용으로 고정한다. 모델은 압축 수준이 다른 여러 크기로 배포된다. 작을수록 빠르고 클수록 똑똑하다는 구도로, Q2_0, IQ2_XS(권장), IQ3_XXS, IQ3_S, Unsloth의 UD-IQ4_XS(약 4비트, 94GB 다운로드), 실험적 성격의 UD-Q4_K_XL 등이 있다. 64GB PC에서 UD-Q4_K_XL은 답변 중 상당 부분을 SSD에서 읽어야 해서 초당 7~8.5 토큰까지 떨어진다. 별도 변형도 눈에 띈다. Coder는 전문가(expert) 절반을 덜어낸 코딩 특화 버전으로 저자 측정 기준 SWE-bench Verified에서 원본의 91% 점수에 도달하고 32GB RAM에 들어가지만, 코드 밖 영역과 중국어 등 CJK 텍스트에서는 약하다. Swift 1.5는 답하기 전 사고 시간을 크게 줄인 파인튜닝이다.

연동 방식은 로컬 서버를 전제로 단순하다. 브라우저에서 http://127.0.0.1:8080 을 열면 채팅과 모니터, 설정 화면이 나온다. 앱에서는 OpenAI 호환 공급자에 http://127.0.0.1:8080/v1 을 넣으면 되고 API 키와 모델 이름은 아무 값이나 통한다. Anthropic API를 쓰는 앱은 /v1/messages, Claude Code는 ANTHROPIC_BASE_URL 환경변수로 연결한다. Codex CLI처럼 OpenAI Responses API를 쓰는 도구는 /v1/responses를 쓴다. 사고 수준은 off·low·medium·high 중에 고를 수 있고, 기본은 한 번에 한 요청만 처리하며 parallel 값을 2로 올리면 동시 처리도 가능하다. 여러 장의 카드로 모델을 나눠 올리는 멀티 GPU 구성도 지원한다.

배경에는 이런 규모 모델의 통상적인 실행 환경이 있다. 100B를 넘는 모델은 보통 수백 GB의 GPU 메모리를 갖춘 서버에서 돌아간다. Strata는 가중치를 VRAM과 시스템 RAM, 필요하면 SSD까지 나눠 배치하는 방식으로 12~24GB 카드에서도 모델이 돌아가게 만든다. 모든 처리가 PC 안에서 끝나기 때문에 프롬프트와 코드가 외부로 나가지 않는다는 점도 이 접근의 전제다. 커뮤니티가 각자 장비에서 실험하고 검증한 경로도 문서로 남아 있다. Tesla P40·V100, GTX 10 시리즈, Radeon VII·MI50 같은 구형 카드, Linux에서 소스 빌드하는 Intel Arc, AVX2가 없는 구형 CPU까지 별도 문서로 안내한다.

개발자 입장에서 달라지는 지점은 코딩 에이전트의 백엔드를 로컬로 내릴 수 있다는 것이다. Claude Code, Cursor, Codex, GitHub Copilot 같은 도구에 설치 안내 프롬프트를 붙여넣으면 그래픽카드와 RAM, 디스크를 확인해 맞는 모델을 골라 설치·기동까지 처리하는 흐름도 제안돼 있다. API 사용료와 데이터 반출 문제를 피하면서 100B급 모델을 쓰는 선택지가 생기는 셈이다.

전제와 주의사항도 분명하다. 첫 구동 때는 모델을 적재하는 동안 PC가 1~3분간 느려지거나 응답하지 않을 수 있고, 창을 닫지 말고 기다려야 한다. RAM이 모자라면 디스크 표시등만 계속 깜빡이거나 엔진이 예기치 않게 멈췄다는 메시지가 나오므로, 브라우저 같은 프로그램을 정리하거나 더 작은 크기를 고르는 편이 낫다. 긴 프롬프트는 3만 토큰당 약 1분이 걸린다. AMD 카드는 Linux에서 프로세서를 거쳐 이미지를 읽지만 Windows에서는 아직 이미지 입력이 되지 않는다. UD-Q4_K_XL은 실험적이며, Coder 변형은 CJK 텍스트에서 약하다는 점도 감안해야 한다.

Strata는 무료 오픈소스로 배포된다. 문제가 생기면 문제 해결 문서를 확인하고, 해결되지 않으면 Strata 폴더의 로그 파일을 첨부해 이슈를 올리는 경로가 안내돼 있다. 보안 문제는 별도 절차로 비공개 제보하도록 되어 있다.