OpenAI가 자사 LLM으로 설계한 첫 AI 가속기 '할라페뇨' 공개

Hacker News21일 전조회 4

OpenAI가 자체 AI 가속기 '할라페뇨(Jalapeño)'를 공개했다. 추론용 칩으로, 지금까지 엔비디아 GPU에 의존해 온 추론 인프라를 자체 실리콘으로 옮기기 위한 첫 결과물이다. 주목할 지점은 성능 수치만이 아니다. OpenAI는 자사 LLM을 칩 설계 과정에 직접 투입해 개발 기간을 크게 단축했다고 밝혔다.

하드웨어 구성은 컴퓨트 다이에 HBM4 6스택과 I/O 칩렛을 붙인 형태다. 4비트 연산 기준 최대 13.4페타플롭을 내고, 232GB 메모리를 15.4TB/s 대역폭으로 읽고 쓴다. OpenAI가 제시한 벤치마크에서는 프롬프트 입력부터 마지막 토큰까지 걸리는 엔드투엔드 지연이 엔비디아 GB300 대비 최대 3.6배 짧았고, 전력 소비도 더 적었다.

설계 속도가 더 눈에 띈다. 첫 아키텍처 구상에서 첫 실리콘까지 20개월이 채 걸리지 않았고, 칩의 논리를 정의하는 첫 RTL에서 테이프아웃까지는 9개월이었다. 하드웨어 부문 부사장 리처드 호는 모델이 엔지니어에게 힘을 실어주는 역할이라며, 판단의 최종 책임은 여전히 사람에게 있지만 훨씬 빠르게 더 많은 경로를 탐색할 수 있게 됐다고 설명했다. 설계 조직은 프로젝트 전 기간 평균 100명 미만이었고, 현재도 비슷한 규모로 2·3세대 설계를 진행 중이다.

LLM은 프런트엔드 워크플로에 깊숙이 들어갔다. 중심에는 구글이 시작한 오픈소스 고수준 합성(HLS) 툴체인 XLS가 있다. 설계자는 Rust에서 영감을 받은 DSLX나 C++로 로직을 작성하고, XLS가 이를 Verilog로 변환한다. OpenAI의 크리스 리어리는 AI가 소프트웨어처럼 보이는 작업에 훨씬 강하다는 점을 활용했다고 말한다. XLS가 그런 형태였기 때문에 이점을 봤다는 것이다. 리어리 본인이 구글 재직 시절 XLS를 시작한 인물이라는 점도 변수로 작용했다.

역할 분담도 명확했다. OpenAI는 추론 가속기와 메모리 계층, 네트워킹을 아우르는 엔드투엔드 시스템 설계를 맡았고, 브로드컴은 게이트 이후의 물리 설계를 담당했다. 업계에서는 이 협업이 빠른 일정의 핵심 전제였다는 평가가 나온다. 에이전트 기반 칩 설계 스타트업 베르코르의 데이비드 친 공동창업자는 일정 자체는 충분히 신빙성이 있다면서도, 다른 팀이 맨바닥에서 시작했다면 불가능했을 것이라고 짚었다. 같은 회사 라비 크리슈나 공동창업자는 지금 시작하면 LLM 성능 향상 덕에 더 빠를 수 있다고 덧붙였다. UC샌디에이고의 앤드루 캉 교수는 이 속도를 두고 현시점 최고 수준이라는 평가를 내놨다.

배경에는 칩 설계 자동화의 오랜 역사가 있다. 메릴랜드대 앤쿠르 스리바스타바 교수는 자동화 자체는 수십 년 전부터 있던 문제라면서, LLM의 차별점은 언어와 코드를 이해하는 능력이라고 본다. 그래서 문제가 여전히 언어적 영역에 남아 있는 설계 작업과 잘 맞는다는 것이다. RTL을 사람이 한 줄씩 쓰던 구간을 상위 언어 기술과 생성으로 대체할 수 있다는 뜻이다.

개발자 입장에서 이 사례가 시사하는 바는 툴체인의 무게중심 이동이다. 하드웨어를 상위 언어로 기술하고 합성하는 흐름 위에 LLM을 얹으면, 설계 공간 탐색과 초안 생성 속도가 달라진다. 반대로 생성된 코드의 정확성을 걸러내는 검증 파이프라인, 기존 EDA 툴과의 접합부, PPA(전력·성능·면적) 최적화는 여전히 사람과 기존 툴의 몫으로 남는다. LLM을 설계 루프에 넣을 때 무엇을 자동화하고 무엇을 게이트로 세울지가 실무의 핵심 질문이 된다.

다만 전제를 분명히 해둘 필요가 있다. 공개된 성능 수치는 OpenAI 자체 벤치마크 결과이며, 할라페뇨가 추론 인프라에 대규모로 투입된 뒤 실제 이득이 확인되기까지는 시간이 필요하다. 설계 속도 역시 브로드컴의 물리 설계 역량과 XLS 같은 기존 자산 위에서 나온 결과라, 다른 조직이 그대로 재현하기는 어렵다는 지적이 함께 나온다.

관련 글