470M 파라미터 인코더 전용 CTC로 속도-정확도 최전선에 선 IBM Granite 5.0 TurboCTC 설계
Design of the IBM Granite 5.0 TurboCTC ASR Model
무엇인가
최근 음성인식(ASR) 개선은 텍스트 기반 대규모 언어모델(LLM)을 ASR 시스템에 통합하는 흐름이 이끌어 왔다. 별도로 학습한 음향 인코더를 학습 가능한 프로젝터로 LLM에 연결하고 LoRA 같은 저랭크 어댑터를 붙이는 방식이 대표적인데, 이렇게 하면 음성 번역이나 문맥 편향, 대화 문맥 활용 같은 능력을 얻는다. 그러나 이 통합은 비용이 크다. LLM이 많은 파라미터를 끌고 들어와 메모리 사용량이 늘고, 대부분의 LLM이 쓰는 자기회귀 생성 방식이 전사 속도를 제한한다. 논문은 잘 학습된 Conformer 자체가 강력한 ASR 모델이라는 점에 주목해, LLM 없이 인코더만 쓰는 Conformer와 CTC 손실 조합으로 방향을 잡는다. 목표는 470M 파라미터 규모에서 속도와 정확도의 균형을 최적화하는 것이다.
어떻게 동작하나
모델은 Conformer 블록 16개, 은닉 차원 1024, 출력층 크기 16,384(음향 전사에서 뽑은 16K BPE 서브워드)로 총 470M 파라미터다. 시간 축 다운샘플링은 두 단계로 나뉜다. 1단계에서는 log-Mel 프레임 레이트를 100Hz에서 50Hz로 낮추는데, 연속한 두 프레임을 쌓고 한 프레임을 건너뛰는 단순 텐서 reshape로 처리한다. 2단계에서는 처음 두 Conformer 블록이 각각 2배씩(합계 4배) 시간 축을 줄여 12.5Hz 프레임/토큰 레이트를 만들고, 이 레이트가 나머지 블록과 출력층까지 유지된다. 이를 위해 Conformer 블록의 depthwise 합성곱을 stride 2로 바꾸고, self-attention에서 나온 잔차의 시퀀스 길이를 절반 길이로 맞추기 위해 연속한 어텐션 잔차 프레임 2개를 평균 풀링한다. 어텐션은 블록 대각(청크 단위) self-attention을 쓰는데, 전체 어텐션 대신 쓰면 복잡도가 시퀀스 길이에 대해 제곱이 아니라 선형으로 늘고 긴 오디오로 일반화가 더 잘 된다는 것이 채택 이유다. 청크 크기는 모든 Conformer 층에서 128 프레임으로, 1층에서는 2.5초, 2층에서는 5초, 그 뒤 층에서는 10초 분량에 해당한다. 마지막으로 중간 층 예측에 조건화하는 self-conditioning을 쓴다. 8번째 층의 프레임 단위 softmax 분포를 선형 사상으로 은닉 차원에 되돌려 9번째 층 입력에 잔차 연결로 더하고, 출력층은 중간 층과 마지막 층이 가중치를 공유하며, CTC 손실은 중간 층 0.2, 마지막 층 0.8의 가중합으로 계산한다.
무엇과 다른가
학습은 세 단계다. CTC 손실로 기본 모델을 학습하고, Granite LLM에서 지식을 증류하고, 강건 미세조정을 한다. 기본 모델은 공개된 영어 ASR 코퍼스와 합성 데이터 약 6만 시간으로 학습한다. 합성 데이터 중 Multispeaker는 MLS, YODAS, CommonVoice-17, VoxPopuli, AMI에서 뽑은 단일 화자 구간을 이어 붙여 만들고, Multispeaker-Earnings는 Earnings-22에서 같은 방식으로 만든다. Numbers는 숫자 표현, 전화번호, 금액, 이메일 주소, URL, 도로명 주소를 담은 발화 모음으로, gpt-oss-120b 또는 gpt-oss-20b로 생성하고 StyleTTS 2로 합성했다. 초기 개발은 AdamW로 했지만 최종 모델은 Muon 변형으로 학습했다. Muon은 행렬 구조 파라미터를 스펙트럼 노름에서의 최급강하로 최적화하며, 업데이트 행렬의 극분해를 반복법으로 근사한다. 2차원 선형 연산자에만 적용되므로 편향, 정규화 파라미터, 상대 위치 임베딩, 시간 합성곱, 출력 투영, 중간 토큰 사후확률을 내부 차원으로 되돌리는 사상은 AdamW로 학습한다. 논문은 AdamW, Muon, Polar Express를 붙인 Muon(MuonP) 세 가지를 비교했고, 두 Muon 변형이 집계 WER에서 AdamW를 앞섰으며 MuonP는 모든 테스트셋에서 AdamW를 이겼다고 보고한다. 학습 설정은 H100 GPU 8장, 균형 데이터 샘플링(α=0.8)과 GPU당 최대 448초 오디오, OneCycleLR 스케줄(5×10^-5에서 5×10^-4까지 177k 업데이트 동안 선형 워밍업, 이후 1.71M 업데이트 동안 1.5×10^-7까지 선형 감쇠), 그래디언트 L2 노름 10.0 클리핑, 가중치 감쇠 λ=0.01, Conformer 블록 내부 드롭아웃 p=0.1과 출력 투영 전 p=0.25, SpecAugment, SNR을 U[-5,20] dB에서 뽑는 p=0.25 노이즈 증강 등이다.
어떻게 쓰나
LLM 지식 증류에서는 4층, 은닉 1024, 75M 파라미터의 보조 트랜스포머 디코더를 학습해 granite-4.1-8b-base 텍스트 LLM의 출력 분포를 예측하게 한다. 이 디코더는 인코더 마지막 층 임베딩에 cross-attention하고, 학습 중에는 이전 토큰 임베딩에 teacher forcing으로 조건화된다. 손실은 교사 분포를 상위 10개 토큰으로 자른 뒤 학생 분포와의 KL 발산으로 재는데, 학생은 granite-4.1-8b-base의 100K BPE 출력층을 동결해 공유한다. 중요한 점은 이 AED 디코더가 학습에만 쓰이고 추론 시에는 버려진다는 것이다. MuonP로 5 에포크 학습하며, CTC로 사전학습된 인코더는 최대 학습률 1e-6, AED 디코더는 1e-3을 쓴다. 결합 손실은 프레임별 CTC 손실과 증류 손실의 가중합으로 가중치는 각각 0.3과 0.7이다. 강건 미세조정은 깨끗한 뷰와 음향적으로 왜곡된 뷰를 짝지어 다중 조건 학습을 하고, 원본 모델과 적응 모델의 파라미터를 보간한다. 속도 섭동은 {0.8, 0.9, 1.0, 1.1, 1.2}에서 균일하게 뽑고, 그 파형이 깨끗한 뷰가 되며 복사본을 추가로 왜곡한다. 왜곡 뷰에는 배경 잡음 0.25, 잔향 0.50, 대역폭 필터링 0.30, 코덱·양자화 0.15의 확률로 각각 독립 적용한다. 잡음은 MUSAN의 잡음 부분집합에서, 잔향은 OpenSLR SLR28과 REVERB Challenge 2014, Aachen 임펄스 응답 DB의 실측·시뮬레이션 룸 임펄스 응답에서 가져온다. 대역폭 교란은 300–3400Hz 전화 대역 필터링을 포함한 고역·저역·대역 통과 필터를, 채널 교란은 PCM 양자화, μ-law, A-law, GSM, ADPCM을 쓴다. 손실은 L_robust(θ;x,y) = (1-w)·L_CTC(θ,x_c,y) + w·L_CTC(θ,x_d,y)이고 w=0.5를 최종 설정으로 택했다. 깨끗한 뷰 손실은 깨끗한 음성 정확도를 지키고, 왜곡 뷰 손실은 왜곡 강건성을 높인다. 두 뷰 예측 사이의 일관성 손실도 실험했지만 인식 성능을 개선하지 못해 최종 목적함수에서 뺐다. 전체 CTC 모델을 같은 데이터로 1 에포크 미세조정하고(초기 학습률 1e-5, 1e-7까지 선형 감쇠, 균형 샘플링 α=0.9), 마지막으로 θ_interp = (1-γ)θ_0 + γθ_r, γ=0.4로 파라미터를 보간해 강건성 이득과 깨끗한 음성 정확도 유지 사이를 절충한다. 보간은 구조와 추론 비용을 바꾸지 않는다.
전제와 한계
논문이 제시한 결과는 다음과 같다. 옵티마이저 비교는 2026년 5월 20일자 OpenASR 리더보드의 공개 부분에서 이뤄졌고, MuonP로 학습한 Conformer가 granite-speech-5.0-470m-turboctc의 기반이 됐다. 속도 실험은 같은 날짜 리더보드의 공개 데이터셋에 대해 배치 크기 128, 단일 NVIDIA H100, Dell XE9680 노드, PyTorch 2.6.0, CUDA 12.4 환경에서 측정했고, LLM 증류와 강건 미세조정 이전인 1단계 학습 종료 체크포인트에 그리디 디코딩을 적용했다. 네 가지 모델 실행 모두 집계 WER 5.83%를 기록했고, 효율적 어텐션 커널과 Conv1d 대신 Linear 연산을 쓴 것을 합치면 추론이 49% 빨라졌으며 더 큰 이득은 효율적 어텐션에서 나왔다. 학습에서는 다른 연산이 섞여 있어 가속 효과가 덜 두드러졌다. 강건 미세조정 덕분에 두 모델은 잡음·원거리 ASR(FFASR) 리더보드에서 정확도 상위 10위 안에 들면서 추론 속도는 가장 높은 두 자리를 차지했다. 추가 학습 데이터를 쓴 자매 모델 granite-speech-5.0-470m-turboctc-nc는 최상위 모델(음성 언어모델)보다 정확도가 0.7% 뒤졌을 뿐이다. 다만 서브샘플링 방식과 FastConformer식 순수 합성곱 서브샘플링의 비교, 블록 어텐션 대 그룹 어텐션 비교, self-conditioning 제거 실험(Table 2)과 학습 단계별 정확도 향상(Table 3), 옵티마이저별 수치(Table 5)의 구체적 숫자는 제공된 원문 발췌에 실려 있지 않다.
실무적으로 이 논문은 LLM을 붙이지 않고도 쓸 만한 정확도를 내는 경량 ASR을 만들려는 팀에 구체적인 레시피를 준다. 첫째, 시간 다운샘플링을 depthwise 합성곱의 stride로 처리하고 어텐션 잔차는 평균 풀링으로 길이를 맞추는 패턴은 기존 Conformer 코드에 비교적 적은 수정으로 이식할 수 있다. 둘째, 청크 어텐션으로 메모리와 연산을 선형화하면 긴 오디오 처리에 유리하다. 셋째, 1×1 합성곱을 수학적으로 동등한 Linear 연산으로 바꾸고 어텐션 백엔드를 EFFICIENT_ATTENTION으로 고정하는 것만으로 추론 49% 가속을 얻었다는 점은 재학습 없이 시도할 수 있는 최적화다. 단, Shaw 방식 상대 위치 인코딩을 쓰면 FlashAttention을 쓸 수 없다는 제약이 함께 따라온다. 넷째, Muon 계열 옵티마이저는 2차원 행렬 파라미터에만 적용하고 나머지는 AdamW로 남기는 혼합 전략이 필요하다. 모델은 허용적 라이선스로 HuggingFace에서 내려받을 수 있어 상용 검토도 가능하다.
저자들이 밝힌 전제와 한계는 이렇다. 모델은 영어 단문 ASR을 겨냥하며, 리더보드 순위와 Pareto frontier 주장은 2026년 9월 4일 시점의 OpenASR 리더보드 기준이다. 인코더 전용 CTC 구조이므로 LLM 결합 모델이 주는 음성 번역, 문맥 편향, 대화 문맥 활용 같은 능력은 제공하지 않는다. LLM 증류는 granite-4.1-8b-base에 의존하지만 보조 AED 디코더는 추론에서 제거되므로 배포 비용에는 영향이 없다. 속도 수치는 단일 H100, 배치 128, 그리디 디코딩, 1단계 체크포인트라는 특정 조건에서 측정된 것이므로 다른 하드웨어나 디코딩 방식에서는 달라질 수 있다. 또한 논문은 학습·추론 코드 일부와 그림 작성에 Claude Code를 사용했고, 모든 실험은 직접 실행·검증했으며 내용에 대한 책임은 저자에게 있다고 명시한다.