Suno가 음성과 배경음악을 한 트랙으로 만드는 Speech를 공개했다
음악 생성 AI로 이름을 알린 Suno가 텍스트를 읽어주는 기능을 내놨다. 'Speech'라는 이름의 이 기능은 웹과 모바일 앱에서 공개 베타로 열렸고, 낭독 음성과 배경 음악을 동시에 만들어 하나의 트랙으로 묶어준다. 읽을 대본을 직접 넣는 방식과 원하는 분위기를 문장으로 설명하는 방식을 모두 지원한다.
사용 경로는 Create 탭 안의 Speech다. Simple 모드에서는 만들고 싶은 상황을 프롬프트 상자에 적으면 된다. Advanced 모드에서는 읽힐 대본을 직접 입력할 수 있고, AI 목소리의 성별과 말투 스타일, 생성할 때마다 목소리가 얼마나 달라질지까지 조절할 수 있다. 결과물의 최대 길이는 약 8분이다. 배경 음악이 필요 없으면 토글로 꺼서 음성만 뽑을 수도 있다.
음성 합성 자체는 새로운 영역이 아니다. DeepMind는 10년 전부터 딥러닝 기반 음성 합성을 연구해 왔고, Adobe는 자체 텍스트-투-스피치 도구를 보유하고 있으며, ElevenLabs는 2023년 등장 이후 이 분야의 대표 플랫폼으로 자리 잡았다. Suno는 이 경쟁에 뒤늦게 합류하는 셈이다.
Suno의 차별점은 음악과 음성을 함께 생성한다는 데 있다. 시 낭송에는 차분한 사운드트랙을, 연설이나 극적인 내레이션에는 에너지 있는 반주를 붙이는 식의 활용을 염두에 둔 것으로 보인다. 회사가 이 기능을 밀어붙이는 배경에는 사업 다각화 의도도 깔려 있다. Suno의 음악 생성기는 저작권을 둘러싼 소송에 휘말려 있다.
제품 책임자 Jack Brody는 음악이 계속 Suno의 중심이자 앞으로 만들 것들의 핵심이지만, 회사의 시야는 늘 인간의 다른 표현 방식까지 향해 있었다고 설명했다. 이번 기능을 두고는 음성과 음악을 하나의 완성된 트랙으로 함께 생성하는 첫 오디오 모델이라고 소개했다.
개발자 입장에서 달라지는 지점은 내레이션과 사운드트랙을 따로 만들 필요가 줄어든다는 것이다. 더빙 초안, 게임이나 영상용 임시 음성, 프레젠테이션용 내레이션처럼 목소리와 분위기를 동시에 맞춰야 하는 작업에서 한 번의 생성으로 결과를 확인할 수 있다. 다만 현재는 웹과 모바일 앱의 베타 기능으로 제공되며, 별도의 API 제공 여부는 이번 발표에서 언급되지 않았다.
Suno 스스로 이 기능이 완성형이 아니라고 인정한다. Brody는 베타는 말 그대로 베타라면서 영국 억양이 호주로 갔다 돌아오는 경우가 있고, 극적인 쉼이 지나치게 극적일 수 있다고 밝혔다. 회사는 사용자 피드백을 반영해 Speech를 계속 개선하겠다는 계획을 내놨다.