← AI Engineer
음성 AI · 지연시간

밀리초 안에 답하라 — 카르티시아가 음성 AI를 상태공간모델로 다시 만든 이유

클라우드 배치가 500~600밀리초에 답하는 것으로는 대화가 안 된다는 데서 시작해, 음성 합성을 빠르게 해서 번 시간을 언어 모델 몫으로 넘긴다는 구조를 짚음. 소닉 2가 초기 모델보다 2.5배 빨라져 모델 지연 40밀리초로 나가고, 기기 안에서 도는 쪽이 클라우드 왕복보다 약 5배 빠르다는 값이 나온다. 트랜스포머가 입력 길이에 제곱으로 무거워지는 것과 달리 상태공간모델은 추론 때 O(1)이라는 구조 설명, 그리고 클로드를 붙이면 왜 느리냐는 청중 물음에 그 여유로 받으라고 답하는 대목까지 이어짐. 값은 전부 회사 자체 값이다.

Arjun Desai (Cartesia) & Rohit Talluri AWS발표 2025-08-2617분 6초AI Engineer

한줄 코멘트. 「우리 모델이 빠르다」로 들리는데 실제 주장은 한 겹 더 있다. 빨라져서 번 시간이 사용자에게 가지 않고 언어 모델 몫으로 넘어간다는 것이다. 음성 합성을 40밀리초로 줄이면 그만큼 언어 모델이 더 생각할 수 있고, 클라우드 왕복도 견딜 수 있다. 그래서 이 발표의 값은 음성 품질이 아니라 예산 배분 이야기다. 다만 잰 값이 전부 회사 자체 값이고 무엇과 견줬는지는 대지 않는다.

1. 무엇을 바꾸려는 자리인가

AWS의 파운데이션 모델 학습·추론 팀 사람이 사회를 보고, 카르티시아 AI 공동창업자가 이야기하는 대담이다. 카르티시아는 어느 기기에서든 도는 실시간 멀티모달 지능을 만든다고 소개하고, 이날은 기업용 음성 AI를 어떻게 만드는지에 초점을 둔다.

바꾸려는 것을 먼저 놓는다. 파운데이션 모델 하면 보통 클라우드에 올려 두고 요청을 모아 처리하는 것을 떠올리는데, 그러면 답이 500~600밀리초 뒤에 온다. 글이라면 그래도 된다. 사람이 초당 200토큰씩 읽지는 않기 때문이다.

영상이나 음성처럼 주고받는 자리에서는 다르다. 속도가 가장 중요하고 품질은 기본으로 갖춰야 하는 조건일 뿐이라고 말한다. 옆 사람과 이야기하는데 상대가 1초 늦게 답하면 어색하다는 비유를 든다. 음성에서는 초가 아니라 밀리초 단위로 답해야 한다는 것이다. 고객센터에 전화한 사람은 답이 늦으면 바로 짜증을 낸다.

여기에 음성만의 조건이 붙는다. 말 중간에 끼어드는 것, 억양처럼 나라마다 다른 문제, 통화 중 들어오는 배경 소음이다. 그리고 음성 경험은 몹시 주관적이라 취향과 맞춤이 많이 든다.

2. 원칙 셋

카르티시아가 모델을 만들며 잡은 것

무엇왜
품질목소리의 자연스러움이 뛰어나야 한다. 이 정도는 기본 조건이라고 말한다
지연상대편에서 첫 소리를 최대한 빨리 듣게 한다. 그렇게 번 시간이 에이전트가 더 생각할 시간이 된다
제어에이전트가 회사와 제품을 어떻게 말하는지가 브랜드라 그 자리를 맞출 수 있어야 한다

셋째를 발표자가 가장 중요할 수 있다고 말한다.

3. 왜 상태공간모델인가

트랜스포머의 대안으로 *상태공간모델을 개척했다고 말한다. 트랜스포머는 입력이 길어지면 메모리와 시간이 제곱으로 늘어난다. 상태공간모델은 추론할 때 생성이 O(1)이다. 상태를 쥐고 있다가 거기서 뽑아내는 구조라, 전통적인 트랜스포머로는 못 내는 지연을 낸다는 것이다.

이 계열이 원래 트랜스포머보다 성능이 낮았다는 것도 짚는다. 그 격차를 메웠고 이제 지연만이 아니라 품질에서도 낫다고 말한다. 무엇으로 잰 품질인지는 대지 않는다.

4. 한 턴이 도는 자리

한 턴이 도는 자리

사람이 말을 멈춘다끼어들기와 배경 소음도 여기서 걸린다
소리를 글자로음성 인식이 받아 적는다
언어 모델이 생각한다저지연용으로 만들어진 모델이 아니다
첫 소리가 나간다모델 지연 40밀리초로 낸다고 말한다
음성 에이전트 한 턴이 도는 자리다. 세 칸이 각각 다른 모델이고, 이음매마다 꼴을 맞춰 줘야 한다. 음성 인식이 낸 것을 언어 모델이 받을 수 있게, 언어 모델이 낸 것을 음성 합성이 읽을 수 있게 고치는 일인데 그 자잘한 자리를 자기네가 대신 처리해 준다고 말한다.

주력 모델은 음성 생성을 맡는 소닉 2인데, 그것은 퍼즐의 한 조각일 뿐이라고 말한다. 실제 음성 에이전트를 세우려면 언어 모델과 *음성 인식 모델까지 이어 붙여야 한다.

가장 큰 문제는 시간이 모자라다는 것이다. 언어 모델은 애초에 지연이 적은 흐름을 염두에 두고 만든 것이 아니라 여유를 최대한 줘야 한다.

번 시간을 누가 쓰나

마지막 칸을 빠르게 해서 번 시간그 여유를 다른 칸이 쓴다
언어 모델이 더 생각한다추론에 쓸 시간이 늘어난다
클라우드 왕복을 견딘다끝에서 끝까지는 아직 지연이 크다고 말한다
빠른 음성 합성이 무엇을 사 주는지에 대한 답이다. 줄인 시간이 사용자에게 가지 않고 언어 모델 몫으로 넘어간다. 클로드를 붙이면 느리게 느껴진다는 청중 물음에도 이 여유로 받으라고 답한다.

사람들이 자기네 판을 쓰는 두 번째 이유로 제어를 든다. 목소리 복제와 억양은 물론 배경 소음까지 그대로 담아내는 품질이다. 여기서 재미있는 대목이 나온다. 에이전트 목소리가 너무 완벽하면 오히려 이상하게 느껴져서, 사람들은 통화에서 나던 작은 잡음이나 삑 소리를 오히려 반긴다는 것이다.

고객 자리로는 셋을 든다. 헬스케어, 고객지원, 그리고 실시간 게임이다. 게임에서는 플레이어가 아닌 캐릭터가 상황에 따라 움직이며 말을 주고받기를 바란다는 것이다.

크리에이터를 위한 목소리 장터도 있다고 말한다. 목표가 성우를 대신하는 것이 아니라고 못 박고, 그 사람다움을 남이 라이선스해 쓰도록 자리를 내주는 것이라고 설명한다. 성우들이 실제로 판에 들어와 있다고 한다.

5. 값과 청중 물음

발표에 나온 값

값무엇언제 것 · 성격
500~600밀리초클라우드에 올린 모델이 배치로 답하는 시간— · 발표자 설명
초당 200토큰사람이 글을 그 속도로 읽지는 않는다는 비유— · 발표자 비유
40밀리초소닉 2의 모델 지연— · 회사 자체 값
2.5배소닉 2가 초기 모델보다 빠른 정도— · 회사 자체 값
약 5배기기 안에서 도는 쪽이 클라우드 왕복보다 빠른 정도— · 회사 자체 값

넷째 줄과 다섯째 줄은 자기네 것끼리 견준 값이다. 다른 회사 모델과 견준 값은 나오지 않는다.

청중 물음이 넷 붙는다.

첫째는 클로드를 붙이면 지연 때문에 잘 안 되는 것 같다는 것이었다. *파이프캣과 붙어 있고 둘 다 AWS와 함께 도는데 클라우드는 끝에서 끝까지 하면 여전히 지연이 꽤 크다고 인정한다. 음성 합성 쪽에서 준 여유를 언어 모델 쪽에서 쓰면 되고, 이런 최적화는 대개 언어 모델을 내놓는 쪽의 몫이라고 답한다. 전용 인스턴스를 띄우는 식으로 더 나은 지연을 얻는 길도 있다고 덧붙인다.

둘째는 데이터가 더 필요한지 밀도가 중요한지였다. 답은 그렇기도 하고 아니기도 하다는 것이다. 크게 사전학습하고 정합이나 선호 데이터로 손보는 흐름은 오디오에도 통하는데, 오디오에서는 사람들이 선호하는 것이 워낙 갈려 한 단계 손보기로는 담기지 않는다고 말한다.

셋째는 소리에서 바로 소리로 가는 모델을 어떻게 보느냐였다. 지금은 프로덕션이나 기업 용도로 쓸 단계가 아니라고 답한다. 조각을 이어 붙인 쪽이 각 부분을 어떻게 굴릴지 훨씬 잘 다룰 수 있다는 것이다. 다만 지연만 놓고 보면 결국 그쪽이 앞설 것이라고 말한다.

넷째는 무엇으로 지켜보느냐였다. 평가가 대단히 중요한 부분이고, 문제는 대개 언어 모델 자리에서 난다고 답한다. 앞의 판이 말한 이음매 이야기가 여기서 다시 나온다.

사회를 본 AWS 쪽은 자기네 모델 장터 이야기를 붙인다. 세이지메이커 점프스타트와 베드록에 여러 모델을 두어 고르게 하고, 카르티시아 같은 다음 파운데이션 모델 제공자를 찾아 생태계에 들이려 한다는 것이다.

마지막 물음은 2030년에 어디쯤 가 있겠느냐였다. 음성 AI가 어느 산업에서든 당연한 것이 되어 있을 것이고, 나아가 실시간으로 도는 세계 모델이 조수나 부조종사처럼 함께 일하는 쪽을 기대한다고 답한다.

6. 발표가 밝히지 않은 것

값이 전부 자기네 것끼리 견준 것이다. 40밀리초도 2.5배도 5배도 무엇과 견줬는지가 자기네 이전 모델이거나 자기네 클라우드 왕복이다. 다른 회사 음성 합성과 나란히 잰 값은 나오지 않는다. 세계에서 가장 빠른 모델을 만들었다는 말이 그 자리를 대신한다.

품질 쪽은 더 얇다. 상태공간모델이 지연만이 아니라 품질에서도 낫다고 말하는데, 무엇으로 어떻게 쟀는지가 없다. 목소리 복제와 억양이 뛰어나다는 것도 잰 값이 아니라 고객들이 그래서 쓴다는 설명이다.

40밀리초가 모델 지연이라는 것도 짚어 둘 자리다. 사람이 실제로 겪는 지연은 음성 인식과 언어 모델과 네트워크를 다 더한 것인데, 그 합이 얼마인지는 발표에 없다. 클라우드 왕복이 여전히 크다고 인정하면서도 그 크기를 대지 않는다.

기기 안에서 도는 쪽도 배수만 있다. 어떤 기기에서 어떤 모델을 돌린 것인지, 그때 품질이 어떻게 되는지가 나오지 않는다.

목소리 장터도 라이선스한다는 데서 멈춘다. 성우가 얼마를 받는지, 복제한 목소리를 어디까지 쓸 수 있는지, 거절할 수 있는지는 다루지 않는다. 성우를 대신하지 않겠다는 말이 그 자리에 놓여 있다.

용어

*상태공간모델
지난 것을 상태 하나에 담아 두고 그 상태에서 다음을 뽑아내는 구조. 영어로 state space model
*음성 인식
사람 말소리를 글자로 받아 적는 기술. 영어로 speech to text
*파이프캣
음성 에이전트의 조각들을 이어 붙여 실시간으로 굴리는 오픈소스 얼개