딥마인드 오디오 쪽을 알아듣기·말하기·실시간·노래 넷으로 훑는 데모 발표. 요청 한 번으로 화자 이름표와 타임스탬프, 언어와 번역, 감정까지 한꺼번에 받아 내는 과정과, 목소리를 수백 개 쌓는 대신 기본 서른 남짓에 감독 노트를 얹어 억양을 만드는 방식이 나옴. 실시간 모델은 지능이 모델 안에 들어 있어 텍스트를 거쳐 언어 모델로 넘기는 방식과 다르다고 말한다. 데모가 여러 번 어긋나고 발표자가 오디오 쪽 벤치마크는 못 믿는다고 스스로 밝혀, 잰 값은 하나도 나오지 않는다.
한줄 코멘트. 값이 없는 발표인데 그것을 발표자가 먼저 말한다. 오디오 쪽 벤치마크는 믿을 수 없다는 것이다. 그래서 남는 판단 재료는 데모인데, 데모가 여러 번 어긋난다. 일본어 번역이 안 되고, 중국어는 맞는지 확인할 사람이 방에 없고, 목소리 재생이 실패해 준비해 둔 녹음으로 대신한다. 잘 도는 것을 보여 주는 자리에서 어긋난 것을 그대로 두고 지나간 셈이라, 이 발표에서 확인되는 것은 무엇을 시킬 수 있는지의 목록이지 얼마나 되는지가 아니다.
구글 딥마인드에서 제미나이 API와 AI 스튜디오 쪽 개발자 경험을 맡은 사람이 나온다. 11월에 팀에 합류했는데 제미나이 3이 나오기 바로 전날이었다고 한다. 자막이 이름을 두 가지로 적어 원문에서 갈린다.
발표 제목이 앞의 「구글 딥마인드에 물어보기」를 빼서 오해를 준다고 먼저 밝힌다. AI 오디오 전체를 다루면 한참 걸리니 자기네가 하고 있는 것만 보여 주겠다는 것이다.
최근에 낸 것을 먼저 늘어놓는다. 공개 모델 쪽에서는 젬마 4를 지난주쯤 냈는데 오디오 이해가 들어 있고 기기 위에서도 돌릴 수 있다. 생성 쪽에서는 비디오 3.1 라이트가 가장 최근이다. 오디오 쪽에서는 실시간 대화 모델을 몇 주 전에 냈다. 자막이 그 모델 이름을 여러 번 다르게 적는다.
바탕은 제미나이 3이라고 말한다. 오디오를 알아듣는 일에서 이 모델이 잘하는데, 받아 적는 것을 넘어 그 안에 든 결까지 읽는다는 것이다. 말 자체만이 아니라 그 말이 놓인 맥락, 감정, 말의 속도 같은 것이다. 목표는 깊이 알아듣고 풍부하게 받아 적고 튼튼하게 추론하는 모델이고, 여러 언어와 방언과 억양을 가리지 않는 것이다. 사람들이 겹쳐 말할 때도 잘 받아 적고 언어가 바뀌어도 매끄럽게 따라간다고 말한다.
한 번 물어 이만큼 받는다
에코스크립트라는 앱을 보여 준다. 녹음을 넣으면 제미나이 3 플래시 프리뷰가 뜯어 정보를 뽑는 앱이고, AI 스튜디오로 만들어 갤러리에 올려 뒀다.
시킨 것은 이렇다. 화자를 갈라 낼 것, 맥락이 있으면 이름으로 이름표를 달 것, 정확한 타임스탬프를 줄 것, 언어를 알려 주고 영어가 아니면 번역을 붙일 것, 감정을 행복·슬픔·화남·중립 중에서 고를 것, 그리고 전체 요약을 맨 앞에 둘 것이다.
이것이 호출 한 번이었다고 강조한다. 받을 꼴을 미리 정해 준 덕에 나온 것이 그대로 화면 칸에 들어갔다는 것이다.
데모에서는 어긋난 자리가 여럿이다. 자기 독일어는 보통 화남으로 분류되는데 이번에는 아니었다고 하고, 프랑스어 대목은 중립으로 나왔는데 보통은 슬픔으로 나온다고 말한다. 일본어 번역은 잘 안 됐다고 그대로 밝힌다. 중국어 번역은 방에 읽을 사람이 없어 맞다고 치고 넘어간다.
목소리를 만드는 네 칸
다른 *음성 합성 서비스는 보통 목소리를 잔뜩 쌓아 두고 성별과 억양과 언어로 걸러 고르게 한다. 제미나이는 기본 목소리가 서른 남짓이고, 오디오를 알아듣는 힘을 써서 그 목소리에게 이렇게 연기하라고 시키는 방식이라고 말한다.
보이스 라이브러리라는 앱이 AI 스튜디오 갤러리에 있다. 높은 음의 아일랜드 남자 목소리가 필요해서 제미나이 3 플래시로 음성 생성용 지시문을 짜게 했다고 한다. 이름을 붙이고, 클레어주 해안의 북적이면서 아늑한 펍이라는 장면을 세우고, 진하고 진짜 같은 아일랜드 억양으로 읽으라고 시킨다.
여기서 재생이 실패한다. 준비해 둔 녹음으로 대신 들려준다. 기본 목소리 하나는 표준 미국 억양이고, 다른 목소리는 같은 방식으로 싱가포르 쪽으로 바꿔 들려준다.
실시간 모델은 소리를 받아 소리로 답하는 방식이고 양쪽이 동시에 말할 수 있다. *웹소켓으로 텍스트와 오디오와 영상을 실시간으로 밀어 넣으면 실시간 오디오와 그 글자 기록이 돌아온다.
여기서 발표자가 성능 이야기를 꺼내다 스스로 끊는다. 오디오 쪽 벤치마크는 믿을 수 없다는 것이다.
대신 구조를 든다. 생각하고 추론하는 힘이 모델 안에 그대로 들어 있어서, 소리를 글자로 바꾸고 그 글자를 언어 모델에 넘겨 지능을 얻는 *캐스케이딩 방식과 다르다는 것이다.
신용카드 없이 무료로 써 볼 수 있다고 안내하고 라이브로 시연한다. 친근한 아일랜드 억양으로 말하라는 지시를 주고 카메라를 물려 대화한다. 독일어로 시를 청하자 독일어로 답하는데 아일랜드 억양이 그대로 얹힌다. 그러니 언어마다 지시를 손봐야 한다고 스스로 짚는다.
화면도 밀어 넣을 수 있는데 영상 프레임을 받는 것이고 지금은 초당 한 장이 한계라고 말한다. 파이썬으로 서버끼리 붙이는 예시와 자바스크립트로 브라우저에서 붙이는 예시가 문서에 있다. 실시간 오디오는 까다로운 편이라 코딩 에이전트에 깔아 쓰는 스킬을 제미나이 API 전체에 대해 내놨다고 한다.
리라 3을 최근에 냈고 이제 가사가 붙은 음악을 만든다. 모델이 둘로 갈려 있다. 클립은 30초짜리 짧은 곡을 만들고, 프로는 길이가 다 있는 곡을 만든다.
라이브 주크박스라는 앱을 만들어, 실시간 모델에 리라를 부르는 도구를 쥐여 줬다. 시연에서는 영국 스타트업 판을 다룬 독일 테크노 슐라거를 미친 듯한 기운으로 만들어 달라고 하고 가사는 알아서 채우라고 시킨다.
슬라이드가 필요하면 되감아 링크를 보여 주겠다는 말로 끝난다.
발표가 스스로 밝힌 어긋남
| 어디서 | 무엇 |
|---|---|
| 지난 발표 | 데모 녹화본을 덮어써서 통째로 날렸다고 말한다 |
| 일본어 번역 | 잘 안 됐다고 그대로 밝히고 넘어간다 |
| 중국어 번역 | 방에 읽을 사람이 없어 맞다고 치고 넘어간다 |
| 목소리 재생 | 실패해서 미리 준비한 녹음으로 대신한다 |
| 감정 분류 | 보통 나오던 것과 다른 값이 나왔다고 두 번 말한다 |
| 억양 지시 | 독일어에도 아일랜드 억양이 얹혀, 언어마다 지시를 손봐야 한다고 밝힌다 |
여섯 다 발표자가 무대에서 직접 말한 것이다.
잰 값이 하나도 없다. 벤치마크를 못 믿겠다고 밝힌 것은 정직한 자리인데, 그러면 무엇으로 판단해야 하는지는 대지 않는다. 겹쳐 말하는 것을 잘 받아 적는다는 주장도 데모 한 번이고 얼마나 자주 맞는지가 없다.
감정을 넷 중에서 고르게 한 것도 그대로 지나간다. 그 넷이 무엇을 근거로 정해진 것인지, 사람이 매긴 것과 얼마나 맞는지가 나오지 않는다. 발표자 자신의 독일어와 프랑스어에서 값이 흔들린 것을 두 번 말하고도 그것을 정확도 이야기로 잇지 않는다.
값과 지연도 없다. 실시간 대화가 얼마나 늦게 돌아오는지, 초당 한 장이라는 영상 한계가 무엇 때문인지, 무료로 얼마나 쓸 수 있는지가 나오지 않는다.
목소리 서른이라는 숫자도 「서른 남짓」에서 멈춘다. 그 목소리로 못 만드는 소리가 무엇인지, 억양을 지시로 입히는 방식이 원어민에게 어떻게 들리는지는 다루지 않는다. 싱가포르와 아일랜드 예시를 들려주면서도 그쪽 사람에게 확인한 이야기는 없다.
노래 쪽은 가장 얇다. 두 모델의 길이 차이만 있고, 가사를 모델이 채운다는 것 말고 어떤 자료로 배운 것인지, 만든 곡을 어디까지 쓸 수 있는지가 발표에 없다.
용어