무엇이든 넣어 무엇으로든 낸다는 슬라이드를 발표자가 스스로 정정하는 데서 시작함 — 아직 한 모델이 아니라 이해하는 모델과 만드는 모델이 따로 있고, 그 사이를 함수 호출로 잇는다. 노트북LM 비슷한 것을 만들며 파이프라인을 미리 박지 않고 무엇을 만들지 모델이 정하게 두는 구조를 보여줌. 오디오 1분이 토큰 1,920개로 환산돼 100만 한도면 9시간 넘게, 영상은 한 시간쯤 들어가고, 같은 파일을 되풀이해 물으면 캐싱으로 값이 90% 준다는 계산이 나옴. 실시간 부분은 시간이 없어 동료 녹화로 대신한다.
한줄 코멘트. 「무엇이든 무엇으로」라는 제목을 발표자가 첫 몇 분 만에 스스로 깎는다. 아직 한 모델이 아니라 이해하는 모델과 만드는 모델이 따로 있고, 사이를 함수 호출이 잇는다는 것이다. 그래서 이 발표에서 실제로 배우는 것은 모달리티가 아니라 배선이다. 무엇을 그리고 무엇을 읽어 줄지 미리 박아 두지 않고 모델이 정하게 두는 구조인데, 그렇게 두면 무엇이 어긋나는지는 다루지 않는다.
구글 딥마인드에서 제미나이 API와 AI 스튜디오를 맡은 사람이 나온다. 이날 다루는 것은 무엇이든 넣어 무엇으로든 내는 네이티브 *멀티모달 에이전트다.
먼저 할 수 있는 것을 늘어놓는다. 넣는 쪽은 글만이 아니라 코드와 이미지, 오디오와 영상, URL과 구글 검색까지다. 내는 쪽도 글만이 아니라 이미지와 음성, 영상, 함수 호출, 코드다.
그러고는 이 슬라이드가 잘못된 인상을 준다고 스스로 짚는다. 아직 하나의 멀티모달 모델이 아니고 모델이 여럿이라는 것이다. 지금 메인인 제미나이 3 계열은 여러 모달리티를 알아듣지만 내놓는 것은 글이다. 이미지와 음성을 만드는 일은 메인 모델을 바탕에 두고 따로 만든 생성 모델이 맡는다.
로컬 이야기도 붙인다. 젬마가 글과 이미지와 영상을 받고 더 작은 모델은 오디오까지 받는다고 말하면서, 틀리면 정정해 달라고 덧붙인다.
자료에서 결과물까지 도는 고리
목표는 이 자리가 끝나면 청중이 노트북LM 비슷한 것을 스스로 만들 수 있게 하는 것이다. 청중 대부분이 써 본 적 있다고 손을 들었다고 한다. 여러 자료를 넣으면 그것을 설명하는 팟캐스트를 만들어 주는 기능이 인기라고 소개한다.
여기서 결정 하나를 밝힌다. 파이프라인을 손으로 박아 두는 워크플로가 아니라 에이전트로 만든다는 것이다. 무엇을 만들지 에이전트가 정하게 둔다.
구조는 두 단계다. 앞이 자료를 읽어 내는 자리이고, 뒤가 제미나이를 추론 모델로 두고 도구를 부르는 고리다. 고리를 돌면서 자료가 더 필요한지 아니면 이만하면 됐는지를 스스로 따진다. 끝에 나오는 것이 글과 음성과 인포그래픽이다. 넣는 자료는 PDF와 이미지, 강의나 튜토리얼 같은 영상, 음성 메모다.
시작은 간단하다. AI 스튜디오에서 API 키를 무료로 받고 SDK를 깐다. PDF와 영상과 MP3를 올리거나 작은 파일은 그대로 실어 보낸다. 코드를 외울 필요는 없다며 제미나이 API 스킬을 코딩 에이전트에 붙이면 된다고 말한다.
발표가 낸 계산
| 값 | 무엇 |
|---|---|
| 1,920토큰 | 오디오 1분이 환산되는 양 |
| 100만 토큰 | 제미나이의 한도 |
| 9시간 넘게 | 그래서 넣을 수 있는 오디오 길이 |
| 한 시간쯤 | 영상은 이만큼 |
| 90% | 같은 파일을 되풀이해 물을 때 *캐싱으로 아끼는 값 |
받아 적는 일도 된다고 말한다. 플래시는 물론 가장 작은 모델도 오디오를 잘 받아 적는다는 것이다. 구간을 정해 5분부터 15분까지만 보라고 시킬 수도 있고, 파일 API로 더 큰 것을 올리거나 유튜브 주소를 그대로 넘길 수도 있다.
여기까지가 첫 확인 지점이다. 여러 자료를 읽어 요약을 낼 수 있다.
무엇을 부를지 누가 정하나
*함수 호출을 붙이는 방식을 보여 준다. 함수 선언에 이름과 설명을 적고, 이 경우 파라미터는 그림이 어떻게 생겨야 하는지 적을 문자열 하나다. 에이전트에는 그림이 있어야 알아들을 만큼 어려운 개념에는 이미지 생성을 부르고, 소리로 들으면 나을 절에는 음성 생성을 부르라고 시킨다.
이미지는 나노 바나나 2로 부르는 모델이 맡는다. 발표자는 모델 이름 자체는 그리 예쁘지 않다고 말한다. 프롬프트에 인포그래픽을 만들라고 적으면 슬라이드 같은 그림을 만들어 준다.
이 모델들을 네이티브라 부르는 까닭도 짚는다. 메인 제미나이가 받은 학습을 상당 부분 그대로 물려받았기 때문이다. 그래서 세상을 아는 것이 그림에 나타난다. 지도 위에 화살표만 그려 놓고 설명을 시킨 예에서 금문교를 정확히 그렸다. 수학 숙제를 채점해 고친 것을 그림으로 만들고 그림 위에 코드를 얹기도 한다.
음성 쪽은 아직 제미나이 2.5를 바탕으로 한다. 화자 둘이 주고받는 팟캐스트 꼴도 만든다. 시연에서는 트랜스포머를 2분에 설명하는 오디오를 들려준다. 여러 언어를 하고 억양과 말투를 알아듣는다면서 영국식 억양에 이어 자기 바이에른 억양을 실시간으로 들려준다.
여기까지가 두 번째 확인 지점이고, 이미 노트북LM 비슷한 것이 된다고 말한다.
실시간용으로는 제미나이 3.1 플래시 라이브가 있고 이것을 오디오 투 오디오 모델이라 부른다. 소리가 들어가 소리가 나오는 하나의 구조라, 모델 여럿을 이어 붙이던 파이프라인이 더 이상 필요 없다는 것이다.
라이브 시연은 시간이 없어 하지 못하고 동료가 찍어 둔 영상으로 대신한다. 영상에서 모델은 상대의 짧은 머리와 수염, 파란 셔츠 위에 걸친 어두운 재킷을 그 자리에서 짚어 낸다. 직접 해 보라고 주소를 안내한다.
마지막으로 그날 아침 키노트에서 나온 것을 붙인다. 여러 모달리티를 하나의 벡터 공간에 모으는 *임베딩 모델인데 멀티모달 검색 같은 데 쓴다. 로컬로 가려면 젬마 4가 있다고 다시 짚는다. 이 패턴이 다른 분야에도 그대로 옮겨 간다는 말로 닫는다.
성능 값이 없다. 나온 숫자는 토큰 환산과 캐싱 절감뿐이고 둘 다 요금 계산이지 얼마나 잘하는지가 아니다. 작은 모델도 받아 적는 것을 잘한다고 말하면서 무엇으로 잰 것인지 대지 않는다.
에이전트로 두는 데 드는 값도 없다. 무엇을 만들지 모델이 정하게 두면 고리를 몇 번 도는지, 그때 값과 시간이 얼마인지, 파이프라인을 손으로 박은 쪽과 견주면 어떤지가 나오지 않는다. 워크플로가 아니라 에이전트로 만든다는 것이 이 발표의 결정인데 그 결정의 값이 비어 있다.
틀렸을 때의 이야기도 없다. 그림이 필요한 개념을 모델이 잘못 고르면, 인포그래픽에 잘못된 값이 들어가면 무엇이 잡아 주는지가 나오지 않는다. 수학 숙제를 채점해 준다는 예가 나온 자리라 더 걸리는 대목이다.
음성 쪽이 아직 이전 세대 모델을 바탕으로 한다는 것도 그대로 지나간다. 언제 옮겨 가는지, 그때까지 무엇이 다른지는 말하지 않는다.
실시간 부분은 직접 보여 주지 못했다. 동료가 찍은 영상으로 대신했고, 지연이 얼마인지도 나오지 않는다.
용어