Gemini 3.8 Flash TTS: голос задаётся промптом, цены снижены до января
Google выпустил две TTS-модели: флагманскую Gemini 3.8 Flash TTS и облегчённую Flash-Lite TTS. Голос теперь описывается промптом, а не выбирается из каталога. До конца года цены снижены на 70% относительно предшественника, но миграция с 3.1 требует переработки кода.
Google выпустил Gemini 3.8 Flash TTS и Flash-Lite TTS: голос теперь описывают промптом, а не выбирают из каталога
23 сентября Google анонсировал две TTS-модели: флагманскую gemini-3.8-flash-tts и облегчённую gemini-3.8-flash-lite-tts. В changelog Gemini API обе помечены как generally available под датой 22 сентября. Формально это релиз новых голосовых моделей. Содержательно — попытка переустроить рынок синтеза речи с двух сторон: сменить способ работы с голосом и демпингом занять объём.
Флагман рассчитан на креативную режиссуру: аудиокниги, подкасты, игры, дизайн персонажей, 130 языков. Лайт-версия — на высокообъёмное производство, дубляж и голосовых агентов, 101 язык, и она официально позиционируется как замена gemini-3.1-flash-tts-preview. Обе работают по схеме text in / audio out, лимит ввода — 8 192 токена, вывода — 16 384, поддерживаются Batch, Flex и Priority inference. Доступ только через API (Gemini API и AI Studio), открытых весов нет. На потребительских поверхностях Flash TTS появится в Gemini Notebook, Flash-Lite — в Google Vids.
Цены: Google демпингует, чтобы занять объём
Тарификация аудио идёт из расчёта 25 токенов в секунду: минута речи — это 1 500 токенов. До 31 декабря 2026 года текст на входе стоит $0.50 за миллион токенов у обеих моделей, аудио на выходе — $9 у Flash и $6 у Flash-Lite. Минута синтеза обходится в 1.35 цента у флагмана и 0.9 цента у лайт-версии. С 1 января 2027 цены удваиваются: $1.00 за вход, $18 и $12 за выход — 2.7 и 1.8 цента за минуту.
Заменяемое превью gemini-3.1-flash-tts-preview стоит $20 за миллион аудио-токенов, то есть 3 цента за минуту. Новая модель до января дешевле собственного предшественника на 70%, после — на 40%. Это не оптимизация издержек. Это сознательный демпинг на объёме: Google фактически объявляет цену, ниже которой конкуренты вроде ElevenLabs долго не смогут опуститься, и открывает окно для переключения клиентов до конца года. Batch-тарифы до января — $4.50 и $3.00 за миллион аудио-токенов — делают массовую генерацию ещё дешевле.
Голос как промпт, а не как ID
Парадигмальный сдвиг релиза — в способе управления голосом. Google предлагает четыре пути: 30 курируемых студийных голосов (Kore, Puck, Zephyr), расширенную библиотеку через новый эндпоинт GET /v1beta/voices, дизайн голоса из текстового описания и репликацию из 30-секундного сэмпла. Голос теперь описывается промптом, а не выбирается из каталога. Переписывание промпта заменяет переключение ID ассета.
Ключевая техническая деталь: текст трактуется строго как дословный транскрипт. Инлайн-указания вроде «Say cheerfully: Hello!» могут быть озвучены буквально. Построчная режиссура выносится в speech_metadata — поля speaker и style. Инлайн-теги в угловых скобках работают только для точечных вокальных событий: <laugh>, <sigh>, <cough>, <breath>, <short pause>. Стили доставки вроде шёпота задаются через speech_metadata.style. Бэк-каналинг — через пайпы: |mhm|, |yeah|.
Практический шаблон из гайдов выглядит так: AUDIO PROFILE / SCENE / DIRECTOR'S NOTES / TRANSCRIPT. Перед полной генерацией стоит прогнать 50–100 слов с самыми сложными местами проекта и менять одну переменную за раз — голос, стиль, темп, скрипт — чтобы знать, что именно улучшило результат. Voice design позволяет сохранять до 200 голосов на проект с хранением год; stateless-ключи для репликации истекают через 7 дней. Обещанный voice remixing — тон, высота, темп, акцент через промпты — помечен как «скоро» и пока не выпущен.
Миграция с 3.1: где ломается код
Миграция с 3.1 — отдельная история operational friction, о которой в анонсе не пишут. Разработчик меняет model ID на gemini-3.8-flash-lite-tts — и запросы перестают работать.
Во-первых, инлайн-указания в тексте теперь озвучиваются буквально: режиссуру нужно выносить в speech_metadata. Во-вторых, 3.8 по умолчанию возвращает WAV с RIFF-заголовком, а не headerless PCM (audio/l16). Код, вручную оборачивающий raw PCM в WAV через wave или ffmpeg, ломается — ручную обёртку нужно убирать. Для headerless PCM, mu-law и A-law требуется явно задать response_format. В-третьих, двухспикерная сцена с дизайнерскими или реплицированными голосами генерируется по одному ходу и склеивается — это не один проход. Нативная постановка двух говорящих из одного скрипта работает только с предсобранными голосами.
Маркетинг опережает реальность
Дальше начинается расхождение маркетинга с документацией. Пост Google говорит о «2 000+ production-ready голосов» и «infinite library». Changelog API упоминает «150+ prebuilt and custom». Документация — «30 курируемых + сотни» в Extended Voice Library. Цифры не сходятся, и это фиксируют даже сторонние обзоры.
С бенчмарками похожая история. Google цитирует Hume AI Voice Design Benchmark, где Flash TTS занимает первое место с 71.4, и Hume Overall Quality Index, где Flash — первый, Flash-Lite — второй. Но независимый замер Artificial Analysis от 23 сентября ставит Flash TTS на второе место с 1260 Elo, позади Cartesia Sonic 3.6 (1273) — впрочем, внутри пересекающихся 95% доверительных интервалов. Flash-Lite — шестое с 1235. Cartesia в анонсе Google не упоминается. ElevenLabs при этом всё ещё выше в индивидуальном качестве голоса и human-like variation по Hume.
Репликация голоса обставлена жёстким гейтом: 30-секундный сэмпл плюс обязательная вербальная запись согласия владельца голоса, которая должна совпадать с референс-спикером. Каждый клип Gemini Audio несёт SynthID-водяной знак, реплицированные голоса — C2PA credentials. Репликация в AI Studio недоступна в Великобритании, ЕЭЗ, Индии, Техасе, Иллинойсе и Швейцарии.
Что из этого следует для продакшена
Flash-Lite — разумный дефолт для высоких объёмов: дешевле, 101 язык, drop-in замена превью 3.1. Flash — для сцен, где нужны характер, акцент, сложная дикция. Перед долгим проектом стоит прогнать один и тот же 20–30-секундный отрывок на обеих моделях.
Эксперты TechTarget описывают происходящее без пафоса. Shimmin из Futurum Group называет это «рефайнментом TTS с тяжёлым таргетингом на конкретные кейсы». Huffman из Modulate замечает, что индустрия движется от отдельных эндпоинтов вроде ElevenLabs к одной связной модели — но голосовые возможности Gemini «всё ещё зачаточные». TTS это не Live: нет Search grounding, function calling, URL context и code execution. Партнёрства с Agora, LiveKit, Pipecat, Vercel и интеграторами вроде Figma, HeyGen и Wondercraft ориентированы на глобальный дубляж и локализацию.
Для разработчика сейчас лучший момент для переключения: до 31 декабря цены минимальные, а миграционный подводный камень в виде WAV-заголовка и строгого транскрипта лучше пройти сейчас, чем после удвоения тарифов.