Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

Gemini 3.5 Transcribe: что это и как работает на Android

Nadia Volkman

Gemini 3.5 Transcribe — самая точная модель распознавания речи от Google. Потоковая транскрипция, 85+ языков, разделение говорящих и голосовое редактирование.

Каталог

    26 августа 2026 года Google DeepMind представила Gemini 3.5 Transcribe — модель распознавания речи, которая обеспечивает более точную транскрипцию, чем предыдущие решения Google. Если вы когда-нибудь диктовали сообщение на Android и получали бессмысленный набор слов, вы знаете, почему это важно. Новая модель решает эту проблему: она распознаёт речь и преобразует её в читаемый текст почти без ошибок.

    Речь идёт не о простом обновлении. Gemini 3.5 Transcribe — это специализированная модель из семейства Gemini 3.5, предназначенная для преобразования речи в текст. Она работает в реальном времени, понимает более 85 языков, распознаёт разные голоса в одном разговоре и даже убирает слова-паразиты. Давайте разберёмся, что это значит для пользователей Android.

    Система распознавания речи Google получила серьёзное обновление. Транскрипция с помощью ИИ раньше часто означала длительную обработку и посредственную точность, но Gemini 3.5 Transcribe меняет ожидания. Это не просто обновление системы распознавания речи Google, а новая модель транскрипции Gemini, созданная специально для речевых задач.

    Что такое Gemini 3.5 Transcribe

    Распознавание речи существует давно. Голосовой ввод на Android появился ещё в 2008 году, и с тех пор Google неоднократно его совершенствовала. Но даже по мере повышения точности такие системы оставались ограниченными: обычно поддерживался один язык и один говорящий, а исправления в реальном времени отсутствовали.

    Gemini 3.5 Transcribe меняет этот подход. Это модель, которая не просто преобразует звук в текст, а обрабатывает речь с более глубоким пониманием контекста. Она распознаёт «эм», «типа», «ну вот» и убирает их. Она определяет случаи, когда говорящий исправляет себя, и отображает исправленный вариант. Она определяет, где начинается и заканчивается предложение, и расставляет знаки препинания без дополнительных подсказок.

    Главный показатель качества распознавания речи — Word Error Rate (WER), то есть коэффициент ошибок в словах. Чем ниже этот показатель, тем лучше. У Gemini 3.5 Transcribe потоковый WER равен 4,0 %, а непотоковый — 2,6 %. Это значит, что в среднем модель допускает примерно две–четыре ошибки на сто слов. Для сравнения, предыдущие модели давали заметно больше ошибок.

    Модель уже доступна в Google AI Studio для разработчиков и на корпоративной платформе Gemini Enterprise Agent Platform. На устройствах Android использовать её можно через приложение Google Gemini.

    Как работает транскрипция речи в Gemini 3.5

    Обычная модель распознавания речи работает по простой схеме: на вход подаётся звук, а на выходе получается текст. Между ними находятся акустическая модель, которая пытается разобрать фонемы, и языковая модель, которая собирает из них осмысленный текст. Если акустическая модель ошибается, языковая модель пытается исправить ошибку по контексту.

    Gemini 3.5 Transcribe делает то же самое, но на более глубоком уровне. Модель обрабатывает аудиопоток в реальном времени и сразу выдаёт текст. Это называется потоковой транскрипцией: вам не нужно ждать окончания записи, чтобы увидеть результат. Текст появляется на экране с минимальной задержкой, составляющей несколько десятых доли секунды.

    Что именно модель делает одновременно:

    • Распознаёт речь на 85 с лишним языках и автоматически определяет, на каком языке говорят
    • Удаляет слова-заполнители, которые засоряют речь при диктовке
    • Обрабатывает самокоррекцию: если вы сказали «встретимся завтра, нет, послезавтра», модель выведет «послезавтра»
    • Различает до трёх говорящих и расставляет временные метки для каждого
    • Форматирует текст: абзацы, знаки препинания, заглавные буквы

    Вызов функций — ещё одна особенность модели. Она может передавать задачи другим моделям Gemini. Например, если в разговоре прозвучало «напомни позвонить завтра», Gemini 3.5 Transcribe может передать эту команду другой системе Gemini для создания напоминания. Это превращает транскрипцию из пассивной записи в инструмент, способный выполнять дополнительные действия.

    Задержка по сравнению с предыдущей моделью Chirp 3 снизилась на 70 %. Для пользователя это означает: вы говорите, и текст появляется на экране почти одновременно. Раньше между речью и текстом была заметная пауза, особенно при потоковой обработке.

    Поддержка языков и автоматическое определение

    Старые системы распознавания речи работали по принципу «выбери один язык, получишь результат на нём». Если вы выбрали русский и начали говорить с английскими вставками, модель могла ошибаться. Английские слова транслитерировались через русскую фонетику, и получались нечитаемые конструкции.

    Gemini 3.5 Transcribe поддерживает более 85 языков и может автоматически определять язык речи. Если в разговоре звучит фраза на русском, а потом на английском, модель может обработать обе части без ручного переключения языка. Для пользователей, которые говорят с английскими терминами, именами продуктов или техническими понятиями в середине русской речи, это снимает часть проблем.

    Качество распознавания на разных языках измеряется бенчмарком FLEURS. У Gemini 3.5 Transcribe показатель составляет 5,50 % WER в потоковом режиме и 5,04 % в непотоковом. Это означает, что даже на языках с меньшим объёмом обучающих данных модель может демонстрировать стабильную точность. Чем меньше данных у предыдущей модели было для конкретного языка, тем выше был её WER. Gemini 3.5 Transcribe сократила этот разрыв.

    Для русскоязычных пользователей поддержка более 85 языков означает не только качественную транскрипцию русской речи, но и более корректную обработку имён продуктов, брендов и технических терминов, которые произносятся по-английски. Раньше именно такие переходы часто приводили к нелепым ошибкам.

    Пользовательская лексика и голосовое редактирование

    Одна из частых проблем распознавания речи — специализированные термины: названия лекарств, юридические формулировки, технический жаргон и имена собственные. Обычные модели пытаются угадать значение по контексту, но часто ошибаются, потому что таких слов могло не быть в обучающих данных.

    Gemini 3.5 Transcribe поддерживает пользовательский словарь, то есть список специализированных терминов. Вы можете задать нужные слова, и модель будет лучше распознавать их в речи. Для кого-то это может показаться мелочью, но если вы диктуете медицинский отчёт, где разница между «гипотиреозом» и «гипертиреозом» критична, такая функция становится особенно полезной.

    Голосовое редактирование — ещё одна функция, делающая модель практичной. После транскрипции вы можете править текст голосом. Не руками и не с помощью клавиатуры, а голосовыми командами. Например, вы можете сказать: «Удали последнее предложение», и модель внесёт это изменение. Команду «Замени слово “большое” на “огромное”» она также может выполнить. Редактирование происходит с помощью естественного языка, а не набора строго заданных команд.

    Для пользователей Android это значит, что после диктовки сообщения не нужно переключаться на клавиатуру для исправлений. Вы можете продолжать говорить, и модель будет вносить изменения в текст по вашим командам.

    Где уже работает Gemini 3.5 Transcribe

    Модель не существует только в лаборатории Google. Она уже встроена в несколько продуктов, и, скорее всего, вы пользуетесь хотя бы одним из них.

    Gboard Rambler на Android. Функция голосового ввода в клавиатуре Google. Когда вы нажимаете значок микрофона в Gboard и говорите, за расшифровку отвечает именно Gemini 3.5 Transcribe. Текст появляется в поле ввода в реальном времени, без фазы «запись, обработка, вывод». Это самое прямое касание модели для пользователей Android.

    Gemini для macOS. Десктопное приложение Google Gemini использует эту модель для транскрибации аудио. Если вы записываете лекцию или встречу, приложение расшифрует её с разделением говорящих.

    Google Antigravity. Платформа для иммерсивных медиа также задействует Gemini 3.5 Transcribe для обработки речи в контенте.

    Chrome. Модель появится в браузере Chrome для живых субтитров и голосовых команд. Точные сроки не названы, но направление понятное: субтитры будут генерироваться не через облачный сервис, а прямо на устройстве.

    Плюсы и минусы Gemini 3.5 Transcribe

    Модель сильная, но не без ограничений. Вот что вы получаете и на что стоит обратить внимание.

    Плюсы

    • Точность: WER 2.6% в непотоковом режиме означает две-три ошибки на сто слов
    • Потоковая транскрипция с задержкой на 70% меньше, чем у Chirp 3
    • Поддержка 85+ языков с автоматическим определением
    • Разделение до трёх говорящих с временными метками
    • Удаление слов-заполнителей и обработка самокоррекции
    • Пользовательская лексика для специализированных терминов
    • Голосовое редактирование текста на естественном языке
    • Function calling для передачи задач другим моделям Gemini

    Минусы

    • Модель недоступна как отдельное приложение, только через продукты Google и платформы для разработчиков
    • Разделение трёх говорящих, это ограничение: в групповой встрече на пять человек модель смешает четвёртого и пятого голоса
    • Полный набор функций доступен через Google AI Studio и платформу Enterprise, что требует аккаунта разработчика или корпоративной подписки
    • Пользовательская лексика работает, но насколько хорошо она справляется с узкоспециализированными терминами в нишевых областях, пока неясно

    Сравнение с предыдущими моделями Google

    Chirp 3 была предыдущей моделью Google для распознавания речи. Она работала приемлемо, но Gemini 3.5 Transcribe обходит её по нескольким направлениям.

    Задержка сократилась на 70%. Если раньше между вашей речью и появлением текста проходила заметная пауза, сейчас текст почти не отстаёт. Для живых субтитров при просмотре видео, голосового ввода в мессенджерах и транскрипции встреч это критично. Задержка в полсекунды заметна, а задержка в две секунды уже раздражает.

    Точность выросла. На бенчмарке FLEURS Gemini 3.5 Transcribe показывает 5,50 % WER в потоковом режиме, что может быть лучше показателей предыдущих моделей. Разница в один-два процента WER может показаться небольшой, но на длинных текстах это означает десятки исправлений, которые не нужно делать вручную.

    Добавились функции, которых у Chirp 3 не было. Разделение говорящих, удаление слов-заполнителей, function calling, голосовое редактирование текста. Это делает Gemini 3.5 Transcribe не просто улучшенной версией, а более функциональной специализированной моделью. Chirp 3 преобразовывала звук в текст. Gemini 3.5 Transcribe преобразует речь в структурированный текстовый документ.

    Google Gemini APK

    Google Gemini — это ИИ‑помощник, который помогает писать, учиться, планировать и создавать контент на телефоне.

    Работа

    Работа

    Заключение

    Gemini 3.5 Transcribe это реальный шаг вперёд в распознавании речи. Снижение задержки, точность на 85 с лишним языках и функции вроде разделения говорящих делают её практичным инструментом, а не демонстрацией технологий. Если вы пользуетесь Android, самый простой способ попробовать модель: клавиатура Gboard с функцией Rambler и приложение Google Gemini. Скачайте Google Gemini с APKPure (download доступен бесплатно), продиктуйте пару сообщений и оцените, насколько меньше приходится исправлять. Убедитесь, что на устройстве включён голосовой ввод в настройках клавиатуры, и предоставьте приложению microphone permissions для корректной работы. Google Gemini обрабатывает аудио с учётом privacy политик компании.

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    Статьи по теме
    Память Claude: как единая память Anthropic работает в чате и CoworkРецензия
    7 лучших приложений родительского контроля для Android в 2026 годуРецензия
    Последние отзывы
    Обзор Transformers: Eternal War: стратегическая RPG про автоботов на андроид
    Что такое бюллетень безопасности Android: разбор сентябрьского патча 2026
    Aniimo: обзор мобильной версии ловца существ на Android
    Fireworks Ember-1: модель рассуждений на базе Kimi K3
    Лучшие отзывы
    Обзор GTA San Andreas: Лучшая Игра с Открытым Миром на Android Спустя 20 Лет
    Легенды Дракономании: захватывающая ролевая игра с элементами стратегии и фэнтези
    Villager News, Actions & Stuff и ванильные жители: что выбрать для Minecraft Bedrock?
    Что Такое PojavLauncher? Запуск Minecraft Java Edition на Android
    Kingdom Rush 6 Genesis TD в сравнении с прошлыми частями серии
    Zenless Zone Zero 3.3: новые персонажи, баннеры и кого качать
    PUBG Mobile 4.6: обновление Midnight Hunters, режим вампира и новое оружие
    Лучшие Приложения для Продуктивности с ИИ на Android в 2026
    Подпишитесь на APKPure
    Будьте первым, кто получит доступ к раннему выпуску, новостям и руководствам лучших игр и приложений для Android.
    Нет, спасибо
    Подписаться
    Подписка оформлена!
    Теперь вы подписаны на APKPure.