Google запустил Gemini 3.5 Transcribe — нейросеть для распознавания речи

Google запустил Gemini 3.5 Transcribe — нейросеть для распознавания речи
Компания Google представила новую модель искусственного интеллекта под названием Gemini 3.5 Transcribe. Это система, которая преобразует устную речь в точный письменный текст. По данным разработчиков, новинка уже сегодня является одной из самых точных в своём классе. Она понимает более восьмидесяти языков, убирает из текста словечки-паразиты и способна различать одновременно до трёх разных говорящих. Доступ к технологии уже открыт для разработчиков и частью потребительских устройств.
Что такое Gemini 3.5 Transcribe и в чём её особенности
Основное назначение Gemini 3.5 Transcribe — распознавание речи и её последующая транскрибация. Однако производитель ставит акцент не на простом копировании слов, а на «умной» обработке звукового сигнала. Модель анализирует контекст высказывания, определяет, где человек делает самокоррекцию (например, «я… я пойду… нет, выйду»), и автоматически очищает текст от таких случайных вкраплений. Также она удаляет междометия и ненужные повторы, которые часто возникают в естественной речи.
Отдельное внимание уделено распознаванию неформальной лексики, жаргонных выражений и специализированной терминологии. Благодаря настраиваемому пользовательскому словарю модель можно подготовить к восприятию узкопрофильных слов, что делает её полезной в медицине, юриспруденции, технической документации и других сферах, где важна точность формулировок.
Поддержка множества языков и говорящих
Система обрабатывает речь на более чем восьмидесяти языках, включая русский. Это позволяет использовать её в международных проектах и многоязычных командах. Ещё одной значимой возможностью является распознавание до трёх говорящих в одном аудиофайле. Модель может разделять голоса по каналам, что удобно для обработки записей совещаний, интервью или подкастов, где участвуют несколько человек.
Где и как можно использовать Gemini 3.5 Transcribe
Новую модель уже интегрировали в несколько сервисов и платформ. Наиболее доступными вариантами для обычных пользователей стали:
- Приложение Gemini для macOS, где функция работает на английском языке.
- Функция голосового ввода Rambler на клавиатуре Gboard для Android. Она охватывает несколько стран, включая Россию, что делает технологию доступной для широкой аудитории смартфонов.
Для разработчиков открыт доступ через Gemini API в среде Google AI Studio и на платформе Google Antigravity. Это позволяет создавать собственные инструменты на основе новой модели. Корпоративные клиенты могут воспользоваться решением Gemini Enterprise Agent Platform, рассчитанным на интеграцию в бизнес-процессы.
Интеграция в веб- braузер
Google также анонсировал планы по добавлению Gemini 3.5 Transcribe в браузер Chrome. Если реализация пройдёт успешно, пользователи смогут диктовать текст в любом веб-интерфейсе — формах, чатах, редакторах — без установки дополнительных приложений. Это может изменить подход к вводу информации и сделать голосовое взаимодействие с компьютером ещё более естественным.
Сравнение с конкурентами и перспективы
В своих тестах Google указывает, что Gemini 3.5 Transcribe показывает более высокие результаты по точности распознавания речи по сравнению с аналогичными решениями других компаний. Это особенно заметно в условиях шума на фоне, когда говорящий произносит текст не полностью или с акцентом.
Выпуск модели знаменует шаг в сторону более глубокой интеграции ИИ в повседневную жизнь. Умная транскрибация уже сейчас помогает journalistам вести заметки, студентам фиксировать лекции, разработчикам создавать голосовые команды, а просто пользователям общаться с устройствами более удобным способом. Расширение доступности через API и потребительские приложения говорит о том, что технология постепенно переходит из категории экспериментов в разряд инфраструктурных решений.
Вывод
Google представил Gemini 3.5 Transcribe — мощный инструмент для распознавания речи, который сочетает высокую точность, поддержку множества языков и контекстное понимание речи. Уже сегодня модель доступна разработчикам и через отдельные приложения, а в будущем она может появиться в браузере Chrome. Для тех, кто ежедневно работает с голосовыми данными, ведёт заметки или занимается трансляциями, новая нейросеть может стать полезным помощником, освобождавая от ручной обработки текста.