Поиск

Сбер представил новые модели ИИ для работы с речью и открыл их код

Сбер представил новые модели ИИ для работы с речью и открыл их код

Компания Сбер расширила возможности работы с речевыми технологиями, представив две новые модели искусственного интеллекта. Релиз включает как инструмент для многоязычного распознавания речи, так и продвинутую систему анализа аудиоданных. Важной особенностью анонса является то, что разработчики не только представили технологию, но и открыли доступ к весам моделей, опубликовав их в открытый доступ.

Новые горизонты речевого ИИ: GigaAM и GigaChat Audio

Новые решения от Сбера закрывают сразу два ключевых направления в области обработки звука. Вместо того чтобы фокусироваться на чем-то одном, компания предложила комплексный подход к работе с аудио.

GigaAM Multilingual: многоязычное распознавание

Первая модель, GigaAM Multilingual, относится к классу систем автоматического распознавания речи (ASR). Она разработана для работы в многоязычной среде и ориентирована на высокую точность при обработке различных диалектов.

Процесс обучения этой модели был масштабным:

  • Базовый аудиоэнкодер обучался на 2 миллионах часов речевых данных более чем на 70 языках.
  • Для повышения точности в различных тематиках использовалось еще 50 тысяч часов специализированных размеченных аудиозаписей.

Особое внимание уделено языкам стран СНГ и русскому языку. При этом разработчики сделали ставку на компактность: даже версия с 240 миллионами параметров, по внутренним тестам компании, демонстрирует результаты выше, чем популярная модель Whisper Large v3.

GigaChat Audio: интеллектуальный анализ звука

Вторая разработка, GigaChat Audio, представляет собой мультимодальную систему, объединяющую возможности языковой модели и анализа звука. Она способна не просто переводить речь в текст, но и глубоко понимать её содержание.

К основным функциям GigaChat Audio относятся:

  • Обработка длительных аудиозаписей продолжительностью до двух часов.
  • Поиск конкретных фрагментов внутри длинного файла.
  • Составление кратких резюме (саммари) с указанием таймкодов.
  • Определение эмоционального фона речи.
  • Поддержка полноценного голосового диалога.

Для оценки точности поиска событий в длинных записях (от 20 до 60 минут) используется метрика Intersection-over-Union, которая в тестах компании составила 48,3.

Открытый код и практическое применение

Сбер продолжает придерживаться стратегии open source. Код и веса новых моделей опубликованы на GitHub и Hugging Face под свободной лицензией MIT. Это позволяет разработчикам по всему миру свободно использовать, изменять и внедрять данные технологии в свои проекты.

Технология уже интегрирована в пользовательский сервис GigaChat. Теперь пользователи могут загружать в чат длинные аудиофайлы или голосовые сообщения, чтобы получить от нейросети краткий пересказ или ответы на вопросы по содержанию записи.

Научное признание

Важным подтверждением технологической значимости релиза стало принятие научных работ, посвященных этим моделям, на конференцию Interspeech. Это одна из ведущих мировых площадок в области речевых технологий, и прохождение научного рецензирования подтверждает серьезный исследовательский уровень разработок.

Вывод

Релиз Сбера — это создание полноценного стека технологий для работы с речью: от простого распознавания до сложного семантического анализа. Если независимые тесты подтвердят заявленные показатели, особенно в работе с русским языком, это станет значимым событием для мирового сообщества разработчиков открытых моделей.

03:35
94
Нет комментариев. Ваш будет первым!