Поиск

Сбер выпустил GigaChat 3.5 Ultra: подробности новой архитектуры

Сбер выпустил GigaChat 3.5 Ultra: подробности новой архитектуры

Сбер представил GigaChat 3.5 Ultra: новая архитектура и открытый доступ

Компания Сбер объявила о выпуске GigaChat 3.5 Ultra — новой флагманской модели в линейке нейросетей. Главная особенность релиза заключается в переходе на гибридную архитектуру, которая позволила значительно оптимизировать работу модели. При объеме в 432 миллиарда параметров новая версия стала почти на 40% компактнее своего предшественника GigaChat 3.1 Ultra, который насчитывал 700 миллиардов параметров.

Важным шагом для сообщества разработчиков стало то, что Сбер открыл доступ к весам модели. Использовать GigaChat 3.5 Ultra можно через ассистент «ГигаЧат», а разработчики могут загрузить веса с HuggingFace или GitVerse под свободной лицензией MIT для создания собственных ИИ-сервисов.

Технологические новшества: гибридное внимание и скорость работы

Ключевое архитектурное изменение коснулось механизма внимания. В отличие от классического подхода, где модель пересчитывает связи со всем предыдущим текстом на каждом новом слове, GigaChat 3.5 Ultra использует комбинацию методов:

  • Классический механизм MLA: используется в каждом четвертом слое для сжатого представления истории диалога.
  • Линейное внимание GatedDeltaNet: применяется в остальных слоях, что позволяет сворачивать историю в состояние фиксированного размера.

Такой подход позволил достичь впечатляющих показателей эффективности. Согласно данным разработчиков, модель потребляет в четыре раза меньше кеша на токен, что позволяет размещать в том же объеме памяти в 2,14 раза больше контекста.

Как достигается ускорение генерации

Важно разделять экономию памяти и скорость работы. Линейное внимание само по себе увеличивает скорость генерации на 15–25%. Однако основной прирост производительности обеспечивается благодаря технологии Multi-Token Prediction. Благодаря способности модели предсказывать сразу несколько токенов за один шаг, скорость вывода текста увеличивается примерно в 2,2 раза.

Особенности обучения и конкуренция на мировом рынке

В создании GigaChat 3.5 Ultra компания сделала ставку на качество исходных данных. Если в предыдущих версиях использовалось много синтетического контента, то в новой модели акцент смещен на органические тексты из интернета. Для этого был разработан собственный LLM-парсер, который преобразует HTML-страницы в чистый Markdown с сохранением таблиц и формул. Кроме того, существенно расширена база знаний в области программирования: количество поддерживаемых языков выросло с 16 до более чем 600.

Сравнение с DeepSeek

Результаты внутренних тестов Сбера показывают, что базовая версия GigaChat-3.5-Ultra-Base превосходит модели DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в задачах по математике, кодингу и общих тестах. После финального этапа обучения (SFT, DPO и онлайн-обучение с подкреплением) итоговая инструктивная модель достигает уровня DeepSeek V3.2, при этом оставаясь примерно в 1,5 раза компактнее конкурента.

Сложности реализации и доступность для всех

Внедрение линейного внимания в модели такого масштаба потребовало от инженеров решения проблем с нестабильностью активаций. Для предотвращения сбоев при обучении специалисты внедрили комплекс мер: гейты внимания, сэндвич-нормализацию и точечный клиппинг значений внутри MoE-слоев. Без этих технических решений обучить модель такого объема было бы невозможно.

Таким образом, релиз GigaChat 3.5 Ultra — это не только технологический прорыв, но и проверка гипотезы о том, может ли гибридная архитектура эффективно работать на сверхкрупных масштабах без потери качества. Теперь независимое сообщество разработчиков сможет проверить эти показатели в реальных условиях.

Вывод: GigaChat 3.5 Ultra демонстрирует, что за счет гибридной архитектуры и оптимизированных данных можно создавать более компактные и быстрые модели, которые успешно конкурируют с ведущими мировыми аналогами.

00:29
65
Нет комментариев. Ваш будет первым!