GFusion — новая экспериментальная модель от Сбера: ускоренный генератор текста
Сбербанк анонсировал GFusion — экспериментальную языковую модель, построенную на базе GigaChat3‑10B‑A1.8B‑base, но использующую новый принцип генерации текста. По словам разработчиков, такой подход позволяет ускорить выдачу ответов примерно на 70 % по сравнению с обычным GigaChat 3, при этом небольшое ухудшение качества пока остаётся приемлемым.
GFusion — это не полностью новая LLM, а переобученная версия уже существующей модели. Благодаря доработке архитектуры и добавлению новых этапов обучения, модель стала способна генерировать текст более эффективно, не требуя дорогих вычислительных ресурсов.
Как меняется процесс генерации текста
Традиционные LLM, такие как ChatGPT, формируют ответ последовательно, добавляя по одному токену. GFusion подходит иначе: сначала она создаёт небольшой фрагмент текста целиком, а затем несколько раз «переписывает» его, улучшая менее удачные части. Этот метод позволяет выполнять часть вычислений параллельно, что и даёт прирост скорости.
Откуда взялась модель
Разработчики использовали открытый код GigaChat3‑10B‑A1.8B‑base в качестве основы. После этого модель прошла несколько этапов дообучения: увеличили максимальный контекст, улучшили способность следовать пользовательским инструкциям и доработали механизм оценки уверенности в генерируемом фрагменте. Такой подход оказался гораздо проще и быстрее, чем обучение новой модели с нуля.
Скорость против качества
Тесты, проведённые Сбером на ускорителе NVIDIA H100, показали, что GFusion генерирует ответы на 70 % быстрее оригинального GigaChat 3. По сравнению с версией, использующей технологию MTP, прирост составил около 39 %. При этом качество слегка упало — на 2–4 % пунктов в их внутренних метриках. Разработчики отмечают, что баланс между скоростью и точностью можно регулировать настройками генерации под конкретные задачи.
Оценка уверенности модели
Чтобы ускорение не приводило к росту ошибок, в GFusion добавлен этап обучения, где модель учится определять степень уверенности в каждом фрагменте ответа. При высокой уверенности генерация завершается быстрее, а при сомнениях отдельные части текста пересчитываются. Такой механизм помогает сохранить качество, даже при значительном ускорении.
Открытый доступ для сообщества
Сбер разместил две версии GFusion на Hugging Face под лицензией MIT. Вместе с моделями доступны подробные описания обучения, изменения, необходимые для работы через SGLang, а также оптимизации, ускоряющие работу с длинными контекстами. Некоторые улучшения пока находятся в виде открытых pull‑request‑ов и ещё не включены в основной код.
Почему это важно
GFusion пока нельзя назвать полноценной заменой крупным LLM, но он демонстрирует, что ускорение возможно не только за счёт более мощного железа или оптимизаций кода, но и путём изменения самого алгоритма генерации. Если такой подход подтвердит свою эффективность в реальных сервисах, будущие модели смогут отвечать быстрее без значительного роста вычислительных затрат, что откроет новые возможности для широкого спектра приложений.
Хорошо, когда крупные компании публикуют не только результаты, но и инструменты для дальнейших исследований.