SpaceXAI представила Grok 4.7: флагман для кода и долгих задач по старой цене

21 сентября компания SpaceXAI, основанная Илоном Маском, анонсировала выпуск Grok 4.7 — новой флагманской большой языковой модели. Релиз позиционируется как инструмент для программирования и многочасовой профессиональной работы, где задача растягивается на часы, а не ограничивается одной репликой в чате. Главная новость: качество заметно выросло по сравнению с Grok 4.6, а цена осталась прежней — 2 доллара за миллион входных токенов и 6 долларов за выходные.
Что изменилось в архитектуре и подходе к обучению
Grok 4.7 построена на более крупной базовой модели, чем её предшественница. Ключевое отличие — длительный цикл обучения с подкреплением (RL), в ходе которого модель тысячи раз пытается решить сложную задачу и получает оценку за итоговый результат, а не просто копирует эталонные ответы. Обучающая выборка намеренно смещена в сторону задач, требующих часовой работы.
Инженеры SpaceXAI отдельно проработали две слабые стороны длинных сценариев. Первая — способность модели проверять собственную работу на каждом шаге: ошибка, незамеченная на ранней стадии, разваливает весь дальнейший расчёт. Вторая — удержание контекста на большой дистанции, чтобы условия задачи не терялись к её завершению. Дополнительно модель дообучена на понимании устройства собственной агентной оболочки Grok Bot, что делает её поведение в диалогах и общих интеллектуальных задачах более предсказуемым.
Ценовая политика и сравнение с конкурентами
Тарифы Grok 4.7 полностью повторяют прошлую версию: вход — 2 доллара за миллион токенов, выход — 6 долларов. В официальной таблице рядом стоят два основных конкурента: GPT-5.6 Sol Max (4 и 20 долларов соответственно) и Fable 5.1 Max (10 и 50 долларов). Разница в стоимости становится критичной на длинных агентных задачах, где генерируется огромный объём выходных токенов — по этой статье Grok 4.7 дешевле Fable 5.1 более чем в восемь раз. Существует также ускоренная версия с удвоенной скоростью генерации, тарифицируемая вдвое дороже базовой.
Результаты тестирования: где модель побеждает, а где проигрывает
Компания подсвечивает не абсолютные баллы, а положение на кривой «средняя стоимость закрытой задачи против результата». Формулировка «на переднем крае по соотношению цена-качество» означает: за эти деньги лучше решения нет. Официальная таблица охватывает семь бенчмарков:
- CursorBench 4.0 — длинные задачи по написанию кода в редакторе.
- DeepSWE v1.1 — практическая работа программиста с реальным проектом.
- EEBench — задачи по электротехнике.
- AA Briefcase v1.1 — многочасовая офисная работа (балльная шкала).
- Terminal-Bench 4.0 — долгая работа в командной строке.
- Harvey Legal Agent Benchmark — юридические задачи.
- HealthBench Professional — клиническое рассуждение.
Против Grok 4.6 новая модель выигрывает во всех семи. Самый резкий скачок — в командной строке (с 20,3% до 38,0%) и электротехнике (с 53,0% до 64,0%). На CursorBench 4.0 Grok 4.7 набрала 46,3% против 40,4% у предшественницы и 51,8% у Fable 5.1 Max, заняв второе место по чистому результату.
Юридические и инженерные задачи — зона уверенного лидерства
На тесте Harvey Legal Agent Benchmark Grok 4.7 показала 19,6% — в три раза выше Fable 5.1 (6,7%) и почти в восемь раз выше GPT-5.6 Sol (2,5%). Для бенчмарка, где все участники держатся у нижней границы, такой отрыв выглядит аномалией. В электротехнике картина похожа: 64,0% против 56,4% у Fable и 39,4% у GPT. Там, где нужна отраслевая эрудиция и длинная цепочка рассуждений, модель берёт уверенно.
Терминал и клиническое мышление — зоны риска
В Terminal-Bench 4.0 Grok 4.7 с 38,0% отстаёт от Fable 5.1 (57,9%) в полтора раза, хотя саму себя прошлую обошла почти вдвое. В клиническом рассуждении (HealthBench Professional) модель последняя из четырёх: 56,7% против 62,1% у Fable и 60,5% у GPT. На DeepSWE результат 71,0% помечен звёздочкой — он получен при высоком уровне усилий, то есть с большим расходом токенов, чем при стандартном прогоне. Вывод: там, где нужно долго и аккуратно работать руками в терминале, впереди остаётся более дорогая модель.
Отсутствие моделей Google в сравнительной таблице
SpaceXAI сравнивает себя только с Fable 5.1 и GPT-5.6 Sol — линейка Gemini в материалах релиза не появляется вообще. Выбор соседей по таблице — всегда часть маркетинговой подачи, поэтому отсутствие целого вендора из тройки лидеров стоит учитывать при чтении процентов. Ещё одна деталь: на графике GDPval (оценка работы юристов, медсестёр, финансовых аналитиков) Grok 4.7 набирает 1695 баллов и уступает Fable 5.1 (1735), а соседом снизу поставлена GPT-6 Astra (1542), хотя в основной таблице от OpenAI участвует GPT-5.6 Sol. Версии конкурентов меняются от графика к графику.
Безопасность: новые тесты и баланс ограничений
Систему безопасности Grok 4.7 пересобирали с нуля. По внутренним замерам это самая устойчивая к обходу ограничений модель из всех, что тестировала SpaceXAI. На биобезопасности она возглавляет рейтинг LatchBio с результатом 62,4%. Отдельный акцент — кибербезопасность: на собственном тесте HackerBench v0.3 модель пропускает 3,3% рискованных запросов двойного назначения, редко блокируя законную работу специалистов по защите. Баланс здесь и есть задача: слишком строгая модель бесполезна безопаснику, слишком покладистая — полезна атакующему. Параллельно компания начала выдавать отдельным партнёрам по кибербезопасности доступ к наступательным возможностям Grok 4.7 для исследовательских целей — по приглашениям.
Как получить доступ к Grok 4.7
Доступно три входа. Первый — бесплатный через среду разработки Grok Build (сайт x.ai/build и мобильное приложение). Второй — редактор кода Cursor, где модель подключили в день релиза. Третий — для тех, кто строит свои продукты: ключи выдаются в консоли разработчика console.x.ai. Модель доступна под именем grok-4.7, контекстное окно — 500 тысяч токенов, на вход принимаются текст и изображения. Оттуда же она подключается к сторонним IDE, маршрутизаторам моделей и облачным платформам. Для оплаты из России, как и с любым зарубежным API, потребуется иностранная карта; официальной поддержки региона у SpaceXAI нет.
Длинный контекст: экономика для контент-проектов
Для вебмастеров и авторов ценность Grok 4.7 не в бенчмарках, а в арифметике. Половина миллиона токенов контекста за 2 доллара означает, что в один запрос помещается крупный раздел сайта целиком, а прогон обходится в единицы центов. Под такую ставку становятся рентабельными задачи, которые раньше считали слишком дорогими для модели верхнего уровня: массовая переработка описаний, сверка сотен страниц между собой, разбор больших выгрузок.
Знания обрываются на май 2026 года
Важное ограничение: данные обучения Grok 4.7 заканчиваются маем 2026 года. Без включённого поиска модель не знает ничего о событиях после этой даты. Для новостных и обзорных материалов поисковые инструменты в запросе нужно подключать явно.
Итог: ставка сделана на стоимость часа работы
Grok 4.7 не пытается быть первой строчкой в каждой таблице — в половине тестов таковой не становится. Заявка построена иначе: результат флагманского класса по ставке, которая у конкурентов идёт за средний сегмент, и главный аргумент — стоимость закрытой задачи, а не проценты. Проверить заявку получится быстро: модель уже стоит в Cursor и API, значит первые честные цифры по расходу токенов на длинных задачах появятся в ближайшие недели — от тех, кто гоняет её на своём коде, а не на бенчмарках вендора. Если разрыв в Terminal-Bench подтвердится на живой работе, дешевизна перестанет быть решающим доводом для агентных сценариев.
