Meta представила Muse Code — терминального агента для долгих инженерных задач с восстановлением после сбоев

Компания Meta 5 августа объявила о запуске бета-доступа к Muse Code — терминальному агенту, способному самостоятельно выполнять сложные инженерные задачи в больших кодовых базах. Вместе с инструментом представлена языковая модель Muse Spark 1.2, специально обученная для работы в связке с агентом. Релиз подготовлен подразделением Meta Superintelligence Labs и позиционируется как шаг к созданию более мощных моделей следующего поколения.
Как работает Muse Code: архитектура, заточенная под долгие сессии
В отличие от большинства существующих агентов, которые для каждой подзадачи запускают отдельного временного помощника, Muse Code использует фоновые субагенты, сохраняющие контекст на протяжении всей рабочей сессии. Это устраняет необходимость повторно собирать информацию о проекте на каждом шаге, сокращает задержки и снижает частоту ручного вмешательства разработчика в многоходовых задачах.
Журнал событий как страховка от сбоев
Ключевая инженерная деталь — локальный журнал, в который записывается каждое обращение к модели, запуск инструмента, подтверждение и правка. Благодаря этому сессию можно воспроизвести ход за ходом, а после аварийного завершения агент продолжает работу ровно с той точки, где остановился. Для задач, длятягивающихся на часы, это критически важно: раньше любой сбой на середине означал старт с чистого листа.
Тест на выносливость: 24 часа оптимизации GPU-ядер
Главный демонстрационный кейс из анонса — оптимизация вычислительных ядер для видеокарт NVIDIA Hopper архитектуры. Запрет на использование готовых библиотек заставил Muse Spark 1.2 писать реализацию с нуля на языке Triton. Процесс занял более тысячи вызовов инструментов и до 24 часов непрерывной работы: модель писала код, компилировала его, снимала профили производительности и итеративно улучшала результат. Прирост производительности накапливался постепенно — сценарий, где качество решения зависит от длительной работы, а не от одного удачного ответа.
Ценообразование: платите деньгами или данными
Meta Model API предлагает два тарифа для Muse Spark 1.2. Стандартный: $1,25 за миллион входных токенов, $0,15 за миллион кэшированных входных и $4,25 за миллион выходных. Контрибьюторский вариант в десять раз дешевле — $0,10, $0,002 и $0,20 соответственно, но требует согласия на использование пользовательских данных для обучения будущих моделей Meta. Такая открытая оценочная модель пользовательских данных нетипична для отрасли, где подобные условия обычно прячут в мелком шрифте пользовательских соглашений.
Ограничения текущей версии
На старте официальный установщик доступен только для macOS и Linux — Windows не поддерживается. Статус продукта — бета. Сравнения с конкурентами (Claude Code, Codex) Meta проводит по собственным замерам на бенчмарках Terminal-Bench 2.1, DeepSWE 1.1 и внутреннем наборе задач; независимых аудитов пока нет. Доступ к модели предоставляется через Meta Model API, географическое покрытие которого компания постепенно расширяет.
Как попробовать на своём проекте
Muse Code поставляется с тремя встроенными сценариями работы:
- /plan — превращает задачу в пошаговый план с обязательным подтверждением каждого этапа;
- /grill — критически проверяет план, пока он не станет устойчивым;
- /goal — ведёт выполнение до достижения поставленной цели.
Разработчикам, уже использующим Claude Code или Codex, имеет смысл запустить Muse Code на одной и той же реальной задаче из своего репозитория — предпочтительно большой, с тестами и правками в нескольких модулях одновременно — чтобы сравнить качество и удобство инструментов в боевых условиях.
Ставка на выносливость вместо скорости
Muse Code входит на насыщенный рынок, где Claude Code и Codex уже сформировали привычки тысяч разработчиков. Главный козырь Meta — не скорость отдельного ответа, а устойчивость на дистанции: восстановление после сбоев, долгоживущие фоновые агенты, способность работать сутками без присмотра. Сработает ли эта стратегия, покажет качество работы на живых корпоративных репозиториях и первые независимые тесты. Пока картина сложена из подобранных компанией примеров.
