Поиск

OpenAI признала негодным бенчмарк SWE-Bench Pro: до 34% задач сломаны, рекомендация отозвана

OpenAI признала негодным бенчмарк SWE-Bench Pro: до 34% задач сломаны, рекомендация отозвана

Компания OpenAI опубликовала результаты масштабного аудита SWE-Bench Pro — одного из ключевых бенчмарков для оценки навыков программирования у агентных ИИ-систем. Проверка выявила серьезные недостатки: от 27 до 34% задач в тестовом наборе содержат ошибки, делающие их непригодными для объективного измерения качества моделей. В связи с этим OpenAI официально отзывает свою предыдущую рекомендацию промышленности переходить на этот стандарт.

Как проводилась проверка: два независимых этапа

Аудит был организован в два этапа, чтобы минимизировать субъективность. Сначала автоматический фильтр проанализировал 731 задачу из публичной части бенчмарка, отобрал 286 потенциально проблемных и направил их на глубокую экспертизу.

Агентный аудит

На первом этапе задействованы ИИ-агенты на базе Codex. Они получили доступ к репозиториям и тестовым окружениям, прогнали проверки, изучили типичные ошибки моделей. Финальное решение о статусе каждой задачи принимал живой исследователь. Этот путь подтвердил брак у 200 задач (27,4% от общего числа).

Ручная разметка инженерами

Параллельно пять опытных разработчиков независимо оценивали каждую помеченную задачу: условие, тесты и эталонное решение («gold patch»). Разногласия решались дополнительной проверкой. Люди обнаружили больше дефектов — 249 задач (34,1%).

Четыре типовые причины поломки задач

Аналитики OpenAI выделяют четыре системные проблемы, из-за которых бенчмарк дает зашумленные результаты:

  • Слишком строгие тесты проверяют конкретную реализацию, не упомянутую в условии, и заваливают решения, которые по сути работают правильно.
  • Недостаточно описанные условия не называют требование, которое потом проверяет скрытый тест; угадать его невозможно.
  • Тесты с низким покрытием пропускают недоделанные решения, потому что проверяют не всё, что просит задача.
  • Вводящее в заблуждение условие направляет модель не туда, куда потом смотрят тесты.

Яркий пример из отчёта — задача OpenLibrary-77c16d5 про сериализацию оглавления в Markdown. Условие показывало строки с одним пробелом перед вертикальной чертой, а скрытый тест требовал два пробела. Модель, честно следовавшая условию, гарантированно проваливала проверку.

Агенты и люди: сходства и расхождения

Пересечение оценок между агентным пайплайном и человеческой разметкой составило 74%: в основном стороны согласовывались в категоризации дефектов. Однако люди чаще признавали задачу сломанной вообще и чаще находили в одной задаче сразу несколько проблем.

Наибольший разрыв проявился на тестах с низким покрытием. Инженеры назвали эту проблему основной для 9,4% бенчмарка, в то время как автоматический аудит зафиксировал её только в 4,1% случаев. Автоматическая проверка оказалась заметно консервативнее человеческой — важный момент для всех, кто полагается исключительно на автотесты.

Второй бенчмарк, который OpenAI признает негодным

Это уже второй случай, когда OpenAI публично отказывается от рекомендованного ею стандарта. Ранее компания признала устаревшим SWE-bench Verified (предшественник Pro) из-за проблем с дизайном задач и утечки данных в обучающие выборки, и посоветовала переходить на SWE-Bench Pro от Scale AI. За восемь месяцев модели подняли долю решённых задач с 23,3% до 80,3%. Теперь выясняется, что значительная часть этого прогресса могла быть иллюзорной: где-то тесты занижали результаты из-за излишней придирчивости, где-то завышали, пропуская неполные решения.

Замены нет — есть призыв к сообществу

OpenAI не предлагает готовый альтернативный бенчмарк. Вместо этого компания призывает сообщество создавать новые тесты с нуля: силами опытных разработчиков, с жёстким человеческим контролем на каждом этапе. Практический вывод для всех, кто сравнивает модели по агентному кодингу: к процентам SWE-Bench Pro в чужих пресс-релизах стоит относиться с осторожностью, пока не появится тест с прозрачной методикой проверки самих задач.

Заодно ситуация демонстрирует обратную сторону растущих возможностей ИИ. Агенты стали достаточно надёжными, чтобы вскрывать брак в собственных экзаменах.

10:22
83
Нет комментариев. Ваш будет первым!