
Anthropic объявит о постоянной команде внешних проверяющих
12 сентября глава компании Дарио Амодей опубликовал эссе, в котором обозначил три шага для усиления контроля за быстрорастущими возможностями ИИ‑моделей. Первый шаг – создание собственной команды внешних экспертов, которая будет работать непосредственно в офисах Anthropic, иметь доступ к внутренним ресурсам и возможность публиковать свои выводы без предварительного согласования руководства. Это решение представлено как реакция на разрыв между темпом роста моделей и существующими механизмами их оценки.
Что получит внешняя команда в офисах Anthropic
Экспертам будут предоставлены рабочие места, корпоративные пропуска и ноутбуки компании. Их права и уровни доступа будут сопоставимы с теми, что имеют внутренние группы оценки рисков. Ограничения на их деятельность сводятся лишь к трём случаям: противоречие действующему законодательству, нарушение обязательств перед партнёрами и раскрытие персональных данных клиентов. При этом команда получит возможность изучать не только готовые модели, но и процессы их обучения, внутренние оценки опасных способностей и соблюдение Anthropic собственных обещаний по безопасности.
Право публиковать неудобные выводы
По условиям контракта внешняя команда сможет публиковать отчёты об уровне рисков, выявленных инцидентах и внутренних практиках без редакторского вмешательства со стороны Anthropic. Компания оставляет за собой право удалять из текстов информацию, подпадающую под категории коммерческой тайны, адвокатской привилегии, данных, защищённых законом, либо сведения третьих лиц. Однако любое такое изъятие должно быть открыто указано в публикации – попытка скрыть важный факт сама по себе станет предметом обсуждения, что снижает риск негласной цензуры.
Реакция OpenAI и Илона Маска
В тот же день Сэм Альтман разместил короткую запись в соцсети X, где согласился с предложением Амодея и заявил, что OpenAI намерен последовать примеру. Детали о сроках, названии организации или объёме доступа пока не раскрыты. Илон Маск поддержал идею лаконичным комментарием «Dario is right». В настоящее время у OpenAI уже существует процедура привлечения внешних оценщиков, но их публикации проходят внутреннее утверждение, поэтому для выполнения обещания потребуется изменить существующие соглашения.
От временного контракта с METR к постоянному присутствию
До этого Anthropic уже сотрудничала с исследовательской организацией METR, которая оценивала опасные способности моделей в рамках восьминедельного соглашения с возможностью продления. Новое обязательство превращает такой разовый проект в постоянное присутствие внешних специалистов внутри компании, аналогично практике банковского надзора, где регуляторы располагаются непосредственно в контролируемом учреждении.
Два следующих шага, которые ещё не обещаны
Второй шаг, описанный Амодеем, предполагает достижение согласия между лабораториями демократических стран по общим стандартам безопасности и ограничению темпа развития моделей через систему контрольных точек. Для реализации этой инициативы потребуется исключение из антимонопольного законодательства, позволяющее компаниям обсуждать вопросы безопасности без риска претензий по сговору. Третий шаг – диалог с недемократическими государствами о возможном ограничении скорости самоусовершенствования ИИ по образцу договоров о стратегической стабильности. Полная приостановка тренировок моделей считается маловероятной, но обсуждение такого сценария остаётся на повестке дня.
Критика и альтернативные предложения
Инвестор Чамат Палихапития усмотрел в предложении Anthropic попытку сконцентрировать власть в руках одной компании под предлогом обеспечения безопасности. Журналист Брайан Merchant отметил, что инициатива может выгодно сразу и Anthropic, и OpenAI. Клеман Деланг из Hugging Face ответил иначе, предложив создать открытую инициативу Open Alignment Initiative и пригласить внешних проверяющих в свои программы, подчеркнув, что вопросы согласования ИИ слишком важны, чтобы решаться за закрытыми дверями нескольких лабораторий.
Почему это может быть полезно разработчикам
Для инженеров, запускающих ИИ‑агентов в собственных системах, появление независимых отчётов станет дополнительным источником информации о реальном поведении моделей во время обучения и тестирования. Такие данные могут дополнить традиционные модельные карточки, помогая лучше оценивать риски перед предоставлением автономных возможностей.
Вывод
Anthropic делает первый шаг к более открытой системе надзора за ИИ‑технологиями, предоставляя внешним экспертам доступ, сопоставимый с внутренними командами, и право публиковать свои выводы без цензуры. Реакция конкурентов и экспертов показывает, что идея находит отклик, но её полная реализация потребует преодоления регуляторных и правовых барьеров, а также поиска согласия с различными заинтересованными сторонами.
