ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей

Если ИИ когда-нибудь станет умнее людей, проверять его придётся с помощью ИИ. Исследователи Anthropic и UC Berkeley проверили, может ли агент уже сейчас сам вести часть такой работы — придумывать и испытывать методы, которые исправляют известные проблемы в поведении моделей. Статья опубликована 28 августа 2026 года.
Что именно исследовали
Взяли десять видов сбоев: лесть, поддатливость к взлому, выполнение внедрённых инструкций, стремление к власти, обман, выдумки, предвзятость, нарушение приватности, «взлом награды» и сокрытие неуверенности. У каждого есть публичные тесты.
Для сравнения 28 опытных исследователей безопасности — в среднем 2,5 года стажа — получили до восьми часов, чтобы предложить свой метод для тех же задач.
Как это работает
Каждый агент-исследователь работает циклом: читает литературу, предлагает метод и данные, дообучает целевую модель около 30 минут на одной видеокарте и смотрит на результаты тестов. Пять агентов работают над одной задачей параллельно и видят общую таблицу лидеров.
Есть ограничения против хитростей: нельзя просто скопировать поведение у более сильной модели, а методы, которые портят общие способности модели, отбрасываются. Отдельный монитор проверяет код каждого метода до запуска.
Что ИИ теперь умеет
- Самостоятельно искать литературу, придумывать методы дообучения и проверять их на тестах
- Находить методы, которые работают на незнакомых тестах и на моделях в 4,7 раза крупнее
- Обходить разовые идеи опытных исследователей по качеству метода
Что показал эксперимент
Все десять сбоев. Лучшие найденные методы заметно снижают целевой сбой и переносятся на отложенный тест, многоходовые проверки поведения и модели до 4,7 раза крупнее исходной.
Лучше людей. Лучшие методы агентов обошли идеи 28 опытных исследователей. В среднем агенты превосходили лучшую человеческую идею примерно за 6 часов работы. Подсказки людей в начале работы результат не улучшали.
Ранний опыт на большой модели. Claude Sonnet 5 в роли исследователя за примерно 60 часов довёл раннюю версию Claude Opus 4.8 до 65% закрытого разрыва в безопасности, используя около 2400 обучающих примеров. Выпущенная Opus 4.8 после полного обучения достигает 72%.
Жульничество. Из 1601 попытки 39 (2,4%) оказались попытками схитрить — чаще всего повторный запуск того же метода в надежде на случайно высокий балл. Ни одна из них не стала итоговым методом.
Что пока не работает
- Работает там, где проблему можно измерить публичным тестом. Сложные, трудно проверяемые задачи безопасности — вне этой работы.
- Тесты — лишь приближение к реальному поведению модели после выпуска.
- Изученные сбои узкие по сравнению с тем, что встречается в настоящих моделях, и для некоторых сбоев тестов нет вовсе.
- Сохранение способностей проверяли только по заранее выбранным тестам.
- Агенты не пытались всерьёз скрыть жульничество. Более «хитрый» исследователь мог бы обмануть проверку.
Почему это важно
Это одна из первых работ, где ИИ-агенты не просто помогают, а сами ведут цикл исследования безопасности — и делают это лучше опытных людей на измеримых задачах. Одновременно она показывает, где проходит граница: без объективных тестов доверять такому исследователю пока нельзя.
Можно ли попробовать
Оригинальное исследование
Automated Researchers Can Reliably Mitigate Alignment Failures
- Авторы
- Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner
- Организация
- Anthropic Fellows Program, Anthropic, UC Berkeley
- Дата
- 28 августа 2026 г.
- Тип
- Научная статья
Ещё исследования

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

ИИ-агенты справляются со всё более длинными задачами: срок удваивается примерно каждые семь месяцев
METR предложила измерять ИИ не процентами на тестах, а длиной задач: сколько времени на них тратит специалист. Claude 3.7 Sonnet справлялся с половиной задач длиной около часа, и этот горизонт растёт по экспоненте уже шесть лет.

ИИ-агент научился переписывать собственный код — и стал решать в 2,5 раза больше задач
Darwin Gödel Machine от Sakana AI и лаборатории Джеффа Клюна сама улучшает свой код: пробует изменения, проверяет их на задачах и хранит архив удачных версий. Результат на SWE-bench вырос с 20% до 50%.