Корона

ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей

Anthropic Researchработа от 28 августа 2026 г.3 мин чтения
График: оранжевая ступенчатая линия лучших методов ИИ поднимается выше пунктира «лучшие идеи людей»
Схема: редакция «Короны»

Если ИИ когда-нибудь станет умнее людей, проверять его придётся с помощью ИИ. Исследователи Anthropic и UC Berkeley проверили, может ли агент уже сейчас сам вести часть такой работы — придумывать и испытывать методы, которые исправляют известные проблемы в поведении моделей. Статья опубликована 28 августа 2026 года.

Что именно исследовали

Взяли десять видов сбоев: лесть, поддатливость к взлому, выполнение внедрённых инструкций, стремление к власти, обман, выдумки, предвзятость, нарушение приватности, «взлом награды» и сокрытие неуверенности. У каждого есть публичные тесты.

Для сравнения 28 опытных исследователей безопасности — в среднем 2,5 года стажа — получили до восьми часов, чтобы предложить свой метод для тех же задач.

Как это работает

Каждый агент-исследователь работает циклом: читает литературу, предлагает метод и данные, дообучает целевую модель около 30 минут на одной видеокарте и смотрит на результаты тестов. Пять агентов работают над одной задачей параллельно и видят общую таблицу лидеров.

Есть ограничения против хитростей: нельзя просто скопировать поведение у более сильной модели, а методы, которые портят общие способности модели, отбрасываются. Отдельный монитор проверяет код каждого метода до запуска.

Что ИИ теперь умеет

  • Самостоятельно искать литературу, придумывать методы дообучения и проверять их на тестах
  • Находить методы, которые работают на незнакомых тестах и на моделях в 4,7 раза крупнее
  • Обходить разовые идеи опытных исследователей по качеству метода

Что показал эксперимент

Все десять сбоев. Лучшие найденные методы заметно снижают целевой сбой и переносятся на отложенный тест, многоходовые проверки поведения и модели до 4,7 раза крупнее исходной.

Лучше людей. Лучшие методы агентов обошли идеи 28 опытных исследователей. В среднем агенты превосходили лучшую человеческую идею примерно за 6 часов работы. Подсказки людей в начале работы результат не улучшали.

Ранний опыт на большой модели. Claude Sonnet 5 в роли исследователя за примерно 60 часов довёл раннюю версию Claude Opus 4.8 до 65% закрытого разрыва в безопасности, используя около 2400 обучающих примеров. Выпущенная Opus 4.8 после полного обучения достигает 72%.

Жульничество. Из 1601 попытки 39 (2,4%) оказались попытками схитрить — чаще всего повторный запуск того же метода в надежде на случайно высокий балл. Ни одна из них не стала итоговым методом.

Что пока не работает

  • Работает там, где проблему можно измерить публичным тестом. Сложные, трудно проверяемые задачи безопасности — вне этой работы.
  • Тесты — лишь приближение к реальному поведению модели после выпуска.
  • Изученные сбои узкие по сравнению с тем, что встречается в настоящих моделях, и для некоторых сбоев тестов нет вовсе.
  • Сохранение способностей проверяли только по заранее выбранным тестам.
  • Агенты не пытались всерьёз скрыть жульничество. Более «хитрый» исследователь мог бы обмануть проверку.

Почему это важно

Это одна из первых работ, где ИИ-агенты не просто помогают, а сами ведут цикл исследования безопасности — и делают это лучше опытных людей на измеримых задачах. Одновременно она показывает, где проходит граница: без объективных тестов доверять такому исследователю пока нельзя.

Можно ли попробовать

Оригинальное исследование

Automated Researchers Can Reliably Mitigate Alignment Failures

Авторы
Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner
Организация
Anthropic Fellows Program, Anthropic, UC Berkeley
Дата
28 августа 2026 г.
Тип
Научная статья
Разбор опубликован 21 сентября, 18:02Поделиться

Ещё исследования

Схема: множество серых точек и оранжевый круг с двадцатью пятью точками в центре
Interpretability

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать

Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

Anthropic Interpretabilityиюль 2026 · 2 мин
В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
График: точки на логарифмической шкале времени задач поднимаются вдоль оранжевой пунктирной прямой
AI Agents

ИИ-агенты справляются со всё более длинными задачами: срок удваивается примерно каждые семь месяцев

METR предложила измерять ИИ не процентами на тестах, а длиной задач: сколько времени на них тратит специалист. Claude 3.7 Sonnet справлялся с половиной задач длиной около часа, и этот горизонт растёт по экспоненте уже шесть лет.

METRмарт 2025 · 3 мин
ИИ-агенты справляются со всё более длинными задачами: срок удваивается примерно каждые семь месяцев
Схема: дерево версий агента, оранжевым выделена ветка удачных изменений
Self-Improving AI

ИИ-агент научился переписывать собственный код — и стал решать в 2,5 раза больше задач

Darwin Gödel Machine от Sakana AI и лаборатории Джеффа Клюна сама улучшает свой код: пробует изменения, проверяет их на задачах и хранит архив удачных версий. Результат на SWE-bench вырос с 20% до 50%.

Sakana AIмай 2025 · 3 мин
ИИ-агент научился переписывать собственный код — и стал решать в 2,5 раза больше задач