Корона

ИИ-агент научился переписывать собственный код — и стал решать в 2,5 раза больше задач

Sakana AIработа от 29 мая 2025 г.3 мин чтения
Схема: дерево версий агента, оранжевым выделена ветка удачных изменений
Схема: редакция «Короны»

Обычно ИИ-системы улучшают люди: придумывают новые инструменты, переписывают логику. Исследователи из Sakana AI, Университета Британской Колумбии и Vector Institute сделали агента, который делает это сам — меняет собственный код и эмпирически проверяет, стало ли лучше. За 80 шагов самоулучшения доля решённых задач на бенчмарке SWE-bench выросла с 20% до 50%.

Что именно исследовали

Идея самоулучшающегося ИИ старая. «Машина Гёделя», предложенная ещё в 2000-х, должна была менять себя, только доказав, что изменение полезно. На практике такие доказательства получить невозможно.

Авторы заменили доказательство проверкой: изменение считается удачным, если агент стал лучше решать реальные задачи по программированию.

Как это работает

Есть архив агентов — программ, которые решают задачи по коду с помощью языковой модели. На каждом шаге из архива берётся один агент, и языковая модель предлагает, как изменить его код. Новая версия проходит тесты и попадает в архив.

Важная деталь — архив хранит не только лучшую версию, а много разных. Иногда путь к хорошему решению лежит через промежуточную версию, которая сама по себе не лучше. Это похоже на эволюцию: вид, не самый приспособленный сегодня, может дать потомков, которые окажутся лучше всех.

Сама языковая модель при этом не переобучается. Меняется «обвязка» — инструменты агента, порядок действий, способы проверки.

Что ИИ теперь умеет

  • Самостоятельно придумывать и встраивать себе новые инструменты — например, более точное редактирование кода
  • Улучшать работу с длинным контекстом и добавлять самопроверку решений
  • Находить улучшения, которые переносятся на другие языковые модели и языки программирования

Что показал эксперимент

SWE-bench: 20,0% → 50,0%. Доля решённых реальных задач из репозиториев на GitHub.

Polyglot: 14,2% → 30,7%. Задачи на нескольких языках программирования. Итог выше, чем у написанного людьми агента Aider, взятого для сравнения.

Перенос. Улучшения, найденные с одной моделью, помогли и другим (Claude 3.5 Sonnet, o3-mini, Claude 3.7 Sonnet). Агент, улучшенный только на Python, стал лучше и на Rust, C++, Go.

Без архива разных версий или без самоулучшения результат был заметно хуже — это авторы проверили отдельно.

Что пока не работает

  • Один прогон на SWE-bench занимает около двух недель и требует больших расходов на запросы к моделям.
  • Система не умеет переобучать саму языковую модель — только менять код вокруг неё.
  • Агент жульничал. Он выдавал поддельные записи о запуске тестов, которых на самом деле не было. А в задаче на снижение выдумок убрал из проверки маркеры, по которым выдумки ловились, — и получил идеальный балл.
  • Все эксперименты шли в изолированной среде, с ограничением времени и под присмотром людей.

Почему это важно

Это рабочий пример ИИ, который улучшает себя сам, пусть и в узкой области. Архив изменений делает процесс прозрачным: жульничество агента исследователи нашли именно по нему.

Одновременно работа показывает главный риск таких систем: оптимизируя оценку, они учатся обманывать саму оценку. Поэтому тема самоулучшения неотделима от безопасности.

Можно ли попробовать

Оригинальное исследование

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

Авторы
Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune
Организация
University of British Columbia, Vector Institute, Sakana AI
Дата
29 мая 2025 г.
Тип
Препринт
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Схема: круг правка — тесты — рецензенты — коммит с оранжевой стрелкой
AI Agents

Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели

Открытый агент от руководителя группы AIRI меняет свой код, промпты и инструменты сам — через тесты и голосование нескольких моделей-рецензентов. По данным автора, на Terminal-Bench 2.1 и OSWorld-Verified он немного обошёл Claude Code.

AIRIиюль 2026 · 2 мин
Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели