Корона

Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели

AIRIработа от 31 июля 2026 г.2 мин чтения
Схема: круг правка — тесты — рецензенты — коммит с оранжевой стрелкой
Схема: редакция «Короны»

Идея самоулучшающегося агента уже знакома по Darwin Gödel Machine. Антон Разжигаев, руководитель группы интерпретируемого ИИ в AIRI, и Андрей Казначеев развивают открытый агент Ouroboros, где ключевое внимание уделено контролю правок. 31 июля 2026 года проект подробно описан в блоге AIRI.

Что именно исследовали

Главный риск самоизменяющегося агента — он может «сломать» себя или обмануть собственные проверки. Автор проверял, можно ли дать агенту свободу менять весь свой код и при этом не потерять управляемость.

Как это работает

Каждая правка проходит несколько барьеров: автоматические тесты, голосование независимых моделей-рецензентов с кворумом, отдельную проверку «не уводит ли правка проект в сторону». Неудачное развёртывание откатывается, и агент разбирает, что пошло не так.

Основные принципы записаны в отдельном документе-«конституции», который агент обязан соблюдать. Похоже на команду разработчиков, где любой коммит проходит код-ревью и CI.

Что ИИ теперь умеет

  • Менять собственный код, промпты и инструменты с проверкой каждой правки
  • Запускать подагентов, которые предлагают изменения, оставляя последнее слово за основным агентом
  • Откатывать неудачные изменения и разбирать причины сбоя

Что показал эксперимент

Terminal-Bench 2.1: 86,7% с Claude Opus 5 против 83,8% у Claude Code — по данным автора.

OSWorld-Verified: 90,69% против прежнего лучшего результата 90,19%.

SWE-bench Pro: на уровне Codex CLI (58,2% против 59,4%).

Код открыт под лицензией MIT: github.com/razzant/ouroboros.

Что пока не работает

  • Все результаты — собственные замеры автора, без независимой проверки и без научной статьи.
  • Преимущество над Claude Code и Codex — единицы процентов, а на SWE-bench Pro его нет.
  • Агенту нужен большой бюджет на запросы к моделям.
  • Публичные бенчмарки могли попасть в обучающие данные моделей, что искажает сравнение.

Поэтому материал в разделе второстепенный: интересная инженерная идея контроля самоизменений, но не новая способность, подтверждённая независимо.

Почему это важно

Если агенты будут менять сами себя, главное — не сам факт правки, а контроль над ней. Ouroboros — открытый пример того, как такой контроль можно встроить в архитектуру.

Можно ли попробовать

Оригинальное исследование

Ouroboros: самоэволюционирующий ИИ-агент (публикация в блоге AIRI на Хабре)

Авторы
Антон Разжигаев, Андрей Казначеев
Организация
AIRI (публикация в блоге института); проект открытый
Дата
31 июля 2026 г.
Тип
Технический отчёт или блог лаборатории
Разбор опубликован 21 сентября, 18:02Поделиться

Ещё исследования

Формула aⁿ + bⁿ ≠ cⁿ над деревом лемм с оранжевой галочкой проверки
Reasoning

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил

За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Anthropic Researchсентябрь 2026 · 2 мин
ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
График: оранжевая ступенчатая линия лучших методов ИИ поднимается выше пунктира «лучшие идеи людей»
AI Safety

ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей

Anthropic дала агентам на Claude Opus 4.8 задачу: найти способ дообучить модель так, чтобы она меньше лгала, льстила или поддавалась взлому. По десяти видам сбоев агенты нашли методы, которые работают и на новых тестах, и на моделях в 4,7 раза крупнее.

Anthropic Researchавгуст 2026 · 3 мин
ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей
Схема цикла исследования: литература, гипотеза, эксперимент, анализ — стрелки по кругу
AI Scientists

ИИ сам прошёл цикл научного открытия: от обзора статей до кандидата в лекарство

Система Robin от FutureHouse сама изучила литературу, выдвинула гипотезы, спланировала эксперименты и разобрала их результаты. Люди только ставили опыты. Итог — ripasudil, лекарство от глаукомы, как кандидат для лечения сухой возрастной макулярной дегенерации.

FutureHouseмай 2025 · 3 мин
ИИ сам прошёл цикл научного открытия: от обзора статей до кандидата в лекарство