Корона

ИИ-агенты справляются со всё более длинными задачами: срок удваивается примерно каждые семь месяцев

METRработа от 18 марта 2025 г.3 мин чтения
График: точки на логарифмической шкале времени задач поднимаются вдоль оранжевой пунктирной прямой
Схема: редакция «Короны»

«Модель набрала 85% на бенчмарке» мало что говорит о реальной работе. Исследовательская организация METR предложила понятную меру: насколько длинные задачи (в часах работы человека-специалиста) ИИ выполняет в половине случаев. У Claude 3.7 Sonnet, лучшей модели на момент исследования, это около 50 минут. Главное открытие — рост: этот горизонт удваивается примерно каждые семь месяцев уже шесть лет.

Что именно исследовали

Бенчмарки быстро «насыщаются»: модели набирают почти максимум, и тест перестаёт различать их. К тому же проценты не переводятся в человеческие мерки.

Авторы ввели метрику «горизонт задач при 50% успеха» — длину задач по времени специалиста, с которыми модель справляется в половине случаев.

Как это работает

Сначала замерили людей: специалисты выполняли задачи по программированию и машинному обучению из наборов RE-Bench, HCAST и 66 новых коротких задач. Так у каждой задачи появилось «человеческое время».

Потом те же задачи дали моделям разных лет — с 2019 по 2025 год — и для каждой посчитали, на какой длине задачи успех падает до 50%.

Это похоже на оценку бегуна не по баллам, а по дистанции, которую он пробегает: сразу понятно, что значит «стал лучше».

Что ИИ теперь умеет

  • Выполнять многошаговые задачи по программированию, на которые у специалиста уходит около часа, — в половине случаев
  • Почти всегда справляться с задачами короче четырёх минут
  • Работать как агент: самостоятельно пользоваться инструментами и доводить задачу до конца без подсказок человека

Что показал эксперимент

Около 50 минут. Горизонт Claude 3.7 Sonnet при 50% успеха.

Удвоение каждые ~7 месяцев. Так рос горизонт последние шесть лет. По данным только за 2024–2025 годы рост был быстрее.

Короткое и длинное. Задачи короче 4 минут модели решают почти всегда, задачи длиннее примерно 4 часов — меньше чем в 10% случаев.

Авторы продлевают тренд: если он продержится ещё 2–4 года, агенты смогут выполнять широкий круг задач длиной в неделю, а к концу десятилетия — проекты на месяц. Это экстраполяция, а не гарантия, и её неопределённость авторы разбирают отдельно.

Код анализа и данные открыты: github.com/METR/eval-analysis-public.

Что пока не работает

  • 50% успеха — это не надёжность. Для задач, где нужна почти безошибочная работа, горизонт заметно короче.
  • Задачи — из программирования и ML, чётко поставленные и автоматически проверяемые. Реальная работа грязнее.
  • Результат зависит от выбора задач и способа замера людей.
  • Экстраполяция на годы вперёд сильно неопределённа: выбор периода для расчёта сдвигает оценки примерно на 2,5 года.

Почему это важно

Метрика даёт понятную шкалу: не «модель стала на 5% лучше», а «модель справляется с задачами на час вместо задач на десять минут». Её используют, чтобы отслеживать рост автономности агентов — в том числе для оценки рисков.

Можно ли попробовать

Оригинальное исследование

Measuring AI Ability to Complete Long Software Tasks

Авторы
Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia и др. (26 авторов), Elizabeth Barnes, Lawrence Chan
Организация
METR (Model Evaluation & Threat Research)
Дата
18 марта 2025 г.
Тип
Препринт
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Формула aⁿ + bⁿ ≠ cⁿ над деревом лемм с оранжевой галочкой проверки
Reasoning

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил

За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Anthropic Researchсентябрь 2026 · 2 мин
ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
График: оранжевая ступенчатая линия лучших методов ИИ поднимается выше пунктира «лучшие идеи людей»
AI Safety

ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей

Anthropic дала агентам на Claude Opus 4.8 задачу: найти способ дообучить модель так, чтобы она меньше лгала, льстила или поддавалась взлому. По десяти видам сбоев агенты нашли методы, которые работают и на новых тестах, и на моделях в 4,7 раза крупнее.

Anthropic Researchавгуст 2026 · 3 мин
ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей
Схема: круг правка — тесты — рецензенты — коммит с оранжевой стрелкой
AI Agents

Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели

Открытый агент от руководителя группы AIRI меняет свой код, промпты и инструменты сам — через тесты и голосование нескольких моделей-рецензентов. По данным автора, на Terminal-Bench 2.1 и OSWorld-Verified он немного обошёл Claude Code.

AIRIиюль 2026 · 2 мин
Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели