ИИ-агенты справляются со всё более длинными задачами: срок удваивается примерно каждые семь месяцев

«Модель набрала 85% на бенчмарке» мало что говорит о реальной работе. Исследовательская организация METR предложила понятную меру: насколько длинные задачи (в часах работы человека-специалиста) ИИ выполняет в половине случаев. У Claude 3.7 Sonnet, лучшей модели на момент исследования, это около 50 минут. Главное открытие — рост: этот горизонт удваивается примерно каждые семь месяцев уже шесть лет.
Что именно исследовали
Бенчмарки быстро «насыщаются»: модели набирают почти максимум, и тест перестаёт различать их. К тому же проценты не переводятся в человеческие мерки.
Авторы ввели метрику «горизонт задач при 50% успеха» — длину задач по времени специалиста, с которыми модель справляется в половине случаев.
Как это работает
Сначала замерили людей: специалисты выполняли задачи по программированию и машинному обучению из наборов RE-Bench, HCAST и 66 новых коротких задач. Так у каждой задачи появилось «человеческое время».
Потом те же задачи дали моделям разных лет — с 2019 по 2025 год — и для каждой посчитали, на какой длине задачи успех падает до 50%.
Это похоже на оценку бегуна не по баллам, а по дистанции, которую он пробегает: сразу понятно, что значит «стал лучше».
Что ИИ теперь умеет
- Выполнять многошаговые задачи по программированию, на которые у специалиста уходит около часа, — в половине случаев
- Почти всегда справляться с задачами короче четырёх минут
- Работать как агент: самостоятельно пользоваться инструментами и доводить задачу до конца без подсказок человека
Что показал эксперимент
Около 50 минут. Горизонт Claude 3.7 Sonnet при 50% успеха.
Удвоение каждые ~7 месяцев. Так рос горизонт последние шесть лет. По данным только за 2024–2025 годы рост был быстрее.
Короткое и длинное. Задачи короче 4 минут модели решают почти всегда, задачи длиннее примерно 4 часов — меньше чем в 10% случаев.
Авторы продлевают тренд: если он продержится ещё 2–4 года, агенты смогут выполнять широкий круг задач длиной в неделю, а к концу десятилетия — проекты на месяц. Это экстраполяция, а не гарантия, и её неопределённость авторы разбирают отдельно.
Код анализа и данные открыты: github.com/METR/eval-analysis-public.
Что пока не работает
- 50% успеха — это не надёжность. Для задач, где нужна почти безошибочная работа, горизонт заметно короче.
- Задачи — из программирования и ML, чётко поставленные и автоматически проверяемые. Реальная работа грязнее.
- Результат зависит от выбора задач и способа замера людей.
- Экстраполяция на годы вперёд сильно неопределённа: выбор периода для расчёта сдвигает оценки примерно на 2,5 года.
Почему это важно
Метрика даёт понятную шкалу: не «модель стала на 5% лучше», а «модель справляется с задачами на час вместо задач на десять минут». Её используют, чтобы отслеживать рост автономности агентов — в том числе для оценки рисков.
Можно ли попробовать
Оригинальное исследование
Measuring AI Ability to Complete Long Software Tasks
- Авторы
- Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia и др. (26 авторов), Elizabeth Barnes, Lawrence Chan
- Организация
- METR (Model Evaluation & Threat Research)
- Дата
- 18 марта 2025 г.
- Тип
- Препринт
Ещё исследования

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

ИИ-исследователи научились сами исправлять опасное поведение моделей — и обошли идеи опытных людей
Anthropic дала агентам на Claude Opus 4.8 задачу: найти способ дообучить модель так, чтобы она меньше лгала, льстила или поддавалась взлому. По десяти видам сбоев агенты нашли методы, которые работают и на новых тестах, и на моделях в 4,7 раза крупнее.

Агент Ouroboros переписывает собственный код, но каждую правку сначала проверяют другие модели
Открытый агент от руководителя группы AIRI меняет свой код, промпты и инструменты сам — через тесты и голосование нескольких моделей-рецензентов. По данным автора, на Terminal-Bench 2.1 и OSWorld-Verified он немного обошёл Claude Code.