Нейросеть научилась рассуждать без примеров рассуждений — только за счёт награды за верный ответ

Раньше модели учили рассуждать на примерах: люди писали пошаговые решения, модель их копировала. Команда DeepSeek проверила другой путь — обучение с подкреплением, где модель получает награду только за правильный итоговый ответ. Без единого человеческого примера рассуждения у модели появились длинные размышления и самопроверка. Работа вышла в Nature в 2025 году.
Что именно исследовали
Авторы хотели понять, нужно ли модели показывать, как рассуждать, или она может научиться этому сама, если правильно поставить задачу.
Эксперимент провели на базовой модели DeepSeek-V3-Base. Первая версия, DeepSeek-R1-Zero, обучалась только с подкреплением — без предварительного обучения на примерах решений.
Как это работает
Модель решает задачи по математике и программированию, где ответ можно проверить автоматически. На каждую задачу она пишет несколько решений. Решения сравниваются между собой, и те, что лучше среднего по группе, закрепляются. Метод называется GRPO.
Награда простая: верный ли ответ и соблюдён ли формат — рассуждения в отдельном блоке. Как именно рассуждать, модели не говорят.
Это похоже на обучение шахматам только по итогу партии: никто не объясняет ходы, но со временем игрок сам находит приёмы, которые ведут к победе.
Что ИИ теперь умеет
- Сама выделять больше «времени на размышление» трудным задачам
- Проверять собственное решение и возвращаться к ошибке — «подожди, проверю ещё раз»
- Менять стратегию посреди решения
- Передавать умение рассуждать небольшим моделям через дообучение на своих ответах
Что показал эксперимент
R1-Zero на AIME 2024: 15,6% → 71,0%. Доля решённых задач американской математической олимпиады с первой попытки. При голосовании 64 ответов — 86,7%.
«Момент озарения». В середине обучения модель начала сама писать фразы вроде «Wait, wait. Wait. That's an aha moment» и пересматривать подход. Этому её не учили.
DeepSeek-R1: 79,8% на AIME 2024 и 97,3% на MATH-500.
Маленькие модели. Шесть «учеников» от 1,5 до 70 миллиардов параметров, обученных на ответах R1. Модель на 7 миллиардов решила 55,5% задач AIME 2024 — больше, чем QwQ-32B-Preview.
Что пока не работает
- У R1-Zero рассуждения плохо читались, а языки внутри ответа перемешивались. Чтобы это исправить, для итоговой R1 всё же понадобилось немного примеров и дополнительные этапы обучения.
- Награда ставилась за проверяемые ответы — в математике и программировании. Там, где правильный ответ нельзя проверить автоматически, так учить сложнее.
- Длинное рассуждение не гарантирует верного ответа: модель может уверенно «проверить» и ошибочное решение.
Почему это важно
Работа показала, что умение рассуждать не обязательно вкладывать примерами — его можно вырастить наградой. Это изменило подход к обучению «думающих» моделей.
Веса DeepSeek-R1 открыты под лицензией MIT, поэтому результат смогли проверить и повторить другие лаборатории.
Можно ли попробовать
Оригинальное исследование
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Авторы
- DeepSeek-AI: Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang и др. (около 200 авторов)
- Организация
- DeepSeek-AI
- Дата
- 22 января 2025 г.
- Тип
- Научная статья
Ещё исследования

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно
BDH-CQ от Pathway на 150 миллионов параметров решает задачи на абстрактное мышление ARC-AGI-1, не проговаривая рассуждения словами. Результат — 29,5% при стоимости около $0,0007 за задачу: по соотношению цены и точности это новый рекорд.

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.