Корона

Нейросеть научилась рассуждать без примеров рассуждений — только за счёт награды за верный ответ

DeepSeekработа от 22 января 2025 г.3 мин чтения
Схема рассуждения: цепочка шагов с оранжевой стрелкой возврата «Подожди… проверю ещё раз»
Схема: редакция «Короны»

Раньше модели учили рассуждать на примерах: люди писали пошаговые решения, модель их копировала. Команда DeepSeek проверила другой путь — обучение с подкреплением, где модель получает награду только за правильный итоговый ответ. Без единого человеческого примера рассуждения у модели появились длинные размышления и самопроверка. Работа вышла в Nature в 2025 году.

Что именно исследовали

Авторы хотели понять, нужно ли модели показывать, как рассуждать, или она может научиться этому сама, если правильно поставить задачу.

Эксперимент провели на базовой модели DeepSeek-V3-Base. Первая версия, DeepSeek-R1-Zero, обучалась только с подкреплением — без предварительного обучения на примерах решений.

Как это работает

Модель решает задачи по математике и программированию, где ответ можно проверить автоматически. На каждую задачу она пишет несколько решений. Решения сравниваются между собой, и те, что лучше среднего по группе, закрепляются. Метод называется GRPO.

Награда простая: верный ли ответ и соблюдён ли формат — рассуждения в отдельном блоке. Как именно рассуждать, модели не говорят.

Это похоже на обучение шахматам только по итогу партии: никто не объясняет ходы, но со временем игрок сам находит приёмы, которые ведут к победе.

Что ИИ теперь умеет

  • Сама выделять больше «времени на размышление» трудным задачам
  • Проверять собственное решение и возвращаться к ошибке — «подожди, проверю ещё раз»
  • Менять стратегию посреди решения
  • Передавать умение рассуждать небольшим моделям через дообучение на своих ответах

Что показал эксперимент

R1-Zero на AIME 2024: 15,6% → 71,0%. Доля решённых задач американской математической олимпиады с первой попытки. При голосовании 64 ответов — 86,7%.

«Момент озарения». В середине обучения модель начала сама писать фразы вроде «Wait, wait. Wait. That's an aha moment» и пересматривать подход. Этому её не учили.

DeepSeek-R1: 79,8% на AIME 2024 и 97,3% на MATH-500.

Маленькие модели. Шесть «учеников» от 1,5 до 70 миллиардов параметров, обученных на ответах R1. Модель на 7 миллиардов решила 55,5% задач AIME 2024 — больше, чем QwQ-32B-Preview.

Что пока не работает

  • У R1-Zero рассуждения плохо читались, а языки внутри ответа перемешивались. Чтобы это исправить, для итоговой R1 всё же понадобилось немного примеров и дополнительные этапы обучения.
  • Награда ставилась за проверяемые ответы — в математике и программировании. Там, где правильный ответ нельзя проверить автоматически, так учить сложнее.
  • Длинное рассуждение не гарантирует верного ответа: модель может уверенно «проверить» и ошибочное решение.

Почему это важно

Работа показала, что умение рассуждать не обязательно вкладывать примерами — его можно вырастить наградой. Это изменило подход к обучению «думающих» моделей.

Веса DeepSeek-R1 открыты под лицензией MIT, поэтому результат смогли проверить и повторить другие лаборатории.

Можно ли попробовать

Оригинальное исследование

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Авторы
DeepSeek-AI: Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang и др. (около 200 авторов)
Организация
DeepSeek-AI
Дата
22 января 2025 г.
Тип
Научная статья
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Формула aⁿ + bⁿ ≠ cⁿ над деревом лемм с оранжевой галочкой проверки
Reasoning

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил

За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Anthropic Researchсентябрь 2026 · 2 мин
ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
Схема задачи ARC: примеры сеток «было — стало», круг «мысль» и сетка-ответ
Reasoning

Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно

BDH-CQ от Pathway на 150 миллионов параметров решает задачи на абстрактное мышление ARC-AGI-1, не проговаривая рассуждения словами. Результат — 29,5% при стоимости около $0,0007 за задачу: по соотношению цены и точности это новый рекорд.

Pathwayавгуст 2026 · 2 мин
Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно
Схема: множество серых точек и оранжевый круг с двадцатью пятью точками в центре
Interpretability

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать

Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

Anthropic Interpretabilityиюль 2026 · 2 мин
В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать