Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно

Большие модели решают головоломки на абстрактное мышление, рассуждая длинными текстами — это дорого. Компания Pathway предложила модель BDH-CQ, которая рассуждает в скрытом числовом пространстве, не превращая мысли в слова. 10 августа 2026 года вышла статья с результатами на ARC-AGI-1.
Что именно исследовали
ARC — набор головоломок: по нескольким примерам «было — стало» на цветных сетках нужно понять правило и применить его к новой сетке. Такие задачи проверяют умение обобщать, а не память.
Авторы изучали, чему модель учится из примеров, насколько последовательно применяет найденное правило и какие понятия остаются для неё трудными.
Как это работает
Примеры задачи подаются модели во время работы и непрерывно обновляют её рекуррентную память. Затем модель решает новый вход, многократно «прокручивая» вычисления в скрытом пространстве, — без промежуточного текста.
Это похоже на человека, который решает головоломку в уме, а не проговаривает каждый шаг вслух: быстрее и дешевле, хотя со стороны рассуждение не видно.
Что ИИ теперь умеет
- Выводить правило из нескольких примеров прямо во время решения, обновляя свою память
- Рассуждать многократными итерациями в скрытом пространстве, без проговаривания шагов
- Решать задачи на абстрактное мышление при очень низкой стоимости вычислений
Что показал эксперимент
29,5% на ARC-AGI-1 (с двух попыток) у конфигурации на 150 миллионов параметров.
Около $0,0007 за задачу. По оценке авторов, эта точка выходит за прежнюю границу «цена — точность» на ARC-AGI-1.
Контролируемые проверки. Авторы меняли задачи ARC-подобным образом, чтобы понять, какие понятия модель выводит из примеров, а какие ей не даются.
Что пока не работает
- 29,5% — это меньше трети задач: по абсолютной точности большие рассуждающие модели решают ARC-AGI-1 лучше. Рекорд — именно по стоимости.
- Проверка — на ARC-AGI-1, более старой версии бенчмарка. О новых версиях работа не говорит.
- Рассуждение скрыто в числах: понять, как модель пришла к ответу, сложнее, чем прочитать текстовую цепочку.
- Результаты — от самих разработчиков, независимое воспроизведение пока не опубликовано.
Почему это важно
Длинные текстовые рассуждения — основной источник стоимости «думающих» моделей. Работа показывает альтернативу: рассуждать в скрытом пространстве и учиться на примерах прямо во время решения. Если подход масштабируется, абстрактное мышление может стать намного дешевле.
Можно ли попробовать
Оригинальное исследование
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
- Авторы
- Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
- Организация
- Pathway
- Дата
- 10 августа 2026 г.
- Тип
- Препринт
Ещё исследования

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

Нейросеть научилась рассуждать без примеров рассуждений — только за счёт награды за верный ответ
DeepSeek показала, что длинные рассуждения, самопроверка и смена стратегии появляются у языковой модели сами, если награждать её только за правильный ответ. Доля решённых олимпиадных задач AIME выросла с 15,6% до 71%.