Корона

Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно

Pathwayработа от 10 августа 2026 г.2 мин чтения
Схема задачи ARC: примеры сеток «было — стало», круг «мысль» и сетка-ответ
Схема: редакция «Короны»

Большие модели решают головоломки на абстрактное мышление, рассуждая длинными текстами — это дорого. Компания Pathway предложила модель BDH-CQ, которая рассуждает в скрытом числовом пространстве, не превращая мысли в слова. 10 августа 2026 года вышла статья с результатами на ARC-AGI-1.

Что именно исследовали

ARC — набор головоломок: по нескольким примерам «было — стало» на цветных сетках нужно понять правило и применить его к новой сетке. Такие задачи проверяют умение обобщать, а не память.

Авторы изучали, чему модель учится из примеров, насколько последовательно применяет найденное правило и какие понятия остаются для неё трудными.

Как это работает

Примеры задачи подаются модели во время работы и непрерывно обновляют её рекуррентную память. Затем модель решает новый вход, многократно «прокручивая» вычисления в скрытом пространстве, — без промежуточного текста.

Это похоже на человека, который решает головоломку в уме, а не проговаривает каждый шаг вслух: быстрее и дешевле, хотя со стороны рассуждение не видно.

Что ИИ теперь умеет

  • Выводить правило из нескольких примеров прямо во время решения, обновляя свою память
  • Рассуждать многократными итерациями в скрытом пространстве, без проговаривания шагов
  • Решать задачи на абстрактное мышление при очень низкой стоимости вычислений

Что показал эксперимент

29,5% на ARC-AGI-1 (с двух попыток) у конфигурации на 150 миллионов параметров.

Около $0,0007 за задачу. По оценке авторов, эта точка выходит за прежнюю границу «цена — точность» на ARC-AGI-1.

Контролируемые проверки. Авторы меняли задачи ARC-подобным образом, чтобы понять, какие понятия модель выводит из примеров, а какие ей не даются.

Что пока не работает

  • 29,5% — это меньше трети задач: по абсолютной точности большие рассуждающие модели решают ARC-AGI-1 лучше. Рекорд — именно по стоимости.
  • Проверка — на ARC-AGI-1, более старой версии бенчмарка. О новых версиях работа не говорит.
  • Рассуждение скрыто в числах: понять, как модель пришла к ответу, сложнее, чем прочитать текстовую цепочку.
  • Результаты — от самих разработчиков, независимое воспроизведение пока не опубликовано.

Почему это важно

Длинные текстовые рассуждения — основной источник стоимости «думающих» моделей. Работа показывает альтернативу: рассуждать в скрытом пространстве и учиться на примерах прямо во время решения. Если подход масштабируется, абстрактное мышление может стать намного дешевле.

Можно ли попробовать

Оригинальное исследование

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Авторы
Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
Организация
Pathway
Дата
10 августа 2026 г.
Тип
Препринт
Разбор опубликован 21 сентября, 18:02Поделиться

Ещё исследования

Формула aⁿ + bⁿ ≠ cⁿ над деревом лемм с оранжевой галочкой проверки
Reasoning

ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил

За 11 дней почти без участия людей Claude перевёл доказательство Великой теоремы Ферма на язык Lean, где каждый шаг проверяет машина. Получилось 13 миллионов строк кода и 29 511 теорем. Кевин Баззард назвал это выдающимся достижением.

Anthropic Researchсентябрь 2026 · 2 мин
ИИ впервые полностью формализовал доказательство Великой теоремы Ферма — и компьютер его проверил
Схема: множество серых точек и оранжевый круг с двадцатью пятью точками в центре
Interpretability

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать

Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

Anthropic Interpretabilityиюль 2026 · 2 мин
В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
Схема рассуждения: цепочка шагов с оранжевой стрелкой возврата «Подожди… проверю ещё раз»
Reasoning

Нейросеть научилась рассуждать без примеров рассуждений — только за счёт награды за верный ответ

DeepSeek показала, что длинные рассуждения, самопроверка и смена стратегии появляются у языковой модели сами, если награждать её только за правильный ответ. Доля решённых олимпиадных задач AIME выросла с 15,6% до 71%.

DeepSeekянварь 2025 · 3 мин
Нейросеть научилась рассуждать без примеров рассуждений — только за счёт награды за верный ответ