Корона

Модели с памятью научились рассуждать по текстам в миллионы токенов — а большие LLM используют лишь 10–20% контекста

AIRIработа от 14 июня 2024 г.3 мин чтения
Схема: длинный текст из серых строк, в котором оранжевым выделены три нужных факта
Схема: редакция «Короны»

Производители моделей соревнуются в длине контекста: 128 тысяч токенов, миллион, больше. Исследователи из AIRI, МФТИ и Лондонского института математических наук проверили, сколько из этого модели реально используют для рассуждений. Ответ — в среднем 10–20%. Зато архитектура с рекуррентной памятью, которую команда развивает несколько лет, показала лучший результат среди способов расширить контекст. Работа принята на NeurIPS 2024.

Что именно исследовали

Обычные тесты на длинный контекст проверяют одно: найдёт ли модель в большом тексте одну спрятанную фразу. Это похоже на поиск иголки в стоге сена — задача на внимание, а не на мышление.

Авторы сделали бенчмарк BABILong, который проверяет другое: сможет ли модель связать несколько фактов, разбросанных по огромному документу, и сделать из них вывод. В нём 20 типов задач на рассуждение: цепочки фактов, индукция, дедукция, подсчёт, работа со списками и множествами.

Как это работает

Нужные для ответа факты вставляются в длинный посторонний текст — отрывки из книг. Например: «Мэри пошла на кухню», через сотни страниц — «Мэри взяла яблоко», ещё дальше — «Мэри ушла в сад». Вопрос: где яблоко? Чтобы ответить, модель должна найти все три факта и сложить их в правильном порядке.

Длину текста можно наращивать сколько угодно — авторы выложили варианты до 10 миллионов токенов. Так один и тот же тест подходит и для сегодняшних моделей, и для будущих.

Рекуррентный трансформер с памятью (RMT) читает текст не целиком, а кусками. После каждого куска он записывает главное в небольшой блок памяти и передаёт его дальше — как человек, который читает толстую книгу по главам и ведёт конспект.

Что ИИ теперь умеет

  • Рассуждать по фактам, разбросанным по тексту длиной в десятки миллионов токенов — у дообученных моделей с рекуррентной памятью
  • Связывать несколько фактов в цепочку, а не просто находить одну фразу
  • Небольшая модель с памятью решает задачи, на которых большие LLM с огромным контекстом ошибаются

Что показал эксперимент

10–20% контекста. Популярные LLM на деле эффективно используют лишь 10–20% заявленного окна. Чем сложнее рассуждение, тем резче падает качество.

Около 60% у поиска по документу. Методы RAG, которые сначала ищут подходящие фрагменты, а потом отвечают, дают около 60% точности на вопросах про один факт — и почти не зависят от длины текста. Для цепочек фактов этого мало.

До 50 миллионов токенов. Лучший результат среди способов расширить контекст показали трансформеры с рекуррентной памятью после дообучения: они обработали тексты длиной до 50 миллионов токенов.

Бенчмарк открыт, у него есть публичный рейтинг моделей.

Что пока не работает

  • Задачи в тесте синтетические и простые: факты вида «кто куда пошёл». В реальных документах — договорах, научных статьях — рассуждения сложнее.
  • Модели с памятью дообучались на задачах BABILong. Как они поведут себя на незнакомых задачах такой длины, из этой работы не следует.
  • Бенчмарк измеряет один тип способности — рассуждение по фактам в длинном тексте. Это не общая оценка «ума» модели.

Почему это важно

Длина контекста стала рекламной цифрой. Работа показывает, что «помещается в окно» и «модель это использует» — разные вещи. Это полезно знать всем, кто загружает в нейросеть длинные документы и ждёт, что она учтёт всё.

Второй вывод — про архитектуру: память, которую модель ведёт сама, может оказаться дешевле и надёжнее, чем бесконечное увеличение окна.

Можно ли попробовать

Оригинальное исследование

BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack

Авторы
Yuri Kuratov, Aydar Bulatov, Petr Anokhin, Ivan Rodkin, Dmitry Sorokin, Artyom Sorokin, Mikhail Burtsev
Организация
AIRI, МФТИ, London Institute for Mathematical Sciences
Дата
14 июня 2024 г.
Тип
Бенчмарк или датасет
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Тепловая карта: буквы ДНК сверху и оранжевые клетки разной яркости — важность каждой замены
AI Science

ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека

AlphaGenome Atlas от Google DeepMind — каталог предсказаний для каждой возможной замены одной буквы в геноме человека. Он помогает находить причины редких болезней и уже позволил найти на 22% больше связей генов с признаками в данных UK Biobank.

Google DeepMindсентябрь 2026 · 2 мин
ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека
Схема задачи ARC: примеры сеток «было — стало», круг «мысль» и сетка-ответ
Reasoning

Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно

BDH-CQ от Pathway на 150 миллионов параметров решает задачи на абстрактное мышление ARC-AGI-1, не проговаривая рассуждения словами. Результат — 29,5% при стоимости около $0,0007 за задачу: по соотношению цены и точности это новый рекорд.

Pathwayавгуст 2026 · 2 мин
Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно
Схема человекоподобного робота, который приседает и тянется к оранжевому ящику
Robotics

Человекоподобные роботы научились работать всем телом: ходить, приседать и брать предметы в одной модели

Gemini Robotics 2 от Google DeepMind управляет не только руками, но и всем телом человекоподобного робота, а также тонкими движениями многопалых кистей. Версия для работы на самом роботе адаптируется к новой машине за несколько часов.

Google DeepMindиюль 2026 · 2 мин
Человекоподобные роботы научились работать всем телом: ходить, приседать и брать предметы в одной модели