Модели с памятью научились рассуждать по текстам в миллионы токенов — а большие LLM используют лишь 10–20% контекста

Производители моделей соревнуются в длине контекста: 128 тысяч токенов, миллион, больше. Исследователи из AIRI, МФТИ и Лондонского института математических наук проверили, сколько из этого модели реально используют для рассуждений. Ответ — в среднем 10–20%. Зато архитектура с рекуррентной памятью, которую команда развивает несколько лет, показала лучший результат среди способов расширить контекст. Работа принята на NeurIPS 2024.
Что именно исследовали
Обычные тесты на длинный контекст проверяют одно: найдёт ли модель в большом тексте одну спрятанную фразу. Это похоже на поиск иголки в стоге сена — задача на внимание, а не на мышление.
Авторы сделали бенчмарк BABILong, который проверяет другое: сможет ли модель связать несколько фактов, разбросанных по огромному документу, и сделать из них вывод. В нём 20 типов задач на рассуждение: цепочки фактов, индукция, дедукция, подсчёт, работа со списками и множествами.
Как это работает
Нужные для ответа факты вставляются в длинный посторонний текст — отрывки из книг. Например: «Мэри пошла на кухню», через сотни страниц — «Мэри взяла яблоко», ещё дальше — «Мэри ушла в сад». Вопрос: где яблоко? Чтобы ответить, модель должна найти все три факта и сложить их в правильном порядке.
Длину текста можно наращивать сколько угодно — авторы выложили варианты до 10 миллионов токенов. Так один и тот же тест подходит и для сегодняшних моделей, и для будущих.
Рекуррентный трансформер с памятью (RMT) читает текст не целиком, а кусками. После каждого куска он записывает главное в небольшой блок памяти и передаёт его дальше — как человек, который читает толстую книгу по главам и ведёт конспект.
Что ИИ теперь умеет
- Рассуждать по фактам, разбросанным по тексту длиной в десятки миллионов токенов — у дообученных моделей с рекуррентной памятью
- Связывать несколько фактов в цепочку, а не просто находить одну фразу
- Небольшая модель с памятью решает задачи, на которых большие LLM с огромным контекстом ошибаются
Что показал эксперимент
10–20% контекста. Популярные LLM на деле эффективно используют лишь 10–20% заявленного окна. Чем сложнее рассуждение, тем резче падает качество.
Около 60% у поиска по документу. Методы RAG, которые сначала ищут подходящие фрагменты, а потом отвечают, дают около 60% точности на вопросах про один факт — и почти не зависят от длины текста. Для цепочек фактов этого мало.
До 50 миллионов токенов. Лучший результат среди способов расширить контекст показали трансформеры с рекуррентной памятью после дообучения: они обработали тексты длиной до 50 миллионов токенов.
Бенчмарк открыт, у него есть публичный рейтинг моделей.
Что пока не работает
- Задачи в тесте синтетические и простые: факты вида «кто куда пошёл». В реальных документах — договорах, научных статьях — рассуждения сложнее.
- Модели с памятью дообучались на задачах BABILong. Как они поведут себя на незнакомых задачах такой длины, из этой работы не следует.
- Бенчмарк измеряет один тип способности — рассуждение по фактам в длинном тексте. Это не общая оценка «ума» модели.
Почему это важно
Длина контекста стала рекламной цифрой. Работа показывает, что «помещается в окно» и «модель это использует» — разные вещи. Это полезно знать всем, кто загружает в нейросеть длинные документы и ждёт, что она учтёт всё.
Второй вывод — про архитектуру: память, которую модель ведёт сама, может оказаться дешевле и надёжнее, чем бесконечное увеличение окна.
Можно ли попробовать
Оригинальное исследование
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
- Авторы
- Yuri Kuratov, Aydar Bulatov, Petr Anokhin, Ivan Rodkin, Dmitry Sorokin, Artyom Sorokin, Mikhail Burtsev
- Организация
- AIRI, МФТИ, London Institute for Mathematical Sciences
- Дата
- 14 июня 2024 г.
- Тип
- Бенчмарк или датасет
Ещё исследования

ИИ предсказал последствия всех 9 миллиардов возможных «опечаток» в ДНК человека
AlphaGenome Atlas от Google DeepMind — каталог предсказаний для каждой возможной замены одной буквы в геноме человека. Он помогает находить причины редких болезней и уже позволил найти на 22% больше связей генов с признаками в данных UK Biobank.

Небольшая модель научилась решать головоломки ARC, рассуждая «про себя» — без слов и почти бесплатно
BDH-CQ от Pathway на 150 миллионов параметров решает задачи на абстрактное мышление ARC-AGI-1, не проговаривая рассуждения словами. Результат — 29,5% при стоимости около $0,0007 за задачу: по соотношению цены и точности это новый рекорд.

Человекоподобные роботы научились работать всем телом: ходить, приседать и брать предметы в одной модели
Gemini Robotics 2 от Google DeepMind управляет не только руками, но и всем телом человекоподобного робота, а также тонкими движениями многопалых кистей. Версия для работы на самом роботе адаптируется к новой машине за несколько часов.