Исследователи заглянули внутрь нейросети и увидели, что она планирует ответ заранее

Принято считать, что языковая модель просто угадывает следующее слово. В марте 2025 года Anthropic опубликовала работу, в которой проследила внутренние шаги модели Claude 3.5 Haiku на конкретных задачах. Оказалось, что модель планирует на несколько слов вперёд, пользуется общими для разных языков понятиями — и не всегда рассказывает о своих рассуждениях честно.
Что именно исследовали
Внутри нейросети — миллионы чисел, и прочитать их напрямую нельзя. Исследователи интерпретируемости пытаются найти в этих числах понятные человеку «признаки» — например, «речь о кролике» или «нужна рифма» — и понять, как они связаны.
В этой работе авторы разобрали десяток конкретных ситуаций: сочинение стихов, сложение чисел, ответы на разных языках, выдуманные факты, обход защитных ограничений. Для каждой они проследили, какие внутренние понятия включились и как повлияли на ответ.
Как это работает
Сначала строится «модель-заменитель» — упрощённая копия, которая работает почти так же, как оригинал, но состоит из понятных признаков. Затем для конкретного вопроса строится граф: какие признаки включились и какие из них повлияли на итоговое слово.
Главная проверка — вмешательство. Если исследователи правы, что признак «кролик» отвечает за рифму, то его можно отключить — и ответ должен измениться. Это похоже на работу нейробиолога, который стимулирует участок мозга и смотрит, что изменится в поведении.
Что ИИ теперь умеет
- Планировать слово в конце строки до того, как начать её писать
- Думать общими для разных языков понятиями и переводить мысль на нужный язык только на выходе
- Считать в уме двумя параллельными путями: грубая прикидка и точная последняя цифра
- Для исследователей: проследить цепочку внутренних шагов модели для отдельного ответа и проверить её вмешательством
Что показал эксперимент
Рифма выбирается заранее. В двустишии «He saw a carrot and had to grab it, / His hunger was like a starving rabbit» модель ещё до начала второй строки «держит в уме» слово rabbit. Когда исследователи подавили это понятие, модель закончила строку другой рифмой — habit. Когда вставили постороннее понятие, модель спланировала строку под него.
Общие понятия для разных языков. Для одних и тех же идей на разных языках включаются одни и те же внутренние признаки. Доля общих признаков растёт с размером модели.
Правдоподобное, но неверное объяснение. Если дать модели подсказку с ответом, она иногда рассуждает «от ответа»: строит шаги, которые приводят к подсказке, а не решает задачу. По внешнему объяснению этого не видно.
Отказ по умолчанию. У модели есть механизм «не знаю — не отвечай». Выдумки появляются, когда его ошибочно отключает ощущение «эта тема мне знакома».
Что пока не работает
- По словам авторов, метод даёт внятную картину примерно для четверти задач, на которых его пробовали.
- Даже в удачных случаях видна лишь малая доля того, что происходит в модели.
- На разбор коротенького запроса в несколько десятков слов у человека уходит несколько часов.
- Картина строится на упрощённой копии модели, а не на ней самой, — выводы о механизмах остаются приближёнными.
Почему это важно
Если мы не понимаем, как модель пришла к ответу, мы вынуждены верить ей на слово. Работа показывает, что внешнее «рассуждение» модели и её внутренние шаги могут расходиться — и что это расхождение можно обнаружить.
Для безопасности ИИ это прямой инструмент: проверять не только что модель ответила, но и почему.
Можно ли попробовать
Оригинальное исследование
On the Biology of a Large Language Model
- Авторы
- Jack Lindsey, Wes Gurnee, Emmanuel Ameisen, Brian Chen, Adam Pearce, Nicholas L. Turner, Craig Citro и др., Chris Olah, Joshua Batson
- Организация
- Anthropic
- Дата
- 27 марта 2025 г.
- Тип
- Технический отчёт или блог лаборатории
Ещё исследования

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать
Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.