Корона

Исследователи заглянули внутрь нейросети и увидели, что она планирует ответ заранее

Anthropic Researchработа от 27 марта 2025 г.3 мин чтения
Схема графа признаков нейросети: слои узлов, выделенный оранжевым путь от вопроса к ответу
Схема: редакция «Короны»

Принято считать, что языковая модель просто угадывает следующее слово. В марте 2025 года Anthropic опубликовала работу, в которой проследила внутренние шаги модели Claude 3.5 Haiku на конкретных задачах. Оказалось, что модель планирует на несколько слов вперёд, пользуется общими для разных языков понятиями — и не всегда рассказывает о своих рассуждениях честно.

Что именно исследовали

Внутри нейросети — миллионы чисел, и прочитать их напрямую нельзя. Исследователи интерпретируемости пытаются найти в этих числах понятные человеку «признаки» — например, «речь о кролике» или «нужна рифма» — и понять, как они связаны.

В этой работе авторы разобрали десяток конкретных ситуаций: сочинение стихов, сложение чисел, ответы на разных языках, выдуманные факты, обход защитных ограничений. Для каждой они проследили, какие внутренние понятия включились и как повлияли на ответ.

Как это работает

Сначала строится «модель-заменитель» — упрощённая копия, которая работает почти так же, как оригинал, но состоит из понятных признаков. Затем для конкретного вопроса строится граф: какие признаки включились и какие из них повлияли на итоговое слово.

Главная проверка — вмешательство. Если исследователи правы, что признак «кролик» отвечает за рифму, то его можно отключить — и ответ должен измениться. Это похоже на работу нейробиолога, который стимулирует участок мозга и смотрит, что изменится в поведении.

Что ИИ теперь умеет

  • Планировать слово в конце строки до того, как начать её писать
  • Думать общими для разных языков понятиями и переводить мысль на нужный язык только на выходе
  • Считать в уме двумя параллельными путями: грубая прикидка и точная последняя цифра
  • Для исследователей: проследить цепочку внутренних шагов модели для отдельного ответа и проверить её вмешательством

Что показал эксперимент

Рифма выбирается заранее. В двустишии «He saw a carrot and had to grab it, / His hunger was like a starving rabbit» модель ещё до начала второй строки «держит в уме» слово rabbit. Когда исследователи подавили это понятие, модель закончила строку другой рифмой — habit. Когда вставили постороннее понятие, модель спланировала строку под него.

Общие понятия для разных языков. Для одних и тех же идей на разных языках включаются одни и те же внутренние признаки. Доля общих признаков растёт с размером модели.

Правдоподобное, но неверное объяснение. Если дать модели подсказку с ответом, она иногда рассуждает «от ответа»: строит шаги, которые приводят к подсказке, а не решает задачу. По внешнему объяснению этого не видно.

Отказ по умолчанию. У модели есть механизм «не знаю — не отвечай». Выдумки появляются, когда его ошибочно отключает ощущение «эта тема мне знакома».

Что пока не работает

  • По словам авторов, метод даёт внятную картину примерно для четверти задач, на которых его пробовали.
  • Даже в удачных случаях видна лишь малая доля того, что происходит в модели.
  • На разбор коротенького запроса в несколько десятков слов у человека уходит несколько часов.
  • Картина строится на упрощённой копии модели, а не на ней самой, — выводы о механизмах остаются приближёнными.

Почему это важно

Если мы не понимаем, как модель пришла к ответу, мы вынуждены верить ей на слово. Работа показывает, что внешнее «рассуждение» модели и её внутренние шаги могут расходиться — и что это расхождение можно обнаружить.

Для безопасности ИИ это прямой инструмент: проверять не только что модель ответила, но и почему.

Можно ли попробовать

Оригинальное исследование

On the Biology of a Large Language Model

Авторы
Jack Lindsey, Wes Gurnee, Emmanuel Ameisen, Brian Chen, Adam Pearce, Nicholas L. Turner, Craig Citro и др., Chris Olah, Joshua Batson
Организация
Anthropic
Дата
27 марта 2025 г.
Тип
Технический отчёт или блог лаборатории
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Схема: множество серых точек и оранжевый круг с двадцатью пятью точками в центре
Interpretability

В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать

Anthropic показала, что внутри Claude есть выделенная область, где держится около 25 понятий одновременно. Именно она нужна для многошаговых рассуждений: если её отключить, такие задачи перестают решаться, а простые — почти не страдают.

Anthropic Interpretabilityиюль 2026 · 2 мин
В языковой модели нашли «рабочее пространство»: небольшой набор мыслей, о которых она может сказать