---
title: Исследователи доказали возможность выявления внутренних этапов рассуждений в нейросетях
url: https://www.dataloco.com/ru/issledovateli-dokazali-vozmoznost-vyiavleniia-vnutrennix-etapov-rassuzdenii-v-neirosetiax
published: 2026-09-13T14:39:44+00:00
language: ru
section: ИИ
source: https://the-decoder.de/denkschritte-von-ki-modellen-lassen-sich-in-deren-internen-zustaenden-nachweisen/
organizations: KAIST, Naver AI Lab, OpenAI, Anthropic
publisher: Dataloco
---

# Исследователи доказали возможность выявления внутренних этапов рассуждений в нейросетях

Исследователи из южнокорейского университета KAIST и лаборатории Naver AI Lab опубликовали результаты нового исследования, в котором они продемонстрировали, что различные этапы логического рассуждения, выполняемые языковыми моделями, можно четко различить в их внутренних числовых представлениях. Работа показала, что внутренние состояния моделей содержат информацию о типе выполняемого мысленного шага, которая выходит за рамки простого анализа используемых слов.

В ходе эксперимента специалисты определили восемь повторяющихся операций мышления, включая извлечение данных, декомпозицию задачи, вызов формулы, дедукцию и вычисление. Для проверки гипотезы они использовали три модели: Qwen2.5-7B, Qwen3-8B и Gemma4-31B, которые решали математические задачи. Решения были разбиты на отдельные фрагменты, и каждый из них был классифицирован моделью GPT-5 как один из предопределенных типов операций. Результаты подтвердили, что различные типы рассуждений можно надежно разделить в внутренних репрезентациях всех трех протестированных моделей.

Наиболее выраженное разделение операций наблюдалось в средних слоях нейросетей. Исследователи проверили, не является ли этот эффект следствием исключительно выбора слов. Классификатор, анализирующий только используемые токены, показал худшие результаты по сравнению с анализом внутренних представлений. Кроме того, само по себе положение фрагмента в последовательности решения не объясняло наблюдаемого эффекта. Это свидетельствует о том, что внутренние состояния кодируют информацию о природе мысленного шага независимо от конкретного текста.

Анализ показал, что одни и те же частые служебные слова получают различные внутренние представления в зависимости от контекста. В начальных слоях сети представления этих слов перемешаны, однако в средних и поздних слоях они разделяются в соответствии с окружающей операцией. Это означает, что одно и то же слово кодируется по-разному в зависимости от того, в каком этапе рассуждения оно встречается. Эксперименты также показали, что мысленный шаг не возникает изолированно: при блокировке внимания на тридцати предыдущих токенах сигнал для конкретной операции ослабевал, что указывает на зависимость текущего шага от предшествующего текста.

Способность различать этапы рассуждений сохранялась даже при решении задач с ошибками. Неправильный вычислительный шаг внутренне по-прежнему напоминал вычислительный процесс, несмотря на неверный результат. Результаты были воспроизведены на модели Llama-3-8B, а обученные классификаторы для Qwen3-8B успешно работали на наборах данных GPQA-Diamond и MATH-500. Авторы отмечают, что эксперименты ограничены математическими задачами и небольшим числом моделей. Вопрос о том, можно ли использовать эти данные для обнаружения ошибок или управления моделью в процессе генерации ответа, остается открытым и требует дальнейших исследований.

Вопрос о соотношении между выводимым текстом и внутренними вычислениями имеет важное значение для безопасности. Согласно данным OpenAI, чтение цепочки рассуждений является одним из немногих доступных инструментов контроля. Anthropic продемонстрировала, что модели раскрывают использованные подсказки лишь в 25 до 39 процентов случаев. Кроме того, метод перевода внутренних числовых векторов в читаемый текст выявил, что модель Claude Opus 4.6 обрабатывает больше информации, чем указано в выведенном рассуждении. В модели Astra от OpenAI техника Recurrent Depth переносит часть рассуждений во внутренние числовые представления, что соответствует области, изучаемой в работе KAIST.

## This story in other languages

- [ไทย](https://www.dataloco.com/th/story-5)
- [עברית](https://www.dataloco.com/he/story-5)
