---
title: Estudo revela que passos de raciocínio de modelos de inteligência artificial são distinguíveis em estados internos
url: https://www.dataloco.com/pt-br/estudo-revela-que-passos-de-raciocinio-de-modelos-de-inteligencia-artificial-sao-distinguiveis-em-estados-internos
published: 2026-09-14T12:26:55+00:00
language: pt-br
section: IA
source: https://the-decoder.de/denkschritte-von-ki-modellen-lassen-sich-in-deren-internen-zustaenden-nachweisen/
organizations: KAIST, Naver AI Lab, OpenAI, Anthropic
publisher: Dataloco
---

# Estudo revela que passos de raciocínio de modelos de inteligência artificial são distinguíveis em estados internos

Pesquisadores demonstraram que as diferentes etapas de raciocínio executadas por modelos de linguagem podem ser identificadas e separadas nas representações numéricas internas desses sistemas. A investigação, conduzida por cientistas do KAIST e do Naver AI Lab, confirmou que operações cognitivas distintas geram padrões de ativação específicos dentro da arquitetura dos modelos, especialmente nas camadas intermediárias. O estudo analisou como os modelos processam tarefas matemáticas e verificou se a natureza de cada passo de pensamento deixa uma marca mensurável nos vetores internos, independentemente do texto final gerado.

Para realizar a análise, a equipe definiu oito operações de pensamento recorrentes, incluindo extração de dados, decomposição do problema, recuperação de fórmulas, dedução lógica e cálculo. Três modelos específicos foram submetidos a problemas de matemática: Qwen2.5-7B, Qwen3-8B e Gemma4-31B. Os caminhos de solução foram divididos em segmentos, e um modelo de referência, o GPT-5, foi utilizado para classificar cada segmento em uma das operações definidas. Os resultados indicaram que as operações são claramente distinguíveis nas representações internas de todos os três modelos testados, com a separação sendo mais acentuada nas camadas centrais da rede neural.

Os pesquisadores investigaram se a distinção se devia apenas à escolha das palavras ou à posição do texto na resposta. Um classificador baseado exclusivamente nos tokens utilizados obteve desempenho inferior à análise das representações internas, e a posição do segmento não explicava o efeito. Isso sugere que os estados internos contêm informações sobre o tipo de passo de raciocínio que vão além do vocabulário superficial. Palavras funcionais comuns, como artigos e verbos de ligação, apresentaram representações misturadas nas camadas iniciais, mas separaram-se nas camadas intermediárias e finais de acordo com a operação de raciocínio em curso.

Testes adicionais mostraram que um passo de raciocínio não surge de forma isolada. Quando a atenção do modelo para os trinta tokens anteriores foi bloqueada artificialmente, o sinal correspondente à operação específica enfraqueceu, indicando dependência do contexto anterior. Mesmo em tarefas resolvidas incorretamente, o modelo manteve padrões internos consistentes com o tipo de operação executada, como cálculo ou dedução, mesmo quando o resultado final estava errado. A replicabilidade foi confirmada com o modelo Llama-3-8B, e os classificadores treinados no Qwen3-8B funcionaram em outros conjuntos de dados, como GPQA-Diamond e MATH-500.

A relevância do estudo para a segurança reside na capacidade de monitorar o raciocínio interno dos modelos. A OpenAI considera a leitura da cadeia de raciocínio uma das poucas ferramentas de controle disponíveis. A Anthropic demonstrou que os modelos revelam apenas entre 25 e 39 por cento das pistas utilizadas. Além disso, um método que converte vetores internos em texto legível indicou que o Claude Opus 4.6 processa mais informações do que as exibidas no raciocínio externo. No modelo Astra da OpenAI, a técnica Recurrent Depth desloca parte do raciocínio para as representações numéricas internas, exatamente a área investigada por este estudo. Os experimentos limitam-se a tarefas matemáticas e a um número reduzido de modelos, e o potencial de uso para detecção de erros ou controle em tempo real permanece aberto para futuras investigações.

## This story in other languages

- [ไทย](https://www.dataloco.com/th/story-5)
- [Русский](https://www.dataloco.com/ru/issledovateli-dokazali-vozmoznost-vyiavleniia-vnutrennix-etapov-rassuzdenii-v-neirosetiax)
- [עברית](https://www.dataloco.com/he/story-5)
- [中文](https://www.dataloco.com/zh/story-6)
- [日本語](https://www.dataloco.com/ja/story-3)
- [Bahasa Indonesia](https://www.dataloco.com/id/studi-menunjukkan-langkah-berpikir-model-kecerdasan-buatan-dapat-dibedakan-dalam-representasi-internal)
- [Nederlands](https://www.dataloco.com/nl/interne-modelstoestanden-onthullen-afzonderlijke-redeneeroperaties)
- [हिन्दी](https://www.dataloco.com/hi/katarama-bthathhamatata-madal-ka-aataraka-caranae-ma-vacara-parakaraya-ka-pata-lga)
- [Español](https://www.dataloco.com/es/estudio-revela-que-los-pasos-de-razonamiento-de-los-modelos-de-inteligencia-artificial-son-distinguibles-en-sus-estados-internos)
- [Türkçe](https://www.dataloco.com/tr/yapay-zeka-modellerinin-icsel-durumlarinda-dusunce-adimlari-ayirt-edilebilir-bulundu)
- [Italiano](https://www.dataloco.com/it/studio-rivela-che-i-passaggi-logici-dei-modelli-di-intelligenza-artificiale-sono-distinguibili-nelle-loro-rappresentazioni-interne)
- [Svenska](https://www.dataloco.com/sv/forskare-upptacker-tydliga-monster-i-ki-modellens-interna-tillstand-under-tankande)
- [Polski](https://www.dataloco.com/pl/badania-wykazaly-ze-kroki-rozumowania-modeli-sztucznej-inteligencji-sa-odroznialne-w-ich-wewnetrznych-stanach)
