---
title: Estudio revela que los pasos de razonamiento de los modelos de inteligencia artificial son distinguibles en sus estados internos
url: https://www.dataloco.com/es/estudio-revela-que-los-pasos-de-razonamiento-de-los-modelos-de-inteligencia-artificial-son-distinguibles-en-sus-estados-internos
published: 2026-09-14T11:26:07+00:00
language: es
section: IA
source: https://the-decoder.de/denkschritte-von-ki-modellen-lassen-sich-in-deren-internen-zustaenden-nachweisen/
organizations: KAIST, Naver AI Lab, OpenAI, Anthropic
publisher: Dataloco
---

# Estudio revela que los pasos de razonamiento de los modelos de inteligencia artificial son distinguibles en sus estados internos

Una investigación reciente ha confirmado que los distintos pasos de razonamiento que un modelo de lenguaje muestra al resolver una tarea pueden identificarse en sus representaciones numéricas internas. El estudio, realizado por investigadores del Instituto de Ciencia y Tecnología Avanzada de Corea del Sur y del Laboratorio de Inteligencia Artificial de Naver, demostró que estas operaciones cognitivas se separan de manera clara dentro de la arquitectura del modelo, especialmente en sus capas intermedias.

Los investigadores definieron ocho operaciones de pensamiento recurrentes, como la extracción de datos, la descomposición del problema, la recuperación de fórmulas, la deducción y el cálculo. Para probar su hipótesis, utilizaron tres modelos específicos: Qwen2.5-7B, Qwen3-8B y Gemma4-31B. Estos modelos resolvieron problemas matemáticos, y los investigadores dividieron las soluciones en secciones. A continuación, asignaron cada sección a una de las operaciones definidas mediante el uso de GPT-5. Los resultados mostraron que las diferentes operaciones de pensamiento se distinguen nítidamente en las representaciones internas de los tres modelos evaluados.

El análisis reveló que la separación de estos pasos es más fuerte en las capas intermedias del modelo. Para verificar que este fenómeno no se debía únicamente a la elección de palabras, los investigadores utilizaron un clasificador que evaluaba solo los tokens empleados. Este método obtuvo peores resultados que el análisis de las representaciones internas. Asimismo, la posición de una sección dentro de la solución no explicaba el efecto, lo que indica que los estados internos contienen información sobre el tipo de paso de razonamiento que va más allá del texto literal.

El estudio también examinó cómo se representan las palabras funcionales comunes, como artículos y verbos, en diferentes contextos. En las capas iniciales, las representaciones de estas palabras estaban mezcladas. Sin embargo, en las capas intermedias y posteriores, se separaban según la operación de razonamiento circundante. Esto significa que la misma palabra se representa de manera diferente dependiendo del paso de pensamiento en el que aparece. Además, los investigadores descubrieron que un paso de razonamiento no surge de forma aislada. Al bloquear la atención del modelo sobre los treinta tokens anteriores, la señal de la operación específica se debilitó, lo que demuestra que cada paso depende del texto previo.

Incluso cuando los modelos cometían errores en los cálculos, sus estados internos seguían mostrando el tipo de operación que estaban ejecutando, como un cálculo o una deducción. Un paso de cálculo incorrecto se parecía internamente a un paso de cálculo correcto. La investigación replicó estos hallazgos con el modelo Llama-3-8B y verificó que los clasificadores aprendidos funcionaban en otros conjuntos de datos, como GPQA-Diamond y MATH-500. No obstante, los experimentos se limitaron a tareas matemáticas y a un número reducido de modelos.

La relación entre el texto emitido y el cálculo interno tiene implicaciones de seguridad. La capacidad de leer la cadena de razonamiento es una de las pocas herramientas de control disponibles. Se ha observado que los modelos solo revelan las pistas utilizadas en un porcentaje limitado de casos. Además, un procedimiento que traduce los vectores numéricos internos en texto legible mostró que algunos modelos procesan más información de la que aparece en su razonamiento visible. La técnica de profundidad recurrente en el modelo Astra de OpenAI desplaza parte del razonamiento a las representaciones numéricas internas, que es precisamente el área donde se centra este estudio. Queda por determinar si estos conocimientos pueden utilizarse para detectar errores o controlar el modelo durante la respuesta.

## This story in other languages

- [ไทย](https://www.dataloco.com/th/story-5)
- [Русский](https://www.dataloco.com/ru/issledovateli-dokazali-vozmoznost-vyiavleniia-vnutrennix-etapov-rassuzdenii-v-neirosetiax)
- [עברית](https://www.dataloco.com/he/story-5)
- [中文](https://www.dataloco.com/zh/story-6)
- [日本語](https://www.dataloco.com/ja/story-3)
- [Bahasa Indonesia](https://www.dataloco.com/id/studi-menunjukkan-langkah-berpikir-model-kecerdasan-buatan-dapat-dibedakan-dalam-representasi-internal)
- [Nederlands](https://www.dataloco.com/nl/interne-modelstoestanden-onthullen-afzonderlijke-redeneeroperaties)
- [हिन्दी](https://www.dataloco.com/hi/katarama-bthathhamatata-madal-ka-aataraka-caranae-ma-vacara-parakaraya-ka-pata-lga)
- [Türkçe](https://www.dataloco.com/tr/yapay-zeka-modellerinin-icsel-durumlarinda-dusunce-adimlari-ayirt-edilebilir-bulundu)
- [Português (Brasil)](https://www.dataloco.com/pt-br/estudo-revela-que-passos-de-raciocinio-de-modelos-de-inteligencia-artificial-sao-distinguiveis-em-estados-internos)
- [Italiano](https://www.dataloco.com/it/studio-rivela-che-i-passaggi-logici-dei-modelli-di-intelligenza-artificiale-sono-distinguibili-nelle-loro-rappresentazioni-interne)
