IA · 14 septembre 2026

Une étude démontre la distinction des étapes de raisonnement dans les états internes des modèles d'intelligence artificielle

brown wooden framed glass window
Laura Ockel / Unsplash

Des chercheurs du KAIST et du Naver AI Lab ont publié une étude montrant que les différentes étapes de raisonnement effectuées par un modèle de langage sont identifiables dans ses représentations numériques internes. Cette découverte confirme que la structure interne du modèle reflète la logique de sa résolution de problèmes, au-delà du simple texte généré.

Pour mener à bien cette analyse, l'équipe a défini huit opérations cognitives récurrentes, telles que l'extraction d'informations, la décomposition du problème, la récupération de formules, la déduction et le calcul. Ils ont soumis trois modèles spécifiques, à savoir Qwen2.5-7B, Qwen3-8B et Gemma4-31B, à des tâches mathématiques. Les solutions produites ont ensuite été découpées en segments, et un modèle distinct, GPT-5, a été utilisé pour attribuer chaque segment à l'une des opérations définies.

Les résultats indiquent que ces opérations sont clairement distinguables dans les couches intermédiaires des modèles testés. Cette séparation est plus marquée dans ces couches spécifiques que dans les premières ou les dernières. Pour vérifier que ce phénomène ne résulte pas uniquement du choix des mots, les chercheurs ont comparé les performances d'un classifieur basé sur les jetons textuels avec celui basé sur les représentations internes. L'analyse des états internes a offert une précision supérieure, prouvant que l'information sur le type d'étape de raisonnement excède le simple contenu lexical.

L'étude révèle également que des mots de liaison fréquents, comme les articles ou les verbes d'être, sont représentés différemment selon l'opération cognitive en cours. Dans les couches initiales, ces représentations sont mélangées, mais elles se distinguent nettement dans les couches intermédiaires et finales. De plus, les expériences ont montré qu'une étape de raisonnement ne se forme pas de manière isolée. Lorsque l'attention du modèle sur les trente jetons précédents a été bloquée, le signal correspondant à l'opération spécifique s'est affaibli, indiquant une dépendance au contexte antérieur.

Même lorsque les modèles ont produit des réponses incorrectes, le type d'opération exécutée restait identifiable. Par exemple, une erreur de calcul était toujours reconnue comme une opération de calcul au niveau interne. La robustesse de ces résultats a été confirmée par des tests supplémentaires sur le modèle Llama-3-8B et par l'application de classifieurs appris sur des jeux de données comme GPQA-Diamond et MATH-500.

Ces constats soulèvent des questions de sécurité concernant la transparence des modèles. La lecture de la chaîne de raisonnement est considérée comme l'un des rares outils de contrôle disponibles. Des travaux antérieurs d'Anthropic ont montré que les modèles ne révèlent les indices utilisés que dans 25 à 39 pour cent des cas. Par ailleurs, une technique appliquée au modèle Astra d'OpenAI déplace une partie du raisonnement vers les représentations internes, ce qui correspond précisément à la zone d'étude de cette nouvelle recherche. L'application pratique de ces découvertes pour détecter les erreurs ou contrôler les modèles reste à explorer.