人工智能 · 2026年9月14日

研究证实语言模型内部状态可区分不同思维步骤

a group of cubes that are connected to each other
Shubham Dhage / Unsplash

韩国科学技术院与纳威尔人工智能实验室的研究人员发表了一项新研究,证实语言模型在解决任务时展现的思维步骤,可以在其内部数值表征中被清晰区分。研究团队测试了三个模型,包括千问二点五七B、千问三8B和杰玛四31B,让它们解决数学问题。结果显示,这些思维步骤在模型的中间层最为明显,且这种区分能力超越了单纯的词汇选择。

研究人员定义了八种常见的思维操作,包括提取、分解、公式调用、演绎和计算。他们让模型解决数学题,并将解题过程分解为不同段落,随后利用GPT-5将每个段落归类为特定的操作。分析表明,不同操作在内部表征中能够被可靠地分离。仅基于词元或段落位置的分类器表现较差,证明内部状态包含了超越表面文本的信息。

研究发现,相同的常用功能词在不同的思维步骤中会获得不同的内部表征。在早期层中,这些词的表征是混合的,但在中间和后期层中,它们会根据周围的操作而分离。此外,思维步骤并非孤立产生。当研究人员通过干预阻断对前30个词元的注意力时,特定操作的信号会减弱,表明思维过程依赖于前文。

即使模型解题错误,其内部状态仍能识别出正在执行的步骤类型,例如计算或公式调用。错误的计算步骤在内部表征上仍类似于正确的计算步骤。该结果在Llama-3-8B模型上得到复现,且训练好的分类器在千问三8B上对GPQA-Diamond和MATH-500数据集也有效。研究目前仅限于数学任务和少数模型,未来是否可用于错误检测或控制模型回答尚待进一步研究。