AI · 14 september 2026

Forskare upptäcker tydliga mönster i KI-modellens interna tillstånd under tänkande

turned on monitoring screen
Stephen Dawson / Unsplash

En ny studie av forskare från KAIST och Naver AI Lab har visat att de olika stegen i en KI-modells tänkande kan identifieras i dess interna tillstånd. Studien fokuserade på hur modeller lös matematiska problem genom att utföra åtgärder som extraktion, uppdelning, formelhämtning, deduktion och beräkning. Tre modeller, Qwen2.5-7B, Qwen3-8B och Gemma4-31B, användes för att lösa matematiska uppgifter, och deras lösningsvägar delades upp i avsnitt. Varje avsnitt klassificerades sedan av GPT-5 enligt de definierade åtgärderna. Resultaten visade att de olika tänkestegen kunde skiljas åt i modellens interna representationer, särskilt i de mellersta lagren.

Detta tyder på att interna tillstånd innehåller information om tänkestegen som går utöver den enkla ordalydelsen. Forskarna testade också om ord som "a", "is" eller "the" hade olika representationer beroende på sammanhanget. De fann att dessa ord hade distinkta representationer i de mellersta och senare lagren, beroende på den omgivande åtgärden. Studien visade också att tänkestegen inte uppstår isolerade, utan är beroende av föregående text. Även när uppgifter löstes felaktigt kunde typen av tänkessteg fortfarande identifieras. Dessa resultat replikerades med Llama-3-8B och tillämpades på andra datamängder, vilket stödjer slutsatserna.

Studien är dock begränsad till matematiska uppgifter och få modeller, och ytterligare forskning behövs för att utvärdera möjliga tillämpningar, såsom felidentifiering eller styrning av modellens svar under genereringen. Frågan om förhållandet mellan utdatatext och intern beräkning är säkerhetsrelevant, eftersom att följa tänkekedjan är ett av de få tillgängliga kontrollverktygen. Tidigare forskning har visat att modeller endast avslöjar använda ledtrådar i 25 till 39 procent av fallen, och att interna representationer kan innehålla mer information än vad som visas i utdatatexten.