Yapay zeka · 14 Eylül 2026
Ayrıca şu dilde de yayımlandı ไทย, Русский, עברית, 中文, 日本語, Bahasa Indonesia, Nederlands, हिन्दी, Español
Yapay zeka modellerinin içsel durumlarında düşünce adımları ayırt edilebilir bulundu
Güney Koreli KAIST ve Naver AI Lab araştırmacıları, dil modellerinin bir görevi çözerken ürettiği metindeki düşünce adımlarının, modelin içsel sayısal temsillerinde de ayırt edilebilir olduğunu ortaya koydu. Çalışma, bu içsel ayrımın özellikle modelin orta katmanlarında en belirgin şekilde gerçekleştiğini gösterdi. Araştırmacılar, çıkarım modellerinin bir problemi adım adım çözme sürecinde metin üzerinden gerçekleştirdiği okuma, problem parçalaması, formül çağırma ve hesaplama gibi işlemlerin, modelin içsel durumlarında birbirinden ayrıştırılıp ayrıştırılamayacağını test etti.
Çalışmada, çıkarım modellerinin metin üzerinden yürüttüğü süreçler incelenerek sekiz tekrarlayan düşünme işlemi tanımlandı. Bu işlemler arasında çıkarım, parçalamaya ayırma, formül çağırma, mantıksal sonuç çıkarma ve hesaplama yer aldı. Araştırmacılar, Qwen2.5-7B, Qwen3-8B ve Gemma4-31B olmak üzere üç farklı modelin matematik problemlerini çözmesini sağladı. Çözüm yolları bölümlere ayrılarak her bir bölümün, GPT-5 modeli tarafından bu sekiz işlemden birine atandığı görüldü. Bu yöntemle, metindeki her bir adımın modelin içsel yapısında karşılık bulup bulmadığı analiz edildi.
Elde edilen bulgular, farklı düşünme işlemlerinin üç modelin tamamında içsel temsillerde net bir şekilde birbirinden ayrışabildiğini kanıtladı. Bu ayrımın en güçlü olduğu nokta, modelin orta katmanları olarak belirlendi. Araştırmacılar, bu etkinin yalnızca kullanılan kelime seçiminden kaynaklanıp kaynaklanmadığını test etmek için ek analizler yürüttü. Sadece kullanılan tokenleri değerlendiren bir sınıflandırıcı, içsel temsillerin analizine kıyasla daha düşük performans gösterdi. Ayrıca çözüm yolundaki bir bölümün konumu da bu etkiyi açıklamada yetersiz kaldı. Bu sonuçlar, içsel durumların, yalnızca metin içeriğinin ötesinde, düşünce adımının türüne dair bilgi barındırdığını gösteriyor.
Araştırma, aynı kelimelerin farklı düşünce adımlarında farklı temsillerle kodlandığını da ortaya koydu. 'a', 'is' veya 'the' gibi sık kullanılan işlev kelimeleri, farklı düşünce adımlarında ortaya çıkıyor. Modelin erken katmanlarında bu kelimelerin temsilleri karışık kalırken, orta ve geç katmanlarda çevreleyen işleme göre ayrışıyor. Bu durum, aynı kelimenin hangi düşünce adımında geçtiğine bağlı olarak farklı şekilde temsil edildiğini kanıtlıyor. Araştırmacılar ayrıca, bir düşünce adımının izole olarak mı yoksa önceki metne bağımlı olarak mı oluştuğunu test etti. Önceki 30 token'e yönelik dikkat mekanizmasını hedefli bir müdahaleyle bloke ettiklerinde, ilgili işlem için sinyal zayıfladı. Bu bulgu, bir düşünce adımının izole olarak değil, önceki metne bağımlı olarak oluştuğunu gösteriyor.
Yanlış çözülen problemlerde bile modelin o an hangi tür bir adım attığı içsel olarak ayırt edilebildi. Örneğin hatalı bir hesaplama adımı, sonucu yanlış olsa bile içsel olarak hâlâ bir hesaplama adımına benziyordu. Bu ayrıştırma yeteneği, Llama-3-8B modeliyle de tekrarlanabildi. Qwen3-8B modeli için öğrenilen sınıflandırıcılar, GPQA-Diamond ve MATH-500 veri kümelerinde de işlevsel kaldı. Deneyler yalnızca matematik problemleri ve sınırlı sayıda modelle sınırlı tutuldu. Bu bulguların, hata tespiti veya modelin yanıt sırasında kontrolü gibi alanlarda kullanılıp kullanılamayacağı henüz belirsizdir ve gelecek çalışmalarla incelenmesi gerekmektedir. Metin çıktısı ile içsel hesaplama arasındaki ilişkinin güvenlik açısından önemli olduğu vurgulandı. OpenAI, düşünce zincirinin okunmasının mevcut kontrol araçlarından biri olduğunu belirtirken, Anthropic, modellerin kullandığı ipuçlarını yalnızca vakaların yüzde 25 ile 39'unda açıkladığını gösterdi. Claude Opus 4.6 için içsel sayısal vektörleri okunabilir metne çeviren bir yöntem, modelin üretilen çıkarım metninde yer alanlardan daha fazla işlem gerçekleştirdiğini ortaya koydu. OpenAI'ın Astra modelinde ise Recurrent Depth tekniği, çıkarımın bir kısmını içsel sayısal temsillere taşıyor.