schema.tr /
MA
Mert Alperen KABA
Araştırma & Makale 12 dk akademik okuma
Yazan: Mert Alperen KABA 29 Ağustos 2026

Büyük Dil Modellerinde Mekanistik Yorumlanabilirlik ve Otonom Muhakeme Paradoksu

Transformatör mimarilerinde rezidüel akış dinamikleri, superposition hipotezi ve olasılıksal token üretiminin bilgi-kuramsal sınırları üzerine epistemolojik bir analiz.

Özet (Abstract): Bu çalışma, çağdaş Yapay Sinir Ağı (YSA) mimarilerinin, bilhassa Otoregresif Transformatör (Autoregressive Transformer) tabanlı Büyük Dil Modellerinin (LLM) semantik temsil yeteneklerini ve bilgi işleme dinamiklerini mekanistik yorumlanabilirlik (mechanistic interpretability) perspektifinden incelemektedir.

1. Giriş ve Epistemolojik Problem Alanı

Modern yapay zeka literatüründe, derin transformatör mimarilerinin ölçekleme yasaları (scaling laws) doğrultusunda parametre ve veri hacminin artışına paralel olarak sergilediği "beliriş" (emergence) yetenekleri, geleneksel istatistiksel öğrenme kuramının sınırlarını zorlamaktadır.

$P(W) = \prod_{t=1}^{T} P(w_t \mid w_{

⚠️
Kritik Ayrım: Bir modelin dilbilgisel tutarlılık sergilemesi, onun epistemik bir inanç durumuna (belief state) sahip olduğunu göstermez. İstatistiki korelasyon, nedensel (causal) çıkarımın ontolojik eşdeğeri değildir.

2. Rezidüel Akış (Residual Stream) ve Superposition Hipotezi

Transformatör mimarisinde bilginin katmanlar arası transferi, rezidüel akış (residual stream) olarak adlandırılan bir vektör uzayı üzerinden gerçekleşir:

01

Rezidüel Akışın Vektörel Ayrışımı

$\mathbf{x}_l = \mathbf{x}_{l-1} + \sum_{h} \text{Attn}_h^l(\mathbf{x}_{l-1}) + \text{MLP}^l(\mathbf{x}_{l-1})$ :::

2.1 Çok-Anlamlılık (Polysemanticity) ve Seyrek Otokodlayıcılar (SAE)

Biyolojik sinir ağlarında olduğu gibi, yapay sinir ağlarında da bir nöronun birden fazla kavrama yanıt vermesi (polysemanticity) yaygındır.
PYTHON
# Sparse Autoencoder (SAE) ile Özellik Ayrıştırma
import torch
import torch.nn as nn

class SparseAutoencoder(nn.Module):
def __init__(self, d_model, d_sae, l1_coeff=1e-3):
super().__init__()
self.encoder = nn.Linear(d_model, d_sae, bias=True)
self.decoder = nn.Linear(d_sae, d_model, bias=False)
self.l1_coeff = l1_coeff

def forward(self, x):
features = torch.relu(self.encoder(x))
reconstruction = self.decoder(features)
recon_loss = nn.functional.mse_loss(reconstruction, x)
l1_loss = self.l1_coeff * features.norm(p=1, dim=-1).mean()
return reconstruction, features, recon_loss + l1_loss


💡
Mekanistik Çıkarım: Seyrek Otokodlayıcılar, modelin rezidüel akışındaki karmaşık aktivasyonları doğrusal olarak ayrıştırılabilir monosemantik (tek-anlamlı) kavram yönlerine dönüştürür.

3. Akıl Yürütme Yanılsaması ve Çıkarım Zamanı Hesaplaması

Son dönemde geliştirilen akıl yürütme modelleri (Chain-of-Thought veya Test-Time Search), modellerin token üretimi sırasında arama uzayını genişletmesine olanak tanımaktadır.

02

Düşünme Zincirinin Bilgi-Kuramsal Dinamiği

1. Adım: Başlangıç bağlamının tensöriyel kodlaması ve belirsizlik entropisinin hesaplanması. 2. Adım: Her düşünce adımında durum uzayının dallandırılması ve değer fonksiyonu ile budanması. 3. Adım: Hata payının ara adımlarla düşürülerek hedef token dağılımının keskinleştirilmesi. :::

4. Halüsinasyon Olgusunun Bilgi-Kuramsal Temelleri ve Sonuç

Halüsinasyon, modelin kasıtlı bir hatası değil; olasılık dağılımının kaçınılmaz bir istatistiksel yan ürünüdür.

$H(X) = - \sum_{i} P(x_i) \log_2 P(x_i)$

Salt bağlantıcı derin öğrenme paradigmaları, istatistiki örüntü eşlemede insanüstü başarı sağlasa da, deterministik mantık ve biçimsel doğrulama gerektiren alanlarda epistemik kırılganlık yaşamaktadır. Geleceğin mimarileri hibrit nörosembolik sistemler üzerinde yükselecektir.

:::
📚

Kaynakça & Referanslar