OĞUZ EROLADS & AI

Yapay Zeka Kendi Hatasını Düzeltir mi? Kontrol Ettim Demek, Düzelttim Demek Değil

Süre 2:51

YouTube'daki açıklama

Kontrol ettim demek, düzelttim demek değil

Yapay zekâya "bir kontrol et" diyorsun, "kontrol ettim, düzelttim" diyor — ama aynı hata yerinde duruyor. Sebebi basit: kendi kâğıdını kendi okuyor.

Açıklamanın tamamı
  • Kör nokta ikinci okumada da kör kalır
  • Hatayı gösteren şey cevap anahtarıdır: test, derleyici, gerçek sonuç
  • Anahtar yokken uzun düşünmek daha ikna edici bir yanlış üretir
  • Yanlış şeyi ölçen anahtar temiz rapor verir, hata yerinde kalır

Bir ajanın tavanını modelin zekâsı değil, elindeki ölçümün kalitesi belirler.

Yapay zekâya bir metni ya da kodu “kontrol et” dediğinde çoğu zaman “kontrol ettim, düzelttim” cevabını alırsın — ama aynı hata yerinde durur. Sebep dikkatsizlik değil: model kendi kâğıdını kendi okur. Soruyu baştan yanlış anladıysa ikinci okumada da aynı yanlış anlamayla okur, kör nokta olduğu yerde kalır. Düzeltme ancak dışarıdan gelen bir ölçüm hatanın yerini gösterince başlar. Bu yüzden bir ajanın tavanını modelin zekâsı değil, elindeki ölçümün kalitesi belirler. Kavramın temeli için Yapay Zeka Ajanı Nedir ve AI Agent ile LLM farkı yazılarına, bütün konu haritası için Agentic AI Rehberi sayfasına bakabilirsin.

Kendi kâğıdını kendi okumak

Sınavdan çıkmış bir öğrenciye “bir daha bak” dersin. Bakar ve “doğru” der. Dördüncü soruya da onay verir, çünkü o soruyu ilk seferinde nasıl anladıysa ikinci seferinde de öyle anlar.

Öğrencinin kendi kâğıdını kendi okuduğu sahne: dördüncü soruda da onay işareti var, kendi kontrolünün hatayı bulamadığı gösteriliyor

Yapay zekânın “kontrol ettim” demesi tam olarak budur. Bir denetim yapılmıştır, ama denetleyen ile denetlenen aynı kafadır.

Daha dikkatli bakmak neden çözmez

İlk akla gelen çözüm “daha dikkatli bak” demektir. İşe yaramaz, çünkü sorun dikkat değil anlamadır.

İkinci okumanın da aynı kafayla yapıldığını gösteren sahne: soruyu yanlış anlayan iki kez yanlış anlar, kör nokta yerinde kalır

Soruyu baştan yanlış anladıysa, ikinci okuma o yanlış anlamayı düzeltmez — üstüne bir kat daha güven ekler. Kör nokta tanımı gereği görülmeyen yerdir; aynı gözle iki kez bakmak onu görünür yapmaz.

Cevap anahtarı ne yapar

Öğrenci hatasını ne zaman görür? Cevap anahtarına bakınca. Anahtarın yaptığı şey özeldir: ne düşündüğünü sormaz. Dördüncü sorunun yanlış olduğunu söyler, o kadar.

Dışarıdan gelen ölçümü gösteren sahne: cevap anahtarı ne düşündüğünü sormaz, doğrudan yanlışı işaret eder ve düzeltme buradan başlar

Düzeltme tam orada başlar. Öncesinde olan şey düzeltme değil, kendi kendini onaylamadır.

Yapay zekâda cevap anahtarı nedir

Yapay zekâ tarafında bunun karşılığı dışarıdan gelen ölçümdür: testin kırmızı yanması, derleyicinin itiraz etmesi, sorgunun boş dönmesi.

Testin kırmızı yanması, derleyicinin itirazı ve sorgunun boş dönmesi: üçü de modelin dışından gelen, modelin fikri olmayan sonuçlar

Bu üçünün ortak özelliği şudur: hiçbiri modelin fikri değildir. Üçü de dünyanın cevabıdır. Model ne kadar emin olursa olsun test kırmızıysa kırmızıdır.

Kod yazan bir ajanda nasıl görünür

En net örnek kod ajanıdır. Kodu yazar, testi çalıştırır, hata mesajını okur, düzeltir, yeniden çalıştırır. Yeşile dönene kadar döner.

Kod ajanının döngüsü: yaz, testi çalıştır, hata mesajını oku, düzelt, yeniden çalıştır; yeşile dönene kadar sürer ve hiçbir adımda sanırım oldu denmez

Bu döngünün kıymeti hızında değil, hiçbir adımda “sanırım oldu” dememesindedir. Her turda dışarıdan bir cevap alır.

Uzun düşünmek neden yetmez

“Model kendi kendine uzun uzun düşünse çözmez mi?” Bazen çözer, ama güvenemezsin.

Anahtar yokken uzun düşünmenin etkisi: gerekçe uzar ve ikna gücü artar ama doğruluk yerinde kalır

Anahtar yokken uzun düşünmek daha doğru bir cevap üretmez, daha ikna edici bir yanlış üretir. Gerekçe uzar, dil güzelleşir, özgüven artar; doğruluk yerinde kalır. Bu, uzun düşünen modellerin en sinsi yan etkisidir.

Görüş ile ölçümü ayırmak

“Şurası zayıftı, düzelttim” cümlesi bir görüştür. Kulağa denetim gibi gelir ama kanıt değildir.

Görüş ile ölçümün ayrıldığı sahne: ikisi aynı kefeye konursa elde kendi kendini onaylayan bir makine kalır

Görüşle ölçümü aynı kefeye koyarsan elinde kendi kendini onaylayan bir makine kalır. Sistem çalışıyor görünür, raporlar temizdir, hatalar birikir.

Anahtar varsa iş bitmez, asıl orada başlar

Ölçüm kurduğunda rahatlama. Çünkü anahtar neyi ölçüyorsa onu düzeltirsin.

Anahtarın sınırını gösteren sahne: yanlış şeyi ölçen bir anahtar temiz rapor verir ama hata yerinde kalır

Yanlış şeyi ölçen bir anahtar sana tertemiz bir rapor verir, hata da yerinde kalır. Ölçümün varlığı değil, neyi ölçtüğü belirleyicidir.

Bu kanalda yaşanmış bir örnek

Bunu kendi üretim hattımda yaşadım. Videoların sesini yazıya çevirip metinle karşılaştıran bir kontrol kurmuştum. Kontrol kusursuza yakın bir eşleşme verdi — oysa sekiz replik yanlış sesle okunmuştu.

Kanalda yaşanan örnek: ölçüm çalıştı ama yanlış şeyi ölçtü, sekiz replik yanlış sesle okunduğu hâlde rapor temiz çıktı

Ölçüm çalışmıştı; yanlış şeyi ölçmüştü. Kelimeleri ölçüyordu, kimin konuştuğunu değil. Metin doğruydu, ses yanlıştı, karşılaştırma bunu göremiyordu.

Düzeltmenin nasıl geldiğini gösteren sahne: eklenen şey yeni bir model değil, yeni bir ölçümdü

O gün eklediğim şey yeni bir model değildi, yeni bir ölçümdü: sesin kime ait olduğunu denetleyen ayrı bir kapı. Sorun daha zeki bir modelle değil, daha doğru bir ölçüyle çözüldü.

Benzetmenin kırıldığı yer

Sınav benzetmesi bir yere kadar gider. Sınavda cevap anahtarını öğretmen hazırlar; burada anahtarı da sen yazarsın.

Benzetmenin sınırı: sınavda anahtarı öğretmen yazar, yapay zekâ sisteminde anahtarı kuran da sensin

Bu yüzden asıl ustalık işi yaptırmak değil, ölçüsünü kurmaktır. Sistemin kalitesi, kurduğun ölçünün kalitesini geçemez.

Tavanı model değil ölçüm koyar

Ajanın tavanını ölçümün koyduğunu gösteren sahne: iyi model kötü ölçümle kendini kandırır, sıradan model iyi ölçümle kendini toparlar

İyi bir model kötü bir ölçümle kendini kandırır. Sıradan bir model iyi bir ölçümle kendini toparlar. Model seçimi önemlidir ama tavanı ölçüm koyar — ajan tasarımında en çok atlanan nokta budur.

Her işin anahtarı yok

Zor olan kısım da burası. Kodun testi vardır, sayının hesabı vardır. Ama “bu yazı ikna edici mi” sorusunun anahtarı yoktur.

Ölçüsü kurulamayan işleri gösteren sahne: ikna edicilik gibi sorularda ajan kendi ödevini kendi notlandırır

Orada ajan kendi ödevini kendi notlandırır — ve bu videonun başındaki soruna geri dönersin. Ölçülemeyen işlerde güven, ölçümün yerini tutmaz; sadece riski görünmez yapar.

Bundan sonra ne soracaksın

Soruyu değiştirmeyi öneren sahne: emin misin yerine nereden biliyorsun diye sor, cevap ölçüme dayanmıyorsa ortada düzeltme değil güven vardır

Yapay zekâya “emin misin” diye sorma. “Nereden biliyorsun” diye sor. Cevap bir ölçüme dayanmıyorsa ortada düzeltme yoktur, sadece güven vardır. Bu tek soru, kendi kendini onaylayan bir sistemle gerçekten denetlenen bir sistemi birbirinden ayırır.

Sıradaki konuyu duyuran kapanış sahnesi: ölçemediğin işi kim denetleyecek

Sıradaki videoda asıl zor soruya bakacağız: ölçemediğin işi kim denetleyecek?

Yapay zekâ hakkındaki içerikler için takip edin

Diğer videolar