Dört AI aracı ölçüldü: en popüleri en yüzeyseli çıktı
Temmuz 2026'da 152 kelimelik bir fikir ortaya atıldı ve beş gün içinde dört bağımsız ekip aynı fikri kendi yöntemiyle kodladı. Bugün dördü de GitHub'da duruyor — ve popülerlik sıralaması, işin ne kadar iyi yapıldığıyla ters orantılı çıktı. Bu, tek bir aracın değil, yazılım seçme alışkanlığımızın hikâyesi.
Dört AI aracı ölçüldü: en popüleri en yüzeyseli çıktı
147 yıldızlı araç yapay zekânın ürettiği şeye bakmıyor bile; 3 yıldızlı olan ekrana basılmış pikselleri denetliyor. Bir aracı seçerken yıldıza değil üç soruya bakın
Temmuz 2026'da 152 kelimelik bir fikir ortaya atıldı ve beş gün içinde dört bağımsız ekip aynı fikri kendi yöntemiyle kodladı. Bugün dördü de GitHub'da duruyor — ve popülerlik sıralaması, işin ne kadar iyi yapıldığıyla ters orantılı çıktı. Bu, tek bir aracın değil, yazılım seçme alışkanlığımızın hikâyesi.
Özetle:
- Dört uygulama bağımsız yazıldı — hiçbiri diğerinin kopyası değil (1 Eylül 2026'da GitHub üzerinden doğrulandı).
- 147 yıldızlı olan, yapay zekânın ürettiği şeyi görmüyor; durma kararını kullanıcıya bırakıyor: "Freni siz çekeceksiniz."
- 3 yıldızlı olan, eleştirmenin ekrana basılmış gerçek görüntüye bakmasını şart koşuyor ve durma ölçütü olarak ölçülebilir bir standart veriyor.
- Sonuç bir seçim kuralı: popüler ≠ işe yarar.
Fikir neydi
Yapay zekâya bir şey ürettirdiğinizde ortaya çıkan sorun tanıdık: model kendi işini beğenir. Temmuz 2026'da ortaya atılan fikir bunu kırmayı hedefliyordu — üreten modelin yanına ayrı ve bağımsız bir eleştirmen koymak. Eleştirmen üretilen şeye bakıyor ve tek soruyu soruyor: "Bu, referans aldığın ürün kadar iyi mi?" Beğenmezse döngü devam ediyor.
Fikir 152 kelimelik bir metinden ibaretti. Beş gün içinde dört ayrı geliştirici onu çalışan bir araca dönüştürdü.
Dört uygulama, dört ayrı derinlik
Ölçüm 1 Eylül 2026'da GitHub üzerinden yapıldı:
| Depo | Yıldız | Ne yapıyor |
|---|---|---|
| mshumer/Claude-of-Duty | 3.338 | Özgün fikrin kendisi — kaynak metin |
| duolahypercho/gauntlet-loop | 147 | "Donanım yok. Durum makinesi yok. Saf komut." |
| trilwu/gauntlet-loop-skills | 3 | Kod çalıştıran, çıktıyı ekrana basan bir ortam şart koşuyor |
| NicholasSpisak/gauntlet-loop | 3 | Dördüncü bağımsız uygulama |
Dördü de GitHub'ın kendi kaydına göre çatallanmış kopya değil (fork: false)
— yani dördü ayrı ayrı yazılmış. Oluşturulma tarihleri: 25, 27, 28 ve 29 Temmuz.
Ters orantı burada
147 yıldızlı uygulama fikri tek komuta indirmiş. Kolay, hızlı, kurulumsuz. Ama iki şeyi yapmıyor:
- Yapay zekânın ürettiği şeyi görmüyor — eleştirmen yalnız metin okuyor, ortaya çıkan ekranı değil.
- Durma ölçütü yok. Kendi belgesinde açıkça yazıyor: "Freni siz çekeceksiniz. Döngü kendiliğinden bitmez."
Yani fikrin can alıcı yarısı — bağımsız denetim — uygulamada yok. Geriye kalan, komutu kısaltan bir kolaylık.
3 yıldızlı uygulama ise zor yarısını yapmış: kod çalıştırabilen gerçek bir ortam istiyor, eleştirmenin ekrana basılmış gerçek görüntüye bakmasını şart koşuyor ve tasarım için sayıya bağlı bir ölçüt veriyor — ekran görüntülerinin kör karşılaştırması, artı erişilebilirlik standardının kontrast eşiği. Yani "güzel oldu" hissi değil, geçilip geçilmediği ölçülebilen bir çizgi.
İkisi arasındaki fark 144 yıldız. Ters yönde.
Neden böyle oluyor
Yıldız, kalitenin değil görünürlüğün ölçüsüdür. Bir depo şu üç şeyi yaptığında yıldız toplar: kurulumu kolaydır, anlatımı nettir, doğru zamanda paylaşılır. Bunların hiçbiri "işi doğru yapıyor mu" sorusuna cevap vermez.
Üstelik kolay olan, doğası gereği daha çok yıldız toplar: kurulumsuz bir komut dosyasını herkes deneyebilir; çalışan bir ortam ve ekran görüntüsü denetimi isteyen bir araçsa daha az kişiye hitap eder. Popülerlik, eşiği düşük olanı ödüllendirir.
Seçerken sorulacak üç soru
Bir yapay zekâ aracının sayfasında yıldız sayısına değil, şunlara bakın:
- Ürettiği şeyi görüyor mu? Eleştiren taraf yalnız metin mi okuyor, yoksa ortaya çıkan gerçek çıktıya mı bakıyor?
- Durma ölçütü sayı mı, his mi? "Yeterince iyi oldu" bir ölçüt değildir; geçilip geçilmediği ölçülebilen bir eşik ölçüttür.
- Eleştiren, üretenden bağımsız mı? Aynı model hem üretip hem kendini denetliyorsa, denetim yoktur.
Bu üç soru yalnız bu dört araca özgü değil — herhangi bir yapay zekâ aracının gerçekten iş yapıp yapmadığını anlamanın kısa yoludur.
Bu yazının sınırları
- Yıldız sayıları 1 Eylül 2026 tarihlidir ve her gün değişir; araştırma sırasında 3.337 olan sayı ölçüm günü 3.338 çıktı.
- Değerlendirme, depoların kendi belgelerine dayanıyor; araçlar çalıştırılıp karşılaştırmalı olarak sınanmadı. "Belgesinde ne söz veriyor" ile "pratikte ne yapıyor" farklı sorulardır; buradaki ölçüm birincisidir.
- Az yıldızlı olanın "daha iyi" olduğu genellenemez — burada ölçülen, bu dört uygulamada popülerliğin derinliği göstermediğidir.
İlgili yazılar
- WhatsApp'ı yapay zekâya bağlarken hangi araç güvenli?
- Yapay Zeka Kullanım Verileri: Şirketler Ne Saklıyor?
- Stanford Araştırması: Yapay Zeka Giriş Seviyesi İşleri Vuruyor
Kaynaklar
- GitHub API üzerinden dört deponun yıldız, çatal ve tarih verisi (1 Eylül 2026)
- Depoların kendi README ve belge metinleri
Bu haber yapay zekâ desteğiyle hazırlandı. Kaynak veriler kardeş araştırma sistemlerinden geldi ve yayın günü yeniden ölçüldü; metin ve değerlendirme Gonet AI Editör tarafından yazıldı.