İçeriğe geç
Blog

Yargı modelden, eşik koddan

4 dk okuma
Koyu zeminde ışıklı bir eşik çizgisi, üstünde parlaklığı farklı üç mor küre; en parlağı çizgiyi geçmiş
İçindekiler

Bir dil modeline "bu PR riskli mi" diye sorduğunda üç paragraf açıklama alırsın. İhtiyacın olan şey ise tek bir sayı ve o sayıya ne kadar güvenebileceğin. Bu ay o boşluğa oynayan bir ürün çıktı; aynı şemayı kendi depolarımda denedim.

Ne oldu

TypeSafe AI, Eylül ortasında Jev adlı modelini duyurdu (duyuru haberi, kod rehberi). Şirket buna "System One" modeli diyor; ad Kahneman'ın hızlı ve yavaş düşünme ayrımından geliyor. Jev metin üretmiyor, sohbet etmiyor. Bir durum ve bir soru listesi alıyor, üç türde tipli karar döndürüyor: seçeneklerden biri (choice), sıralı bir ölçekte seviye (score), evet ya da hayır olasılığı (noul). Her cevabın yanında bir güven değeri ve seçenek dağılımı geliyor.

Şirketin kendi sayfasındaki iddiası iki eksende: olasılıklar kalibre, yani model yüzde 70 dediğinde yüz vakanın yetmişi tutuyor; ve token üretmediği için sohbet modellerine göre yüz kat mertebesinde hızlı ve ucuz. Fiyat olarak milyar giriş token'ı başına 42 dolar yazıyor. Şerh baştan: bu rakamlar satıcının kendi ölçümü, bağımsız bir karşılaştırma henüz yok. İkinci şerh: bu yazı hazırlanırken (25 Eylül) konsol sayfası yeni hesap açılışının durdurulduğunu ve bekleme listesi olduğunu yazıyordu. Ben de o listedeyim.

Neden önemli

Masasında oturduğum toplantılarda AI sorusu çoğunlukla "hangi model" diye başlıyor; bu benim gözlemim, sektör ölçümü değil. Oysa bir ajanın iş akışında üretimden ayrı bir karar katmanı var: bu talep hangi ekibe gider, bu kayıt bugün mü ele alınır, bu içerik yayına hazır mı, bu aksiyon insan onayı ister mi. Kendi düzeneklerimde bu kararlar için de sohbet modeli çağırıyordum; model üç paragraf yazıyor, kod o paragrafın içinden "evet" kelimesini arıyor. Pahalı, yavaş ve ölçülemez: modelin "eminim" demesi ile gerçekten emin olması arasındaki farkı ölçen bir yerim yoktu.

Jev'in tipli çıktısından benim çıkardığım ayrım şu: yargı modelden, ağırlık ve eşik koddan, geri alınamaz aksiyon insandan. Model "bu PR'ın riski 0 ile 2 arası ölçekte 1.5" der; "1.5 ve üstü satır satır okunur" kuralı kodda durur ve onu sen yazarsın. ITIL'de değerlendirme ile onayın ayrı roller olması gibi; yeni olan, bu ayrımı model sınırına taşıyan bir ürünün çıkması.

Saha yorumum: kalibrasyon kanıtla, sonra güven

Bekleme listesinde boş durmak yerine aynı şemayı yerelde kurdum. Mac'te Ollama üzerinde çalışan açık bir modele (Gemma 4, 12 milyar parametre, 7.6 GB) JSON şemasıyla aynı üç soru türünü sordurdum; dağılımı normalize etmek, ağırlıklı skoru ve güveni hesaplamak kodun işi. Bu bir öykünme: modelin beyan ettiği olasılık, Jev'in iddia ettiği kalibre olasılık değil. Sınırı da yazayım: tek makinelik bir deneme düzeneği, kendi deneyim, sen okur olarak doğrulayamazsın. Satıcının iddiasıyla aynı terazide tartılmaz.

İki gerçek işe bağladım. Birincisi, bu sitenin sosyal medya kuyruğu: yayın öncesi her post için kaynak yazıya sadakat, üslup, kanal uyumu ve yayına hazırlık sorusu. İkincisi, depolarımdaki PR'lar: risk seviyesi, değişiklik türü, insan incelemesi gerekip gerekmediği.

İlk turdan üç bulgu çıktı, üçü de modelden çok tasarım hakkında.

Bir. Besleyici kod kuyruktaki posta yanlış kaynak yazıyı verdi; model sadakat sorusuna 0.10 dedi. Doğru yazıyı verince aynı post 1.00 aldı. Model karşılaştırma yapıyordu, rastgele puan vermiyordu. Asıl ders: modelin cevabı, ona verdiğim bağlam kadar doğru. Context engineering burada da belirleyici.

İki. Kesin kuralları modele sordurmadım. Yasak tire, karakter sınırı, hashtag sayısı, kuyruğun güncel yazıyı taşıyıp taşımadığı: bunlar kod. Model yalnız yargı gerektiren soruyu aldı. Böylece "model bugün em-dash'i kaçırdı" diye bir risk hiç doğmadı.

Üç. İki kod PR'ında model "insan değişikliği satır satır okusun" sorusuna 0.7 ve 0.8 dedi. İki örnek karar için az; asıl soru şu: on PR'da da aynı sayı çıkarsa o soru bilgi taşımıyor demektir ve listeden çıkar. Veriyi biriktiriyorum. Jev açıldığında aynı PR'ları iki sağlayıcıyla çalıştırıp beyan edilen güven ile ölçülen isabeti yan yana koyacağım.

Bir de süreç bulgusu: kuyruktaki iki post, sitede iki hafta önce yayınlanan yazıyı taşıyordu, site o arada ileri gitmişti. Bunu model görmedi; koddaki tarih karşılaştırması yakaladı ve uyarı olarak bastı. Ne yapılacağı ise ne modelin ne kodun kararı; bende kaldı, doğru yer de orası.

Ne yapmalı

Bir sohbet modelini sınıflandırma için çağırdığın her yerde şu üç adımı at:

  • Soruyu tipe indir: hangisi, kaçıncı seviye, evet mi hayır mı. Cevabı kodun doğrudan okuyacağı biçimde iste.
  • Kesin kuralı modele sorma. Karakter sınırı, yasak karakter, tarih karşılaştırması kodun işi. Model yalnız yargı gerektiren soruyu alsın.
  • Güveni ölçmeden eşik yazma. Modelin "yüzde 80" dediği yirmi vakayı topla, kaçı tuttu say. Sayı tutmuyorsa değişmesi gereken eşik değil, sorunun kendisi.

Jev'in vaadi bu üçüncü adımı ürün olarak vermek. Vaat tutar mı, bekleme listesi açılınca kendi kayıtlarımla göreceğim. Ama ayrımın kendisi bugün geçerli ve hiçbir yeni model gerektirmiyor: yargı modelden, eşik koddan.

Hayrettin Şendil

Hayrettin Şendil

26 Eylül 2026 · 4 dk okuma

LinkedIn · X

Yazıyı paylaş
LinkedInX

İlgili Yazılar

Koyu lacivert zeminde ışıklı mor bir kapı açık duruyor, ince mor çizgiler kapıdan hızla geçiyor, kapının yanında küçük bir ölçek işareti

Onay kapısı için kanıt yok

DORA dış onay kapısının değişiklik başarısızlığını düşürdüğüne kanıt bulamadı; ajan üretimi taleplerin çoğu incelenmiyor. Çıkış: riske göre dereceli model.

·5 dk okuma

Yorumlar