Yapay Zekâ

Yapay Zekâ Çıktısının Kalitesi Nasıl Ölçülür? Değerlendirme Seti Rehberi

Yapay zekâ ürününüzün iyi çalışıp çalışmadığını üç örneğe bakarak anlayamazsınız. Ölçümü, teknik olmayan bir ekibin de izleyebileceği biçimde anlatıyoruz.

Yapay zekâ çıktısının kalitesini ölçmenin tek güvenilir yolu, önceden hazırlanmış bir soru kümesini her değişiklikten sonra aynı ölçütlerle puanlamaktır. "Deneyip baktık, iyi görünüyor" cümlesi ölçüm değildir; üç örneğe bakıp onay vermek, ürünü sessizce bozulmaya açık bırakır. Bu yazı, teknik olmayan bir ekibin bile kurabileceği basit bir değerlendirme düzenini anlatıyor.

Neden "iyi görünüyor" yeterli değil?

Dil modelleri (LLM) aynı soruya her seferinde biraz farklı cevap verebilir ve cevapların çoğu ilk bakışta akıcı durur. Akıcılık doğruluk demek değildir: model kulağa mantıklı gelen ama kaynağı olmayan bir bilgiyi rahatlıkla yazabilir. Bunun adı halüsinasyon, yani modelin uydurduğu içerik.

İkinci sorun zamandır. Bir komutu (prompt) düzelttiğinizde, modeli yenilediğinizde ya da kaynak dokümanlara yeni dosya eklediğinizde, bir senaryo düzelirken bir başkası bozulabilir. Bunu fark etmenin yolu her seferinde aynı sınavı yeniden yapmaktır. Yapay zekâ entegrasyonu hizmetimizde bu sınava değerlendirme seti diyoruz ve teslimatın ayrı bir kalemi olarak ele alıyoruz.

Değerlendirme seti nedir ve nasıl hazırlanır?

Değerlendirme seti, gerçek kullanım senaryolarından seçilmiş sorular ile her birinin beklenen cevabını (ya da kabul edilebilir cevabın özelliklerini) içeren bir tablodur. Başlamak için 30–50 satır çoğu proje için yeterlidir; 200 satırlık mükemmel bir set kurmak yerine bu hafta 30 satırlık bir set kurmak daha değerlidir.

  1. Gerçek soruları toplayın. Destek kutusundan, satış yazışmalarından ve iç ekibin sık sorduğu sorulardan örnek çekin. Kendi hayal ettiğiniz sorular değil, müşterinin yazdığı haliyle sorular.
  2. Her soruya beklenen sonucu yazın. Konuyu bilen biri doğru cevabı ya da cevapta mutlaka geçmesi gereken bilgiyi not eder.
  3. Zor örnekleri bilerek ekleyin. Cevabı dokümanlarda olmayan sorular, belirsiz sorular ve yanlış yönlendirmeye açık sorular setin yaklaşık beşte biri kadar olmalı.
  4. Seti sürüm kontrolüne koyun. Set de kod gibi değişir; kimin neyi ne zaman eklediği görünür kalmalı.

Hangi ölçütlerle puanlanır?

Tek bir "kalite puanı" yerine, işe göre seçilmiş birkaç ayrı ölçüt kullanın. Aşağıdaki tablo en sık kullandığımız dört ölçütü ve her birinin neyi yakaladığını özetliyor.

ÖlçütNeyi sorar?Düşük çıkarsa ne anlama gelir?
DoğrulukCevap beklenen bilgiyle örtüşüyor mu?Model ya da kaynak veri yanlış
Dayanak (kaynağa sadakat)Her iddia verilen dokümandan çıkıyor mu?Model kendi bilgisinden uyduruyor
KapsamGerekli tüm bilgi cevapta var mı?Arama adımı doğru bölümü getirmiyor
Ton ve biçimUzunluk, dil ve format kurallara uyuyor mu?Komut yeterince net değil

Dayanak ölçütü, kendi verinizle çalışan sistemlerde (RAG: modelin önce sizin dokümanlarınızdan ilgili bölümü bulup yalnızca ona dayanarak cevap vermesi) en kritik olandır. Doğru görünen ama kaynağı olmayan bir cevap, yanlış bir cevaptan daha tehlikelidir; çünkü kimse kontrol etmez.

Puanlamayı kim yapar: insan mı, başka bir model mi?

En sağlıklısı ikisini birleştirmektir: ilk turu insan yapar, tekrarlayan turları model destekli otomatik puanlama yapar. Başka bir modelin puanlayıcı olarak kullanılmasına "hakem model" (LLM-as-judge) denir; hızlı ve ucuzdur ama kendi önyargıları vardır, örneğin uzun cevapları kayırabilir.

Bu yüzden hakem modelin kararlarını düzenli aralıklarla insan puanlarıyla karşılaştırın. İkisi sürekli ayrışıyorsa hakemin yönergesi yeniden yazılmalıdır. Kesin cevabı olan sorularda (tarih, ürün kodu, sayı) model gerekmez; basit bir metin eşleştirmesi daha güvenilirdir.

Sistem canlıya çıktıktan sonra nasıl izlenir?

Değerlendirme seti yayın öncesi sınavdır; yayın sonrası için gerçek kullanımdan beslenen ikinci bir döngü gerekir. Kullanıcıya her cevabın altında basit bir "işe yaradı / yaramadı" düğmesi sunmak, ekibinize haftada onlarca gerçek örnek kazandırır.

  • Olumsuz oy alan cevapları haftalık gözden geçirin ve sorunlu olanları değerlendirme setine ekleyin.
  • Sistemin "bilmiyorum" dediği ya da insana devrettiği soruların oranını izleyin; ani artış genellikle dokümanların eskidiğini gösterir.
  • Her model ya da komut değişikliğinden önce seti çalıştırın ve önceki sonuçla karşılaştırın; belirli bir eşiğin altına düşen değişiklik yayına çıkmasın.
  • Yanıt süresi ve kullanım hacmini kalite ile birlikte takip edin; bütçe tarafı için yazılım projesi maliyeti yazımıza bakabilirsiniz.

Değerlendirmede en sık yapılan hatalar

İlk hata, seti yalnızca sistemi kuran kişinin yazmasıdır. Kurucu doğal olarak sistemin cevaplayabileceği soruları seçer; gerçek kullanıcının sorduğu garip sorular dışarıda kalır. Seti, sistemi kullanacak ekibin ve müşteri tarafıyla konuşan kişilerin katkısıyla doldurun.

İkinci hata, ortalamaya bakıp tek tek başarısızlıkları görmemektir. Yüzde 90 doğruluk, kalan yüzde 10'un fatura iptali ya da hukuki bilgi gibi kritik bir konuda yoğunlaşması durumunda kabul edilemez olabilir. Soruları risk seviyesine göre etiketleyin ve yüksek riskli grubu ayrı raporlayın.

Üçüncü hata, seti hiç güncellememektir. Ürün, politika ve dokümanlar değiştikçe beklenen cevaplar da eskir. Her çeyrekte setin tamamını gözden geçirip güncelliğini yitirenleri silin.

İşletme olarak karar verirken hangi eşikleri belirlemelisiniz?

Teknik ekip ölçümü kurar, ama "yeterince iyi"nin eşiğini iş tarafı koymalıdır. Bu eşik kullanım senaryosuna göre değişir; aşağıdaki örnekler yaklaşımı gösterir.

SenaryoHata maliyetiÖnerilen yaklaşım
Dahili doküman aramasıDüşükKaynak gösterimi yeterli, insan onayı gerekmez
Müşteri destek botuOrtaDayanak ölçütünde sıkı eşik, belirsizde insana devir
Sözleşme ya da finansal özetYüksekHer çıktı insan onayından geçer, set sık güncellenir

Destek senaryosunun ayrıntıları için yapay zekâ destek botu yazımıza, doküman tarafı için doküman özetleme otomasyonu yazımıza göz atın. Kendi sürecinizde nereden başlanacağını konuşmak isterseniz iletişim formumuzdan yazabilirsiniz.

Sık sorulan sorular

Yapay zekâ cevaplarının doğruluğu nasıl ölçülür?

Gerçek sorulardan oluşan bir değerlendirme seti hazırlanır ve her değişiklikten sonra aynı set çalıştırılıp cevaplar beklenen sonuçlarla karşılaştırılır. Doğruluk, kaynağa sadakat ve kapsam gibi ayrı ölçütlerle puanlanır; tek bir genel puan yanıltıcı olur.

Değerlendirme setinde kaç soru olmalı?

Başlangıç için 30–50 gerçek soru çoğu proje için yeterlidir. Sonrasında kullanıcı geri bildirimlerinden gelen hatalı örnekler eklenerek set büyütülür.

Başka bir yapay zekâ modeli cevapları puanlayabilir mi?

Evet, buna hakem model (LLM-as-judge) denir ve tekrar eden ölçümleri hızlandırır. Ancak kendi önyargıları olduğu için kararları düzenli olarak insan puanlarıyla karşılaştırılmalıdır.

Yapay zekâ kalitesi canlıya çıktıktan sonra düşebilir mi?

Evet; dokümanların eskimesi, model sürümünün değişmesi ya da komutta yapılan küçük bir düzenleme kaliteyi sessizce düşürebilir. Bu yüzden her değişiklikten önce set çalıştırılır ve canlıda kullanıcı geri bildirimi izlenir.

LinkedInXWhatsApp

Bu konuyu birlikte konuşalım

Projenizi kısaca anlatın; 48 saat içinde dönüp kapsam ve yol haritası çıkaralım. Bağlayıcı değil, ücretsiz.