Problemi doğru sınırlandırın
AI çıktısı belirsiz veya riskli olduğunda aynı işlemi zorla tamamlamak yerine güvenli deterministik akış veya insan incelemesine yönlendiren eşikler kurun.
Bu rehberin odak noktası AI otomasyonunda cevap vermeme ve devretme davranışını ürün özelliği olarak tasarlamak. Örnek senaryo gerçek bir müşteri vakası değil, karar mantığını görünür kılmak için hazırlanmış varsayımsal bir çalışma örneğidir: Belge sınıflandırıcı bazı dosyalarda iki kategori arasında kararsız kalıyor fakat sistem her durumda otomatik muhasebe kaydı açıyor.
Yapay zekâ özelliği deterministik bir form ekranı gibi davranmaz; kalite dağılımı veri, prompt, model, retrieval ve araç çağrısı değiştikçe hareket eder. Bu yüzden yayın kararı yalnızca iyi bir demo üzerinden verilemez.
Karar çerçevesi
Bu durumda temel karar şudur: Confidence tek sinyal olmasın; veri eksikliği, kural ihlali ve riskli aksiyon sınıfını birleştirerek fallback kararını orkestratör versin. Bu kararın değeri, ekip tarafından aynı şekilde yorumlanabilmesi ve testle kanıtlanabilmesidir. Belirsiz ifadeler yerine gözlenebilir davranış, sorumlu sistem ve hata halinde beklenen sonuç yazılmalıdır. Uygulama ayrıntısı: Fallback sonucu kullanıcıya hata gibi değil kontrollü durum olarak gösterilsin; iş kaydı beklemede, manuel incelendi veya deterministik kural uygulandı gibi izlenebilir state'ler kullanın. Fallback sonucu kullanıcıya hata gibi değil kontrollü durum olarak gösterilsin; iş kaydı beklemede, manuel incelendi veya deterministik kural uygulandı gibi izlenebilir state'ler kullanın.
Sabit bir değerlendirme seti, açık başarısızlık eşikleri, yetki sınırları ve geri alınabilir rollout birlikte tasarlandığında AI özelliği ölçülebilir bir ürün bileşenine dönüşür.
Dört uygulama ve kabul kontrolü
Birinci kontrol “Düşük skor örneklerini human queue'ya gönderin” olmalıdır. Bunun için önce mevcut durumdan örnek kayıt veya trafik seçin, beklenen sonucu önceden yazın ve değişiklikten sonra aynı örnekleri yeniden çalıştırın. Kontrolün sahibi ile kanıtın saklanacağı yer belli değilse, test tamamlandı denmemelidir.
İkinci kontrol “Eksik zorunlu veride AI'ı atlayın” maddesidir. Bu kontrol yalnızca başarılı senaryoda değil; boş veri, gecikme, tekrar, yetkisiz kullanıcı veya bağlantı sorunu gibi sınır koşullarında da denenmelidir. Böylece sistemin yalnızca demo sırasında değil gerçek operasyon baskısı altında nasıl davrandığı anlaşılır.
Üçüncü kontrol “Yüksek riskli action'da ikinci onay isteyin” olarak tanımlanmıştır. Uygulama ekibi teknik logları izlerken operasyon ekibi aynı olayın kullanıcı veya iş sonucu üzerindeki etkisini görebilmelidir. İki görünüm arasında ilişki kurulması, sorunun kaynağını daha hızlı ayırmaya yardımcı olur.
Yayın öncesinde AI otomasyonunda cevap vermeme ve devretme davranışını ürün özelliği olarak tasarlamak bağlamında fallback oranını kategori bazında ölçün için hazırlığı somutlaştırmalısınız. Bu kontrol hangi test verisiyle yapılacak, beklenen davranış nasıl ölçülecek, arızalı sonucun kullanıcıya görüntüsü ne olacak, ve bulunursa veri nasıl düzeltilecek—tüm bunlar yazılı olmalıdır. Sorumlu kişi, kanıt deposu ve geri alma adımları belirlenmek üzere bir form doldurmalısınız.
| # | Kontrol | Kanıt | Zaman |
|---|---|---|---|
| 1 | Düşük skor örneklerini human queue'ya gönderin | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 2 | Eksik zorunlu veride AI'ı atlayın | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 3 | Yüksek riskli action'da ikinci onay isteyin | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
| 4 | Fallback oranını kategori bazında ölçün | Örnek veri + beklenen sonuç + sorumlu | Yayın öncesi |
Riskleri yayın öncesinde görünür kılın
Yayından sonra ilk 24 saat kritiktir. Normal durumda beklediğiniz sinyalleri (işlem sayısı, hata oranı, yanıt süresi) önceden yazın; hangi değerler alarm üreteceği ve kim baktığını belirleyin. fallback'ın sessizce normal başarı sayılması gerçekleşirse geri alma kararını kimin vereceği ve kaç dakika içinde uygulanacağı belli olmalıdır. Ardından fallback oranını kategori bazında ölçün yeniden çalıştırarak değişikliğin hala güvenli olduğunu kanıtlayın. Kanıt planı: Threshold tuning için precision ve automation rate'i birlikte izleyin; daha çok otomasyon uğruna kritik yanlışların arttığı noktayı karar tablosunda görünür hale getirin.
| # | Risk | Kontrol yaklaşımı |
|---|---|---|
| 1 | Yanlış yüksek confidence | Erken sinyal, etki kapsamı ve geri alma adımı |
| 2 | İnsan kuyruğunun kapasiteyi aşması | Erken sinyal, etki kapsamı ve geri alma adımı |
| 3 | Fallback'ın sessizce normal başarı sayılması | Erken sinyal, etki kapsamı ve geri alma adımı |
Kabul kriterini operasyonla bağlayın
Dördüncü kontrol “Fallback oranını kategori bazında ölçün” maddesidir. Bu son adım çoğu projede atlanır; oysa yayın öncesi kabul listesinin bir parçası olduğunda değişikliğin ne zaman gerçekten tamamlandığı netleşir. Kontrol sonuçları tarih, sürüm ve sorumlu ile kaydedilmelidir. Threshold tuning için precision ve automation rate'i birlikte izleyin; daha çok otomasyon uğruna kritik yanlışların arttığı noktayı karar tablosunda görünür hale getirin.
Birincil kaynaklarla teknik çerçeveyi doğrulayın
Risk analizi üç görünür başlıkta tutulabilir. Birincisi “Yanlış yüksek confidence”. Bu risk için erken uyarı sinyali, etkilenebilecek kayıt veya kullanıcı kapsamı ve geri alma adımı yazılmalıdır. İkincisi “İnsan kuyruğunun kapasiteyi aşması”; bunu yalnızca log hatası olarak değil veri veya müşteri etkisi olarak da ölçün. Üçüncüsü “Fallback'ın sessizce normal başarı sayılması”; bu risk gerçekleşmese bile test senaryosunda kasıtlı olarak tetiklenerek kontrolün işe yaradığı kanıtlanabilir.
Yayın, gözlem ve geri dönüş planı
Kabul tablosu proje yönetim aracı yerine geçmez; ekiplerin aynı 'bitti' tanımını kullanmasını sağlar. Her kontrol için örnek veri, beklenen sonuç, gözlem noktası ve sorumlu belirlemek; sonradan yaşanan tartışmayı yayın öncesi karara dönüştürür. Eğer bir kontrol otomatikleştirilebiliyorsa regresyon testine eklenmesi, manuel kalıyorsa tekrar çalıştırılabilecek kısa bir runbook'a bağlanması yararlıdır. Kapsam sınırı: Model confidence değeri her sağlayıcıda kalibre edilmiş olasılık değildir; threshold'ı doğrudan evrensel doğruluk yüzdesi gibi yorumlamadan kendi eval verinizle kalibre edin.
Teknik çerçeveyi kontrol ederken bu rehberde OpenAI Developers — Evals, OpenAI Developers — Function Calling birincil dokümantasyonları referans alınmıştır. Bu kaynaklar kullanılan kavramların ve platform davranışlarının resmi açıklamalarını sağlar; ancak sizin veri modeliniz, sözleşmeleriniz, trafik profiliniz ve güvenlik gereksiniminiz için nihai tasarım kararı değildir. Uygulama öncesinde kullanılan ürün/sürüm dokümantasyonu yeniden kontrol edilmelidir.
Yayın planında üç kapı kullanın: önce yapısal doğrulama, sonra sınırlı gerçek kullanım, son olarak genişletme. İlk kapıda şema, yetki, hata ve veri bütünlüğü test edilir. İkinci kapıda gerçek trafik veya temsil edici kullanıcı grubu üzerinden performans ve davranış izlenir. Üçüncü kapıya yalnızca belirlenen hata bütçesi ve iş metriği sınırları içinde kalındığında geçilir. Bu sıra, değişikliği yavaşlatmak için değil geri bildirim maliyetini düşürmek için vardır. Model confidence değeri her sağlayıcıda kalibre edilmiş olasılık değildir; threshold'ı doğrudan evrensel doğruluk yüzdesi gibi yorumlamadan kendi eval verinizle kalibre edin.
Sık sorulan sorular
AI Confidence Düşükse Ne Olmalı? Deterministik Fallback ve İnsan Kuyruğu Tasarımı için ilk adım nedir?
Önce problemi teknik çözüm adıyla değil iş etkisiyle sınırlayın. Bu rehberdeki senaryoda başlangıç noktası AI otomasyonunda cevap vermeme ve devretme davranışını ürün özelliği olarak tasarlamak. Ardından mevcut davranışı ölçün ve ilk kabul kriterini düşük skor örneklerini human queue'ya gönderin şeklinde somutlaştırın.
Bu çalışma tek seferde canlıya alınmalı mı?
Genellikle hayır. En güvenli yaklaşım, değişikliği küçük bir kapsamda doğrulayıp gözlem sinyallerini izlemektir. Özellikle “Yanlış yüksek confidence” riski gerçekleştiğinde geri dönüş veya telafi adımının önceden tanımlı olması gerekir.
Yapay Zekâ ve Otomasyon projesinde başarı nasıl kabul edilir?
Başarı yalnızca ekranın veya endpoint'in çalışması değildir. Eksik zorunlu veride AI'ı atlayın ve yüksek riskli action'da ikinci onay isteyin birlikte doğrulanmalı; hata, tekrar ve yetki gibi sınır durumları için de ölçülebilir kanıt üretilmelidir.
Bu akışı kendi sisteminize uyarlayalım.
Mevcut süreci, kullandığınız sistemleri ve çözmek istediğiniz darboğazı paylaşın. Kapsamı, entegrasyon sınırlarını ve kabul kriterlerini birlikte netleştirelim.
İlgili Ganz hizmetini inceleProjenizi konuşalım →Bu içerikteki senaryo ve kabul örnekleri açıklama amacıyla hazırlanmış varsayımsal örneklerdir; müşteri sonucu, fiyat, sertifikasyon veya performans garantisi değildir. Platform davranışları uygulama tarihinde güncel birincil dokümantasyondan yeniden doğrulanmalıdır.