İngilizce kaynak · Türkçe inceleme: 9 Eylül 2026 · Kaynak tarihi yukarıdaki künyededir.
Editoryal inceleme taslağı
Kaynak kontrolü yapıldı; Türkçe inceleme insan editör değerlendirmesini bekliyor. DijitalPi bu çalışma için müşteri deneyi yapmadı.
KISA AÇIKLAMA
Bu Araştırma Size Ne Söylüyor?
Bir AI çözümünü seçerken kaç işi doğru yaptığının yanında, ekibin kontrol ve düzeltmeye ayıracağı zamanı da hesaba katın.
Bir örnek düşünün
İki asistan aynı sayıda doğru teklif taslağı hazırlıyor. Birinin hatalarını fark etmek için bütün dosyayı okumak gerekiyor; diğeri kontrol gerektiren alanları ayrı gösteriyor.
İşinizde ne yapabilirsiniz?
Küçük bir denemede doğru sonuç sayısını, kontrol süresini, düzeltme süresini ve araç ücretini ayrı kaydedin. Denemeye başlamadan kabul edeceğiniz sonucu tanımlayın.
DijitalPi’nin uygulama yorumu. Örnek, konuyu açıklamak için hazırlanmıştır.
ARAŞTIRMAYI BİRLİKTE OKUYALIM
Önce araştırmacıların sorusunu, yöntemini ve bulgularını tanıyalım. Ardından sonuçların nasıl okunabileceğini DijitalPi’nin açıklamalarıyla ele alalım.
01 / ARAŞTIRMACILAR NEYİ ANLAMAK İSTEDİ?
Bir AI sistemi işi yapabiliyorsa kullanıma hazır sayılır mı?
Chatrath ve çalışma arkadaşları READY ile, bir AI sistemini belirli iş, güvenilirlik hedefi, insan incelemesi ve maliyet koşulları içinde değerlendirmeyi öneriyor.
Konuyu açalım · DijitalPi açıklaması
Bir denemede doğru çıktı görmek sevindiricidir. Fakat o çıktının müşteriye gönderilebilmesi için başka işler yapılabilir: eksik bilgiyi bulmak, şüpheli kısmı kontrol etmek, düzeltmek ve son onayı vermek. İşe hazır olma sorusu, bu adımların nasıl tamamlanacağıyla birlikte anlam kazanır.
Kendi örneğimizde iki asistanın aynı sayıda doğru teklif hazırladığını düşünelim. İlkinde her teklif baştan sona okunuyor. İkincisinde kontrol gerektiren alanlar daha kolay bulunuyor. Yalnız doğru teklif sayısını yazarsak, ekibin bu iki düzen arasında yaşayacağı farkı raporda göremeyiz. Bu örnek araştırmanın klinik vakası değildir.
02 / ARAŞTIRMA NASIL YAPILDI?
Soruyu nasıl sınadılar?
Çalışma 16 AI sistemini 750 klinik kayıt denetimi örneğinde inceliyor. Sonucu kabul etme veya insana gönderme kuralı geliştirme verisinde seçilip ayrı örneklerle sınanıyor. Birincil hesapta insan incelemesinin başarı olasılığı %90 varsayılıyor; bu yol her vakada fiilen çalıştırılmıyor.
Yöntemi anlamak · DijitalPi açıklaması
Bir kuralı kurduğunuz örneklerde sınamak ile yeni örneklerde denemek farklıdır. Aynı dosyalar üzerinde sürekli ayar yaptığınızda dosyalara alışabilirsiniz. Ayrı bir test bölümü, seçtiğiniz düzenin görmediği örneklerde de çalışıp çalışmadığını incelemek içindir.
İnsan kontrolü varsayımını da açalım. Hesaba bir başarı oranı koymak, o oranın sizin ekibinizde ölçüldüğü anlamına gelmez. Kontrol eden kişinin bilgisi, elindeki süre ve belgenin açıklığı değişebilir. Bu nedenle böyle bir hesabı okurken hangi girdinin deneyden, hangisinin kabul edilen varsayımdan geldiğini ayırırız.
03 / ARAŞTIRMANIN BULGULARI
Benzer doğruluk, farklı insan incelemesi yüküyle birleşebiliyor.
Makalede GPT-5.4’ün tek başına doğruluğu %72,8, Sonnet 5’in %72,5. Çalışmada belirlenen %76 güvenilirlik hedefinde insan incelemesine yönlendirme oranları sırasıyla %39,2 ve %29,6. Bu karşılaştırma çalışmanın koşullarına ve insan incelemesi varsayımına bağlı.
GPT-5.4
%39,2Çalışmanın hedefi ve varsayımları altında insana yönlendirilen pay; tek başına doğruluk %72,8.
Sonnet 5
%29,6Aynı karşılaştırmada insana yönlendirilen pay; tek başına doğruluk %72,5.
Yönlendirme oranı, ekibin önüne ne kadar iş gelebileceğini düşünmemizi sağlar. Ama zamanın kendisi değildir. On kısa dosyayla on karmaşık dosyanın inceleme süresi aynı olmayabilir. İnsan emeğini hesaplamak için dosya sayısının yanında kontrolün süresini ve zorluğunu da bilmek gerekir.
Daha az dosyayı insana göndermek de tek başına başarı ölçüsü olamaz. Sistem sorunlu çıktıları fark etmeden kabul ediyorsa kuyruk kısalabilir, fakat hata başka bir yere taşınır. Bu yüzden önce kabul edilebilir sonucun tanımı gerekir. Ardından o sonuca ulaşırken yapılan işin maliyeti değerlendirilir. Makaledeki %76 da bu deneyin seçilmiş hedefidir; kendi işiniz için yeterli sayılacak bir oran olarak önerilmez.
Buradan işletmeler için çıkardığımız soru şudur: AI devreye girdikten sonra iş gerçekten ne zaman bitiyor? Araç ücretine bakmak başlangıçtır. Hazırlık, kontrol, düzeltme ve bekleme kayıtları da tutulursa kazancın nerede oluştuğunu, nerede kaybolduğunu daha açık görebiliriz.
05 / SONUÇ VE AÇIK SORULAR
Neyi öğrendik, neyi henüz bilmiyoruz?
READY, model puanını iş akışının bütünüyle birlikte okumayı öneriyor. Ön baskıdaki sonuçlar belirli klinik görev ve varsayımlarla sınırlı; genel kullanıma hazır olma sertifikası değil.
Sizin teklif, başvuru veya destek sürecinizde insan kontrolü ne kadar etkili ve ne kadar zaman alıyor? Bunun yanıtı makaledeki tablodan alınamaz. Aşağıdaki örnekler, kendi küçük denemenizde bu bilgileri nasıl görünür kılabileceğinizi düşünmek için hazırlandı.
Bu üç senaryoyu konuyu birlikte düşünmek için hazırladık. Araştırmadan alınmış vaka veya ölçülmüş müşteri sonucu değildir.
ÖRNEK 01
Hızlı teklif, uzun kontrol
Asistan bir dakikada teklif hazırladı. Satış sorumlusu ürünleri, fiyatları ve koşulları tek tek kontrol etmek için yirmi dakika harcadı.
Yalnız hazırlama süresini başarı diye yazar mısınız?
Örnek 01 için öneriyi aç+
İşin tamamlanma süresini ölçün.
Başlangıçtan müşteriye gönderilmeye hazır son sürüme kadar geçen süreyi kaydedin. Çalışanın aktif emeğini ayrıca tutun. AI öncesinde aynı tür teklifin ne kadar sürdüğüyle karşılaştırın; kontrol süresini hesabın dışında bırakmayın.
ÖRNEK 02
Her kayıt onaya geliyor
Başvuruları ayıran asistanın sonuçları çoğunlukla doğru görünüyor. Ancak neredeyse her başvuru ekip yöneticisinin onayını bekliyor.
Doğru cevap sayısı tek başına yeterli mi?
Örnek 02 için öneriyi aç+
Onay kuyruğunu da görünür yapın.
Kaç kaydın onaya geldiğini, ne kadar beklediğini ve kaçının düzeltildiğini sayın. Kontrolü kaldırmadan önce hangi koşulda gerektiğini belirleyin. Her şeyi aynı kişiye göndermek, darboğazı başka bir yere taşıyabilir.
ÖRNEK 03
Denemede sorunsuz, yeni ayda farklı
Asistan eski ürünlerle denendi. Sonraki ay fiyat yapısı ve kampanya koşulları değişti; ekip eski deneme sonucuna güvenerek devam ediyor.
Önceki test yeni koşulları da kapsıyor mu?
Örnek 03 için öneriyi aç+
Değişen işi yeniden deneyin.
Hangi fiyat, belge, model ve kurallarla test yaptığınızı kaydedin. Değişiklikten etkilenen örnekleri yeniden çalıştırın. Eski sonucu silmeyin; yeni denemenin tarihini ve farkını ekleyin.
EKİBİNİZLE DENEYİN
Bir işi baştan sona izleyin.
Ekibinizden bir tekrarlayan iş seçin. Başlangıç, ilk AI çıktısı, insan kontrolü, düzeltme ve tamamlanma anlarını not edin. Bu kayıt, nerede zaman harcandığını görmenize yardımcı olur; tek başına bilimsel başarı ölçümü sayılmaz.
Veronica Chatrath, Bryan Zhu, Jingxuan Fan, George Pu, Soham Dinesh Tiwari, Soham Dan, Ryan Young, Yuan (Christy) Li, Yuang Yao, Apaar Shanker, Minglai Yang, Daniel Yue Zhang, Yunzhong He, Ying Liu, Chenguang Wang, Zhijun Yin ve Yuan (Emily) Xue. Scale AI; University of California, Santa Cruz; Vanderbilt University Medical Center.
Akademik çalışma yukarıdaki araştırmacılara aittir. Bu sayfa, DijitalPi’nin AI desteğiyle hazırladığı açıklamalı inceleme ve özgün iş örneklerini içerir; makalenin tam çevirisi değildir.