İnceleme içeriğine geç
DijitalPi
TREN
İletişim

ULUSLARARASI ARAŞTIRMA / ÖN BASKI

AI çalışanı gerçekten
işe hazır mı?

İşi yapabiliyor. Peki ekibiniz ne kadar kontrol edecek? AI çözümünü seçerken doğruluğu, kontrol emeğini ve toplam maliyeti birlikte düşünün.

Tüm yazarlar ve kurumlar

İngilizce kaynak · Türkçe inceleme: 9 Eylül 2026 · Kaynak tarihi yukarıdaki künyededir.

Editoryal inceleme taslağı

Kaynak kontrolü yapıldı; Türkçe inceleme insan editör değerlendirmesini bekliyor. DijitalPi bu çalışma için müşteri deneyi yapmadı.

KISA AÇIKLAMA

Bu Araştırma Size Ne Söylüyor?

Bir AI çözümünü seçerken kaç işi doğru yaptığının yanında, ekibin kontrol ve düzeltmeye ayıracağı zamanı da hesaba katın.

Bir örnek düşünün
İki asistan aynı sayıda doğru teklif taslağı hazırlıyor. Birinin hatalarını fark etmek için bütün dosyayı okumak gerekiyor; diğeri kontrol gerektiren alanları ayrı gösteriyor.
İşinizde ne yapabilirsiniz?
Küçük bir denemede doğru sonuç sayısını, kontrol süresini, düzeltme süresini ve araç ücretini ayrı kaydedin. Denemeye başlamadan kabul edeceğiniz sonucu tanımlayın.

DijitalPi’nin uygulama yorumu. Örnek, konuyu açıklamak için hazırlanmıştır.

ARAŞTIRMAYI BİRLİKTE OKUYALIM

Önce araştırmacıların sorusunu, yöntemini ve bulgularını tanıyalım. Ardından sonuçların nasıl okunabileceğini DijitalPi’nin açıklamalarıyla ele alalım.

01 / ARAŞTIRMACILAR NEYİ ANLAMAK İSTEDİ?

Bir AI sistemi işi yapabiliyorsa kullanıma hazır sayılır mı?

Chatrath ve çalışma arkadaşları READY ile, bir AI sistemini belirli iş, güvenilirlik hedefi, insan incelemesi ve maliyet koşulları içinde değerlendirmeyi öneriyor.

Konuyu açalım · DijitalPi açıklaması

Bir denemede doğru çıktı görmek sevindiricidir. Fakat o çıktının müşteriye gönderilebilmesi için başka işler yapılabilir: eksik bilgiyi bulmak, şüpheli kısmı kontrol etmek, düzeltmek ve son onayı vermek. İşe hazır olma sorusu, bu adımların nasıl tamamlanacağıyla birlikte anlam kazanır.

Kendi örneğimizde iki asistanın aynı sayıda doğru teklif hazırladığını düşünelim. İlkinde her teklif baştan sona okunuyor. İkincisinde kontrol gerektiren alanlar daha kolay bulunuyor. Yalnız doğru teklif sayısını yazarsak, ekibin bu iki düzen arasında yaşayacağı farkı raporda göremeyiz. Bu örnek araştırmanın klinik vakası değildir.

02 / ARAŞTIRMA NASIL YAPILDI?

Soruyu nasıl sınadılar?

Çalışma 16 AI sistemini 750 klinik kayıt denetimi örneğinde inceliyor. Sonucu kabul etme veya insana gönderme kuralı geliştirme verisinde seçilip ayrı örneklerle sınanıyor. Birincil hesapta insan incelemesinin başarı olasılığı %90 varsayılıyor; bu yol her vakada fiilen çalıştırılmıyor.

Yöntemi anlamak · DijitalPi açıklaması

Bir kuralı kurduğunuz örneklerde sınamak ile yeni örneklerde denemek farklıdır. Aynı dosyalar üzerinde sürekli ayar yaptığınızda dosyalara alışabilirsiniz. Ayrı bir test bölümü, seçtiğiniz düzenin görmediği örneklerde de çalışıp çalışmadığını incelemek içindir.

İnsan kontrolü varsayımını da açalım. Hesaba bir başarı oranı koymak, o oranın sizin ekibinizde ölçüldüğü anlamına gelmez. Kontrol eden kişinin bilgisi, elindeki süre ve belgenin açıklığı değişebilir. Bu nedenle böyle bir hesabı okurken hangi girdinin deneyden, hangisinin kabul edilen varsayımdan geldiğini ayırırız.

03 / ARAŞTIRMANIN BULGULARI

Benzer doğruluk, farklı insan incelemesi yüküyle birleşebiliyor.

Makalede GPT-5.4’ün tek başına doğruluğu %72,8, Sonnet 5’in %72,5. Çalışmada belirlenen %76 güvenilirlik hedefinde insan incelemesine yönlendirme oranları sırasıyla %39,2 ve %29,6. Bu karşılaştırma çalışmanın koşullarına ve insan incelemesi varsayımına bağlı.

GPT-5.4
%39,2Çalışmanın hedefi ve varsayımları altında insana yönlendirilen pay; tek başına doğruluk %72,8.
Sonnet 5
%29,6Aynı karşılaştırmada insana yönlendirilen pay; tek başına doğruluk %72,5.

Kaynak: READY v1: yöntem, deney sonuçları ve insan incelemesi varsayımları ↗

04 / DİJİTALPİ’NİN AÇIKLAMASI

Bu bulguları nasıl okuyabiliriz?

Yönlendirme oranı, ekibin önüne ne kadar iş gelebileceğini düşünmemizi sağlar. Ama zamanın kendisi değildir. On kısa dosyayla on karmaşık dosyanın inceleme süresi aynı olmayabilir. İnsan emeğini hesaplamak için dosya sayısının yanında kontrolün süresini ve zorluğunu da bilmek gerekir.

Daha az dosyayı insana göndermek de tek başına başarı ölçüsü olamaz. Sistem sorunlu çıktıları fark etmeden kabul ediyorsa kuyruk kısalabilir, fakat hata başka bir yere taşınır. Bu yüzden önce kabul edilebilir sonucun tanımı gerekir. Ardından o sonuca ulaşırken yapılan işin maliyeti değerlendirilir. Makaledeki %76 da bu deneyin seçilmiş hedefidir; kendi işiniz için yeterli sayılacak bir oran olarak önerilmez.

Buradan işletmeler için çıkardığımız soru şudur: AI devreye girdikten sonra iş gerçekten ne zaman bitiyor? Araç ücretine bakmak başlangıçtır. Hazırlık, kontrol, düzeltme ve bekleme kayıtları da tutulursa kazancın nerede oluştuğunu, nerede kaybolduğunu daha açık görebiliriz.

05 / SONUÇ VE AÇIK SORULAR

Neyi öğrendik, neyi henüz bilmiyoruz?

READY, model puanını iş akışının bütünüyle birlikte okumayı öneriyor. Ön baskıdaki sonuçlar belirli klinik görev ve varsayımlarla sınırlı; genel kullanıma hazır olma sertifikası değil.

Sizin teklif, başvuru veya destek sürecinizde insan kontrolü ne kadar etkili ve ne kadar zaman alıyor? Bunun yanıtı makaledeki tablodan alınamaz. Aşağıdaki örnekler, kendi küçük denemenizde bu bilgileri nasıl görünür kılabileceğinizi düşünmek için hazırlandı.

DİJİTALPİ’NİN UYGULAMA YORUMU

Sizin işinizde nasıl görünür?

Bu üç senaryoyu konuyu birlikte düşünmek için hazırladık. Araştırmadan alınmış vaka veya ölçülmüş müşteri sonucu değildir.

ÖRNEK 01

Hızlı teklif, uzun kontrol

Asistan bir dakikada teklif hazırladı. Satış sorumlusu ürünleri, fiyatları ve koşulları tek tek kontrol etmek için yirmi dakika harcadı.

Yalnız hazırlama süresini başarı diye yazar mısınız?

Örnek 01 için öneriyi aç

İşin tamamlanma süresini ölçün.

Başlangıçtan müşteriye gönderilmeye hazır son sürüme kadar geçen süreyi kaydedin. Çalışanın aktif emeğini ayrıca tutun. AI öncesinde aynı tür teklifin ne kadar sürdüğüyle karşılaştırın; kontrol süresini hesabın dışında bırakmayın.

ÖRNEK 02

Her kayıt onaya geliyor

Başvuruları ayıran asistanın sonuçları çoğunlukla doğru görünüyor. Ancak neredeyse her başvuru ekip yöneticisinin onayını bekliyor.

Doğru cevap sayısı tek başına yeterli mi?

Örnek 02 için öneriyi aç

Onay kuyruğunu da görünür yapın.

Kaç kaydın onaya geldiğini, ne kadar beklediğini ve kaçının düzeltildiğini sayın. Kontrolü kaldırmadan önce hangi koşulda gerektiğini belirleyin. Her şeyi aynı kişiye göndermek, darboğazı başka bir yere taşıyabilir.

ÖRNEK 03

Denemede sorunsuz, yeni ayda farklı

Asistan eski ürünlerle denendi. Sonraki ay fiyat yapısı ve kampanya koşulları değişti; ekip eski deneme sonucuna güvenerek devam ediyor.

Önceki test yeni koşulları da kapsıyor mu?

Örnek 03 için öneriyi aç

Değişen işi yeniden deneyin.

Hangi fiyat, belge, model ve kurallarla test yaptığınızı kaydedin. Değişiklikten etkilenen örnekleri yeniden çalıştırın. Eski sonucu silmeyin; yeni denemenin tarihini ve farkını ekleyin.

EKİBİNİZLE DENEYİN

Bir işi baştan sona izleyin.

Ekibinizden bir tekrarlayan iş seçin. Başlangıç, ilk AI çıktısı, insan kontrolü, düzeltme ve tamamlanma anlarını not edin. Bu kayıt, nerede zaman harcandığını görmenize yardımcı olur; tek başına bilimsel başarı ölçümü sayılmaz.

İşletmenize uygun AI çözümlerini inceleyin

Kaynak ve emeğin sahibi

Veronica Chatrath, Bryan Zhu, Jingxuan Fan, George Pu, Soham Dinesh Tiwari, Soham Dan, Ryan Young, Yuan (Christy) Li, Yuang Yao, Apaar Shanker, Minglai Yang, Daniel Yue Zhang, Yunzhong He, Ying Liu, Chenguang Wang, Zhijun Yin ve Yuan (Emily) Xue.
Scale AI; University of California, Santa Cruz; Vanderbilt University Medical Center.

arXiv · 2 Eylül 2026 · v1 · Ön baskı. Orijinal yayını aç

Akademik çalışma yukarıdaki araştırmacılara aittir. Bu sayfa, DijitalPi’nin AI desteğiyle hazırladığı açıklamalı inceleme ve özgün iş örneklerini içerir; makalenin tam çevirisi değildir.

← Tüm araştırma yazılarına dön

YAPAY ZEKAYA SORUN

DijitalPi ne yapar, yapay zeka anlatsın.

Seçtiğiniz asistanı hazır bir araştırma promptuyla açar. Siteyi canlı okuyup yanıtlar.