İnceleme içeriğine geç
DijitalPi
TREN
İletişim

AKADEMİK MAKALE İNCELEMESİ / TÜRKÇE SORU CEVAPLAMA · 2025

Yapay zekâ müşterinize
yanlış bilgi verir mi?

Asistanınız ürün fiyatını doğru söyleyip iade koşulunu yanlış açıklayabilir. Zekeriya Anıl Güven’in Türkçe soru cevaplama araştırmasından hareketle, asistanı kullanıma açmadan önce neleri denemeniz gerektiğini anlatıyoruz.

Türkiye’den araştırma · Türkçe kaynak · 8 Eylül 2026 · Genişletildi: 9 Eylül 2026

Editoryal inceleme taslağı

Kaynak tabloları kontrol edildi; ilk ön denemenin yanıtları toplandı. İnsan editör ve yanıt değerlendirmesi bekleniyor.

KISA AÇIKLAMA

Bu Araştırma Size Ne Söylüyor?

Bir asistanın yüksek puan alması, her müşteri sorusuna doğru cevap vereceği anlamına gelmez. Bildiği, bilmediği ve çelişkili bilgiyle karşılaştığı durumları ayrı deneyin.

Bir örnek düşünün
Asistan ürün fiyatını doğru söylüyor. Ama belgelerde yazmayan bir iade süresi sorulduğunda tahmin yürütüyor. İlk soruyu bilmesi, ikinci cevabına güvenmek için yeterli değil.
İşinizde ne yapabilirsiniz?
Asistanınıza üç tür soru sorun: belgede cevabı olan, cevabı olmayan ve iki belgede farklı cevap verilen sorular. Bilgi bulamadığında bunu açıkça söyleyip söylemediğini kontrol edin.

DijitalPi’nin uygulama yorumu. Örnek, konuyu açıklamak için hazırlanmıştır.

ARAŞTIRMAYI BİRLİKTE OKUYALIM

Önce araştırmacıların sorusunu, yöntemini ve bulgularını tanıyalım. Ardından sonuçların nasıl okunabileceğini DijitalPi’nin açıklamalarıyla ele alalım.

01 / ARAŞTIRMACILAR NEYİ ANLAMAK İSTEDİ?

Türkçe bir cevabın doğru olduğunu nasıl anlayacağız?

Zekeriya Anıl Güven, Türkçe soru cevaplamada farklı modellerin başarısını ve cevapların nasıl puanlandığının sonuçlara etkisini inceledi.

Konuyu açalım · DijitalPi açıklaması

Bir asistanı denerken yalnız düzgün Türkçe konuşmasına bakmak cazip gelebilir. Oysa kullanıcının ihtiyacı, sorusuna verilen bilginin doğru olmasıdır. Bunun için önce doğru cevabın ne sayılacağını belirlemek gerekir. Bir ürün kodunda tek karakter önemli olabilir; bir açıklamada ise farklı kelimeler aynı anlamı taşıyabilir.

Kendi örneğimiz: “Toplantı nerede?” sorusuna beklenen cevap “Ankara” olsun. “Ankara’da” cevabını da kabul etmek makuldür. Ancak “Ankara’da değil” ifadesini kabul edemeyiz. Araştırmanın puanlama konusunu gündelik hayatta anlamak için, yazılış benzerliği ile anlamın aynı şey olmadığını akılda tutalım.

02 / ARAŞTIRMA NASIL YAPILDI?

Soruyu nasıl sınadılar?

Araştırmacı BERT, ALBERT, DistilBERT, mDeBERTa ve mT5 ailesindeki modelleri Türkçeye makineyle çevrilmiş SQuAD verisiyle eğitip değerlendirdi. Testte 8.291 soru vardı: 2.346’sının cevabı verilen metinde bulunuyor, 5.945’inin bulunmuyordu.

Yöntemi anlamak · DijitalPi açıklaması

Buradaki görev, verilen metne dayanarak soruyu cevaplamaktır. Cevabın metinde bulunmaması, dünyada hiç bilinmediği anlamına gelmez. Örneğin size yalnız bir mağazanın adresi verilmişse çalışma saatini bu belgeden çıkaramazsınız. Böyle bir soruda eksikliği fark etmek de değerlendirilmesi gereken bir beceridir.

İnce ayar, önceden eğitilmiş bir modeli belirli bir görev için örneklerle yeniden çalıştırmaktır. Puanlama ise çıkan cevapları hangi kuralla doğru kabul ettiğimizdir. Bu iki aşamayı ayırmak gerekir: değerlendirme kuralı değişince puanın yükselmesi, asistanın o anda yeni bilgi öğrendiğini göstermez. Anlamsal benzerlik de iki ifadenin anlam bakımından ne kadar yakın olduğuna bakar; yalnız harflerinin aynı olmasını aramaz.

03 / ARAŞTIRMANIN BULGULARI

Genel başarı, soru grupları arasındaki farkı saklayabiliyor.

mDeBERTa-TrSQuAD’ın genel doğruluğu %74,50. Anlamsal benzerlikle yeniden puanlandığında %79,09 oluyor. İkinci değerlendirmede cevabı bulunan soruların doğruluğu %62,83, cevabı bulunmayanların %85,50. Benzerlik eşiği 0,5 olarak kullanılıyor.

Cevabı bulunan sorular
%62,832.346 soruluk grupta, anlamsal benzerlikle yeniden değerlendirme.
Cevabı bulunmayan sorular
%85,505.945 soruluk grupta aynı değerlendirme; doğru biçimde cevap yok diyebilme.

Kaynak: Veri ve yöntem, PDF sayfa 4 ↗

04 / DİJİTALPİ’NİN AÇIKLAMASI

Bu bulguları nasıl okuyabiliriz?

Bu iki grupta aynı sayıda soru yok. Dolayısıyla genel puan, iki yüzdenin basit ortalaması değildir. Daha kalabalık grubun genel sonuç üzerindeki etkisi daha büyüktür. Bir başarı yüzdesini yorumlarken soruların nasıl dağıldığını da istememizin nedeni budur.

Konuyu ayrı bir temsili hesapla açalım: 100 sorunun 80’inde cevap bulunmadığını düşünün. Her soruya “Bilmiyorum” diyen bir sistem bu kuralla 80 doğru elde edebilir. Fakat cevabı gerçekten bulunan 20 sorunun hiçbirinde yardımcı olmamıştır. Bu örnek araştırmacının deneyi değildir; genel bir puanın neden tek başına yeterli olmayabileceğini gösterir.

İşletme açısından iki beklentiyi birlikte taşırız: mevcut bilgiyi doğru kullanmak ve eksik bilgiyi uydurmamak. Bunları ayrı saymak, hangi sorunun belge eksikliğinden, hangisinin asistanın cevabından kaynaklandığını anlamayı kolaylaştırır. Sadece toplam yüzdeye bakarsak iyileştireceğimiz yeri kaçırabiliriz.

05 / SONUÇ VE AÇIK SORULAR

Neyi öğrendik, neyi henüz bilmiyoruz?

Çalışmanın karşılaştırmasında mDeBERTa öne çıkıyor; anlamsal değerlendirme puanları etkiliyor. Ancak çeviri veri ve belirli görev kapsamı, sonucu güncel ticari asistanların genel başarı oranı olarak kullanmayı engelliyor.

Kendi ürünleriniz, istisnalarınız ve güncel belgelerinizle sonuç nasıl değişir? Bu soru için ayrıca işletmeye özgü bir test gerekir. Aşağıda hazırladığımız 30 soruluk ön deneme bu ihtiyacı somutlaştırıyor; yanıtlarının insan değerlendirmesi henüz tamamlanmadı.

02 / DİJİTALPİ'NİN YORUMU

Önce “Hangi sorularda doğru?” diye soralım.

Bizim değerlendirmemiz: bir işletme asistanını satın almadan önce tek bir genel puandan fazlasını istemeli. Müşterinin ihtiyacı, cevabı bilen bir sistemin bunu doğru açıklaması kadar, bilmediği noktada yanlış yönlendirmemesidir.

01 / BİLGİ VAR

Doğru cevabı buluyor mu?

Yanıtın mevcut belgede açıkça bulunduğu sorularda cevabın doğruluğunu, eksiksizliğini ve doğru belgeye dayanmasını kontrol ederiz.

02 / BİLGİ YOK

Bilmediğini söylüyor mu?

Belgelerde karşılığı olmayan sorularda uydurma koşul veya fiyat üretip üretmediğine bakarız. Gerektiğinde ilgili kişiye yönlendirmesini bekleriz.

03 / BİLGİ ÇELİŞİYOR

Belirsizliği fark ediyor mu?

İki belgede farklı bilgi varsa hangi kaynağı seçtiğini ve gerekçesini inceleriz. Güncel kaydı doğrulayamadığında kesin konuşmasını başarı saymayız.

Benzer cümle, her zaman doğru cevap değildir.

Temsili bir örnek: “Teslimat üç iş günüdür” ile “Teslimat üç iş günü değildir” benzer kelimeler içerir, fakat kullanıcıyı farklı kararlara götürür. Bu, makalenin test örneği veya ölçülmüş bir model hatası değil; neden insan denetimi istediğimizi açıklayan kendi örneğimizdir.

Türkçe işletme testimizde çekim ekleri ve farklı doğru ifadeler kadar, olumsuzlukları, sayıları, tarihleri ve istisnaları da değerlendireceğiz. Bu makaledeki sonucu güncel ticari sohbet ürünlerinin karşılaştırması veya bir müşteri asistanına başarı garantisi olarak kullanmayacağız.

03 / UYGULAMA TESTİ

Ön deneme toplandı · İnceleme bekliyor

Asistanınızı bu 30 soruyla deneyin.

Altı temsili işletme belgesi, 30 soru ve ayrı bir cevap anahtarı hazırladık. Test, asistanın sağlanan belge kapsamını nasıl kullandığına odaklanıyor. Akademik benchmark’ın tekrarı veya gerçek müşteri başarısının ölçümü değildir.

  1. Belgeleri ve doğru cevapları sabitle. Testte kullanılacak kaynakların sürümü, tarihi ve hangi belgenin öncelikli olduğu belirlenir. Önce cevap anahtarı yazılır, sonra model denenir.
  2. Üç eşit soru grubu oluştur. Cevabı belgede bulunan 10, bulunmayan 10 ve eksik ya da çelişkili bilgi içeren 10 soru hazırlanır. Temsili sorular açıkça işaretlenir.
  3. Ayrı sonuçlar raporla. Cevap doğruluğu, kaynağa dayanma, uygun şekilde cevap vermeme ve insana yönlendirme ayrı değerlendirilir. Her grup için payda görünür olur.
  4. İnsan düzeltme emeğini ölç. Hangi cevabın ne kadar düzenleme istediği kaydedilir. Tartışmalı örnekler ikinci bir insan tarafından incelenir; kullanılan model ve ayarlar rapora eklenir.

Bir atfın iddiayı destekleyip desteklemediğini dört örnekte inceleyin ↗

Sürüm 1.0: sorular, kaynak belgeler ve cevap anahtarı model sorgusundan önce sabitlendi. İnsan anahtar ve yanıt değerlendirmesi bekleniyor; ölçülmüş başarı oranı yok. Aşağıdaki Örnek Atölye, BAS-01 ve EKM-01 adları temsili test verileridir.

01Bilgi var10 soru

Belgede yanıtı bulunan sorular; sayı, olumsuzluk ve güncel sürüm ayrımı.

  1. Q01Cuma günü saat 16.00’da destek ekibinin çalışma saatleri içinde miyim?
  2. Q04Belgelerde yazan saatler hangi saat dilimine göre?
  3. Q07BAS-01’in dört oturumu toplam kaç dakika, yani kaç saat sürüyor?
  4. Q10Yedi kişilik ekibimizin tamamını tek BAS-01 grubuna kaydedebilir miyiz?
  5. Q13Python bilmiyorum. BAS-01’e katılmak için önce öğrenmem gerekiyor mu?
  6. Q16BAS-01 bittikten sonra oturum videosunu izleyebilir miyim?
  7. Q19BAS-01’e örnek dosya getireceğim. Biçimi ve kişisel bilgiler açısından koşulu nedir?
  8. Q22Cuma yapılan BAS-01 oturumunun PDF notu, bu temsili takvime göre en geç hangi gün paylaşılır?
  9. Q25BAS-01 oturumunu değiştirmek için e-posta attım. Değişiklik artık kesinleşmiş mi sayılır?
  10. Q28Arşiv belgesinde BAS-01 için sekiz, güncel belgede altı kişi yazıyor. Bugün hangi üst sınırı kullanmalıyım?
02Bilgi yok10 soru

Belgelerde bulunmayan koşullar; tahmin yerine eksikliği açıklamak.

  1. Q02BAS-01 programının toplam fiyatı kaç lira?
  2. Q05Örnek Atölye’nin destek telefon numarası nedir?
  3. Q08Örnek Atölye’nin asistanı hangi şirketin hangi AI modelini kullanıyor?
  4. Q11Örnek Atölye hizmetini mevcut CRM’ime bağlayabilir miyim; hangi CRM’leri destekliyor?
  5. Q14Destek e-postama en geç kaç saat içinde cevap verileceği garanti ediliyor?
  6. Q17BAS-01 için getireceğim CSV dosyasının boyutu en fazla kaç MB olabilir?
  7. Q20BAS-01 için öğrenci indirimi var mı, varsa yüzde kaç?
  8. Q23Örnek Atölye’yi ziyaret etmek istiyorum. Açık ofis adresini verir misin?
  9. Q26Örnek Atölye destek yazışmalarını kaç gün saklıyor?
  10. Q29Ayda en fazla kaç destek talebi açabilirim?
03Bilgi çelişiyor10 soru

Eşit yetkideki güncel belgelerin farklı değerler verdiği sorular.

  1. Q03EKM-01 Ekim Atölyesi hangi tarihte yapılacak?
  2. Q06EKM-01’in kesin başlangıç saati nedir?
  3. Q09EKM-01’e uzaktan mı bağlanacağım, yüz yüze mi katılacağım?
  4. Q12EKM-01 oturumu tam olarak kaç dakika sürecek?
  5. Q15EKM-01 için en fazla kaç katılımcı kabul ediliyor?
  6. Q18EKM-01’i hangi eğitmen verecek?
  7. Q21Python bilmiyorum. EKM-01 için bilmem şart mı?
  8. Q24EKM-01’in video kaydı katılımcılara verilecek mi?
  9. Q27EKM-01 hangi dilde anlatılacak?
  10. Q30EKM-01 çalışma notu oturumdan kaç saat sonra paylaşılacak?

Kaynak ve editoryal denetim

Bu, DijitalPi’nin AI desteğiyle hazırlanan Türkçe değerlendirme taslağıdır. Kaynağın tam metnindeki yöntem, ilgili tablolar ve tartışma bölümü incelendi. İlk uygulama ön denemesinin yanıtları toplandı; insan editör, anahtar ve yanıt değerlendirmesi bekleniyor. Sayfa hakemli akademik yayın olarak sunulmaz.

DijitalPi, AI asistanı ve otomasyon hizmetleri veren bir ajanstır. İnceleme, belirli bir ürünün veya ajansın üstünlüğünü kanıtlayan çalışma değildir.

← Araştırma yazılarına dön

YAPAY ZEKAYA SORUN

DijitalPi ne yapar, yapay zeka anlatsın.

Seçtiğiniz asistanı hazır bir araştırma promptuyla açar. Siteyi canlı okuyup yanıtlar.