RAG, dil modelini rehber ve protokollere dayandırır; hatayı azaltabilir ama sıfırlamaz. Kaynak gösteren klinik asistanlarda hekimin kontrol edeceği noktalar.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet Yeni klinik asistanların çoğu, yanıtını bir belge havuzundan çektiği metinlere…
Haberi paylaş
İlgilenecek birine ulaştırın.

RAG, dil modelini rehber ve protokollere dayandırır; hatayı azaltabilir ama sıfırlamaz. Kaynak gösteren klinik asistanlarda hekimin kontrol edeceği noktalar.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
Yeni klinik asistanların çoğu, yanıtını bir belge havuzundan çektiği metinlere dayandırıyor ve altına kaynak ekliyor. Bu yönteme RAG (erişimle güçlendirilmiş üretim) deniyor. RAG, modelin eğitimde ezberlediği bilgiye yaslanmasını azaltır ama hatayı ortadan kaldırmaz. Yanlış pasaj çekilebilir, kaynak eski olabilir ya da cümle kaynağın söylediğinden fazlasını iddia edebilir.
Terim, Lewis ve arkadaşlarının 2020'de NeurIPS'te sunduğu çalışmadan gelir. Yazarlar iki tür belleği birleştirdi. Parametrik bellek, modelin eğitimle ağırlıklarına işlenmiş bilgisidir. Parametrik olmayan bellek ise sorguyla erişilen dış bir belge dizinidir; o çalışmada bu dizin Wikipedia'dan oluşuyordu.
Yazarlar bu yaklaşımın, yalnızca parametrik belleğe dayanan modellere göre daha olgusal metin ürettiğini bildirdi. Klinik bir asistanda süreç kabaca üç adımdan oluşur. Önce sorunuza benzeyen pasajlar belge havuzundan çekilir. Sonra bu pasajlar sorunuzla birlikte dil modeline verilir ve model yanıtı atıflarla yazar.
Bu yapıda iki ayrı bileşen vardır: Belgeleri bulan erişim bileşeni ve metni yazan dil modeli. Hata bu ikisinin herhangi birinden kaynaklanabilir. Bu ayrımı bilmek, bir yanıtın neden yanlış olduğunu anlamanıza yardım eder.
Belge havuzu güncel rehberler ve yerel protokollerden oluşursa model, eğitim verisindeki eski bilgiye daha az yaslanır. Ancak zincirin her halkası hata üretebilir:
Bu hataların ortak noktası, yanıtın yine de akıcı ve kendinden emin görünmesidir. ABD Ulusal Standartlar ve Teknoloji Enstitüsü (NIST), kendinden emin ama yanlış içeriği konfabulasyon olarak adlandırıyor. Gündelik dilde buna halüsinasyon deniyor. RAG bu riski küçültür ama kaynak gösterilmesi tek başına doğruluk garantisi değildir.
Wu ve arkadaşları 2025'te Nature Communications'ta tıbbi yanıtlardaki kaynak desteğini ölçen otomatik bir çerçeve yayımladı. Yedi dil modeli 800 soru üzerinde test edildi. Yaklaşık 58 bin ifade ile kaynak çifti incelendi. Modele göre yanıtların %50 ile %90'ı gösterdiği kaynaklarla tam desteklenmiyordu; bazen kaynakla çelişiyordu.
Web aramalı GPT-4o'da bile ifadelerin yaklaşık %30'u desteksizdi. Yanıtların yaklaşık yarısı ise kaynaklarla tam desteklenmiyordu. Değerlendirilen sürümler bugün piyasadaki araçlardan eski; güncel oranlar farklı olabilir. Yine de bulgu, "kaynak gösteriyor" ile "kaynak destekliyor" arasındaki farkı net biçimde gösteriyor.
Ke ve arkadaşları 2025'te npj Digital Medicine'de ameliyat öncesi değerlendirme için RAG'ı test etti. On dil modeli, 35 yerel ve 23 uluslararası rehberle 14 simüle senaryoda sınandı. En iyi yapılandırma olan GPT-4 ve uluslararası rehberler %96,4 doğruluğa ulaştı. İnsan yanıtlarında bu oran %86,6 idi.
Aynı çalışmada yerel rehberlerle doğruluk daha düşüktü. Yazarlar bunu uluslararası rehberlerin daha kapsamlı olmasına ve şema ile tabloları metinle açıklamasına bağladı. Çoğu modelde halüsinasyon oranı düşüktü, ancak Llama2'de belirgin biçimde yüksekti. Ders açık: RAG'ın kalitesi, havuzdaki belgelerin kalitesine ve biçimine bağlı.
Şöyle bir durum düşünün. Hastanenizin asistanına penisilin alerjisi olan hastada cerrahi profilaksiyi soruyorsunuz. Yanıt net ve iki kaynak gösteriyor: hastane protokolü ve uluslararası bir rehber.
Kaynağa tıkladığınızda protokolün eski bir sürümü açılıyor. Üstelik pasaj alerji tipine göre ayrım yaparken yanıt bu ayrımı atlıyor. Yanıt tümüyle yanlış değil, ama eksik ve güncel değil. RAG'ın tipik başarısızlığı budur: Kaynak var, fakat cümleyi tam desteklemiyor.
Belge havuzu sistemin bilgi kaynağıdır; özenle seçilmezse model de özensiz yanıt verir. Hangi belgelerin havuza girdiğini ve kimin onayladığını baştan yazın. Eski sürümler havuzdan çıkarılmalı ya da açıkça yürürlükten kalktı diye etiketlenmeli.
Tablo ve akış şemaları için ayrı bir kontrol yapın. Ke ve arkadaşlarının bulgusu, bu biçimlerin sorun yaratabileceğini düşündürüyor. Sistemi devreye almadan önce gerçek sorulara benzeyen bir test seti hazırlayın ve yanıtları kaynağı okuyan hekimler puanlasın. Kullanıma geçtikten sonra da hatalı yanıtları bildirmek için basit bir yol açın.
6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli kişisel veri sayıyor. Dış sunucuda çalışan bir asistana hasta bilgisi yazmak bu yüzden ayrıca dikkat ister. Yerel protokollerle RAG kurmak isteyen hastaneler, belgelerin sürüm takibini de baştan planlamalı. Aktardığımız çalışmalar Türkçe içerikle yapılmadı; Türkçe belge havuzlarıyla performans ayrıca test edilmeli.
Kaynak göstermek doğrulamayı kolaylaştırır ama doğruluğu garanti etmez. Nature Communications'taki değerlendirmede web aramalı modelde bile ifadelerin önemli bir kısmı kaynakla desteklenmiyordu.
İnce ayar, modelin kendisini ek veriyle yeniden eğitir. RAG ise modeli değiştirmeden her soruda dış belgelerden bilgi çeker. Bu yüzden RAG'da bir protokolü güncellemek, modeli yeniden eğitmekten daha kolaydır.
Bu iyi bir işaret; model boşluğu uydurmak yerine bildiriyor. Soruyu farklı sözcüklerle yeniden sorabilir ya da doğrudan rehbere dönebilirsiniz.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: