Dil modelleri tıp sınavı sorularında yüksek puan alıyor. Gerçek hasta kayıtları ve insan kullanıcılarla yapılan çalışmalar daha temkinli bir tablo çiziyor.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet Büyük dil modelleri (çok büyük metin verisiyle eğitilen, soru yanıtlayan yapay zekâ…
Haberi paylaş
İlgilenecek birine ulaştırın.

Dil modelleri tıp sınavı sorularında yüksek puan alıyor. Gerçek hasta kayıtları ve insan kullanıcılarla yapılan çalışmalar daha temkinli bir tablo çiziyor.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
Büyük dil modelleri (çok büyük metin verisiyle eğitilen, soru yanıtlayan yapay zekâ sistemleri) tıp lisans sınavı tarzı sorularda yüksek puan alıyor. Gerçek hasta kayıtlarıyla kurulan bir değerlendirmede ise bu tür modeller hekimlerden belirgin biçimde düşük tanı doğruluğu gösterdi. Randomize bir çalışmada, modelin tek başına iyi çözdüğü senaryolarda onu kullanan sıradan kişiler kontrol grubundan daha başarılı olmadı. Kısacası sınav puanı bilgiyi ölçer; klinik yetkinlik ise bilgi toplamayı, önceliklendirmeyi ve iletişimi de ister.
MedQA, ABD, Çin anakarası ve Tayvan'daki hekimlik lisans sınavlarından derlenen çoktan seçmeli bir soru setidir. ABD bölümünde 12.723 soru bulunur ve her soru dört seçeneklidir. Yapay zekâ dünyasında bu tür setlere "benchmark" (sabit soru kümesiyle yapılan kıyaslama testi) denir. Modelin puanı, bu kümede doğru seçeneği bulma oranıdır.
Google ekibinin 2023'te Nature'da yayımladığı çalışmada Flan-PaLM modeli MedQA'da %67,6 doğruluğa ulaştı. Aynı ekibin Med-PaLM 2 modeli, 2025'te Nature Medicine'de yayımlanan makalede %86,5'e çıktı. Yazarlar ilk makalede, geliştirdikleri Med-PaLM modelinin hâlâ klinisyenlerin gerisinde kaldığını açıkça yazdı. İkinci makalede de gerçek iş akışında doğrulamayı gelecekte yapılması gereken önemli bir iş olarak tanımladılar.
Sınav sorusunda vaka size hazır gelir. Öykü, bulgu ve laboratuvar tek paragrafta, düzenli bir sırayla durur. Seçenekler de önünüzdedir. Klinikte ise hangi bilgiyi isteyeceğinize siz karar verirsiniz ve seçenek listesi yoktur.
Hager ve arkadaşları 2024'te Nature Medicine'de tam bu boşluğu ölçen bir çalışma yayımladı. Ekip, MIMIC-IV veri tabanındaki gerçek kayıtlardan 2.400 hastalık bir test seti kurdu. Vakalar dört karın patolojisini kapsıyordu: apandisit, kolesistit, divertikülit ve pankreatit. Çalışma retrospektif (geçmiş kayıtlar üzerinden yapılan) bir değerlendirmeydi.
Tüm bilgiler modele hazır verildiğinde bile fark büyüktü. Çalışmadaki hekimler, test edilen alt kümede ortalama %87,5 ile %92,5 doğru tanı koydu. Test edilen açık kaynak modeller ise %58,8 ile %67,8 arasında kaldı. Model bilgiyi kendisi toplamak zorunda kaldığında doğruluk %45,5 ile %54,9 arasına indi.
Çalışma başka zayıflıklar da gösterdi. Modeller laboratuvar değerlerini yorumlarken, özellikle düşük ve yüksek sonuçları tanımakta zorlandı. Talimatlara uymada her iki ila dört hastada bir hata yaptılar. Bilginin veriliş sırası değişince performans %18'e varan oranda oynadı.
Test edilen modeller bugünün en güçlü sistemleri değildi. Yine de soru bugün de geçerli: sınav puanı, gerçek vakada bilgi toplama becerisini öngörüyor mu?
Bean ve arkadaşlarının Şubat 2026'da Nature Medicine'de yayımlanan randomize çalışması soruyu başka bir açıdan ele aldı. Birleşik Krallık'tan 1.298 katılımcı, üç hekimin hazırladığı on klinik senaryo üzerinde çalıştı. Katılımcılar GPT-4o, Llama 3 veya Command R+ ile ya da kendi seçtikleri kaynaklarla karar verdi. Görev, olası durumu tanımak ve nereye başvurulacağını seçmekti.
Modeller senaryoları tek başına çözdüğünde ilgili durumu vakaların %94,9'unda tanıdı. Aynı modelleri kullanan katılımcılar ise ilgili durumu vakaların %34,5'inden azında tanıyabildi. Doğru başvuru yerini seçme oranı %44,2'nin altında kaldı ve kontrol grubundan iyi değildi. Yazarlar, standart kıyaslama testlerinin ve simüle hasta etkileşimlerinin bu başarısızlığı öngöremediğini bildirdi.
Sorun bilgide değil, etkileşimdeydi. Kullanıcılar modele hangi bilgiyi vermesi gerektiğini her zaman bilmedi. Modeller küçük soru farklarıyla tutarsız yanıtlar üretti ve kullanıcılar iyi öneriyi kötüsünden ayırmakta zorlandı. Yazarlar, halka açık sağlık kullanımından önce gerçek kullanıcılarla sistematik test yapılmasını öneriyor.
Şöyle bir durum düşünün. Bir firma, acil servisinize yapay zekâ destekli bir triyaj asistanı öneriyor. Sunumun ana slaytı, modelin tıp sınavı sorularında çok yüksek puan aldığını söylüyor. Bu rakam size ne anlatır?
Aslında çok az şey anlatır. Modelin sizin hastalarınızla ve aceleyle girilmiş eksik notlarla nasıl çalıştığını göstermez. Türkçe öyküde ya da eksik vital bulgularda ne yaptığını da göstermez. Hager çalışması, modelin bilgiyi kendisi toplarken zorlandığını gösterdi; triyaj tam olarak bu işi ister.
Aşağıdaki soruları satın alma toplantısına götürün.
Türkiye'de Tıbbi Cihaz Yönetmeliği, tanı, izlem, tahmin ve tedavi amaçlı yazılımları tıbbi cihaz tanımına dahil eder. Yönetmelik, yetkili kurum olarak Türkiye İlaç ve Tıbbi Cihaz Kurumu'nu (TİTCK) tanımlar. Bu yüzden klinik karar amacıyla sunulan bir yazılımın mevzuat durumunu sormak yerinde bir adımdır. Bu yazıdaki klinik çalışmalar İngilizce veriyle yapıldı; Türkçe klinik metindeki performansı ayrıca sorgulayın.
Hager çalışmasındaki modeller bugün eski sayılır ve yeni modeller daha iyi olabilir. Ancak Bean çalışması GPT-4o gibi güçlü bir modeli de içeriyordu ve yine insanla etkileşimde başarısızlık gördü. Asıl ders, modeli sınav puanıyla değil gerçek kullanım koşullarında değerlendirmektir.
Hayır, yüksek puan modelin geniş tıbbi bilgi taşıdığını gösterir. Ama bu, güvenli klinik kullanım için gereken koşullardan yalnızca biridir. Bilgi toplama, tutarlılık ve kullanıcıyla etkileşim ayrıca test edilmelidir.
Bean çalışmasında model kullanan katılımcılar kontrol grubundan daha doğru karar vermedi. Hastanıza bu araçların yanıtlarının tutarsız olabileceğini anlatın. Acil belirtilerde sohbet robotu yerine doğrudan sağlık kuruluşuna başvurmasını önerin.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: