DoktorClub
Hakkımızda
Kurumsal
Fırsatlar
Haberler
Kongreler
Akademi
LongeviTurk
Yapay Zeka Haber
İletişim
Oturum açDOKGPT'yi dene
DoktorClub
Sağlık Bilgisi.
Hekim Güveni.

Hasta Rehberleri

  • Belirti Rehberleri
  • Kadın Sağlığı
  • Ruh Sağlığı
  • Longevity
  • Acil & İlk Yardım
  • Tüm Sağlık Haberleri

Platform

  • DOKGPT
  • TUS Soru Bankası
  • Hesaplayıcılar
  • Akademi
  • Dijital Tıp Fakültesi

Topluluk

  • Hekim Ağı
  • Vaka Tartışmaları
  • Haberler
  • Yapay Zeka Haber
  • AI Sağlık Bültenleri
  • AI Sağlık Takipçisi
  • Kongreler
  • Doktorclub Awards
  • Akademi
  • Canlı Yayınlar

Kaynaklar

  • Dergiler
  • TUS Blog
  • Fırsatlar
  • Sıralama
  • VIP

Kurumsal

  • Hakkımızda
  • Kurumsal Çözümler
  • İletişim
  • Gizlilik & KVKK

Üyelik

  • Hekim Kaydı
  • Öğrenci Kaydı
  • Akademisyen Kaydı
  • Oturum Aç
DoktorClub© 2026 DoktorClub. Tüm hakları saklıdır.
InstagramLinkedIn
Ana Sayfa›Sağlık Haberleri
24 Eylül 2026Yapay Zeka Haber

Tıp sınavını geçen yapay zekâ klinikte neden zorlanıyor?

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet Büyük dil modelleri (çok büyük metin verisiyle eğitilen, soru yanıtlayan yapay zekâ…

Haberi paylaş

İlgilenecek birine ulaştırın.

WhatsApp ile paylaş↗
XFacebookLinkedIn
← Sağlıkta yapay zekâ merkezine dön
DoktorClub Yayın Kurulu · Tıbbi Gözetim: Dr. Murat Toktamışoğlu
6 dk okuma
Hekim editör gözetiminde · AI-destekli
Tıp sınavını geçen yapay zekâ klinikte neden zorlanıyor?
DoktorClub Görüşü

Dil modelleri tıp sınavı sorularında yüksek puan alıyor. Gerçek hasta kayıtları ve insan kullanıcılarla yapılan çalışmalar daha temkinli bir tablo çiziyor.

Kaynak
Singhal K ve ark. (2023) — Large language models encode clinical knowledge, Nature:
Yazar: DoktorClub Yayın Kurulu · Tıbbi Gözetim: Dr. Murat Toktamışoğlu
Tıbbi Gözetim: Dr. Murat Toktamışoğlu
Son Tıbbi Gözetim: 24 Eylül 2026
Sonraki Planlı İnceleme: 24 Mart 2027
Kaynaklar:
  • Singhal K ve ark. (2023) — Large language models encode clinical knowledge, Nature: https://doi.org/10.1038/s41586-023-06291-2
  • Singhal K ve ark. (2025) — Toward expert-level medical question answering with large language models, Nature Medicine: https://doi.org/10.1038/s41591-024-03423-7
  • Jin D ve ark. (2021) — What Disease Does This Patient Have? A Large-Scale Open Domain Question Answering Dataset from Medical Exams, Applied Sciences: https://www.mdpi.com/2076-3417/11/14/6421
  • Hager P ve ark. (2024) — Evaluation and mitigation of the limitations of large language models in clinical decision-making, Nature Medicine: https://doi.org/10.1038/s41591-024-03097-1
  • Bean AM ve ark. (2026) — Reliability of LLMs as medical assistants for the general public: a randomized preregistered study, Nature Medicine: https://doi.org/10.1038/s41591-025-04074-y
  • University of Oxford (2026) — New study warns of risks in AI chatbots giving medical advice: https://www.ox.ac.uk/news/2026-02-10-new-study-warns-risks-ai-chatbots-giving-medical-advice
  • T.C. Resmî Gazete / Mevzuat Bilgi Sistemi (2021) — Tıbbi Cihaz Yönetmeliği: https://www.mevzuat.gov.tr/anasayfa/MevzuatFihristDetayIframe?MevzuatTur=7&MevzuatNo=38657&MevzuatTertip=5
Çıkar Çatışması / Sponsorluk: Bu makale herhangi bir ticari sponsorluk içermez ve DoktorClub editöryel ekibi tarafından bağımsız olarak hazırlanmıştır. Yazarın ve tıbbi inceleyicinin makale konusuyla bilinen bir finansal çıkar çatışması bulunmamaktadır. Editöryel bağımsızlık prensiplerimiz için yayın politikamızı inceleyebilirsiniz.

Tıbbi Uyarı: Bu içerik yalnızca bilgilendirme amaçlıdır ve doktor tavsiyesi yerine geçmez. Sağlık durumunuzla ilgili kararlar için her zaman hekiminize danışın. Bu içerik hekim editör kurulu gözetiminde yapay zeka destekli olarak hazırlanmıştır; DoktorClub içerikleri Tıbbi Direktör ve uzman hekim editör kurulu gözetimindedir. Daha fazla bilgi için tıbbi inceleme politikamızı inceleyebilirsiniz.

Bu sayfa nasıl kaynak gösterilir?
DoktorClub Tıbbi Editör Kurulu. "Tıp sınavını geçen yapay zekâ klinikte neden zorlanıyor?". DoktorClub Medikal İçerik Merkezi. Hekim editör kurulu gözetiminde yapay zeka destekli hazırlanmıştır. Tıbbi gözetim: Dr. Murat Toktamışoğlu. Son güncelleme: 24 Eylül 2026. URL: https://doktorclub.com/haberler/tip-sinavini-gecen-model-klinikte-neden-zorlanir
Bu rehber yardımcı oldu mu?
Paylaş🩺Hekim Bul
🩺
Bu konuyu bir hekime danışın
DoktorClub hekim ağında uzmanlık alanına ve şehre göre hekim profillerini inceleyin.
Hekim Bul →
DoktorClub’da Keşfet
🎓Akademi🔬Vaka Tartışmaları🧮Tıbbi Hesaplayıcılar🤖DOKGPT
← Tüm Haberlere Dön

Okumaya devam edin

Düşük doz BT'de derin öğrenme rekonstrüksiyonu neyi değiştirir?
Yapay Zeka Haber

Düşük doz BT'de derin öğrenme rekonstrüksiyonu neyi değiştirir?

24 Eylül 2026
Maliyeti hastalık sanan algoritma: etiket yanlılığı nedir?
Yapay Zeka Haber

Maliyeti hastalık sanan algoritma: etiket yanlılığı nedir?

24 Eylül 2026
Makale yazarken yapay zekâ: ICMJE ve COPE kuralları ne diyor?
Yapay Zeka Haber

Makale yazarken yapay zekâ: ICMJE ve COPE kuralları ne diyor?

24 Eylül 2026

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

30 Saniyede Özet

Büyük dil modelleri (çok büyük metin verisiyle eğitilen, soru yanıtlayan yapay zekâ sistemleri) tıp lisans sınavı tarzı sorularda yüksek puan alıyor. Gerçek hasta kayıtlarıyla kurulan bir değerlendirmede ise bu tür modeller hekimlerden belirgin biçimde düşük tanı doğruluğu gösterdi. Randomize bir çalışmada, modelin tek başına iyi çözdüğü senaryolarda onu kullanan sıradan kişiler kontrol grubundan daha başarılı olmadı. Kısacası sınav puanı bilgiyi ölçer; klinik yetkinlik ise bilgi toplamayı, önceliklendirmeyi ve iletişimi de ister.

Sınav sorusu neyi ölçer, neyi ölçmez?

MedQA, ABD, Çin anakarası ve Tayvan'daki hekimlik lisans sınavlarından derlenen çoktan seçmeli bir soru setidir. ABD bölümünde 12.723 soru bulunur ve her soru dört seçeneklidir. Yapay zekâ dünyasında bu tür setlere "benchmark" (sabit soru kümesiyle yapılan kıyaslama testi) denir. Modelin puanı, bu kümede doğru seçeneği bulma oranıdır.

Google ekibinin 2023'te Nature'da yayımladığı çalışmada Flan-PaLM modeli MedQA'da %67,6 doğruluğa ulaştı. Aynı ekibin Med-PaLM 2 modeli, 2025'te Nature Medicine'de yayımlanan makalede %86,5'e çıktı. Yazarlar ilk makalede, geliştirdikleri Med-PaLM modelinin hâlâ klinisyenlerin gerisinde kaldığını açıkça yazdı. İkinci makalede de gerçek iş akışında doğrulamayı gelecekte yapılması gereken önemli bir iş olarak tanımladılar.

Sınav sorusunda vaka size hazır gelir. Öykü, bulgu ve laboratuvar tek paragrafta, düzenli bir sırayla durur. Seçenekler de önünüzdedir. Klinikte ise hangi bilgiyi isteyeceğinize siz karar verirsiniz ve seçenek listesi yoktur.

Gerçek hasta kayıtlarıyla test edilince ne oldu?

Hager ve arkadaşları 2024'te Nature Medicine'de tam bu boşluğu ölçen bir çalışma yayımladı. Ekip, MIMIC-IV veri tabanındaki gerçek kayıtlardan 2.400 hastalık bir test seti kurdu. Vakalar dört karın patolojisini kapsıyordu: apandisit, kolesistit, divertikülit ve pankreatit. Çalışma retrospektif (geçmiş kayıtlar üzerinden yapılan) bir değerlendirmeydi.

Tüm bilgiler modele hazır verildiğinde bile fark büyüktü. Çalışmadaki hekimler, test edilen alt kümede ortalama %87,5 ile %92,5 doğru tanı koydu. Test edilen açık kaynak modeller ise %58,8 ile %67,8 arasında kaldı. Model bilgiyi kendisi toplamak zorunda kaldığında doğruluk %45,5 ile %54,9 arasına indi.

Çalışma başka zayıflıklar da gösterdi. Modeller laboratuvar değerlerini yorumlarken, özellikle düşük ve yüksek sonuçları tanımakta zorlandı. Talimatlara uymada her iki ila dört hastada bir hata yaptılar. Bilginin veriliş sırası değişince performans %18'e varan oranda oynadı.

Test edilen modeller bugünün en güçlü sistemleri değildi. Yine de soru bugün de geçerli: sınav puanı, gerçek vakada bilgi toplama becerisini öngörüyor mu?

Model doğru bildiğinde bile insan neden yanlış sonuca varıyor?

Bean ve arkadaşlarının Şubat 2026'da Nature Medicine'de yayımlanan randomize çalışması soruyu başka bir açıdan ele aldı. Birleşik Krallık'tan 1.298 katılımcı, üç hekimin hazırladığı on klinik senaryo üzerinde çalıştı. Katılımcılar GPT-4o, Llama 3 veya Command R+ ile ya da kendi seçtikleri kaynaklarla karar verdi. Görev, olası durumu tanımak ve nereye başvurulacağını seçmekti.

Modeller senaryoları tek başına çözdüğünde ilgili durumu vakaların %94,9'unda tanıdı. Aynı modelleri kullanan katılımcılar ise ilgili durumu vakaların %34,5'inden azında tanıyabildi. Doğru başvuru yerini seçme oranı %44,2'nin altında kaldı ve kontrol grubundan iyi değildi. Yazarlar, standart kıyaslama testlerinin ve simüle hasta etkileşimlerinin bu başarısızlığı öngöremediğini bildirdi.

Sorun bilgide değil, etkileşimdeydi. Kullanıcılar modele hangi bilgiyi vermesi gerektiğini her zaman bilmedi. Modeller küçük soru farklarıyla tutarsız yanıtlar üretti ve kullanıcılar iyi öneriyi kötüsünden ayırmakta zorlandı. Yazarlar, halka açık sağlık kullanımından önce gerçek kullanıcılarla sistematik test yapılmasını öneriyor.

Klinik senaryo: triyaj asistanı teklifi geldiğinde

Şöyle bir durum düşünün. Bir firma, acil servisinize yapay zekâ destekli bir triyaj asistanı öneriyor. Sunumun ana slaytı, modelin tıp sınavı sorularında çok yüksek puan aldığını söylüyor. Bu rakam size ne anlatır?

Aslında çok az şey anlatır. Modelin sizin hastalarınızla ve aceleyle girilmiş eksik notlarla nasıl çalıştığını göstermez. Türkçe öyküde ya da eksik vital bulgularda ne yaptığını da göstermez. Hager çalışması, modelin bilgiyi kendisi toplarken zorlandığını gösterdi; triyaj tam olarak bu işi ister.

Firma "benchmark" rakamı sunduğunda ne sormalı?

Aşağıdaki soruları satın alma toplantısına götürün.

  • Hangi test seti kullanıldı ve bu set sınav sorularından mı, gerçek hasta kayıtlarından mı oluşuyor?
  • Model, bilgiyi kendisi toplamak zorunda kaldığında nasıl sonuç verdi?
  • Gerçek kullanıcılarla randomize ya da prospektif (ileriye dönük) bir çalışma yapıldı mı?
  • Bilginin sırası veya soru ifadesi değişince sonuç ne kadar oynuyor?
  • Türkçe ve sizin hasta profilinize benzer verilerle yerel doğrulama yapıldı mı?
  • Model yanıldığında hatayı kim fark edecek ve nasıl raporlanacak?

Türkiye'deki hekim için ne anlama geliyor?

Türkiye'de Tıbbi Cihaz Yönetmeliği, tanı, izlem, tahmin ve tedavi amaçlı yazılımları tıbbi cihaz tanımına dahil eder. Yönetmelik, yetkili kurum olarak Türkiye İlaç ve Tıbbi Cihaz Kurumu'nu (TİTCK) tanımlar. Bu yüzden klinik karar amacıyla sunulan bir yazılımın mevzuat durumunu sormak yerinde bir adımdır. Bu yazıdaki klinik çalışmalar İngilizce veriyle yapıldı; Türkçe klinik metindeki performansı ayrıca sorgulayın.

Sık sorulan sorular

Yeni modeller bu sorunları çözmedi mi?

Hager çalışmasındaki modeller bugün eski sayılır ve yeni modeller daha iyi olabilir. Ancak Bean çalışması GPT-4o gibi güçlü bir modeli de içeriyordu ve yine insanla etkileşimde başarısızlık gördü. Asıl ders, modeli sınav puanıyla değil gerçek kullanım koşullarında değerlendirmektir.

Sınav puanı tamamen anlamsız mı?

Hayır, yüksek puan modelin geniş tıbbi bilgi taşıdığını gösterir. Ama bu, güvenli klinik kullanım için gereken koşullardan yalnızca biridir. Bilgi toplama, tutarlılık ve kullanıcıyla etkileşim ayrıca test edilmelidir.

Hastalarım sorularını sohbet robotlarına soruyor; ne söylemeliyim?

Bean çalışmasında model kullanan katılımcılar kontrol grubundan daha doğru karar vermedi. Hastanıza bu araçların yanıtlarının tutarsız olabileceğini anlatın. Acil belirtilerde sohbet robotu yerine doğrudan sağlık kuruluşuna başvurmasını önerin.

Kaynaklar

  • Singhal K ve ark. (2023) — Large language models encode clinical knowledge, Nature: https://doi.org/10.1038/s41586-023-06291-2
  • Singhal K ve ark. (2025) — Toward expert-level medical question answering with large language models, Nature Medicine: https://doi.org/10.1038/s41591-024-03423-7
  • Jin D ve ark. (2021) — What Disease Does This Patient Have? A Large-Scale Open Domain Question Answering Dataset from Medical Exams, Applied Sciences: https://www.mdpi.com/2076-3417/11/14/6421
  • Hager P ve ark. (2024) — Evaluation and mitigation of the limitations of large language models in clinical decision-making, Nature Medicine: https://doi.org/10.1038/s41591-024-03097-1
  • Bean AM ve ark. (2026) — Reliability of LLMs as medical assistants for the general public: a randomized preregistered study, Nature Medicine: https://doi.org/10.1038/s41591-025-04074-y
  • University of Oxford (2026) — New study warns of risks in AI chatbots giving medical advice: https://www.ox.ac.uk/news/2026-02-10-new-study-warns-risks-ai-chatbots-giving-medical-advice
  • T.C. Resmî Gazete / Mevzuat Bilgi Sistemi (2021) — Tıbbi Cihaz Yönetmeliği: https://www.mevzuat.gov.tr/anasayfa/MevzuatFihristDetayIframe?MevzuatTur=7&MevzuatNo=38657&MevzuatTertip=5

Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.


İlgili Yazılar

Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:

  • Hastaya yapay zekâ kullandığınızı söylemeli misiniz?
  • Makale yazarken yapay zekâ: ICMJE ve COPE kuralları ne diyor?
  • Maliyeti hastalık sanan algoritma: etiket yanlılığı nedir?