30 Saniyede Özet
İki merkezli bir Çin çalışmasında GPT-5-Thinking, görüntü görmeden yalnızca MR raporlarının bulgular kısmını okuyarak orbita ve baş-boyun tümörlerinde tanı tahmini yaptı. Yan dal merkezinin 500 olgusunda ilk tahmin isabeti, uzman raporlarından anlamlı farklı değildi. Genel radyoloji merkezinde ise rutin raporlardan daha isabetliydi ve destek olarak verildiğinde genel radyologların doğruluğundaki artışla ilişkili bulundu. Sonuçlar gözlemsel; model, iyi yazılmış bir raporun üstüne kuruluyor.
Ne oldu?
Çalışma Eylül 2026'da Radiology dergisinde yayımlandı. Veriler iki hastaneden geldi: genel radyoloji pratiği yapılan Jilin Üniversitesi İkinci Hastanesi ve yan dal pratiği olan Pekin Tongren Hastanesi. Her merkezden 300 orbita ve 200 baş-boyun tümörü alındı. Hastaların yaş ortalaması 51, 520'si erkekti.
Araştırmacılar, OpenAI'ın GPT-5-Thinking modeline uygulama programlama arayüzü (API) üzerinden erişti. Modele özgün tetkik istemindeki klinik bilgi ve MR raporunun bulgular bölümü verildi. Raporların tanısal yorum kısımları elle çıkarıldı. Model, iyi–kötü huylu ayrımı ve ilk üç ayırıcı tanıyı üretti.
Birinci aşamada modelin ilk tahmini (top-1 doğruluk) rutin rapor tanılarıyla karşılaştırıldı. Makalenin özetine göre yan dal merkezinde orbitada model %76,7, uzmanlar %78,3 isabet gösterdi (P=0,64). Baş-boyunda bu oranlar %67,5 ve %68,0 idi (P=0,92). Fark istatistiksel olarak anlamlı değildi.
Genel radyoloji merkezinde tablo farklıydı. Orbitada model %74,0, rutin raporlar %68,7 isabet gösterdi (P=0,03). Baş-boyunda ise model %64,0, rutin raporlar yalnızca %27,0 doğru ilk tanı içeriyordu (P<0,001).
İkinci aşamada genel merkezden, 7–15 yıllık deneyimi olan yedi genel radyolog raporları iki kez yorumladı. Önce yardımsız, en az dört haftalık aradan sonra model desteğiyle okudular. Model desteği, orbitada doğruluğun %61,4'ten %70,3'e, baş-boyunda %47,0'dan %61,0'a çıkmasıyla ilişkiliydi (her ikisi P<0,001). Tam metne göre okuyucular arası uyum da arttı (Fleiss kappa 0,41'den 0,71'e).
Kanıt ne kadar güçlü?
Çalışmanın değeri, gerçek klinik raporları ve patoloji referansını kullanması. İki merkez ve iki farklı pratik türü, karşılaştırmayı anlamlı kılıyor. Okuyucu çalışması, modelin tek başına değil hekimle birlikte nasıl çalıştığını da gösteriyor.
Yine de dikkat edilmesi gereken noktalar var. Model görüntüye bakmadı; görüntüyü yorumlayan radyoloğun yazdığı bulguları okudu. Yani başarı, raporun ne kadar eksiksiz yazıldığına bağlı. Tam metne göre yan dal uzmanınca düzeltilmiş girdiyle, incelenen 78 hatalı model yanıtının 39'unda doğru tanıya ulaşıldı.
Modelin kendi isabeti de merkeze göre değişti. Orbitada yan dal raporlarıyla %76,7, genel raporlarla %74,0 isabet gösterdi. Bu fark, girdinin kalitesinin sonucu etkilediği yorumuyla uyumlu. İki merkezin hasta ve tümör karışımı da farklı olduğu için kesin bir neden söylemek zor.
Olgular ardışık değil, merkez başına önceden belirlenen sayıya ulaşılana kadar yeniden eskiye doğru toplandı. Yazarlar bunun seçim ve olgu karışımı yanlılığı doğurabileceğini kabul ediyor. İkinci aşamada model okuyucuların kendi yönlendirdiği, standart dışı bir biçimde kullanıldı. Yazarlar bulguları gözlemsel ve hipotez üretici olarak niteliyor.
Her iki kurumun etik kurulu çalışmayı onayladı ve geriye dönük tasarım nedeniyle aydınlatılmış onam şartını kaldırdı. Çalışma tek bir modeli ve tek bir sürümü test ediyor. Finansman Çin'deki kamu kaynaklarından geliyor; yazarların çıkar beyanları ek dosyada yer alıyor.
Hekim için ne anlama geliyor?
En somut çıkarım şu: Büyük dil modelleri, orbita gibi nadir tümörlerin yoğunlaştığı anatomik bölgelerde ayırıcı tanı listesini genişleten bir ikinci görüş olabilir. Bu, özellikle yan dal desteğine kolay ulaşamayan genel radyologlar için önemli. Ancak model tanı koymuyor, rapordaki tanımlamaları olası tanılara bağlıyor. Sonuç, yine patoloji ile doğrulanmalı.
Kullanmayı düşünen hekim için pratik bir kontrol listesi şöyle.
- Yalnız kurumunuzun onayladığı bir araç kullanın ve modele kimliksizleştirilmiş bulgu metni verin; ad, protokol ve tarih çıkarın.
- Önce bulguları eksiksiz tarif edin; çalışmada incelenen 78 hatalı yanıtın 39'u, uzmanın düzelttiği girdiyle doğruya döndü.
- Modelin önerisini ikinci görüş olarak kullanın, raporun kendi yorumunun yerine koymayın.
- Önerilen tanıyı görüntüyle tekrar karşılaştırın ve gerekirse yan dal konsültasyonu isteyin.
Türkiye'den bakınca
Hasta raporu, Kişisel Verilerin Korunması Kanunu'nun (KVKK) özel nitelikli saydığı sağlık verisini içerir. Kanunun dokuzuncu maddesi ise kişisel verilerin yurt dışına aktarılmasını ayrıca şartlara bağlıyor.
Sunucusu yurt dışında olan ticari bir sohbet aracına hasta raporu yapıştırmak, bu yüzden kişisel telefondan yapılacak bir iş değil. Rapor metni ad içermese bile nadir bir tümör, yaş ve tarihle birlikte kişiyi belirlenebilir kılabilir. Güvenli yol, kurumun hukuk birimiyle belirlediği ve kimlik bilgisini ayıklayan bir kullanım akışı.
Çalışmanın Türkiye'deki hastalar ya da Türkçe raporlarla test edilmediğini de hatırlatalım. Rapor dili, yazım alışkanlıkları ve tümör sıklıkları farklı olabilir. Bu nedenle benzer bir yerel doğrulama olmadan sonuçları doğrudan aktarmak doğru olmaz.
Sık sorulan sorular
Model görüntüleri mi yorumladı?
Hayır. Model yalnızca klinik bilgi ile MR raporunun bulgular kısmını okudu. Radyoloğun görüntüden çıkardığı tanımlar olmadan model bir sonuç üretemezdi.
Genel radyologların baş-boyunda %27 isabeti neden bu kadar düşük?
Bu oran, rutin raporlarda doğru ilk tanının yer alma sıklığını gösteriyor. Yan dal deneyimi gerektiren nadir tümörlerde genel raporlar çoğu zaman kesin bir ilk tanı vermiyor olabilir. Makalenin özeti bu farkın nedenini ayrıntılı açıklamıyor.
Bu sonuç başka dil modelleri için de geçerli mi?
Çalışma yalnızca GPT-5-Thinking'i test etti. Başka modellerin ya da aynı modelin farklı sürümlerinin benzer sonuç vereceği bilinmiyor. Her model ve sürüm için ayrı doğrulama gerekir.
Kaynaklar
- Li J, Xiao L, Qu X ve ark. (2026) — Bridging the Generalist-Subspecialist Gap with GPT-5-Thinking: Dual-Center Evaluation in Orbital and Head-and-Neck Tumor MRI Reports (Radiology): https://doi.org/10.1148/radiol.253579
- PubMed (2026) — Bridging the Generalist-Subspecialist Gap with GPT-5-Thinking, PMID 42742382: https://pubmed.ncbi.nlm.nih.gov/42742382/
- AuntMinnie (2026) — LLM on par with head-and-neck subspecialists in analyzing MRI reports: https://www.auntminnie.com/imaging-informatics/artificial-intelligence/news/15835088/llm-on-par-with-headandneck-subspecialists-in-analyzing-mri-reports
- T.C. Resmî Gazete / Mevzuat Bilgi Sistemi (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://www.mevzuat.gov.tr/mevzuatmetin/1.5.6698.pdf
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
1.000 hastalık Radiology çalışması: GPT-5-Thinking yalnız MR rapor metnini okuyarak orbita ve baş-boyun tümöründe yan dal uzmanlarına benzer isabet gösterdi.
