1.000 hastalık Radiology çalışması: GPT-5-Thinking yalnız MR rapor metnini okuyarak orbita ve baş-boyun tümöründe yan dal uzmanlarına benzer isabet gösterdi.
İki merkezli bir Çin çalışmasında GPT-5-Thinking, görüntü görmeden yalnızca MR raporlarının bulgular kısmını okuyarak orbita ve baş-boyun tümörlerinde tanı tahmini yaptı. Yan dal merkezinin 500 olgusunda ilk tahmin…
Haberi paylaş
İlgilenecek birine ulaştırın.

1.000 hastalık Radiology çalışması: GPT-5-Thinking yalnız MR rapor metnini okuyarak orbita ve baş-boyun tümöründe yan dal uzmanlarına benzer isabet gösterdi.
İki merkezli bir Çin çalışmasında GPT-5-Thinking, görüntü görmeden yalnızca MR raporlarının bulgular kısmını okuyarak orbita ve baş-boyun tümörlerinde tanı tahmini yaptı. Yan dal merkezinin 500 olgusunda ilk tahmin isabeti, uzman raporlarından anlamlı farklı değildi. Genel radyoloji merkezinde ise rutin raporlardan daha isabetliydi ve destek olarak verildiğinde genel radyologların doğruluğundaki artışla ilişkili bulundu. Sonuçlar gözlemsel; model, iyi yazılmış bir raporun üstüne kuruluyor.
Çalışma Eylül 2026'da Radiology dergisinde yayımlandı. Veriler iki hastaneden geldi: genel radyoloji pratiği yapılan Jilin Üniversitesi İkinci Hastanesi ve yan dal pratiği olan Pekin Tongren Hastanesi. Her merkezden 300 orbita ve 200 baş-boyun tümörü alındı. Hastaların yaş ortalaması 51, 520'si erkekti.
Araştırmacılar, OpenAI'ın GPT-5-Thinking modeline uygulama programlama arayüzü (API) üzerinden erişti. Modele özgün tetkik istemindeki klinik bilgi ve MR raporunun bulgular bölümü verildi. Raporların tanısal yorum kısımları elle çıkarıldı. Model, iyi–kötü huylu ayrımı ve ilk üç ayırıcı tanıyı üretti.
Birinci aşamada modelin ilk tahmini (top-1 doğruluk) rutin rapor tanılarıyla karşılaştırıldı. Makalenin özetine göre yan dal merkezinde orbitada model %76,7, uzmanlar %78,3 isabet gösterdi (P=0,64). Baş-boyunda bu oranlar %67,5 ve %68,0 idi (P=0,92). Fark istatistiksel olarak anlamlı değildi.
Genel radyoloji merkezinde tablo farklıydı. Orbitada model %74,0, rutin raporlar %68,7 isabet gösterdi (P=0,03). Baş-boyunda ise model %64,0, rutin raporlar yalnızca %27,0 doğru ilk tanı içeriyordu (P<0,001).
İkinci aşamada genel merkezden, 7–15 yıllık deneyimi olan yedi genel radyolog raporları iki kez yorumladı. Önce yardımsız, en az dört haftalık aradan sonra model desteğiyle okudular. Model desteği, orbitada doğruluğun %61,4'ten %70,3'e, baş-boyunda %47,0'dan %61,0'a çıkmasıyla ilişkiliydi (her ikisi P<0,001). Tam metne göre okuyucular arası uyum da arttı (Fleiss kappa 0,41'den 0,71'e).
Çalışmanın değeri, gerçek klinik raporları ve patoloji referansını kullanması. İki merkez ve iki farklı pratik türü, karşılaştırmayı anlamlı kılıyor. Okuyucu çalışması, modelin tek başına değil hekimle birlikte nasıl çalıştığını da gösteriyor.
Yine de dikkat edilmesi gereken noktalar var. Model görüntüye bakmadı; görüntüyü yorumlayan radyoloğun yazdığı bulguları okudu. Yani başarı, raporun ne kadar eksiksiz yazıldığına bağlı. Tam metne göre yan dal uzmanınca düzeltilmiş girdiyle, incelenen 78 hatalı model yanıtının 39'unda doğru tanıya ulaşıldı.
Modelin kendi isabeti de merkeze göre değişti. Orbitada yan dal raporlarıyla %76,7, genel raporlarla %74,0 isabet gösterdi. Bu fark, girdinin kalitesinin sonucu etkilediği yorumuyla uyumlu. İki merkezin hasta ve tümör karışımı da farklı olduğu için kesin bir neden söylemek zor.
Olgular ardışık değil, merkez başına önceden belirlenen sayıya ulaşılana kadar yeniden eskiye doğru toplandı. Yazarlar bunun seçim ve olgu karışımı yanlılığı doğurabileceğini kabul ediyor. İkinci aşamada model okuyucuların kendi yönlendirdiği, standart dışı bir biçimde kullanıldı. Yazarlar bulguları gözlemsel ve hipotez üretici olarak niteliyor.
Her iki kurumun etik kurulu çalışmayı onayladı ve geriye dönük tasarım nedeniyle aydınlatılmış onam şartını kaldırdı. Çalışma tek bir modeli ve tek bir sürümü test ediyor. Finansman Çin'deki kamu kaynaklarından geliyor; yazarların çıkar beyanları ek dosyada yer alıyor.
En somut çıkarım şu: Büyük dil modelleri, orbita gibi nadir tümörlerin yoğunlaştığı anatomik bölgelerde ayırıcı tanı listesini genişleten bir ikinci görüş olabilir. Bu, özellikle yan dal desteğine kolay ulaşamayan genel radyologlar için önemli. Ancak model tanı koymuyor, rapordaki tanımlamaları olası tanılara bağlıyor. Sonuç, yine patoloji ile doğrulanmalı.
Kullanmayı düşünen hekim için pratik bir kontrol listesi şöyle.
Hasta raporu, Kişisel Verilerin Korunması Kanunu'nun (KVKK) özel nitelikli saydığı sağlık verisini içerir. Kanunun dokuzuncu maddesi ise kişisel verilerin yurt dışına aktarılmasını ayrıca şartlara bağlıyor.
Sunucusu yurt dışında olan ticari bir sohbet aracına hasta raporu yapıştırmak, bu yüzden kişisel telefondan yapılacak bir iş değil. Rapor metni ad içermese bile nadir bir tümör, yaş ve tarihle birlikte kişiyi belirlenebilir kılabilir. Güvenli yol, kurumun hukuk birimiyle belirlediği ve kimlik bilgisini ayıklayan bir kullanım akışı.
Çalışmanın Türkiye'deki hastalar ya da Türkçe raporlarla test edilmediğini de hatırlatalım. Rapor dili, yazım alışkanlıkları ve tümör sıklıkları farklı olabilir. Bu nedenle benzer bir yerel doğrulama olmadan sonuçları doğrudan aktarmak doğru olmaz.
Hayır. Model yalnızca klinik bilgi ile MR raporunun bulgular kısmını okudu. Radyoloğun görüntüden çıkardığı tanımlar olmadan model bir sonuç üretemezdi.
Bu oran, rutin raporlarda doğru ilk tanının yer alma sıklığını gösteriyor. Yan dal deneyimi gerektiren nadir tümörlerde genel raporlar çoğu zaman kesin bir ilk tanı vermiyor olabilir. Makalenin özeti bu farkın nedenini ayrıntılı açıklamıyor.
Çalışma yalnızca GPT-5-Thinking'i test etti. Başka modellerin ya da aynı modelin farklı sürümlerinin benzer sonuç vereceği bilinmiyor. Her model ve sürüm için ayrı doğrulama gerekir.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: