30 Saniyede Özet
Nature Medicine'de 13 Eylül 2026'da yayımlanan I3LUNG çalışması, ileri evre küçük hücreli dışı akciğer kanserine odaklandı. Araştırmacılar, immünoterapi (bağışıklık tedavisi) sonucunu tahmin eden bir yapay zeka aracını sınadı. Altı ülkeden altı merkez ve 2.396 hasta verisi kullanıldı. Kullanılabilirlik testinde 20 hekim, 10'ar vakayı önce yalnız, sonra yapay zeka açıklamalarıyla değerlendirdi. Hastalık kontrolünü doğru öngörme duyarlılığı yüzde 72'den yüzde 87'ye çıktı. Genel isabet yüzde 57'den yüzde 65'e yükseldi. Ancak araç, hastanın gidişini iyileştirdiğini henüz kanıtlamadı ve rutin kullanıma hazır değil.
Araştırma nasıl kurgulandı?
Çalışma iki katmandan oluşuyor. İlk katmanda araştırmacılar, klinik bilgiler ve rutin kan testlerinden öğrenen bir model geliştirdi. Model, tedavinin hastalığı kontrol altında tutup tutamayacağını tahmin etmeye çalıştı.
İmmünoterapi, bağışıklık sistemini tümöre karşı harekete geçiren bir tedavi. İleri evre akciğer kanserinde standart seçeneklerden biri. Ancak her hasta aynı ölçüde fayda görmüyor. Kimin yanıt vereceğini önceden bilmek, gereksiz yan etkiyi ve zaman kaybını azaltabilir. Çalışmanın çıkış noktası bu ihtiyaç.
İkinci katman insan faktörünü ölçtü. 10'u akciğer kanseri uzmanı, 10'u uzman olmayan 20 hekim seçildi. Her hekim 10 vakayı değerlendirdi; toplam 200 değerlendirme yapıldı. Her vaka önce yardım almadan, sonra modelin gerekçeli önerisiyle yeniden ele alındı.
"Açıklanabilir" sözü buradaki kilit kavram. Klasik modeller çoğu zaman kara kutu gibi çalışır; sonucu söyler ama nedenini göstermez. Bu model ise hangi verinin tahmini hangi yöne çektiğini sıralıyor. Böylece hekim, öneriyi kendi klinik aklıyla karşılaştırabiliyor.
Modelin kendi başarısı ne düzeyde?
Modelin ayırt etme gücü AUC ile ölçüldü. AUC, 0,5'te yazı-tura düzeyini, 1,0'da kusursuz ayrımı gösterir. Model iç testlerde 0,77'ye kadar çıktı. Dış merkezlerde doğrulandığında ise 0,55 ile 0,72 arasına indi.
Bu düşüş önemli. Bir merkezin verisinde iyi çalışan model, başka bir hastanede aynı başarıyı göstermeyebilir. Hasta profili, laboratuvar yöntemleri ve tedavi alışkanlıkları merkezden merkeze değişir.
Hekimlerin kararı nasıl değişti?
Yapay zeka açıklamaları eklendiğinde üç ölçüt hareket etti:
- Duyarlılık (hastalık kontrolünü doğru yakalama): yüzde 72'den yüzde 87'ye çıktı.
- Genel isabet: yüzde 57'den yüzde 65'e yükseldi.
- Özgüllük (fayda görmeyecek hastayı doğru tanıma): hafifçe düştü.
Yani hekimler tedaviden fayda görecek hastayı daha sık yakaladı. Buna karşılık fayda görmeyecek bazı hastaları da "fayda görür" diye işaretledi. Bu dengenin klinikte ne anlama geldiği henüz belli değil.
Otomasyon yanlılığı neden önemli?
Çalışmanın en dikkat çekici bulgusu bu. Bazı hekimler, model yanlış öneri sunduğunda kendi doğru kararını değiştirdi. Buna otomasyon yanlılığı (makineye aşırı güven) deniyor.
Açıklama eklemek bu sorunu tümüyle çözmedi. Gerekçeli bir yanlış, gerekçesiz bir yanlıştan daha ikna edici olabilir. Bu yüzden araştırmacılar, ileriye dönük çalışmalara insan faktörü ölçütlerinin eklenmesini önerdi.
Bu sorun akciğer kanserine özgü değil. Radyolojiden dermatolojiye kadar birçok alanda benzer gözlemler var. Araç ne kadar güvenilir görünürse, hekimin kendi şüphesini bastırma eğilimi o kadar artıyor.
Bu sizin için ne anlama geliyor?
Akciğer kanseri tedavisi görüyorsanız, hekiminizin kararı bugün de klinik deneyime ve mevcut biyobelirteçlere dayanır. Bu araç henüz hiçbir kılavuzda yer almıyor. Geriye dönük bir çalışma; 2.000'den fazla hastayla ileriye dönük doğrulama henüz tamamlanmadı. Hekiminize "bu karar hangi verilere dayanıyor" diye sormaktan çekinmeyin. Bu soru, yapay zeka olsun ya da olmasın, iyi bir kararın temeli.
Hekimler için mesaj daha somut. Bir yapay zeka önerisini "ikinci görüş" gibi ele alın, son söz olarak değil. Öneriyle aynı fikirde olmadığınızda gerekçenizi kaydedin. Dünya Sağlık Örgütü'nün sağlıkta yapay zeka etik rehberi de insan denetimini merkeze koyuyor.
Çalışmanın sınırları neler?
Sonuçlar hekim tahminini ölçtü, hasta sonucunu değil. Daha doğru tahmin, daha uzun yaşam demek değil. Kullanılabilirlik testi 20 hekimle yapıldı; bu küçük bir örneklem. Vakalar gerçek zamanlı değil, dosya üzerinden değerlendirildi.
Dış doğrulamadaki performans düşüşü de modelin genellenebilirliğini sorgulatıyor. Türkiye'deki hasta profili ve laboratuvar standartları, çalışmadaki altı merkezden farklı olabilir. Bu tür bir aracın burada işe yarayıp yaramayacağı ayrı bir çalışma konusu.
Kaynaklar
- Nature Medicine — Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC: https://doi.org/10.1038/s41591-026-04488-2
- Nature Medicine — Dergi ana sayfası: https://www.nature.com/nm/
- ClinicalTrials.gov — NCT05537922 kayıt sayfası: https://clinicaltrials.gov/study/NCT05537922
- World Health Organization — Ethics and governance of artificial intelligence for health: https://www.who.int/publications/i/item/9789240029200
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Nature Medicine'de yayımlanan 2.396 hastalık I3LUNG çalışmasında yapay zeka açıklamaları hekimlerin hastalık kontrolünü öngörme duyarlılığını yüzde 72'den 87'ye çıkardı.