Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
30 Saniyede Özet
Bir yapay zekâ modeli test verisinde neredeyse kusursuz görünüyorsa, önce veri sızıntısını düşünün. Veri sızıntısı (test verisine ait bilginin eğitim sürecine karışması), modeli gerçekte olduğundan başarılı gösterir. Kapoor ve Narayanan, bu hatanın 17 bilim alanında en az 294 makaleyi etkilediğini derledi. Beyin MR'ı üzerine bir çalışmada kesit düzeyinde bölme, doğruluğu 29 ile 55 puan arasında şişirdi.
Veri sızıntısı tam olarak nedir?
Bir modeli değerlendirmenin temel kuralı basittir. Model, test aşamasında daha önce hiç görmediği verilerle sınanmalıdır. Test seti (modelin performansını ölçmek için ayrılan, eğitimde kullanılmayan veri) bu yüzden ayrı tutulur.
Sızıntı bu ayrımı bozar. Model, test sorularının bir kısmını önceden görmüş bir öğrenci gibi davranır. Sonuç tabloda parlak görünür ama başka hastanede ya da yeni hastada tekrarlanmaz.
Kapoor ve Narayanan 2023'te bu sorunu sınıflandırdı. Sınıflamada üç ana grup yer alıyor: eğitim ve test verisinin temiz ayrılmaması, meşru olmayan değişkenler ve yanlış dağılımdan seçilmiş test seti. Yazarların iç savaş tahmini örneğinde, hatalar düzeltilince "üstün" karmaşık modeller lojistik regresyondan belirgin biçimde daha iyi çıkmadı.
Sızıntı en sık hangi yollarla oluşur?
İlk yol, aynı hastanın verisinin hem eğitim hem test setine düşmesidir. Bir hastanın onlarca MR kesiti ya da birden çok grafisi olabilir. Veriyi görüntü düzeyinde rastgele bölerseniz, aynı hastanın kesitleri iki tarafa dağılır. Model hastalığı değil, hastayı tanımayı öğrenebilir.
Yagis ve arkadaşları bunu beyin MR'ında sınadı; kesit düzeyinde bölme, test doğruluğunu OASIS'te 30, ADNI'de 29, PPMI'de 48 puan artırdı. Yerel bir Parkinson veri setinde bu fark 55 puana çıktı. Etiketler tamamen rastgele atandığında bile kesit düzeyinde bölmeyle yaklaşık %96 doğruluk elde edildi. Hasta düzeyinde bölmede ise beklendiği gibi %50 civarı sonuç çıktı.
İkinci yol, ön işlemenin bölmeden önce yapılmasıdır. Eksik veri tamamlama (imputasyon) veya normalizasyon tüm veriye birlikte uygulanırsa test bilgisi eğitime sızar. Özellik seçimi (modelde kullanılacak değişkenlerin seçilmesi) tüm veriyle yapılırsa aynı sorun doğar.
Üçüncü yol, zamansal sızıntıdır (geleceğe ait bilginin geçmişi tahmin eden modele karışması). Test seti, eğitim verisinden daha eski bir döneme aitse model geleceği önceden görmüş olur. Buna yakın bir hata meşru olmayan değişken kullanımıdır. Kapoor ve Narayanan, hipertansiyonu tahmin ederken antihipertansif ilaç kullanımını değişken almayı buna örnek veriyor.
Dördüncü yol, kopya verilerdir. Roberts ve arkadaşları COVID-19 görüntüleme modellerini inceledi. Başka setlerden derlenip yeni adla dağıtılan veri setlerinin örtüşebildiğini gösterdiler. Bir çalışma, eğitimde kullandığı veriyi zaten içeren bir setle "dış doğrulama" yaptığını sanmıştı.
Aynı görüntü iki farklı adla iki sete girerse model test sorusunu ezberlemiş olur.
Klinik bir senaryo: Fazla parlak bir pnömoni modeli
Şöyle varsayımsal bir durum düşünün. Bir firma, göğüs grafisinden pnömoniyi ayıran bir model sunuyor ve makalede AUC değeri 0,99 yazıyor. AUC (modelin hasta ile sağlamı ayırma gücünü özetleyen ölçü; 0,5 şans düzeyi, 1 kusursuz ayrım) bu düzeyde nadiren gerçekçidir.
Yöntem bölümünü açtığınızda, verinin "görüntülere göre rastgele" bölündüğünü görüyorsunuz. Yoğun bakım hastalarının günlük kontrol grafileri de veri setinde yer alıyor. Aynı hastanın ardışık grafileri büyük olasılıkla iki sete dağılmıştır.
Bu durumda model, hastanın tüplerini, kateterini veya vücut yapısını tanıyıp etiketi hatırlıyor olabilir. Sizin hastanenizde ilk kez çekilen bir grafide bu avantaj yoktur. Beklenen performans, makaledeki değerden belirgin biçimde düşük olabilir.
Makale okurken hangi soruları sormalısınız?
Aşağıdaki kontrol listesi, yöntem bölümünü birkaç dakikada taramanıza yardım eder.
- Veri hasta düzeyinde mi bölündü, yoksa görüntü veya kesit düzeyinde mi?
- Eksik veri tamamlama, normalizasyon ve özellik seçimi yalnızca eğitim verisiyle mi yapıldı?
- Modeldeki her değişken, gerçek klinik karar anında elde bulunan bir bilgi mi?
- Test seti zaman olarak eğitim setinden sonra mı toplandı?
- Birleştirilen veri setlerinde kopya veya örtüşen hasta taraması yapıldı mı?
- Model, farklı bir merkezin verisiyle dışsal olarak doğrulandı mı?
Bu sorulardan birine net yanıt yoksa, sonucu kesin değil geçici bir bulgu olarak okuyun. Kapoor ve Narayanan da tekrarlanabilirlik sorunları çözülene kadar bu alandaki sonuçlara temkinle yaklaşılmasını öneriyor.
Hangi işaretler "fazla iyi" sonucu ele verir?
Birkaç kırmızı bayrak sızıntı şüphesini artırır. Tek merkezli, küçük bir veri setinde neredeyse mükemmel başarı bunlardan biridir. Karmaşık bir modelin basit modelleri çok büyük farkla geçmesi de dikkat çekmelidir.
Dış doğrulamada performansın sert düşmesi başka bir uyarıdır. Yöntem sorunları da yaygındır. Roberts ve arkadaşları ayrıntılı incelediği 62 çalışmadaki modellerin hiçbirini, yöntemsel kusurlar ve/veya yanlılıklar nedeniyle klinik kullanıma aday bulmadı.
Kod ve veri bölme ayrıntılarının paylaşılmaması da değerlendirmeyi zorlaştırır.
Türkiye'deki hekim için ne anlama geliyor?
Kendi hastanenizin verisiyle bir model projesine katılıyorsanız, veri bölme kararına en baştan dahil olun. Hasta kimliğine göre bölme yapılmasını yazılı olarak talep edin.
6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli kişisel veri sayıyor. Kanun, anonim hâle getirilmiş verilerin araştırma ve istatistik amacıyla işlenmesini kapsam dışında tutuyor. Hasta düzeyinde bölme için her hastaya özgü bir takma kod gerekir. Takma kodlu verinin anonim sayılıp sayılmadığını kurumunuzun veri koruma birimiyle netleştirin.
Tıbbi cihaz niteliğindeki yazılımlar için Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) tıbbi cihaz mevzuatını uyguluyor. Türkiye'deki Tıbbi Cihaz Yönetmeliği, Avrupa Birliği'nin 2017/745 sayılı tüzüğüyle uyumlu hazırlandı.
Sık sorulan sorular
Veri sızıntısı yalnızca görüntüleme çalışmalarında mı görülür?
Hayır, tablo verisiyle kurulan risk modellerinde de sık görülür. Kapoor ve Narayanan'ın derlemesi tıp dışındaki pek çok alanı da kapsıyor. Ön işleme ve özellik seçimi hataları her veri türünde ortaya çıkabilir.
Yüksek AUC her zaman sızıntı anlamına mı gelir?
Hayır, bazı görevler gerçekten kolaydır ve yüksek başarı mümkündür. Ancak yüksek sonuç, yöntem ayrıntılarını daha dikkatli okumanız için bir nedendir. Dış doğrulamadaki performans, bu şüpheyi gidermenin en iyi yoludur.
Firma "verimiz ayrıldı" diyorsa yeterli mi?
Yeterli değildir, ayrımın hangi düzeyde yapıldığını sormalısınız. Hasta düzeyinde bölme ve zaman sırasına uygun test seti isteyin. Mümkünse modeli kendi hastanenizin verisiyle küçük bir pilot çalışmada sınayın.
Kaynaklar
- Kapoor S, Narayanan A (2023) — Leakage and the reproducibility crisis in machine-learning-based science, Patterns: https://doi.org/10.1016/j.patter.2023.100804
- Yagis E ve ark. (2021) — Effect of data leakage in brain MRI classification using 2D convolutional neural networks, Scientific Reports: https://doi.org/10.1038/s41598-021-01681-w
- Roberts M ve ark. (2021) — Common pitfalls and recommendations for using machine learning to detect and prognosticate for COVID-19 using chest radiographs and CT scans, Nature Machine Intelligence: https://doi.org/10.1038/s42256-021-00307-0
- T.C. Cumhurbaşkanlığı Mevzuat Bilgi Sistemi (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://mevzuat.gov.tr/MevzuatMetin/1.5.6698.pdf
- Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi Cihaz Mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
Tıbbi yapay zekâ makalelerinde şişkin başarının sık nedeni veri sızıntısıdır. Hasta düzeyinde bölme, ön işleme ve kopya görüntüler için kontrol listesi.
