Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
30 Saniyede Özet
Bir yapay zekâ çalışmasındaki duyarlılık ve özgüllük, modelin neyle karşılaştırıldığına bağlıdır. Bu karşılaştırma ölçütüne referans standart (tanının doğru kabul edildiği ölçüt, sıklıkla "altın standart" olarak da anılır) denir. Tek okuyucunun etiketi, uzman konsensüsü, patoloji ya da klinik izlem birbirinden çok farklı sonuçlar üretebilir. Bu yazı, referans standardı sorgulamanız için hangi sorulara bakacağınızı özetliyor.
Referans standart neden bu kadar önemli?
Bir tanı testi, ancak doğru bilinen bir cevaba göre değerlendirilebilir. Yapay zekâ modelleri de aynı kurala tabidir. Model, etiketleri yanlış olan bir veriyle sınanırsa ölçülen başarı da yanlış olur.
Tanı doğruluğu çalışmalarının raporlama rehberi STARD 2015, 30 maddelik bir kontrol listesi sunuyor. Rehber, referans standardın farklı tanımlanmasının duyarlılık ve özgüllük tahminlerini değiştirebileceğini vurguluyor. Bu yüzden referans standardın ayrıntılı tanımını ve alternatifler varsa seçilme gerekçesini istiyor. Katılımcı akışını gösteren bir diyagram da her raporda bekleniyor.
Etiketler nereden geliyor?
Büyük görüntü veri setlerinde etiketler çoğu zaman radyoloji raporlarından otomatik çıkarılır. Bu yöntem hızlıdır ama rapordaki belirsizlik ve atlamalar etikete taşınır. Sonuçta model "gerçek tanıyı" değil, "rapordaki ifadeyi" öğrenir.
Oakden-Rayner, yaygın kullanılan ChestX-ray14 veri setinden seçtiği görüntü örneklerini gözle inceledi. Pozitif prediktif değerin (pozitif etiketlilerin gerçekten pozitif olma oranı) belgelerde bildirilenden çoğunlukla %10 ile %30 daha düşük olduğunu buldu. İncelenen pnömotoraks pozitiflerinin yaklaşık %80'inde göğüs tüpü vardı. Yazar, veri seti hazırlayanlara görsel kalite kontrolü ve etiketleme sürecinin ayrıntılı belgelenmesini öneriyor.
Uzmanlar da birbirine katılmıyorsa ne olur?
Okuyucular arası değişkenlik (aynı görüntüye farklı hekimlerin farklı yorum getirmesi), referans standardı doğrudan etkiler. Tek bir radyoloğun okuması bir model için "doğru cevap" kabul edilirse, o radyoloğun hataları da doğru sayılır.
Majkowska ve arkadaşları göğüs grafilerinde dört bulgu için bu sorunu ele aldı. Üç radyolog görüntüleri bağımsız okudu, ardından anlaşmazlıkları tartışarak çözdü. İlk okumadan sonra uzlaşma görüntülerin %41,8'inde sağlanmıştı. Tartışma sürecinden sonra bu oran %96,8'e yükseldi.
Bu bulgu şunu gösteriyor: tek okuyucuya dayalı bir referans standart ciddi gürültü taşıyabilir. Konsensüs veya uzlaştırma (adjudikasyon, anlaşmazlıkların yapılandırılmış tartışmayla çözülmesi) daha güvenilir bir karşılaştırma sağlar.
Doğrulama yanlılığı nasıl ortaya çıkar?
Her hastaya aynı referans test uygulanmadığında doğrulama yanlılığı (yalnızca bazı hastaların kesin tanı testine gönderilmesinden doğan sapma) ortaya çıkar. Örneğin yalnızca şüpheli lezyonlara biyopsi yapılır, diğerleri izlemle takip edilir. Biyopsi yapılmayan grupta gözden kaçan kanserler hiç kayda geçmeyebilir.
QUADAS-2, tanı doğruluğu çalışmalarında yanlılık riskini değerlendiren bir araçtır. Aracın "akış ve zamanlama" alanı tam da bunu sorar. Tüm hastalara referans standart uygulandı mı, hepsi aynı standardı mı aldı, hepsi analize dahil edildi mi? Referans standardın indeks testin sonucu bilinmeden yorumlanıp yorumlanmadığı da ayrı bir sorudur.
Kusursuz bir referans standart yoksa ne yapılır?
Pek çok klinik durumda kusursuz bir referans yoktur. Reitsma ve arkadaşları bu soruna önerilen çözümleri dört grupta topladı. Eksik referans verisini tamamlama, kusurlu standarttan kaynaklanan hatayı düzeltme ve birden fazla bilgiyi birleştiren bir referans oluşturma ilk üç gruptur.
Dördüncü yol, klasik doğruluk yaklaşımını bırakıp klinik geçerliliğe bakmaktır. Burada test sonucu, hastanın sonraki klinik olayları veya tedavi yanıtı gibi anlamlı sonuçlarla ilişkilendirilir. Yapay zekâ çalışmalarında da "model neyi öngörüyor ve bu hastaya ne kazandırıyor?" sorusu bu yüzden değerlidir.
Klinik bir senaryo: Nodül modeli "radyolog kadar iyi"
Şöyle varsayımsal bir durum düşünün. Bir akciğer nodülü modeli, göğüs grafisinde "radyolog düzeyinde" başarı iddia ediyor. Makaleye baktığınızda referans standardın tek bir radyoloğun raporu olduğunu görüyorsunuz.
Bu durumda model, o radyoloğun görmediği nodülleri de "yanlış pozitif" sayılmış olabilir. Tersine, radyoloğun yanıldığı yerlerde modelin aynı hatayı yapması "doğru" kabul edilir. BT ile doğrulanmış ya da uzman panelince uzlaştırılmış bir referans, bambaşka bir tablo gösterebilir.
Referans standardı sorgulamak için kontrol listesi
Makaleyi ya da firma sunumunu okurken şu soruları sorun:
- Referans standart ne: tek okuyucu mu, konsensüs mü, patoloji mi, klinik izlem mi?
- Etiketler rapordan otomatik mi çıkarıldı, yoksa görüntüler hekimlerce yeniden mi okundu?
- Okuyucular arası uyum bildirildi mi ve anlaşmazlıklar nasıl çözüldü?
- Tüm hastalara aynı referans test uygulandı mı?
- Referans standardı belirleyenler modelin çıktısını bilmeden mi karar verdi?
- Katılımcı akış diyagramı var mı ve dışlanan hasta sayısı açık mı?
Türkiye'deki hekim için ne anlama geliyor?
Türkiye'de tıbbi cihaz yazılımları Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) mevzuatına tabidir. TİTCK'nin yayımladığı yönetmelikler, Avrupa Birliği'nin 2017/745 sayılı Tıbbi Cihaz Tüzüğü ile uyumlu hazırlandı. Kurumun mevzuat sayfası, tıbbi cihaz yazılımının klinik değerlendirmesine dair MDCG 2020-1 rehberini de listeliyor.
Bir ürünün piyasada olması, sizin hasta grubunuzda doğrulandığı anlamına gelmez. Satın alma veya pilot uygulama öncesinde, hangi referans standartla test edildiğini yazılı olarak sorun.
Sık sorulan sorular
Radyoloji raporundan çıkarılan etiketler neden sorunlu?
Raporlar klinik iletişim için yazılır, veri etiketlemek için değil. Belirsiz ifadeler ve belirtilmeyen bulgular otomatik etiketlemede hataya dönüşebilir. Oakden-Rayner'ın ChestX-ray14 incelemesi bu hataların ölçülebilir büyüklükte olduğunu gösterdi.
Konsensüs her zaman patolojiden daha mı zayıftır?
Her zaman değil; bazı durumlarda patoloji hiç elde edilemez. Önemli olan, seçilen referansın klinik soruya uygun olması ve gerekçesinin yazılmasıdır. STARD 2015 de referans standardın seçilme gerekçesini bildirmeyi istiyor.
Model referans standarttan "daha iyi" olabilir mi?
Olabilir, ama bunu kusurlu bir referansla göstermek zordur. Model, referansın kaçırdığı gerçek bulguları yakalarsa yanlış pozitif sayılır. Bu yüzden daha güçlü bir referansla, örneğin izlem veya ileri görüntülemeyle yeniden değerlendirme gerekir.
Kaynaklar
- Bossuyt PM ve ark. (2015) — STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies, BMJ: https://doi.org/10.1136/bmj.h5527
- Whiting PF ve ark. (2011) — QUADAS-2: a revised tool for the quality assessment of diagnostic accuracy studies, Annals of Internal Medicine: https://doi.org/10.7326/0003-4819-155-8-201110180-00009
- Reitsma JB ve ark. (2009) — A review of solutions for diagnostic accuracy studies with an imperfect or missing reference standard, Journal of Clinical Epidemiology: https://doi.org/10.1016/j.jclinepi.2009.02.005
- Oakden-Rayner L (2020) — Exploring large-scale public medical image datasets, Academic Radiology: https://doi.org/10.1016/j.acra.2019.10.006
- Majkowska A ve ark. (2020) — Chest radiograph interpretation with deep learning models: assessment with radiologist-adjudicated reference standards and population-adjusted evaluation, Radiology: https://doi.org/10.1148/radiol.2019191293
- Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi Cihaz Mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
Bir yapay zekânın doğruluğu, karşılaştırıldığı referans standart kadar güvenilirdir. Etiket kalitesi, okuyucu uyumu ve doğrulama yanlılığı için rehber.
