Bir yapay zekânın doğruluğu, karşılaştırıldığı referans standart kadar güvenilirdir. Etiket kalitesi, okuyucu uyumu ve doğrulama yanlılığı için rehber.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet Bir yapay zekâ çalışmasındaki duyarlılık ve özgüllük, modelin neyle…
Haberi paylaş
İlgilenecek birine ulaştırın.

Bir yapay zekânın doğruluğu, karşılaştırıldığı referans standart kadar güvenilirdir. Etiket kalitesi, okuyucu uyumu ve doğrulama yanlılığı için rehber.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
Bir yapay zekâ çalışmasındaki duyarlılık ve özgüllük, modelin neyle karşılaştırıldığına bağlıdır. Bu karşılaştırma ölçütüne referans standart (tanının doğru kabul edildiği ölçüt, sıklıkla "altın standart" olarak da anılır) denir. Tek okuyucunun etiketi, uzman konsensüsü, patoloji ya da klinik izlem birbirinden çok farklı sonuçlar üretebilir. Bu yazı, referans standardı sorgulamanız için hangi sorulara bakacağınızı özetliyor.
Bir tanı testi, ancak doğru bilinen bir cevaba göre değerlendirilebilir. Yapay zekâ modelleri de aynı kurala tabidir. Model, etiketleri yanlış olan bir veriyle sınanırsa ölçülen başarı da yanlış olur.
Tanı doğruluğu çalışmalarının raporlama rehberi STARD 2015, 30 maddelik bir kontrol listesi sunuyor. Rehber, referans standardın farklı tanımlanmasının duyarlılık ve özgüllük tahminlerini değiştirebileceğini vurguluyor. Bu yüzden referans standardın ayrıntılı tanımını ve alternatifler varsa seçilme gerekçesini istiyor. Katılımcı akışını gösteren bir diyagram da her raporda bekleniyor.
Büyük görüntü veri setlerinde etiketler çoğu zaman radyoloji raporlarından otomatik çıkarılır. Bu yöntem hızlıdır ama rapordaki belirsizlik ve atlamalar etikete taşınır. Sonuçta model "gerçek tanıyı" değil, "rapordaki ifadeyi" öğrenir.
Oakden-Rayner, yaygın kullanılan ChestX-ray14 veri setinden seçtiği görüntü örneklerini gözle inceledi. Pozitif prediktif değerin (pozitif etiketlilerin gerçekten pozitif olma oranı) belgelerde bildirilenden çoğunlukla %10 ile %30 daha düşük olduğunu buldu. İncelenen pnömotoraks pozitiflerinin yaklaşık %80'inde göğüs tüpü vardı. Yazar, veri seti hazırlayanlara görsel kalite kontrolü ve etiketleme sürecinin ayrıntılı belgelenmesini öneriyor.
Okuyucular arası değişkenlik (aynı görüntüye farklı hekimlerin farklı yorum getirmesi), referans standardı doğrudan etkiler. Tek bir radyoloğun okuması bir model için "doğru cevap" kabul edilirse, o radyoloğun hataları da doğru sayılır.
Majkowska ve arkadaşları göğüs grafilerinde dört bulgu için bu sorunu ele aldı. Üç radyolog görüntüleri bağımsız okudu, ardından anlaşmazlıkları tartışarak çözdü. İlk okumadan sonra uzlaşma görüntülerin %41,8'inde sağlanmıştı. Tartışma sürecinden sonra bu oran %96,8'e yükseldi.
Bu bulgu şunu gösteriyor: tek okuyucuya dayalı bir referans standart ciddi gürültü taşıyabilir. Konsensüs veya uzlaştırma (adjudikasyon, anlaşmazlıkların yapılandırılmış tartışmayla çözülmesi) daha güvenilir bir karşılaştırma sağlar.
Her hastaya aynı referans test uygulanmadığında doğrulama yanlılığı (yalnızca bazı hastaların kesin tanı testine gönderilmesinden doğan sapma) ortaya çıkar. Örneğin yalnızca şüpheli lezyonlara biyopsi yapılır, diğerleri izlemle takip edilir. Biyopsi yapılmayan grupta gözden kaçan kanserler hiç kayda geçmeyebilir.
QUADAS-2, tanı doğruluğu çalışmalarında yanlılık riskini değerlendiren bir araçtır. Aracın "akış ve zamanlama" alanı tam da bunu sorar. Tüm hastalara referans standart uygulandı mı, hepsi aynı standardı mı aldı, hepsi analize dahil edildi mi? Referans standardın indeks testin sonucu bilinmeden yorumlanıp yorumlanmadığı da ayrı bir sorudur.
Pek çok klinik durumda kusursuz bir referans yoktur. Reitsma ve arkadaşları bu soruna önerilen çözümleri dört grupta topladı. Eksik referans verisini tamamlama, kusurlu standarttan kaynaklanan hatayı düzeltme ve birden fazla bilgiyi birleştiren bir referans oluşturma ilk üç gruptur.
Dördüncü yol, klasik doğruluk yaklaşımını bırakıp klinik geçerliliğe bakmaktır. Burada test sonucu, hastanın sonraki klinik olayları veya tedavi yanıtı gibi anlamlı sonuçlarla ilişkilendirilir. Yapay zekâ çalışmalarında da "model neyi öngörüyor ve bu hastaya ne kazandırıyor?" sorusu bu yüzden değerlidir.
Şöyle varsayımsal bir durum düşünün. Bir akciğer nodülü modeli, göğüs grafisinde "radyolog düzeyinde" başarı iddia ediyor. Makaleye baktığınızda referans standardın tek bir radyoloğun raporu olduğunu görüyorsunuz.
Bu durumda model, o radyoloğun görmediği nodülleri de "yanlış pozitif" sayılmış olabilir. Tersine, radyoloğun yanıldığı yerlerde modelin aynı hatayı yapması "doğru" kabul edilir. BT ile doğrulanmış ya da uzman panelince uzlaştırılmış bir referans, bambaşka bir tablo gösterebilir.
Makaleyi ya da firma sunumunu okurken şu soruları sorun:
Türkiye'de tıbbi cihaz yazılımları Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) mevzuatına tabidir. TİTCK'nin yayımladığı yönetmelikler, Avrupa Birliği'nin 2017/745 sayılı Tıbbi Cihaz Tüzüğü ile uyumlu hazırlandı. Kurumun mevzuat sayfası, tıbbi cihaz yazılımının klinik değerlendirmesine dair MDCG 2020-1 rehberini de listeliyor.
Bir ürünün piyasada olması, sizin hasta grubunuzda doğrulandığı anlamına gelmez. Satın alma veya pilot uygulama öncesinde, hangi referans standartla test edildiğini yazılı olarak sorun.
Raporlar klinik iletişim için yazılır, veri etiketlemek için değil. Belirsiz ifadeler ve belirtilmeyen bulgular otomatik etiketlemede hataya dönüşebilir. Oakden-Rayner'ın ChestX-ray14 incelemesi bu hataların ölçülebilir büyüklükte olduğunu gösterdi.
Her zaman değil; bazı durumlarda patoloji hiç elde edilemez. Önemli olan, seçilen referansın klinik soruya uygun olması ve gerekçesinin yazılmasıdır. STARD 2015 de referans standardın seçilme gerekçesini bildirmeyi istiyor.
Olabilir, ama bunu kusurlu bir referansla göstermek zordur. Model, referansın kaçırdığı gerçek bulguları yakalarsa yanlış pozitif sayılır. Bu yüzden daha güçlü bir referansla, örneğin izlem veya ileri görüntülemeyle yeniden değerlendirme gerekir.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: