Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
30 Saniyede Özet
Duyarlılığı ve özgüllüğü %95 olan bir yapay zekâ aracı kulağa neredeyse kusursuz gelir. Hastalık 100 kişiden birinde görülüyorsa, bu aracın pozitif sonuçlarının yalnızca yaklaşık altıda biri gerçek hastadır. Sebep aracın kötülüğü değil, pozitif kestirim değerinin prevalansa bağlı olmasıdır. Firmaların yüksek prevalanslı, zenginleştirilmiş test setlerinden verdiği rakamlar bu yüzden gerçek tarama performansını olduğundan iyi gösterebilir.
Dört ölçüt ne söyler, ne söylemez?
Duyarlılık (hastaların yüzde kaçını testin pozitif bulduğu) ve özgüllük (sağlamların yüzde kaçını negatif bulduğu) testin kendisine dair ölçütlerdir. Hekimin masasındaki soru ise farklıdır: pozitif çıkan bu kişi gerçekten hasta mı? Bu sorunun yanıtı pozitif kestirim değeridir (PKD, pozitif sonuçların yüzde kaçının gerçek hasta olduğu). Negatif kestirim değeri (NKD) de negatif sonuçların yüzde kaçının gerçekten sağlam olduğunu gösterir.
Altman ve Bland, BMJ'deki kısa istatistik notunda kestirim değerlerinin prevalansa (hastalığın test edilen grupta görülme sıklığına) bağlı olduğunu anlatır. Aynı test, hastalığın sık olduğu bir klinikte yüksek, nadir olduğu bir taramada düşük PKD verir. Tanısal doğruluk çalışmalarının raporlama kılavuzu STARD 2015 de duyarlılık ve özgüllüğün sabit test özellikleri olmadığını vurgular. Bu değerler, hastaların nasıl başvurduğuna ve daha önce hangi testlerden geçtiğine göre değişebilir.
Açıklayıcı hesap: %1 prevalansta %95'lik bir araç
Aşağıdaki sayılar gerçek bir çalışmadan değil, Bayes teoremine dayanan basit bir hesaptan gelir. Duyarlılığı ve özgüllüğü %95 olan bir aracı, prevalansın %1 olduğu 10.000 kişilik bir tarama grubunda düşünün.
- Grupta 100 hasta ve 9.900 sağlam kişi var.
- Araç 100 hastanın 95'ini yakalar, 5'ini kaçırır.
- Araç 9.900 sağlam kişinin 495'ini yanlışlıkla pozitif bulur.
- Toplam 590 pozitif sonucun yalnızca 95'i gerçek hastadır, yani PKD yaklaşık %16'dır.
- Negatif sonuçlanan 9.410 kişinin 9.405'i gerçekten sağlamdır, yani NKD %99,9'un üzerindedir.
Aynı araç, aynı duyarlılık ve özgüllükle farklı prevalanslarda şu PKD'leri verir:
- Prevalans %0,1 ise PKD yaklaşık %2
- Prevalans %1 ise PKD yaklaşık %16
- Prevalans %10 ise PKD yaklaşık %68
- Prevalans %50 ise PKD %95
Burada iki ders var. Birincisi, nadir hastalıkta çok yüksek NKD kolayca elde edilir ve tek başına etkileyici değildir. İkincisi, yanlış pozitiflerin sayısı gerçek pozitiflerden kat kat fazla olabilir. Prevalans düştükçe bu fark hızla büyür.
Zenginleştirilmiş test setleri neden yanıltır?
Bazı yapay zekâ çalışmaları, hasta ve sağlam görüntüleri ayrı ayrı toplayıp birleştirir. Bu vaka-kontrol tasarımında prevalans yapay olarak yüksektir, yarı yarıya bile olabilir. Yukarıdaki hesapta gördüğünüz gibi, %50 prevalansta aynı araç %95 PKD verir. Bu rakam, %1 prevalanslı bir taramaya taşınamaz.
Sorun yalnızca PKD ile sınırlı değildir. Lijmer ve arkadaşları 1999'da JAMA'da 184 tanısal doğruluk çalışmasını inceledi. Hastaları ve ayrı bir kontrol grubunu kullanan çalışmalarda tanısal olasılık oranı (testin ayırt etme gücünü özetleyen ölçü) yaklaşık üç kat yüksek çıkıyordu. Belirgin hastalar ile sağlıklı gönüllüleri ayırmak, gerçek hayattaki sınırda vakaları ayırmaktan kolaydır.
Gerçek bir örnek: sepsis uyarıları ve alarm yükü
Wong ve arkadaşları, yaygın kullanılan tescilli bir sepsis tahmin modelini Michigan Üniversitesi hastanelerinde bağımsız olarak test etti. 38.455 yatışta sepsis sıklığı %6,6 idi. Seçilen eşikte modelin duyarlılığı %33, PKD'si %12 bulundu.
Model yatışların %18'inde uyarı üretti ve buna rağmen sepsisli hastaların üçte ikisini kaçırdı. Yazarlar bunun önemli bir alarm yorgunluğu (sık uyarı nedeniyle uyarıların önemsenmemeye başlaması) yükü yarattığını belirtti. Bu çalışma gözlemseldir ve tek bir sağlık sistemini yansıtır, ama PKD ile alarm yükü ilişkisini net gösterir.
Senaryo: Aile hekimliğinde tarama yazılımı
Şöyle bir durum düşünün. Birinci basamakta kullanılmak üzere bir retina tarama yazılımı öneriliyor. Broşürde %95 duyarlılık ve %95 özgüllük yazıyor. Tarayacağınız grupta hedef hastalığın sıklığı %1 civarındaysa, her 6 pozitif sonuçtan yaklaşık 5'i yanlış pozitif olacaktır.
Bu kişilerin her biri sevk, randevu ve kaygı demektir. Doğrulama testi için ayrılan kapasite de bu yanlış pozitiflerle dolar. Karar vermeden önce sevk kapasitenizi ve yanlış pozitiflerin maliyetini bu rakamla birlikte düşünün.
Yarın kullanabileceğiniz kontrol listesi
- Çalışmadaki prevalansı bulun ve kendi hasta grubunuzdaki prevalansla karşılaştırın.
- Test setinin ardışık hastalardan mı, yoksa ayrı toplanmış hasta ve kontrol gruplarından mı oluştuğuna bakın.
- Duyarlılık ve özgüllükten kendi prevalansınız için PKD'yi yeniden hesaplayın.
- Beklenen pozitif sayısını haftalık iş yükünüze çevirin.
- Firmadan, kullanım ortamına benzeyen bir grupta gerçek PKD ve uyarı oranını isteyin.
Türkiye'deki hekim için ne anlama geliyor?
Türkiye'de tıbbi cihaz alanındaki düzenleyici kurum Türkiye İlaç ve Tıbbi Cihaz Kurumu'dur (TİTCK). Kurumun 2021 tarihli Tıbbi Cihaz Yönetmeliği, AB'nin 2017/745 sayılı tüzüğüyle uyumludur. Ancak piyasaya çıkış belgesi, aracın sizin hasta grubunuzdaki PKD'sini söylemez. Bu hesabı kendi prevalans tahmininizle yapmak size kalır.
Sık sorulan sorular
Özgüllüğü artırmak sorunu çözer mi?
Özgüllük arttıkça yanlış pozitif sayısı düşer ve PKD yükselir. Ancak eşik değiştirildiğinde duyarlılık genellikle azalır ve daha fazla hasta kaçabilir. Hangi dengenin kabul edilebilir olduğu, kaçırılan vakanın ve gereksiz sevkin klinik bedeline bağlıdır.
Yüksek NKD aracın güvenli olduğunu gösterir mi?
Nadir bir hastalıkta hiç test yapmadan herkese negatif demek bile çok yüksek NKD verir. Bu yüzden NKD'yi duyarlılıkla ve kaçırılan vaka sayısıyla birlikte değerlendirin. Açıklayıcı hesapta 10.000 kişide 5 hasta kaçırılıyordu.
PKD'yi kendim nasıl hesaplarım?
10.000 kişilik hayali bir grup alın ve prevalansa göre hasta sayısını bulun. Duyarlılıkla gerçek pozitifleri, bir eksi özgüllükle yanlış pozitifleri hesaplayın. Gerçek pozitifleri toplam pozitife bölmek PKD'yi verir.
Kaynaklar
- Altman DG, Bland JM (1994) — Diagnostic tests 2: Predictive values (BMJ): https://doi.org/10.1136/bmj.309.6947.102
- Bossuyt PM ve ark. (2015) — STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies (BMJ): https://doi.org/10.1136/bmj.h5527
- Lijmer JG ve ark. (1999) — Empirical evidence of design-related bias in studies of diagnostic tests (JAMA): https://doi.org/10.1001/jama.282.11.1061
- Wong A ve ark. (2021) — External validation of a widely implemented proprietary sepsis prediction model in hospitalized patients (JAMA Internal Medicine): https://doi.org/10.1001/jamainternmed.2021.2626
- Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi cihaz mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
%95 duyarlılık ve özgüllüğe sahip bir araçta %1 prevalansta pozitiflerin yaklaşık altıda biri gerçek hastadır. PKD ve alarm yükünü hesaplamayı öğrenin.
