Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
30 Saniyede Özet
AUC, bir modelin hastaları risk sırasına ne kadar iyi dizdiğini ölçer ama verdiği yüzdelerin doğru olup olmadığını söylemez. Tedavi kararları ise çoğu zaman bir risk eşiğine göre verilir, bu yüzden yüzdelerin doğruluğu yani kalibrasyon belirleyicidir. Modelin gerçekten işe yarayıp yaramadığını görmek için karar eğrisi analizi ve net fayda kullanılır. Makalede AUC'nin yanında kalibrasyon grafiği ve karar eğrisi arayın.
AUC neyi ölçer, neyi ölçmez?
AUC ya da C istatistiği ayırt ediciliği ölçer (rastgele seçilen bir olaylı hastaya olaysız hastadan daha yüksek risk verme olasılığı). Bu bir sıralama ölçüsüdür. Model herkesin riskini iki katına çıkarsa bile sıralama değişmez ve AUC aynı kalır.
Van Calster ve arkadaşları 2019'da BMC Medicine'de bunun somut bir örneğini verir. QRISK2-2011 ile NICE Framingham modellerinin AUC değerleri neredeyse aynıydı, 0,771 ve 0,776. Ancak %20'lik geleneksel eşikte QRISK2-2011, 35-74 yaş arası 1000 erkekten 110'unu yüksek riskli sayıyordu. Riski fazla tahmin eden NICE Framingham ise neredeyse iki katını, 206 kişiyi seçiyordu.
Bu yüzden TRIPOD+AI raporlama kılavuzu, performans ölçütlerine örnek olarak ayırt edicilik ile kalibrasyonu birlikte sayar.
Kalibrasyon grafiği nasıl okunur?
Kalibrasyon, tahmin edilen riskin gerçekleşen riske uymasıdır. Van Calster ve arkadaşları dört düzey tanımlar. Ortalama kalibrasyon (kalibrasyonda genel uyum), ortalama tahmin edilen riskin gözlenen olay oranına eşit olmasıdır. Zayıf kalibrasyonda kesişim (intercept) 0'a, eğim (slope) 1'e yakın olmalıdır.
Kesişimin negatif olması riskin genel olarak fazla, pozitif olması eksik tahmin edildiğini gösterir. Eğimin 1'den küçük olması tahminlerin fazla uç olduğunu gösterir. Yani yüksek riskliler için risk abartılır, düşük riskliler için küçümsenir. Yazarlar bu tabloyu aşırı öğrenmenin (modelin eğitim verisindeki gürültüyü ezberlemesi) beklenen sonucu olarak açıklar.
Orta düzey kalibrasyon için bir kalibrasyon eğrisi çizilir. Yatay eksende tahmin edilen, dikey eksende gözlenen risk yer alır ve ideal eğri köşegen üzerindedir. Yazarlar, güvenilir bir eğri için en az 200 olaylı ve 200 olaysız hasta önerir. Hosmer–Lemeshow testini ise gücü düşük ve bilgi vermediği için önermezler.
Her tahminin kusursuz olduğu güçlü kalibrasyonu ise ulaşılamaz bir ideal sayarlar.
Kurulumdan sonra kalibrasyon bozulabilir mi?
Evet, ve bu sık görülen bir sorundur. Hasta profili, hastalık sıklığı ve sevk düzeni değiştikçe model kalibrasyonunu kaybedebilir. Van Calster ve arkadaşları bu nedenle sürekli izleme ve gerektiğinde yeniden kalibrasyon önerir.
Davis ve arkadaşları, ABD Gaziler İşleri hastanelerinde akut böbrek hasarı modellerini 9 yıl boyunca izledi. Modellerin ayırt edicilik gücü korunurken hepsi zamanla riski giderek fazla tahmin etmeye başladı. Kayma, kullanılan yönteme göre farklı büyüklükteydi. Yani AUC sabit kalsa bile modelin verdiği yüzdeler bozulabilir.
Net fayda ve karar eğrisi ne anlatır?
Vickers ve Elkin, karar eğrisi analizini 2006'da Medical Decision Making dergisinde tanıttı. Yöntemin çıkış noktası eşik olasılığıdır (hekimin ya da hastanın tedaviye karar verdiği risk düzeyi). Bu eşik, yanlış pozitif ile yanlış negatif hatanın göreli ağırlığını da yansıtır.
Vickers, Van Calster ve Steyerberg 2016'da BMJ'de net faydayı sade bir mantıkla anlatır. Net fayda, faydadan zararın bir değişim oranıyla çarpılıp çıkarılmasıdır. Örneğin bir hastayı bulmak için 10 işlem yapmaya razı olmak, %10'luk bir eşiğe karşılık gelir. Yazarlara göre AUC klinik değer hakkında doğrudan bilgi vermeyen istatistiksel bir soyutlamadır.
Karar eğrisinde yatay eksen eşik olasılığını, dikey eksen net faydayı gösterir. Modelin eğrisi, "herkesi tedavi et" ve "kimseyi tedavi etme" stratejileriyle karşılaştırılır. Klinik olarak makul eşik aralığında en yüksek net faydayı veren strateji tercih edilir.
Senaryo: Eşiğin hemen altındaki hasta
Şöyle bir durum düşünün. Bir model hastanıza %8 risk veriyor ve sizin tedavi eşiğiniz %10. Model yerel popülasyonunuzda riski sistematik olarak iki kat abartıyorsa gerçek risk yaklaşık %4'tür. Eksik tahmin ediyorsa hasta aslında eşiğin üzerinde olabilir.
AUC bu iki durumu birbirinden ayıramaz. Kalibrasyon grafiği ise hangi yönde hata yapıldığını doğrudan gösterir.
Yarın kullanabileceğiniz kontrol listesi
- AUC'nin yanında bir kalibrasyon grafiği var mı?
- Kalibrasyon kesişimi ve eğimi raporlanmış mı, 0 ve 1'e ne kadar yakın?
- Kalibrasyon dış veride, yani sizin ortamınıza benzer hastalarda gösterilmiş mi?
- Karar eğrisi var mı ve sizin kullandığınız eşik aralığını kapsıyor mu?
- Model, "herkesi tedavi et" ve "kimseyi tedavi etme" stratejilerinden daha iyi mi?
- Kullanım sırasında kalibrasyonun nasıl izleneceği tanımlanmış mı?
Türkiye'deki hekim için ne anlama geliyor?
Yurt dışında geliştirilen bir modelin kalibrasyonu, Türkiye'deki hastalık sıklığına ve sevk düzenine uymayabilir. Türkiye'de tıbbi cihaz alanındaki düzenleyici kurum Türkiye İlaç ve Tıbbi Cihaz Kurumu'dur (TİTCK). Ancak mevzuata uygunluk, modelin sizin hastalarınızda iyi kalibre olduğunu göstermez. Yerel kalibrasyonu kontrol etmek için veri kullanırken, KVKK'nın sağlık verisini özel nitelikli saydığını unutmayın.
Sık sorulan sorular
AUC'si yüksek bir model kötü kalibre olabilir mi?
Evet. AUC yalnızca sıralamayı ölçtüğü için, tüm riskleri aynı oranda abartan bir modelin AUC'si değişmez. Bu durumda eşiğe göre verilen kararlar sistematik olarak hatalı olur.
Kalibrasyon bozuksa model çöpe mi atılmalı?
Her zaman değil. Van Calster ve arkadaşları, kalibrasyonu bozuk bulunan bir modelin yerel veriyle güncellenmesini önerir. Bunun için yeterli sayıda olay içeren yerel veri gerekir.
Karar eğrisini okumak için istatistik bilmem gerekir mi?
Temel mantık basittir: kendi eşiğinizi yatay eksende bulun. O noktada modelin çizgisi diğer iki stratejinin üzerindeyse model net fayda sağlıyordur. Eğriler iç içeyse, model o eşikte belirgin bir fayda sunmuyor demektir.
Kaynaklar
- Van Calster B ve ark. (2019) — Calibration: the Achilles heel of predictive analytics (BMC Medicine): https://doi.org/10.1186/s12916-019-1466-7
- Vickers AJ, Elkin EB (2006) — Decision curve analysis: a novel method for evaluating prediction models (Medical Decision Making): https://doi.org/10.1177/0272989X06295361
- Vickers AJ, Van Calster B, Steyerberg EW (2016) — Net benefit approaches to the evaluation of prediction models, molecular markers, and diagnostic tests (BMJ): https://doi.org/10.1136/bmj.i6
- Davis SE ve ark. (2017) — Calibration drift in regression and machine learning models for acute kidney injury (JAMIA): https://doi.org/10.1093/jamia/ocx030
- Collins GS ve ark. (2024) — TRIPOD+AI statement (BMJ): https://doi.org/10.1136/bmj-2023-078378
- Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi cihaz mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati
- T.C. Resmî Gazete (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://www.mevzuat.gov.tr/mevzuatmetin/1.5.6698.pdf
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
Benzer AUC'li iki model aynı eşikte çok farklı sayıda hastayı tedaviye yönlendirebilir. Kalibrasyon grafiğini ve karar eğrisini okumayı adım adım anlatıyoruz.
