Benzer AUC'li iki model aynı eşikte çok farklı sayıda hastayı tedaviye yönlendirebilir. Kalibrasyon grafiğini ve karar eğrisini okumayı adım adım anlatıyoruz.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet AUC, bir modelin hastaları risk sırasına ne kadar iyi dizdiğini ölçer ama verdiği…
Haberi paylaş
İlgilenecek birine ulaştırın.

Benzer AUC'li iki model aynı eşikte çok farklı sayıda hastayı tedaviye yönlendirebilir. Kalibrasyon grafiğini ve karar eğrisini okumayı adım adım anlatıyoruz.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
AUC, bir modelin hastaları risk sırasına ne kadar iyi dizdiğini ölçer ama verdiği yüzdelerin doğru olup olmadığını söylemez. Tedavi kararları ise çoğu zaman bir risk eşiğine göre verilir, bu yüzden yüzdelerin doğruluğu yani kalibrasyon belirleyicidir. Modelin gerçekten işe yarayıp yaramadığını görmek için karar eğrisi analizi ve net fayda kullanılır. Makalede AUC'nin yanında kalibrasyon grafiği ve karar eğrisi arayın.
AUC ya da C istatistiği ayırt ediciliği ölçer (rastgele seçilen bir olaylı hastaya olaysız hastadan daha yüksek risk verme olasılığı). Bu bir sıralama ölçüsüdür. Model herkesin riskini iki katına çıkarsa bile sıralama değişmez ve AUC aynı kalır.
Van Calster ve arkadaşları 2019'da BMC Medicine'de bunun somut bir örneğini verir. QRISK2-2011 ile NICE Framingham modellerinin AUC değerleri neredeyse aynıydı, 0,771 ve 0,776. Ancak %20'lik geleneksel eşikte QRISK2-2011, 35-74 yaş arası 1000 erkekten 110'unu yüksek riskli sayıyordu. Riski fazla tahmin eden NICE Framingham ise neredeyse iki katını, 206 kişiyi seçiyordu.
Bu yüzden TRIPOD+AI raporlama kılavuzu, performans ölçütlerine örnek olarak ayırt edicilik ile kalibrasyonu birlikte sayar.
Kalibrasyon, tahmin edilen riskin gerçekleşen riske uymasıdır. Van Calster ve arkadaşları dört düzey tanımlar. Ortalama kalibrasyon (kalibrasyonda genel uyum), ortalama tahmin edilen riskin gözlenen olay oranına eşit olmasıdır. Zayıf kalibrasyonda kesişim (intercept) 0'a, eğim (slope) 1'e yakın olmalıdır.
Kesişimin negatif olması riskin genel olarak fazla, pozitif olması eksik tahmin edildiğini gösterir. Eğimin 1'den küçük olması tahminlerin fazla uç olduğunu gösterir. Yani yüksek riskliler için risk abartılır, düşük riskliler için küçümsenir. Yazarlar bu tabloyu aşırı öğrenmenin (modelin eğitim verisindeki gürültüyü ezberlemesi) beklenen sonucu olarak açıklar.
Orta düzey kalibrasyon için bir kalibrasyon eğrisi çizilir. Yatay eksende tahmin edilen, dikey eksende gözlenen risk yer alır ve ideal eğri köşegen üzerindedir. Yazarlar, güvenilir bir eğri için en az 200 olaylı ve 200 olaysız hasta önerir. Hosmer–Lemeshow testini ise gücü düşük ve bilgi vermediği için önermezler.
Her tahminin kusursuz olduğu güçlü kalibrasyonu ise ulaşılamaz bir ideal sayarlar.
Evet, ve bu sık görülen bir sorundur. Hasta profili, hastalık sıklığı ve sevk düzeni değiştikçe model kalibrasyonunu kaybedebilir. Van Calster ve arkadaşları bu nedenle sürekli izleme ve gerektiğinde yeniden kalibrasyon önerir.
Davis ve arkadaşları, ABD Gaziler İşleri hastanelerinde akut böbrek hasarı modellerini 9 yıl boyunca izledi. Modellerin ayırt edicilik gücü korunurken hepsi zamanla riski giderek fazla tahmin etmeye başladı. Kayma, kullanılan yönteme göre farklı büyüklükteydi. Yani AUC sabit kalsa bile modelin verdiği yüzdeler bozulabilir.
Vickers ve Elkin, karar eğrisi analizini 2006'da Medical Decision Making dergisinde tanıttı. Yöntemin çıkış noktası eşik olasılığıdır (hekimin ya da hastanın tedaviye karar verdiği risk düzeyi). Bu eşik, yanlış pozitif ile yanlış negatif hatanın göreli ağırlığını da yansıtır.
Vickers, Van Calster ve Steyerberg 2016'da BMJ'de net faydayı sade bir mantıkla anlatır. Net fayda, faydadan zararın bir değişim oranıyla çarpılıp çıkarılmasıdır. Örneğin bir hastayı bulmak için 10 işlem yapmaya razı olmak, %10'luk bir eşiğe karşılık gelir. Yazarlara göre AUC klinik değer hakkında doğrudan bilgi vermeyen istatistiksel bir soyutlamadır.
Karar eğrisinde yatay eksen eşik olasılığını, dikey eksen net faydayı gösterir. Modelin eğrisi, "herkesi tedavi et" ve "kimseyi tedavi etme" stratejileriyle karşılaştırılır. Klinik olarak makul eşik aralığında en yüksek net faydayı veren strateji tercih edilir.
Şöyle bir durum düşünün. Bir model hastanıza %8 risk veriyor ve sizin tedavi eşiğiniz %10. Model yerel popülasyonunuzda riski sistematik olarak iki kat abartıyorsa gerçek risk yaklaşık %4'tür. Eksik tahmin ediyorsa hasta aslında eşiğin üzerinde olabilir.
AUC bu iki durumu birbirinden ayıramaz. Kalibrasyon grafiği ise hangi yönde hata yapıldığını doğrudan gösterir.
Yurt dışında geliştirilen bir modelin kalibrasyonu, Türkiye'deki hastalık sıklığına ve sevk düzenine uymayabilir. Türkiye'de tıbbi cihaz alanındaki düzenleyici kurum Türkiye İlaç ve Tıbbi Cihaz Kurumu'dur (TİTCK). Ancak mevzuata uygunluk, modelin sizin hastalarınızda iyi kalibre olduğunu göstermez. Yerel kalibrasyonu kontrol etmek için veri kullanırken, KVKK'nın sağlık verisini özel nitelikli saydığını unutmayın.
Evet. AUC yalnızca sıralamayı ölçtüğü için, tüm riskleri aynı oranda abartan bir modelin AUC'si değişmez. Bu durumda eşiğe göre verilen kararlar sistematik olarak hatalı olur.
Her zaman değil. Van Calster ve arkadaşları, kalibrasyonu bozuk bulunan bir modelin yerel veriyle güncellenmesini önerir. Bunun için yeterli sayıda olay içeren yerel veri gerekir.
Temel mantık basittir: kendi eşiğinizi yatay eksende bulun. O noktada modelin çizgisi diğer iki stratejinin üzerindeyse model net fayda sağlıyordur. Eğriler iç içeyse, model o eşikte belirgin bir fayda sunmuyor demektir.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: