DoktorClub
Hakkımızda
Kurumsal
Fırsatlar
Haberler
Kongreler
Akademi
LongeviTurk
Yapay Zeka Haber
İletişim
Oturum açDOKGPT'yi dene
DoktorClub
Sağlık Bilgisi.
Hekim Güveni.

Hasta Rehberleri

  • Belirti Rehberleri
  • Kadın Sağlığı
  • Ruh Sağlığı
  • Longevity
  • Acil & İlk Yardım
  • Tüm Sağlık Haberleri

Platform

  • DOKGPT
  • TUS Soru Bankası
  • Hesaplayıcılar
  • Akademi
  • Dijital Tıp Fakültesi

Topluluk

  • Hekim Ağı
  • Vaka Tartışmaları
  • Haberler
  • Yapay Zeka Haber
  • AI Sağlık Bültenleri
  • AI Sağlık Takipçisi
  • Kongreler
  • Doktorclub Awards
  • Akademi
  • Canlı Yayınlar

Kaynaklar

  • Dergiler
  • TUS Blog
  • Fırsatlar
  • Sıralama
  • VIP

Kurumsal

  • Hakkımızda
  • Kurumsal Çözümler
  • İletişim
  • Gizlilik & KVKK

Üyelik

  • Hekim Kaydı
  • Öğrenci Kaydı
  • Akademisyen Kaydı
  • Oturum Aç
DoktorClub© 2026 DoktorClub. Tüm hakları saklıdır.
InstagramLinkedIn
Ana Sayfa/AI Haberleri/Genel başarı yüksek, kritik hastada hata: Yapay ze...
Analiz24 Eylül 20265 dk

Genel başarı yüksek, kritik hastada hata: Yapay zekâda gizli alt grup

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

Genel başarı yüksek, kritik hastada hata: Yapay zekâda gizli alt grup

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

30 Saniyede Özet

"Genel AUC 0,87" gibi tek bir sayı, bir modelin en çok önem taşıyan hastalarda nasıl çalıştığını gizleyebilir. Oakden-Rayner ve arkadaşları buna gizli tabakalaşma (hidden stratification) adını verdi. Göğüs grafisinde pnömotoraks modeli, göğüs tüpü olan hastalarda başarılı, tüpü olmayan hastalarda belirgin biçimde zayıftı. Benzer biçimde, göğüs grafisi modellerinin bazı demografik gruplarda hastalığı daha sık kaçırdığı gösterildi.

Gizli tabakalaşma ne demek?

Bir tanı etiketi, genellikle birbirinden farklı alt tipleri kapsar. "Pnömotoraks" etiketi hem acil girişim bekleyen hastayı hem de tüpü takılmış, tedavisi süren hastayı içerir. Veri setinde bu ayrım yazılı değilse, model iki grubu tek bir sınıf olarak öğrenir.

Gizli tabakalaşma, modelin genel başarısı yüksekken tanımlanmamış bir alt grupta sürekli hata yapmasıdır. Sorun, bu alt grubun çoğu zaman klinik açıdan en riskli grup olmasıdır. Genel başarı ölçüsü ise bu hatayı ortalamada eritir.

Bunun basit bir nedeni var. Genel ölçü, her alt grubu veri setindeki payı oranında temsil eder. Kritik alt grup küçükse, orada yapılan hatalar genel sayıyı pek değiştirmez. Model, sık görülen kolay vakalardaki başarısıyla ortalamayı yukarıda tutar.

Pnömotoraks örneği neyi gösterdi?

Oakden-Rayner, Dunnmon, Carneiro ve Ré, 2020'de ACM CHIL konferansında bu sorunu sistematik biçimde inceledi. ChestX-ray14 veri setinde pnömotoraks için genel AUC 0,87 bulundu. AUC (modelin hasta ile sağlamı ayırma gücünü özetleyen ölçü; 0,5 şans düzeyi, 1 kusursuz ayrım) göğüs tüpü olan hastalarda 0,94'tü. Tüpü olmayan hastalarda ise 0,77'ye düştü.

Test setindeki pnömotoraks vakalarının %80'inde göğüs tüpü vardı. Bu tablo, modelin pnömotoraksın kendisinden çok tedavinin izine, yani tüpe dayanıyor olabileceğini düşündürüyor. Klinik açıdan en önemli grup, yani tanı bekleyen tedavisiz hasta, en kötü sonucu aldı.

Yazarlar başka örnekler de gösterdi. Kalça kırığı modelinde genel duyarlılık 0,981 iken, silik kırıklarda 0,900'e düştü. Kas-iskelet grafilerinden oluşan MURA veri setinde genel AUC 0,91 idi. Anormal vakaların %43'ünü oluşturan dejeneratif eklem hastalığında ise AUC 0,76'da kaldı.

Yazarlara göre gizli tabakalaşma, klinik açıdan önemli alt gruplarda %20'yi aşan göreli performans farklarına yol açabiliyor. Bu farklar, yalnızca genel sonuca bakan bir okuyucunun gözünden kolayca kaçar.

Adalet sorunu: Hangi hastalar daha sık kaçırılıyor?

Alt grup sorunu yalnızca hastalık alt tipleriyle sınırlı değildir. Seyyed-Kalantari ve arkadaşları 2021'de Nature Medicine'de göğüs grafisi modellerini demografik gruplara göre inceledi. Çalışmada MIMIC-CXR, CheXpert ve ChestX-ray14 veri setleri ile bunların birleşimi kullanıldı. Birleşik veri seti 700 binden fazla görüntü içeriyordu.

Araştırmacılar düşük tanıyı (hastalığı olan hastaya "bulgu yok" denmesini) ölçtü. Kadınlar, 0–20 yaş grubu, Siyahi ve Hispanik hastalar ile Medicaid sigortalılar sistematik olarak daha sık düşük tanı aldı. Birden fazla dezavantajın kesiştiği gruplarda, örneğin Hispanik kadınlarda, etki daha da belirgindi.

Bu çalışma gözlemsel ve geriye dönük bir analizdir. Yine de genel performansın iyi olmasının, her grupta eşit güvenlik anlamına gelmediğini açıkça gösteriyor.

Klinik bir senaryo: Acilde "normal" denen grafi

Şöyle varsayımsal bir durum düşünün. Acil serviste yapay zekâ destekli bir triyaj sistemi kullanılıyor. Sistem "normal" dediği grafileri okuma listesinin sonuna atıyor.

Sistem geliştirme verisinde çoğunlukla takılı tüpü olan, yatan hastaları görmüşse, tüpsüz ilk başvuruları kaçırabilir. Tam da bu hastalar acil girişim gerektiren gruptur. Genel başarı raporu iyi olsa da, en kritik hasta listenin sonunda bekleyebilir.

Hangi alt grup sonuçlarını istemelisiniz?

Yazarlar gizli alt grupları bulmak için üç yol önerdi. Birincisi, uzmanların önceden olası klinik alt tipleri tanımlamasıdır. İkincisi, modelin hatalarını tek tek inceleyip ortak örüntü aramaktır. Üçüncüsü, kümeleme gibi algoritmik yöntemlerle performansı düşük grupları otomatik aramaktır.

Tahmin modelleri için güncel raporlama rehberi TRIPOD+AI de bu yönde. Rehber, model performansının sosyodemografik gruplar gibi temel alt gruplarda değerlendirilmesini öneriyor. Adaleti (modelin herhangi bir grubu dezavantajlı duruma düşürmemesi) raporlamanın birçok bölümüne yerleştiriyor.

Bir ürünü değerlendirirken şunları isteyin:

  • Klinik açıdan kritik alt tiplere göre ayrı duyarlılık ve özgüllük tablosu
  • Tedavi izleri (tüp, kateter, implant) olan ve olmayan görüntülerde ayrı sonuç
  • Yaş, cinsiyet ve varsa etnik köken gruplarına göre düşük tanı oranları
  • Farklı cihaz, merkez ve çekim koşullarına göre performans
  • Her alt grubun örnek sayısı ve güven aralığı

Türkiye'deki hekim için ne anlama geliyor?

Yurt dışı veri setleriyle geliştirilen bir modelin sizin hasta profilinizde nasıl çalıştığı ayrıca sınanmalıdır. Demografik yapı, cihaz parkı ve başvuru örüntüsü merkezden merkeze değişir.

Türkiye'de tıbbi cihaz yazılımları Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) mevzuatına tabidir. Yönetmelikler, Avrupa Birliği'nin 2017/745 sayılı Tıbbi Cihaz Tüzüğü ile uyumlu hazırlandı. Kullanım öncesinde, üreticiden alt grup sonuçlarını ve yerel pilot verisini yazılı olarak isteyin.

Sık sorulan sorular

Genel AUC yüksekse model güvenli sayılamaz mı?

Genel AUC, tüm hastaların ortalamasını yansıtır. Küçük ama kritik bir alt grupta ciddi başarısızlık bu ortalamada görünmeyebilir. Güvenlik kararı için alt grup sonuçlarına bakmanız gerekir.

Alt grup analizi her zaman güvenilir mi?

Hayır, küçük alt gruplarda sonuçlar belirsizdir. Bu yüzden her alt grubun örnek sayısını ve güven aralığını isteyin. Az örnekli bir grupta iyi sonuç, güvence değil yalnızca bir işarettir.

Hekim olarak gizli alt grubu nasıl fark edebilirim?

Modelin hatalarını düzenli olarak kaydedin ve ortak özellik arayın. Yazarların önerdiği hata incelemesi yaklaşımı tam olarak budur. Aynı tip hastada tekrarlayan bir kaçırma, üreticiye bildirilmesi gereken bir sinyaldir.

Kaynaklar

  • Oakden-Rayner L, Dunnmon J, Carneiro G, Ré C (2020) — Hidden stratification causes clinically meaningful failures in machine learning for medical imaging, ACM CHIL: https://doi.org/10.1145/3368555.3384468
  • Seyyed-Kalantari L ve ark. (2021) — Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations, Nature Medicine: https://doi.org/10.1038/s41591-021-01595-0
  • Collins GS ve ark. (2024) — TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods, BMJ: https://doi.org/10.1136/bmj-2023-078378
  • Oakden-Rayner L (2020) — Exploring large-scale public medical image datasets, Academic Radiology: https://doi.org/10.1016/j.acra.2019.10.006
  • Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi Cihaz Mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati

Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.


İlgili Yazılar

Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:

  • Yanlış yapay zekâ önerisi hekimi yanıltır mı? Otomasyon yanlılığı
  • Hekim artı yapay zekâ her zaman daha mı iyi? Kanıtlar ne diyor
  • Yapay zekâyla çalışan hekim beceri kaybeder mi? Kolonoskopi verisi
DoktorClub Görüşü

Genel AUC yüksek bir yapay zekâ, klinik açıdan kritik bir alt grupta başarısız olabilir. Gizli tabakalaşma, alt grup analizi ve istenecek sonuçlar.

Paylaş:

Kanıt ve inceleme

  • Kanıt: Resmî kaynak
  • İnceleme durumu: Editör inceledi
  • Editör: DoktorClub Yayın Kurulu · Tıbbi Gözetim: Dr. Murat Toktamışoğlu

Kaynak rozetleri

İlgili içerikler

Ana akışa dön
Yapay zekâ tahmin modeli makalesi TRIPOD+AI ile nasıl okunur?

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

Firma klinik çalışma gösterdiğinde neye bakmalı? CONSORT-AI ve DECIDE-AI

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

Düşük prevalanslı taramada iyi bir yapay zekâ neden çok yanlış alarm verir?

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.