Mamografi deneyinde yanlış yapay zekâ önerisi okuyucuların doğruluğunu belirgin düşürdü. Otomasyon yanlılığı nedir, hangi önlemler riski azaltır?
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet Yapay zekâ doğru öneri verdiğinde yardımcı olabilir, ama yanlış önerinin de hekimi…
Haberi paylaş
İlgilenecek birine ulaştırın.

Mamografi deneyinde yanlış yapay zekâ önerisi okuyucuların doğruluğunu belirgin düşürdü. Otomasyon yanlılığı nedir, hangi önlemler riski azaltır?
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
Yapay zekâ doğru öneri verdiğinde yardımcı olabilir, ama yanlış önerinin de hekimi peşinden sürükleyebildiği gösterildi. Buna otomasyon yanlılığı (otomatik sisteme gereğinden fazla güvenip kendi yargısını geri plana atma) denir. Deneysel bir mamografi çalışmasında, yanlış öneri gördüklerinde deneyimsiz okuyucuların doğruluğu yaklaşık %80'den %20'ye düştü. Bir sistematik derleme; eğitimi, kullanıcının hesap verebilirliğini ve önerinin ekranda sunuluş biçimini önlem olarak öne çıkarıyor.
Bir karar destek sistemi öneri verdiğinde, kullanıcı iki tür hata yapabilir. Sistem yanlış bir şey önerdiğinde bunu kabul edebilir. Sistem bir şeyi atladığında kendisi de atlayabilir.
Goddard, Roudsari ve Wyatt 2012'de bu konuda sistematik bir derleme yayımladı. Taranan binlerce makaleden 74 çalışma dahil edildi. Derleme, otomasyon yanlılığını otomasyona aşırı güvenme eğilimi olarak tanımladı. Bu eğilim, sistem çıktısının yeterince denetlenmemesiyle, yani rehavetle yakından ilişkiliydi.
Derleme, yanlılığı artıran ya da azaltan etkenleri de sıraladı. Kullanıcı tarafında bilişsel tarz, göreve özgü deneyim ile sisteme duyulan güven öne çıktı. Ortam tarafında iş yükü, görevin karmaşıklığı ve zaman baskısı yer aldı. Yani sorun yalnızca bireysel dikkat eksikliği değildir, çalışma koşullarıyla da ilgilidir.
Dratsch ve arkadaşları 2023'te Radiology dergisinde prospektif deneysel bir çalışma yayımladı. 27 radyolog 50 mamografiyi, yapay zekâ olduğu söylenen bir sistemin önerileriyle birlikte değerlendirdi. Aslında sistem, araştırmacıların önceden hazırladığı önerileri gösteren bir programdı.
Mamografilerin 38'inde öneri doğruydu, 12'sinde ise bilerek yanlış bir BI-RADS kategorisi önerildi. Yanlış önerilerin yarısı daha yüksek, yarısı daha düşük bir kategori içeriyordu. Okuyucular deneyim düzeyine göre üç gruba ayrıldı.
Öneri doğruyken üç grubun doğruluğu benzerdi ve %79,7 ile %82,3 arasındaydı. Öneri yanlış olduğunda tablo değişti:
Yanlış öneri daha yüksek bir BI-RADS kategorisi olduğunda, deneyimsiz okuyucular öneriye daha çok uydu. Bu grupta aşırı tanıya doğru kayma, diğer iki gruptan anlamlı biçimde fazlaydı. Klinikte bu, gereksiz ek inceleme ve biyopsi riskine karşılık gelebilir.
Deneyim etkiyi azalttı ama ortadan kaldırmadı. Yazarlar, deneyimden bağımsız olarak tüm radyologların otomasyon yanlılığına açık olduğu sonucuna vardı.
Bu bir laboratuvar deneyidir, gerçek klinik iş akışı değildir. Yanlış öneri oranı (%24) araştırmacılarca belirlendi ve gerçek bir ürün kullanılmadı. Bu yüzden kesin rakamlar klinik pratiğe doğrudan taşınamaz.
Yine de bulgu diğer kanıtlarla uyumlu. Yu ve arkadaşlarının 140 radyologla yaptığı çalışmada, hatalı yapay zekâ tahminleri radyolog performansını olumsuz etkiledi. Aynı çalışmada deneyim yılı, yapay zekâdan kimin fayda göreceğini öngörmedi.
Lyell ve Coiera'nın sistematik derlemesi de önemli bir ayrıntı ekliyor. Otomasyon yanlılığı, özellikle doğrulaması zor tanısal görevlerde ortaya çıkıyordu. Yanlılık yalnızca çoklu görev altında değil, tek bir göreve odaklanıldığında da görüldü. Görüntü yorumlama tam da bu tür bir görevdir.
Şöyle varsayımsal bir durum düşünün. Poliklinikte yoğun bir gün geçiriyorsunuz ve EKG yorumlayan bir yazılım "normal sinüs ritmi" diyor. Hastanın yakınması hafif ve bekleyen hasta sayısı fazla.
EKG'ye kendiniz dikkatle bakmadan yazılımın sonucunu onaylıyorsunuz. Oysa ince bir iskemik değişiklik vardı ve yazılım bunu kaçırmıştı. Goddard ve arkadaşlarının derlemesi, iş yükü ve zaman baskısının otomasyon yanlılığını artıran etkenler arasında olduğunu gösteriyor.
Bu senaryodaki asıl sorun, yazılımın hatası kadar bağımsız kontrolün atlanmasıdır. Aynı yazılım doğru çalıştığı yüzlerce vakada güven kazanmış olabilir. Güven arttıkça denetim azalır ve nadir hata fark edilmeden geçer.
Goddard ve arkadaşları eğitim, kullanıcının hesap verebilirliğini vurgulama ve sistem tasarımını önlem olarak öne çıkardı. Tasarım tarafında önerinin ekrandaki yeri ve güven düzeyinin gösterilmesi gibi unsurlar tartışıldı. Aşağıdaki kontrol listesi bu ilkeleri günlük pratiğe çeviriyor:
Türkiye'de tıbbi cihaz yazılımları Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) mevzuatına tabidir. TİTCK yönetmelikleri, Avrupa Birliği'nin 2017/745 sayılı Tıbbi Cihaz Tüzüğü ile uyumlu hazırlandı.
Avrupa Birliği'nin 2024/1689 sayılı Yapay Zekâ Tüzüğü, bu konuya ayrıca değiniyor. İnsan gözetimi maddesi (Madde 14), yüksek riskli sistemin, gözetimle görevli kişilerin otomasyon yanlılığının farkında kalmasına olanak verecek biçimde sunulmasını istiyor. Bu kişiler gerektiğinde çıktıyı göz ardı edebilmeli, geçersiz kılabilmeli veya tersine çevirebilmelidir. Bu tüzük Türkiye'de doğrudan uygulanmasa da, AB pazarına yönelik ürünlerin tasarımını etkileyebilir.
Tam olarak korunmaz. Dratsch çalışmasında çok deneyimli okuyucular da yanlış öneride belirgin doğruluk kaybı yaşadı. Deneyim etkiyi azaltabilir ama tek başına yeterli bir güvence değildir.
Her zaman değil; doğru öneriler performansı destekleyebilir. Önemli olan, öneriyi kendi bağımsız değerlendirmenizden sonra görmektir. Böylece öneri kararınızı değiştirmek yerine sınar.
Sistemin belirsizlik gösterip göstermediğini ve hatalı önerilerin nasıl izlendiğini sorun. Kullanıcıların itirazlarını kaydeden bir mekanizma olup olmadığını öğrenin. Ürünün okuyucu çalışmalarında yanlış öneri senaryolarıyla sınanıp sınanmadığını da sorgulayın.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: