Hekim ile yapay zekâyı birleştirmek her zaman başarıyı artırmıyor. Randomize çalışma, radyoloji deneyleri ve meta-analiz ışığında iş birliği tasarımı.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir. 30 Saniyede Özet "Hekim ve yapay zekâ birlikte, ikisinden de iyidir" cümlesi sezgisel ama her…
Haberi paylaş
İlgilenecek birine ulaştırın.

Hekim ile yapay zekâyı birleştirmek her zaman başarıyı artırmıyor. Randomize çalışma, radyoloji deneyleri ve meta-analiz ışığında iş birliği tasarımı.
Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
"Hekim ve yapay zekâ birlikte, ikisinden de iyidir" cümlesi sezgisel ama her zaman doğru değil. Randomize bir çalışmada, büyük dil modeline erişim hekimlerin tanısal akıl yürütme puanını anlamlı biçimde artırmadı. Aynı çalışmada modelin tek başına puanı daha yüksekti. Kanıtlar, birlikteliğin faydasının araca, göreve ve iş akışı tasarımına bağlı olduğunu gösteriyor.
Beklenti mantıklı görünür. Hekim bağlamı, hastanın hikâyesini ve klinik sezgiyi getirir. Yapay zekâ ise yorulmadan çok sayıda örüntüyü tarar. İkisinin hataları farklıysa, birbirini tamamlamaları beklenir.
Bu tamamlayıcılığın (iki tarafın farklı hataları yapması ve birbirinin açığını kapatması) gerçek olduğuna dair veriler var. Majkowska ve arkadaşları göğüs grafisinde modelleri ve radyologları karşılaştırdı. Doğru pozitif bulguların önemli bir kısmını yalnızca model ya da yalnızca radyologlar yakaladı. Bu oran veri setine göre %25,1 ile %43,7 arasındaydı.
Ancak tamamlayıcılık potansiyeli, birleşimin kendiliğinden başarılı olacağı anlamına gelmez. Hekimin öneriyi ne zaman kabul edip ne zaman reddedeceği belirleyici olur.
Goh ve arkadaşları 2024'te JAMA Network Open'da randomize bir klinik çalışma yayımladı. ABD'de aile hekimliği, iç hastalıkları ve acil tıp alanlarından 50 hekim katıldı; 26'sı uzman, 24'ü asistandı. Bir grup geleneksel kaynaklara ek olarak GPT-4 tabanlı bir sohbet aracı kullandı. Diğer grup yalnızca geleneksel kaynaklarla çalıştı.
Hekimlere en fazla altı klinik vakayı değerlendirmek için 60 dakika verildi. Tanısal akıl yürütme puanının ortancası, dil modeli grubunda %76, geleneksel grupta %74 oldu. İki puanlık fark istatistiksel olarak anlamlı değildi. Vaka başına harcanan süre de anlamlı biçimde değişmedi.
Dikkat çeken bulgu şuydu: dil modeli tek başına %92 ortanca puan aldı. Bu, geleneksel kaynak grubundan 16 puan yüksekti. Yazarlara göre sonuçlar, araca yalnızca erişimin tanısal akıl yürütmeyi genel olarak iyileştirmeyeceğini düşündürüyor. Teknoloji ve iş gücü gelişimine ihtiyaç olduğunu belirttiler.
Bu sonucu genellerken dikkatli olun. Vakalar yazılı klinik vinyetlerdi ve katılımcı sayısı sınırlıydı. Gerçek hasta başında, farklı araç ve görevlerde sonuç değişebilir.
Agarwal, Moehring, Rajpurkar ve Salz radyologlarla bir deney yaptı. Bu çalışma, hakem değerlendirmesinden geçmemiş bir NBER çalışma makalesidir (working paper). Yazarlara göre yapay zekâ tahminini göstermek, radyolog performansını ortalamada artırmadı. Klinik bağlam bilgisi vermek ise performansı iyileştirdi.
Yazarlar bunu, yeni bilgiyle kanaatlerin güncellenmesindeki hatalara bağladı. Radyologlar yapay zekâ tahminine kendi değerlendirmelerine göre az ağırlık verdi. Ayrıca kendi bilgileriyle yapay zekâ tahmini arasındaki ilişkiyi hesaba katmadılar. Yazarlara göre bu hatalar düzeltilmedikçe en iyi tasarım, vakaları çoğunlukla ya yalnız insana ya yalnız yapay zekâya bırakmaktır.
Yu ve arkadaşlarının Nature Medicine'de yayımlanan çalışması 140 radyoloğu ve 15 göğüs grafisi görevini inceledi. Yapay zekâ desteğinin etkisi radyologdan radyoloğa belirgin biçimde değişti. Deneyim yılı ya da yan dal uzmanlığı, kimin fayda göreceğini öngörmedi. Hatalı yapay zekâ tahminleri ise performansı düşürdü.
Vaccaro, Almaatouq ve Malone, 2020–2023 arasındaki 106 deneyi meta-analizde birleştirdi. Çalışmalar yalnızca tıbbı değil, farklı alanlardaki insan-yapay zekâ görevlerini kapsıyordu. Ortalamada insan-yapay zekâ birlikteliği, tek başına en iyi olan taraftan daha kötü performans gösterdi. Buna karşın birliktelik, tek başına insandan daha iyiydi.
İki ayrıntı özellikle önemli. Karar verme görevlerinde birliktelik kayba, yaratıcı üretim görevlerinde ise kazanca yöneldi. İnsan tek başına yapay zekâdan iyiyse birliktelik fayda sağladı, yapay zekâ daha iyiyse kayıp belirginleşti.
Şöyle varsayımsal bir durum düşünün. Hastaneniz, acil serviste ayırıcı tanı öneren bir dil modeli aracını denemek istiyor. Firma, modelin tek başına yüksek başarı gösterdiği bir çalışma sunuyor.
Bu veri tek başına yeterli değildir. Asıl soru, aracın hekimlerinizin elinde sonucu değiştirip değiştirmediğidir. Goh çalışması, modelin iyi olmasının hekim-model birlikteliğinin de iyi olacağı anlamına gelmediğini gösteriyor.
Bir aracı iş akışına almadan önce şu soruları ekipçe yanıtlayın:
Türkiye'de tıbbi cihaz yazılımları Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) mevzuatına tabidir. TİTCK yönetmelikleri, Avrupa Birliği'nin 2017/745 sayılı Tıbbi Cihaz Tüzüğü ile uyumlu hazırlandı.
Genel amaçlı dil modellerinin hasta verisiyle kullanımı ayrıca dikkat ister. 6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli kişisel veri sayıyor. Kimlik bilgisi içeren vaka ayrıntılarını bu araçlara girmeden önce kurumunuzun veri politikasını kontrol edin.
Hayır, bu sonuç dar ve kontrollü görevlerden geliyor. Gerçek klinik karar, sorumluluk, hasta tercihi ve bağlam gerektirir. Kanıtlar daha çok görev paylaşımının iyi tasarlanması gerektiğini gösteriyor.
Goh çalışmasında katılımcılara komut yazma eğitimi verilmedi ve eğitim ayrı bir kol olarak sınanmadı. Yazarlar tartışmada, komut eğitiminin veya iş akışına gömülü hazır komutların yararlı olabileceğini öne sürdü. Bu sorunun yanıtı, eğitimi doğrudan sınayan çalışmalardan gelmeli.
Tek bir çalışma genelleme için yeterli değildir. Araç, görev ve kullanıcı grubu değiştiğinde sonuç da değişebilir. Kendi ortamınızda küçük bir pilot, en güvenilir yol gösterici olur.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: