Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.
30 Saniyede Özet
Bir yapay zekâ ürününün "klinik çalışması var" demesi, hasta sonuçlarını iyileştirdiğini tek başına göstermez. Arşiv verisinde yüksek doğruluk ile gerçek bakımda yarar sağlamak farklı sorulardır. CONSORT-AI ve SPIRIT-AI 2020'de yapay zekâ denemeleri için, DECIDE-AI ise 2022'de erken evre canlı değerlendirmeler için yayımlandı. Bu yazı, bu kılavuzların istediği ek maddeleri ve firmaya sorulacak soruları özetliyor.
Test setinde doğruluk neden klinik deneme sayılmaz?
Bir modelin arşiv görüntülerinde yüksek AUC alması, tanısal performansını bir kez ölçer. Klinik deneme ise model bakım sürecine girince hekim kararlarının ve hasta sonuçlarının nasıl değiştiğini sorar. Hekim uyarıyı görmezden gelebilir, ona fazla güvenebilir ya da iş akışı yavaşlayabilir. Bunların hiçbiri retrospektif (geçmiş kayıtlar üzerinde yapılan) bir test setinde görünmez.
Bu kanıt açığı küçük de değildir. Wu ve arkadaşları, ABD Gıda ve İlaç Dairesi (FDA) onaylı 130 yapay zekâ cihazının kamuya açık belgelerini inceledi. Bunların 126'sı onay başvurusunda yalnızca retrospektif çalışmaya dayanıyordu. 93 cihaz için çok merkezli değerlendirme kamuya açık biçimde raporlanmamıştı.
CONSORT-AI ve SPIRIT-AI hangi ek bilgileri ister?
CONSORT-AI, randomize kontrollü deneme (hastaların kurayla gruplara ayrıldığı çalışma) raporları için CONSORT 2010 listesine 14 madde ekler. Bunların 11'i yeni genişletme, 3'ü açıklamadır. Kılavuz 2020'de Nature Medicine, BMJ ve The Lancet Digital Health'te eş zamanlı yayımlandı. Geliştirme sürecinde 103 paydaşla iki aşamalı Delphi (uzman görüşlerini turlar hâlinde uzlaştırma) anketi yapıldı.
SPIRIT-AI aynı çalışma grubundan gelir ve deneme protokolleri içindir. SPIRIT 2013 listesine 15 madde ekler: 12 genişletme ve 3 açıklama. Protokolde yazılanla raporda yazılanı karşılaştırmak, sonradan değiştirilen hedefleri yakalamanın yoludur.
İki kılavuzun ortak ek maddeleri şunlardır:
- Kullanılan algoritmanın sürümü
- Girdi verisinin nasıl toplandığı ve seçildiği
- Düşük kaliteli ya da eksik girdinin nasıl ele alındığı
- İnsan ile yapay zekâ etkileşimi ve kullanıcıdan beklenen deneyim
- Modelin çıktısı ve bu çıktının klinik karara nasıl katıldığı
- Hata analizi ile modele ve koda erişim koşulları
Uygulamada bu maddelere ne kadar uyuluyor?
Plana ve arkadaşları 2022'de makine öğrenmesi müdahalelerini test eden 41 randomize denemeyi inceledi. Hiçbir deneme CONSORT-AI ölçütlerinin tümünü karşılamıyordu. Denemelerin %93'ü düşük kaliteli girdinin değerlendirilmesini, yine %93'ü hata analizini raporlamamıştı. Denemelerin yarısından fazlası tek merkezde yapılmıştı.
Martindale ve arkadaşlarının 2024 tarihli derlemesi, 65 denemede genel uyumu yüksek buldu. Yine de algoritma sürümü ve koda erişim gibi yapay zekâya özgü maddeler tutarlı biçimde yetersiz raporlanmıştı. Yalnızca 10 deneme CONSORT-AI kullandığını açıkça belirtmişti.
DECIDE-AI hangi boşluğu dolduruyor?
Arşiv performansı ile büyük randomize deneme arasında bir ara evre vardır. Bu evrede model ilk kez gerçek hekimlerin elinde, sınırlı sayıda hastada canlı kullanılır. DECIDE-AI, Vasey ve arkadaşlarınca 2022'de Nature Medicine ve BMJ'de bu evre için yayımlandı. Kılavuzda 28 alt maddeden oluşan 17 yapay zekâya özgü madde ve 10 genel madde bulunur.
Bu evrede odak, kullanıcı ve güvenliktir. Kılavuz, insan faktörlerinin ve kullanılabilirliğin değerlendirilmesini ister. Hataların ve güvenlik sorunlarının nasıl saptandığı da raporlanmalıdır. Değerlendirme sırasında algoritmada yapılan değişiklikler de sürüm bilgisiyle yazılmalıdır.
Senaryo: Firma "klinik çalışmamız var" diyor
Şöyle bir durum düşünün. Radyoloji biriminize akciğer grafisi yorumlayan bir yazılım öneriliyor. Sunumda "klinik çalışmada yüksek duyarlılık" yazıyor ve bir makale gösteriliyor. Makaleyi açtığınızda, çalışmanın tek merkezli arşiv görüntülerinde yapılmış bir doğruluk analizi olduğunu görüyorsunuz.
Bu çalışma değerli olabilir ama bir klinik deneme değildir. Radyologların yazılımla birlikte nasıl karar verdiği ölçülmemiştir. Test edilen algoritma sürümü yazmıyorsa, size sunulan ürünle aynı olup olmadığını da bilemezsiniz.
Firmaya hangi soruları sormalısınız?
- Çalışma retrospektif doğruluk analizi mi, canlı değerlendirme mi, yoksa randomize deneme mi?
- Test edilen algoritma sürümü, size sunulan sürümle aynı mı?
- Kötü kaliteli ya da eksik girdi geldiğinde sistem ne yapıyor?
- Hekim çıktıyı nasıl görüyor ve karara nasıl katıyor?
- Hata analizi yapıldı mı, hangi hasta gruplarında hata arttı?
- Çalışma kaç merkezde yapıldı ve rapor CONSORT-AI ya da DECIDE-AI maddelerini karşılıyor mu?
Türkiye'deki hekim için ne anlama geliyor?
Türkiye'de tıbbi cihaz alanındaki düzenleyici kurum Türkiye İlaç ve Tıbbi Cihaz Kurumu'dur (TİTCK). Kurumun 2021 tarihli Tıbbi Cihaz Yönetmeliği, AB'nin 2017/745 sayılı tüzüğüyle uyumlu hazırlanmıştır. Ancak bir ürünün piyasaya çıkabilmesi, sizin iş akışınızda yarar sağladığını kanıtlamaz. Satın alma ya da pilot kararı öncesinde yukarıdaki soruları yazılı olarak sormak makul bir başlangıçtır.
Sık sorulan sorular
Her yapay zekâ aracı için randomize deneme şart mı?
Bu kılavuzlar bir kullanım izni vermez, yalnızca kanıtın nasıl raporlanacağını tanımlar. Retrospektif doğruluk, erken canlı değerlendirme ve randomize deneme farklı soruları yanıtlar. Önemli olan, iddia edilen yararın uygun kanıt türüyle desteklenmesidir.
DECIDE-AI ile CONSORT-AI arasındaki fark nedir?
DECIDE-AI, sistemin gerçek klinik ortamda ilk kez küçük ölçekte kullanıldığı erken evreyi kapsar. CONSORT-AI ise karşılaştırmalı randomize denemelerin raporlanması içindir. İlki daha çok güvenlik, insan faktörleri ve ilk klinik performansa, ikincisi karşılaştırmalı etkinliğe odaklanır.
Makale CONSORT-AI'a atıf yapıyorsa yeterli mi?
Atıf, maddelerin gerçekten raporlandığını garanti etmez. Derlemeler, algoritma sürümü ve koda erişim gibi maddelerin sık eksik kaldığını gösteriyor. Bu maddeleri makalede kendiniz arayın.
Kaynaklar
- Liu X ve ark. (2020) — Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension (Nature Medicine): https://doi.org/10.1038/s41591-020-1034-x
- Cruz Rivera S ve ark. (2020) — Guidelines for clinical trial protocols for interventions involving artificial intelligence: the SPIRIT-AI extension (Nature Medicine): https://doi.org/10.1038/s41591-020-1037-7
- Vasey B ve ark. (2022) — Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI (Nature Medicine): https://doi.org/10.1038/s41591-022-01772-9
- Plana D ve ark. (2022) — Randomized clinical trials of machine learning interventions in health care: a systematic review (JAMA Network Open): https://doi.org/10.1001/jamanetworkopen.2022.33946
- Martindale APL ve ark. (2024) — Concordance of randomised controlled trials for artificial intelligence interventions with the CONSORT-AI reporting guidelines (Nature Communications): https://doi.org/10.1038/s41467-024-45355-3
- Wu E ve ark. (2021) — How medical AI devices are evaluated: limitations and recommendations from an analysis of FDA approvals (Nature Medicine): https://doi.org/10.1038/s41591-021-01312-x
- Türkiye İlaç ve Tıbbi Cihaz Kurumu (2021) — Tıbbi cihaz mevzuatı: https://www.titck.gov.tr/faaliyetalanlari/tibbicihaz/tibbi-cihaz-mevzuati
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
Test setinde yüksek doğruluk klinik deneme değildir. CONSORT-AI, SPIRIT-AI ve DECIDE-AI'ın istediği ek maddeleri ve firmaya sorulacak soruları özetliyoruz.
