30 Saniyede Özet
Hekimlerin en çok beğendiği yapay zekâ notu, en az hata içeren not değildi. Journal of the American Medical Informatics Association (JAMIA) dergisinde 23 Eylül 2026'da yayımlanan çalışmada 56 hekim, üç ticari sistemin notlarını puanladı. En yüksek puanı alan sistemde 8, en az hatalı sistemde 3 hata sayıldı. Yazarlar hekim puanlarının hata denetimiyle birlikte kullanılmasını öneriyor.
Ne oldu?
New York eyaletindeki Rochester Regional Health'in klinik bilişim bölümü ve Rochester Teknoloji Enstitüsü araştırmacıları bu değerlendirmeyi yaptı. Konu, ortam dinleyen dijital not yazıcılar (ambient digital scribe). Bu sistemler hekim-hasta konuşmasını dinleyip otomatik klinik not taslağı hazırlıyor.
Çalışmanın özetine göre ekip iki standart muayeneyi canlandırıp ses kaydına aldı. Biri kısa, soruna odaklı bir vizitti. Diğeri kapsamlı bir yıllık kontroldü. Üç satıcının sistemi aynı ses kayıtlarından not üretti.
Değerlendirme iki kolda yürüdü. Farklı branşlardan 56 hekim notları yedi basamaklı ölçekle dört alanda puanladı. Bu alanlar ilgililik, doğruluk, kalite ve hekimin nota duyduğu güvendi.
Paralel olarak hekim denetçiler her notu kaynak ses kaydıyla satır satır karşılaştırdı. Önceden belirlenmiş bir ölçüte göre üç hata türünü saydılar. Bunlar uydurma içerik (halüsinasyon), atlanan bilgi ve yanlış aktarılan bilgiydi.
Sonuçlar iki kolda farklı çıktı. Hekim puanlarında A satıcısı dört alanın tamamında en yüksek ortalamayı aldı. Üç satıcı arasındaki fark kısa vizitte (P<0,001) ve uzun vizitte (P=0,005) anlamlıydı. Ancak çoklu karşılaştırma düzeltmesinden sonra yalnızca kısa vizitte A ile B arasındaki fark anlamlı kaldı (P=0,0098).
Hata denetimi ise farklı bir sıralama çıkardı. En az hata B satıcısının notlarında bulundu (3 hata). A satıcısında 8, C satıcısında 9 hata sayıldı.
Bir bulgu daha dikkat çekici. Hekimler, denetimin doğruladığından daha sık halüsinasyon işaretledi. Yazarlar bu durumu temkinli bir dille "sözde halüsinasyon" olarak adlandırıyor.
Kanıt ne kadar güçlü?
Yazarlar çalışmayı açıkça keşif amaçlı olarak tanımlıyor. Yalnızca iki canlandırılmış muayene kullanıldı. Bu yüzden hata sayıları küçük ve satıcılar hakkında genelleme yapmaya elvermiyor.
Canlandırılmış muayeneler kullanıldığı için gerçek hasta, gürültülü ortam ya da farklı aksanlarla performans bu çalışmadan çıkarılamaz. Satıcıların adı özette verilmiyor, harflerle kodlanmış. Bulgular belirli bir ürün sürümüne ait ve güncellemelerle değişebilir.
Tam metne erişemediğimiz için bu yazı çalışmanın özetine dayanıyor. Puanlayıcıların notları hangi satıcının ürettiğini bilip bilmediği ve çıkar çatışması beyanları özette yer almıyor. Yazarların önerisi, bu çerçevenin daha büyük çalışmalarla doğrulanmadan satın alma kararlarını yönlendirmemesi.
Hekim için ne anlama geliyor?
Yapay zekâ ile not yazan araçları seçerken hekim izlenimi önemli bir girdi. Bu çalışma, izlenimin yanıltabileceğine dair erken bir işaret sunuyor. Akıcı ve derli toplu görünen bir not daha güvenilir algılanabilir.
Yazarlar, not üslubunun puanları etkilemiş olabileceğini bir hipotez olarak öne sürüyor. Bu henüz kanıtlanmış bir neden değil. Yine de pratikte önemli bir uyarı taşıyor.
Kurumunuz böyle bir aracı değerlendiriyorsa şunları gündeme getirebilirsiniz.
- Hekim beğeni anketine ek olarak, notları ses kaydıyla karşılaştıran bir hata denetimi isteyin.
- Hataları türüne göre ayırın, çünkü atlanan bir alerji ile fazladan bir cümle aynı ağırlıkta değil.
- Deneme senaryolarına kendi kurumunuzun dilini, aksanlarını ve hasta profilini katın.
- Satıcı güncellemelerinden sonra denetimi tekrarlayın.
Günlük pratik için ders açık: Akıcı not, doğru not demek değil. İmzalamadan önce ilaç, doz, taraf ve bulgu ayrıntılarını kendiniz kontrol edin.
Türkiye'den bakınca
Türkçe konuşmaları işleyen yapay zekâ not yazıcılarının Türkiye'de ne ölçüde kullanıldığına dair doğrulanmış bir veri görmedik. Çalışma ABD'de yapıldı ve Türkçe konuşmalarda performans sınanmadı. Türkçe tıbbi terimlerin İngilizceyle karıştığı konuşmalarda hata türleri farklılaşabilir.
Bu çalışmanın yöntemi Türkiye'deki kurumlar için kopyalanabilir bir model sunuyor. Satıcıları canlandırılmış Türkçe muayenelerle karşılaştırmak, ses kaydıyla satır satır hata denetimini mümkün kılar. Üstelik deneme aşamasında gerçek hasta sesi, yani Kişisel Verilerin Korunması Kanunu'nun (KVKK) özel nitelikli saydığı sağlık verisi işlenmemiş olur.
Sık sorulan sorular
Hangi yapay zekâ not yazıcısı en iyisiydi?
Özette satıcı adları verilmiyor, sistemler A, B ve C olarak kodlanmış. Hekimler en çok A'yı beğendi, en az hata ise B'de bulundu. Yalnızca iki muayene kullanıldığı için bir kazanan ilan etmek doğru olmaz.
"Sözde halüsinasyon" ne demek?
Hekimlerin uydurma içerik diye işaretlediği, ancak ses kaydıyla karşılaştırmada doğrulanmayan ifadeleri anlatıyor. Yazarlar bu terimi geçici bir etiket olarak kullanıyor. Kavramın geçerliliği daha büyük çalışmalarla sınanmalı.
Bu sonuçlar satın alma kararını değiştirmeli mi?
Tek başına değiştirmemeli, çünkü örneklem çok küçük. Ancak yöntem önemli bir ilke öneriyor. Hekim beğenisi ile nesnel hata denetimini birlikte kullanmak daha güvenli görünüyor.
Kaynaklar
- Weiss E, Zsenits B, Nasar F ve ark. (2026) — Comparative evaluation of ambient digital scribe systems in clinical documentation (JAMIA): https://doi.org/10.1093/jamia/ocag157
- PubMed (2026) — PMID 42776572 kaydı ve özet: https://pubmed.ncbi.nlm.nih.gov/42776572/
- Kashiouris MG ve ark. (2026) — Ambient AI documentation in a multisite emergency department network (Applied Clinical Informatics): https://pmc.ncbi.nlm.nih.gov/articles/PMC13574497/
- Kişisel Verileri Koruma Kurumu — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://www.kvkk.gov.tr/Icerik/6649/Personal-Data-Protection-Law
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
JAMIA'daki çalışmada 56 hekim üç yapay zekâ not yazıcısını puanladı. En beğenilen sistemin notlarında 8 hata vardı, en az hatalı sistemde ise yalnızca 3.
