30 Saniyede Özet
Yedi büyük dil modeli (LLM; metin üreten yapay zekâ modeli), içine uydurma ve tehlikeli öneri tuzakları yerleştirilmiş 30 antibiyotik yönetimi senaryosuyla sınandı. Çalışma, Avrupa Klinik Mikrobiyoloji ve Enfeksiyon Hastalıkları Derneği'nin (ESCMID) yayın organı Clinical Microbiology and Infection dergisinde 22 Ağustos 2026'da yayımlandı. Hiçbir model yanıtlarının %63'ünden fazlasında uydurma ya da tehlike işaretinden arınmış çıkmadı. Tehlikeli öneri oranı modele göre %6,7 ile %16,7 arasında değişti.
Ne oldu?
Çalışmayı İspanya'daki Lozano Blesa Üniversite Hastanesi ve Aragón Teknoloji Enstitüsü öncülüğünde, Hollanda'daki Radboudumc'nin de katıldığı bir ekip yürüttü. Amaç, genel amaçlı dil modellerinin antimikrobiyal yönetim (antimicrobial stewardship, AMS) desteği için yeterli olup olmadığını görmekti. AMS, antibiyotiklerin doğru endikasyon, doz ve sürede kullanılmasını sağlayan kurumsal programları kapsar.
Test edilen modeller şunlardı: GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro ve Grok 4. Açık ağırlıklı (herkesin indirip çalıştırabildiği) modeller olarak Llama-3.3-70b, Qwen 2.5-72b ve DeepSeek-chat-v3.1 eklendi. Senaryolar ESCMID'in AMS yetkinlik çerçevelerine göre hazırlandı. Bazı senaryolara bilerek, modeli bilgi uydurmaya ya da tehlikeli öneriye iten tuzaklar kondu.
Hollanda ve İspanya'dan altı AMS uzmanı yanıtları kör ve çift değerlendirmeyle puanladı. İçerik 0–5 arasında puanlandı. Uydurma ve tehlike için ayrıca evet/hayır işaretleri konuldu. Standart istem (prompt) ile modeli "teşvik eden" bir istem de karşılaştırıldı.
Sonuçlar ne gösterdi?
Dört ticari model 5 üzerinden 3,9'un üzerinde ortalama içerik puanı aldı:
Claude Sonnet 4.5: 4,06
Gemini 2.5 Pro: 3,96
Grok 4: 3,96
GPT-5: 3,94
Açık ağırlıklı modeller anlamlı olarak daha düşük puan aldı (2,94–3,57). Buna karşın tehlike işaretleri açısından ticari ve açık modeller arasında anlamlı fark bulunmadı. Tuzak içermeyen senaryolarda uydurma bilgi, yanıtın klinik yararını anlamlı biçimde düşürmedi.
Teşvik edici istemler, içerik puanında ortalama 0,48 puanlık artışla ilişkiliydi (p=0,006). Ancak senaryo düzeyindeki kümelenme hesaba katıldığında bu anlamlılık zayıfladı. Altı uzmanın beşi, dil modellerini orta düzey gözetimle yararlı AMS destek araçları olarak gördü. Yazarlara göre sınırları bilmek, özellikle yerinde enfeksiyon uzmanı olmayan ekipler için önemli.
Kanıt ne kadar güçlü?
Bu kesitsel bir değerlendirme; gerçek hastalarda sonuç ölçülmedi. Senaryo sayısı 30 ile sınırlı ve tuzaklar bilinçli olarak zorlayıcı tasarlandı. Bu nedenle oranlar günlük pratiği değil, stres testini yansıtıyor.
Değerlendirme uzmanlarının kör olması ve çift okuma yapılması güçlü yanlar. Öte yandan gerçek klinik sorular da çoğu zaman eksik bilgi ve belirsizlik içerir. Bu açıdan tuzak senaryolar tamamen yapay sayılmaz; modelin baskı altında nasıl davrandığını gösteriyor.
Bu haberdeki rakamlar çalışmanın özetine göre aktarıldı; tam metne erişemedik. Özet, tuzak türlerinin ve tehlikeli önerilerin ayrıntısını vermiyor. Model sürümleri hızla değiştiği için sonuçlar test tarihindeki sürümlere aittir. Çıkar beyanında yazarların model şirketleriyle bağlantısı bildirilmiyor; yalnızca kongre katılım desteği ve bir kamu araştırma sözleşmesi yer alıyor.
Hekim için ne anlama geliyor?
Yazarların vardığı sonuç ikiye ayrılıyor. Eğitim, belgeleme ve iletişim gibi klinik dışı işler bugün dil modelinden yararlanabilir. Klinik öneriler ise uzman gözetimi gerektiriyor. Temel güvenlik sorunu uydurma bilgi; bu da doğrulama iş akışını zorunlu kılıyor.
Tehlikeli öneriler ise yazarlara göre tanımlanabilir hata türlerinde toplandı. Bu, riskin azaltılabileceği anlamına geliyor. Ekipler, modelin sık yanıldığı soru tiplerini listeleyip bunları insan onayına bağlayabilir.
Antibiyotik kararlarında dil modeli kullanırken şunlara dikkat edin:
Modelin verdiği kaynak, kılavuz ya da çalışma adını mutlaka özgün metinden doğrulayın.
Doz, böbrek ayarı ve etkileşim bilgisini ilaç prospektüsü ve güncel kılavuzla karşılaştırın.
Yerel direnç verisini model bilmez; kurumunuzun antibiyogram verisini esas alın.
Tedavi önerisini enfeksiyon hastalıkları ya da AMS ekibiyle teyit edin.
Hasta kimliğini içeren bilgiyi kurum onaylı olmayan araçlara girmeyin.
Türkiye'den bakınca
Dünya Sağlık Örgütü (DSÖ), antimikrobiyal direnci küresel bir sağlık tehdidi olarak tanımlıyor. DSÖ'ye göre bakteriyel direnç 2021'de 4,7 milyonu aşkın ölümle ilişkiliydi.
Çalışmada Türkçe yanıtlar ve Türkiye'nin direnç profili test edilmedi. Dil modeli kurumunuzun antibiyogramını bilmediği için, ampirik tedavi önerisi yerel direnç verisiyle uyuşmayabilir. Bu nedenle modelin önerisini hastanenin kendi ampirik tedavi rehberiyle karşılaştırmak ilk adım olmalı. Hasta verisi girilecekse Kişisel Verilerin Korunması Kanunu'nun (KVKK) sağlık verisini özel nitelikli saydığı unutulmamalı.
Sık sorulan sorular
En iyi puanı alan model güvenle kullanılabilir mi?
Hayır. En yüksek içerik puanını alan modeller de uydurma ve tehlike işaretlerinden kurtulamadı. Hiçbir model yanıtlarının %63'ünden fazlasında temiz çıkmadı.
Açık ağırlıklı modeller daha mı tehlikeli?
İçerik puanları daha düşüktü. Ancak tehlikeli öneri sıklığında ticari modellerle anlamlı fark bulunmadı. Tehlike oranı tüm modellerde %6,7 ile %16,7 arasındaydı.
Dil modeli AMS ekibinde nerede işe yarayabilir?
Uzmanlar belgeleme hazırlığı ve asistan eğitimini umut verici alanlar olarak işaret etti. Bireysel hastaya tedavi önerisi ise uzman denetimi olmadan kullanılmamalı.
Kaynaklar
Abejez-Arrizabalaga Á, Paño-Pardo JR ve ark. (2026) — Testing Knowledge Boundaries: Adversarial Evaluation of LLMs for Antimicrobial Stewardship, Clinical Microbiology and Infection: https://doi.org/10.1016/j.cmi.2026.08.025
PubMed (2026) — Çalışma özeti ve çıkar beyanı, PMID 42632419: https://pubmed.ncbi.nlm.nih.gov/42632419/
Dünya Sağlık Örgütü (2026) — Antimicrobial resistance, bilgi notu: https://www.who.int/news-room/fact-sheets/detail/antimicrobial-resistance
Kişisel Verileri Koruma Kurumu (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://www.kvkk.gov.tr/Icerik/6649/Personal-Data-Protection-Law
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
İspanyol ve Hollandalı uzmanlar 7 dil modelini 30 tuzaklı antibiyotik senaryosunda sınadı. Hiçbiri yanıtlarının %63'ünden fazlasında temiz çıkmadı.
