DoktorClub
Hakkımızda
Kurumsal
Fırsatlar
Haberler
Kongreler
Akademi
LongeviTurk
Yapay Zeka Haber
İletişim
Oturum açDOKGPT'yi dene
DoktorClub
Sağlık Bilgisi.
Hekim Güveni.

Hasta Rehberleri

  • Belirti Rehberleri
  • Kadın Sağlığı
  • Ruh Sağlığı
  • Longevity
  • Acil & İlk Yardım
  • Tüm Sağlık Haberleri

Platform

  • DOKGPT
  • TUS Soru Bankası
  • Hesaplayıcılar
  • Akademi
  • Dijital Tıp Fakültesi

Topluluk

  • Hekim Ağı
  • Vaka Tartışmaları
  • Haberler
  • Yapay Zeka Haber
  • AI Sağlık Bültenleri
  • AI Sağlık Takipçisi
  • Kongreler
  • Doktorclub Awards
  • Akademi
  • Canlı Yayınlar

Kaynaklar

  • Dergiler
  • TUS Blog
  • Fırsatlar
  • Sıralama
  • VIP

Kurumsal

  • Hakkımızda
  • Kurumsal Çözümler
  • İletişim
  • Gizlilik & KVKK

Üyelik

  • Hekim Kaydı
  • Öğrenci Kaydı
  • Akademisyen Kaydı
  • Oturum Aç
DoktorClub© 2026 DoktorClub. Tüm hakları saklıdır.
InstagramLinkedIn
Ana Sayfa/AI Haberleri/Yedi dil modeli tuzaklı antibiyotik sorularında sı...
Çalışma25 Eylül 20264 dk

Yedi dil modeli tuzaklı antibiyotik sorularında sınandı

Yedi büyük dil modeli (LLM; metin üreten yapay zekâ modeli), içine uydurma ve tehlikeli öneri tuzakları yerleştirilmiş 30 antibiyotik yönetimi senaryosuyla sınandı.

Yedi dil modeli tuzaklı antibiyotik sorularında sınandı

30 Saniyede Özet

Yedi büyük dil modeli (LLM; metin üreten yapay zekâ modeli), içine uydurma ve tehlikeli öneri tuzakları yerleştirilmiş 30 antibiyotik yönetimi senaryosuyla sınandı. Çalışma, Avrupa Klinik Mikrobiyoloji ve Enfeksiyon Hastalıkları Derneği'nin (ESCMID) yayın organı Clinical Microbiology and Infection dergisinde 22 Ağustos 2026'da yayımlandı. Hiçbir model yanıtlarının %63'ünden fazlasında uydurma ya da tehlike işaretinden arınmış çıkmadı. Tehlikeli öneri oranı modele göre %6,7 ile %16,7 arasında değişti.

Ne oldu?

Çalışmayı İspanya'daki Lozano Blesa Üniversite Hastanesi ve Aragón Teknoloji Enstitüsü öncülüğünde, Hollanda'daki Radboudumc'nin de katıldığı bir ekip yürüttü. Amaç, genel amaçlı dil modellerinin antimikrobiyal yönetim (antimicrobial stewardship, AMS) desteği için yeterli olup olmadığını görmekti. AMS, antibiyotiklerin doğru endikasyon, doz ve sürede kullanılmasını sağlayan kurumsal programları kapsar.

Test edilen modeller şunlardı: GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro ve Grok 4. Açık ağırlıklı (herkesin indirip çalıştırabildiği) modeller olarak Llama-3.3-70b, Qwen 2.5-72b ve DeepSeek-chat-v3.1 eklendi. Senaryolar ESCMID'in AMS yetkinlik çerçevelerine göre hazırlandı. Bazı senaryolara bilerek, modeli bilgi uydurmaya ya da tehlikeli öneriye iten tuzaklar kondu.

Hollanda ve İspanya'dan altı AMS uzmanı yanıtları kör ve çift değerlendirmeyle puanladı. İçerik 0–5 arasında puanlandı. Uydurma ve tehlike için ayrıca evet/hayır işaretleri konuldu. Standart istem (prompt) ile modeli "teşvik eden" bir istem de karşılaştırıldı.

Sonuçlar ne gösterdi?

Dört ticari model 5 üzerinden 3,9'un üzerinde ortalama içerik puanı aldı:

  • Claude Sonnet 4.5: 4,06

  • Gemini 2.5 Pro: 3,96

  • Grok 4: 3,96

  • GPT-5: 3,94

Açık ağırlıklı modeller anlamlı olarak daha düşük puan aldı (2,94–3,57). Buna karşın tehlike işaretleri açısından ticari ve açık modeller arasında anlamlı fark bulunmadı. Tuzak içermeyen senaryolarda uydurma bilgi, yanıtın klinik yararını anlamlı biçimde düşürmedi.

Teşvik edici istemler, içerik puanında ortalama 0,48 puanlık artışla ilişkiliydi (p=0,006). Ancak senaryo düzeyindeki kümelenme hesaba katıldığında bu anlamlılık zayıfladı. Altı uzmanın beşi, dil modellerini orta düzey gözetimle yararlı AMS destek araçları olarak gördü. Yazarlara göre sınırları bilmek, özellikle yerinde enfeksiyon uzmanı olmayan ekipler için önemli.

Kanıt ne kadar güçlü?

Bu kesitsel bir değerlendirme; gerçek hastalarda sonuç ölçülmedi. Senaryo sayısı 30 ile sınırlı ve tuzaklar bilinçli olarak zorlayıcı tasarlandı. Bu nedenle oranlar günlük pratiği değil, stres testini yansıtıyor.

Değerlendirme uzmanlarının kör olması ve çift okuma yapılması güçlü yanlar. Öte yandan gerçek klinik sorular da çoğu zaman eksik bilgi ve belirsizlik içerir. Bu açıdan tuzak senaryolar tamamen yapay sayılmaz; modelin baskı altında nasıl davrandığını gösteriyor.

Bu haberdeki rakamlar çalışmanın özetine göre aktarıldı; tam metne erişemedik. Özet, tuzak türlerinin ve tehlikeli önerilerin ayrıntısını vermiyor. Model sürümleri hızla değiştiği için sonuçlar test tarihindeki sürümlere aittir. Çıkar beyanında yazarların model şirketleriyle bağlantısı bildirilmiyor; yalnızca kongre katılım desteği ve bir kamu araştırma sözleşmesi yer alıyor.

Hekim için ne anlama geliyor?

Yazarların vardığı sonuç ikiye ayrılıyor. Eğitim, belgeleme ve iletişim gibi klinik dışı işler bugün dil modelinden yararlanabilir. Klinik öneriler ise uzman gözetimi gerektiriyor. Temel güvenlik sorunu uydurma bilgi; bu da doğrulama iş akışını zorunlu kılıyor.

Tehlikeli öneriler ise yazarlara göre tanımlanabilir hata türlerinde toplandı. Bu, riskin azaltılabileceği anlamına geliyor. Ekipler, modelin sık yanıldığı soru tiplerini listeleyip bunları insan onayına bağlayabilir.

Antibiyotik kararlarında dil modeli kullanırken şunlara dikkat edin:

  • Modelin verdiği kaynak, kılavuz ya da çalışma adını mutlaka özgün metinden doğrulayın.

  • Doz, böbrek ayarı ve etkileşim bilgisini ilaç prospektüsü ve güncel kılavuzla karşılaştırın.

  • Yerel direnç verisini model bilmez; kurumunuzun antibiyogram verisini esas alın.

  • Tedavi önerisini enfeksiyon hastalıkları ya da AMS ekibiyle teyit edin.

  • Hasta kimliğini içeren bilgiyi kurum onaylı olmayan araçlara girmeyin.

Türkiye'den bakınca

Dünya Sağlık Örgütü (DSÖ), antimikrobiyal direnci küresel bir sağlık tehdidi olarak tanımlıyor. DSÖ'ye göre bakteriyel direnç 2021'de 4,7 milyonu aşkın ölümle ilişkiliydi.

Çalışmada Türkçe yanıtlar ve Türkiye'nin direnç profili test edilmedi. Dil modeli kurumunuzun antibiyogramını bilmediği için, ampirik tedavi önerisi yerel direnç verisiyle uyuşmayabilir. Bu nedenle modelin önerisini hastanenin kendi ampirik tedavi rehberiyle karşılaştırmak ilk adım olmalı. Hasta verisi girilecekse Kişisel Verilerin Korunması Kanunu'nun (KVKK) sağlık verisini özel nitelikli saydığı unutulmamalı.

Sık sorulan sorular

En iyi puanı alan model güvenle kullanılabilir mi?

Hayır. En yüksek içerik puanını alan modeller de uydurma ve tehlike işaretlerinden kurtulamadı. Hiçbir model yanıtlarının %63'ünden fazlasında temiz çıkmadı.

Açık ağırlıklı modeller daha mı tehlikeli?

İçerik puanları daha düşüktü. Ancak tehlikeli öneri sıklığında ticari modellerle anlamlı fark bulunmadı. Tehlike oranı tüm modellerde %6,7 ile %16,7 arasındaydı.

Dil modeli AMS ekibinde nerede işe yarayabilir?

Uzmanlar belgeleme hazırlığı ve asistan eğitimini umut verici alanlar olarak işaret etti. Bireysel hastaya tedavi önerisi ise uzman denetimi olmadan kullanılmamalı.

Kaynaklar

  • Abejez-Arrizabalaga Á, Paño-Pardo JR ve ark. (2026) — Testing Knowledge Boundaries: Adversarial Evaluation of LLMs for Antimicrobial Stewardship, Clinical Microbiology and Infection: https://doi.org/10.1016/j.cmi.2026.08.025

  • PubMed (2026) — Çalışma özeti ve çıkar beyanı, PMID 42632419: https://pubmed.ncbi.nlm.nih.gov/42632419/

  • Dünya Sağlık Örgütü (2026) — Antimicrobial resistance, bilgi notu: https://www.who.int/news-room/fact-sheets/detail/antimicrobial-resistance

  • Kişisel Verileri Koruma Kurumu (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://www.kvkk.gov.tr/Icerik/6649/Personal-Data-Protection-Law

Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.


İlgili Yazılar

Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:

  • WhatsApp botu kolorektal kanser taramasına katılımı artırdı
  • Nijerya'da sağlık çalışanına ChatGPT desteği ne kazandırdı?
  • Sesli yapay zekâ kayıtçısıyla olay raporları daha eksiksiz
DoktorClub Görüşü

İspanyol ve Hollandalı uzmanlar 7 dil modelini 30 tuzaklı antibiyotik senaryosunda sınadı. Hiçbiri yanıtlarının %63'ünden fazlasında temiz çıkmadı.

Paylaş:

Kanıt ve inceleme

  • Kanıt: Resmî kaynak
  • İnceleme durumu: Editör inceledi
  • Editör: DoktorClub Yayın Kurulu
  • Reviewer: Dr. Hamza Gemici

Kaynak rozetleri

Abejez-Arrizabalaga Á, Paño-Pardo JR ve ark. (2026) — Testing Knowledge Boundaries: Adversarial Evaluation of LLMs for Antimicrobial Stewardship, Clinical Microbiology and Infection:referencePubMed (2026) — Çalışma özeti ve çıkar beyanı, PMID 42632419:referenceDünya Sağlık Örgütü (2026) — Antimicrobial resistance, bilgi notu:referenceKişisel Verileri Koruma Kurumu (2016) — 6698 sayılı Kişisel Verilerin Korunması Kanunu:reference

İlgili içerikler

Ana akışa dön
Yapay Zeka Tıbbi Cihazların Onayını Gelir mi Belirliyor?

PYMNTS'in Eylül 2026 tarihli haberine göre FDA, önemli bir kararını sürdürüyor.

FDA yapay zekâ listesinde 1.614 cihaz: LLM etiketi gündemde

Yapay zekâlı tıbbi cihazların ABD'deki resmî envanteri yenilendi.

Giyilebilir veriden sonlanım noktası: FDA'dan ortak çerçeve

Akıllı saatin kaydettiği yürüyüş, bir ilaç çalışmasında sonlanım noktası olabilir mi?