30 Saniyede Özet
OpenEvidence, 3 Eylül 2026'da hekimlere yönelik dört yapay zekâ modelinden oluşan bir aile duyurdu. Hızlı yanıt veren Osler, orta derinlikteki Sackett ve uzun literatür taraması yapan Snow ücretsiz sunuluyor. Dördüncü model Darwin ise yalnızca başvuruyla açılan bir araştırma önizlemesi. Duyurudaki yüksek skorlar şirketin kendi açıklaması; bağımsız çalışmalar daha temkinli bir tablo çiziyor.
Ne oldu?
Şirketin Miami çıkışlı basın bülteni, modelleri yanıt süresine göre ayırıyor. Osler yaklaşık beş saniyede yanıt veriyor ve muayene sırasındaki kısa sorular için tasarlandı. Sackett yaklaşık otuz saniyede, kanıtın tartılmasını gerektiren sorulara odaklanıyor. Snow ise yaklaşık beş dakika boyunca literatürde birden çok soru hattını inceliyor.
Bu üç model, şirketin web sitesi ve mobil uygulamaları üzerinden doğrulanmış klinisyenlere ücretsiz sunuluyor. Darwin için durum farklı. Şirket bu modeli kurumsal ortaklara, araştırma iş birliklerine ve akademik araştırmacılara başvuruyla açıyor. Gerekçe olarak viroloji, immünoloji ve genetikte çift kullanımlı (hem yararlı hem zararlı amaçla kullanılabilen) yetenekleri gösteriyor.
Bülten, Darwin için dört ölçüt (benchmark) skoru veriyor. Buna göre model MedQA'da yüzde 100, MedXpertQA'da yüzde 72,8 aldı. HealthBench Professional'da yüzde 82,7, NOHARM'da ise yüzde 87,2 skor bildirildi.
Şirket, ABD'de kendi platformunu kullanan hekim sayısının rakiplerin toplamını aştığını da öne sürüyor. Bunu bağımsız çalışmalara dayandırıyor, ancak bültende bu çalışmalar gösterilmiyor.
Kanıt ne kadar güçlü?
Skorların tamamı şirketin kendi raporladığı değerler. Bültende ölçümlerin bağımsız bir ekipçe tekrarlandığına ya da hakemli bir yayında sunulduğuna dair bilgi yok. MedQA, tıpta lisans sınavı tarzı çoktan seçmeli sorulardan oluşuyor. Bu tür bir sınavda tam puan, gerçek hastadaki belirsizliği yönetme becerisini göstermiyor.
NOHARM daha klinik bir ölçüt. Harvard ve Stanford kökenli araştırmacıların arXiv'de paylaştığı ön baskı (hakem değerlendirmesinden geçmemiş makale), birinci basamaktan uzmana konsültasyon vakalarını kullanıyor. Çalışmanın Temmuz 2026 tarihli dördüncü sürümü güncel sayıları veriyor.
Bu sürüm, 10 uzmanlık alanında 1.100 görev içeriyor. Toplam 20 genel dil modeli ve 4 kaynak taramalı klinik yapay zekâ aracı sınandı. Vakaların yüzde 24,6'sına varan oranda ciddi zarar potansiyeli saptandı. Ciddi hataların yüzde 80'den fazlası ihmal hatasıydı (gerekeni önermemek).
Bağımsız değerlendirmeler karışık bir tablo veriyor. Artsi, Sorin, Glicksberg ve arkadaşları, 11 çalışmayı toplayan bir sistematik derlemeyi Şubat 2026'da Research Square'de ön baskı olarak paylaştı. Research Square sayfasına göre derleme Ağustos 2026'da npj Digital Medicine'de yayımlandı.
Derlemeye göre platform uydurma kaynaktan kaçındı ve kılavuza dayalı sorularda iyi performans gösterdi. Karmaşık senaryolarda ise doğruluk değişken kaldı; doğru kaynağa rağmen yorum hataları görüldü.
UT Southwestern ve Virginia Commonwealth Üniversitesi araştırmacılarının medRxiv ön baskısı daha zor bir tablo sundu. MedXpertQA'dan (zor uzmanlık sorularından oluşan bir veri seti) rastgele seçilen 100 yan dal senaryosu kullanıldı. Hızlı arama modu ortalama yüzde 31, derin danışma modu yüzde 39,5 doğruluk gösterdi. Çalışma yeni model ailesinden önce yapıldı; sonuçlar yeni modellere doğrudan genellenemez.
Hekim için ne anlama geliyor?
Yeni aile, hız ile derinlik arasındaki seçimi açık bir tercih hâline getiriyor. Beş saniyelik bir yanıt, muayene sırasında pratik olabilir. Ancak NOHARM bulguları, en sık ciddi hatanın eksik öneri olduğunu hatırlatıyor. Hızlı yanıt, atlanan bir tetkiki fark etmeyi zorlaştırabilir.
Klinik kullanımda şu kontrol listesi işe yarayabilir:
- Yanıttaki kaynakları açın ve önerinin gerçekten o kaynakta yer alıp almadığını kontrol edin.
- Karmaşık, çok hastalıklı veya yan dal sorularında derin modu seçin; uzman görüşünü yine de atlamayın.
- Yanıtta neyin eksik olabileceğini ayrıca sorun, çünkü ihmal hataları en sık zarar türü.
- İlaç dozu ve etkileşimlerinde güncel prospektüsü ve ulusal kılavuzları esas alın.
- Hasta kimliğini belli eden bilgileri soru metnine yazmayın.
Türkiye'den bakınca
Duyuru, ücretsiz erişimi doğrulanmış klinisyenler üzerinden tanımlıyor. Türkiye'deki hekimlerin erişim koşulları bültende ayrıca belirtilmiyor. Ürünün Türkiye'de tıbbi cihaz olarak değerlendirildiğine dair bir bilgiye de ulaşamadık. Türkiye'de tıbbi cihaz otoritesi Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK).
Hasta verisi açısından tablo net. 6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli kişisel veri sayıyor. Yurt dışındaki bir hizmete hasta bilgisi girmek, kanunun yurt dışına aktarım kurallarını gündeme getirir. Bu nedenle soruları kimliksizleştirilmiş (kişiyi tanımlayan bilgilerden arındırılmış) biçimde sormak en güvenli yol.
Sık sorulan sorular
Darwin'in MedQA'da tam puan alması ne anlama geliyor?
Modelin sınav tarzı çoktan seçmeli soruları çok iyi yanıtladığını gösteriyor. Bu skor şirketin kendi açıklaması ve gerçek hastadaki klinik performansı ölçmüyor. Klinik değer için prospektif, sonlanım odaklı çalışmalar gerekiyor.
OpenEvidence kaynak uyduruyor mu?
Sistematik derleme, incelenen çalışmalarda uydurma kaynak sorununun belirgin olmadığını bildiriyor. Yine de doğru kaynağa dayanıp yanlış yorum yapılan örnekler görüldü. Bu yüzden kaynağı açıp okumak hâlâ gerekli.
Hangi modeli ne zaman kullanmalıyım?
Şirket kısa sorular için Osler'ı, kanıt tartılması gereken sorular için Sackett'ı konumluyor. Kapsamlı literatür incelemesi için Snow tasarlandı. Hangi model seçilirse seçilsin nihai karar ve sorumluluk hekimde kalıyor.
Kaynaklar
- OpenEvidence (2026) — Introducing the OpenEvidence Model Family (Business Wire basın bülteni): https://www.businesswire.com/news/home/20260903878517/en/Introducing-the-OpenEvidence-Model-Family
- Artsi Y, Sorin V, Glicksberg BS ve ark. (2026) — OpenEvidence Clinical Question-Answering Platform: Systematic Review of Early Evaluations (Research Square): https://www.researchsquare.com/article/rs-8896277/v1
- Jagarapu J, Babata K, Chamarthi S, Hoyt R (2025) — The accuracy and repeatability of OpenEvidence on complex medical subspecialty scenarios (medRxiv ön baskı): https://www.medrxiv.org/content/10.64898/2025.11.29.25341091v1.full
- NOHARM çalışma grubu (2025–2026) — First, do NOHARM (arXiv ön baskı, güncel sürüm): https://arxiv.org/abs/2512.01241
- T.C. Mevzuat Bilgi Sistemi — 6698 sayılı Kişisel Verilerin Korunması Kanunu: https://mevzuat.gov.tr/MevzuatMetin/1.5.6698.pdf
- MobiHealthNews (2026) — OpenEvidence launches 4 medical AI models for clinicians (haber kaynağı): https://www.mobihealthnews.com/news/openevidence-launches-4-medical-ai-models-clinicians
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
OpenEvidence hekimler için dört yapay zekâ modeli duyurdu. Şirketin skorları, bağımsız çalışmaların bulguları ve klinik kullanımda dikkat edilecekler.
