DoktorClub
Hakkımızda
Kurumsal
Fırsatlar
Haberler
Kongreler
Akademi
LongeviTurk
Yapay Zeka Haber
İletişim
Oturum açDOKGPT'yi dene
DoktorClub
Sağlık Bilgisi.
Hekim Güveni.

Hasta Rehberleri

  • Belirti Rehberleri
  • Kadın Sağlığı
  • Ruh Sağlığı
  • Longevity
  • Acil & İlk Yardım
  • Tüm Sağlık Haberleri

Platform

  • DOKGPT
  • TUS Soru Bankası
  • Hesaplayıcılar
  • Akademi
  • Dijital Tıp Fakültesi

Topluluk

  • Hekim Ağı
  • Vaka Tartışmaları
  • Haberler
  • Yapay Zeka Haber
  • AI Sağlık Bültenleri
  • AI Sağlık Takipçisi
  • Kongreler
  • Doktorclub Awards
  • Akademi
  • Canlı Yayınlar

Kaynaklar

  • Dergiler
  • TUS Blog
  • Fırsatlar
  • Sıralama
  • VIP

Kurumsal

  • Hakkımızda
  • Kurumsal Çözümler
  • İletişim
  • Gizlilik & KVKK

Üyelik

  • Hekim Kaydı
  • Öğrenci Kaydı
  • Akademisyen Kaydı
  • Oturum Aç
DoktorClub© 2026 DoktorClub. Tüm hakları saklıdır.
InstagramLinkedIn
Ana Sayfa/AI Haberleri/FDA, yapay zekâ raporlarını dil modeli jürisiyle s...
Düzenleyici karar25 Eylül 20265 dk

FDA, yapay zekâ raporlarını dil modeli jürisiyle sınatıyor

ABD Gıda ve İlaç Dairesi (FDA), yapay zekânın yazdığı radyoloji raporlarını ölçmek için yeni bir yöntemi finanse ediyor. 1,29 milyon dolarlık sözleşmeyle Cognita Imaging, birkaç büyük dil modelini jüri gibi kullanıp yaklaşık 1 milyon tetkiki tarayacak.

FDA, yapay zekâ raporlarını dil modeli jürisiyle sınatıyor

30 Saniyede Özet

ABD Gıda ve İlaç Dairesi (FDA), yapay zekânın yazdığı radyoloji raporlarını ölçmek için yeni bir yöntemi finanse ediyor. 1,29 milyon dolarlık sözleşmeyle Cognita Imaging, birkaç büyük dil modelini jüri gibi kullanıp yaklaşık 1 milyon tetkiki tarayacak. Modellerin anlaşamadığı klinik açıdan önemli vakalar radyologlara gidecek. Bu bir ürün onayı değil; henüz sonuç da yok.

Ne oldu?

Cognita Imaging, 16 Eylül 2026'da FDA'dan 1,29 milyon dolarlık bir araştırma sözleşmesi aldığını duyurdu. Şirket, Radiology Partners'a bağlı Mosaic Clinical Technologies'in yan kuruluşu. ABD federal harcama kaydı USAspending de sözleşmeyi doğruluyor. Kayda göre tutar 1.294.042 dolar, süre 22 Haziran 2026 ile 21 Aralık 2027 arası.

Projenin konusu, tam radyoloji raporu üreten sistemlerin nasıl sınanacağı. Şirketin kurucu ortağına göre tek bir bulguyu işaretleyen araçları değerlendirmek görece kolay. Serbest metin rapor yazan bir modelin çıktısı ise yüzlerce olası bulguyu içerebiliyor.

MedTech Dive'a göre araçların çoğu okuyucu çalışmalarıyla, yani uzman radyolog panelleriyle sınanıyor. Bu yol, geniş çıktılı modellerde zor ve zaman alıcı.

Şirketin önerdiği yöntemin adı LLMs-as-a-jury, yani dil modeli jürisi. Burada tek bir büyük dil modeli (LLM, geniş metin verisiyle eğitilmiş yazı üreten model) not vermiyor. Birkaç modelin yargısı karşılaştırılıyor. Amaç, tek bir modelin eğilimlerine bağımlılığı azaltmak.

Çerçeve kurulduktan sonra ABD'deki geniş bir kohortta yaklaşık 1 milyon tetkike uygulanacak. Performans hasta grubu, bakım ortamı, görüntüleme cihazı ve hastalık türüne göre ayrı ayrı incelenecek. Küçük veri setlerinde iyi incelenemeyecek kadar seyrek bulgular da hedefte. Ekip ayrıca büyük veriden küçük doğrulama kohortları türetecek ve az vakalı bir çalışmada neyin kaçabileceğini ölçecek.

Klinik açıdan önemli uyuşmazlıkları radyologlar inceleyecek. Hatanın kaynağı yapay zekâ raporu mu, jüri mi, yoksa asıl radyolog raporu mu, bu ayrıştırılacak. FDA'ya yazılım kodu, jüri kurma rehberi, uyuşmazlık analizleri ve sınırlılık raporları teslim edilecek.

Kanıt ne kadar güçlü?

Şu an ortada bir bulgu yok; yalnızca bir çalışma planı var. Duyuruya göre sözleşme, FDA'nın herhangi bir Cognita ürününü onayladığı anlamına gelmiyor. MedTech Dive'ın haberine göre şirketin göğüs grafisi raporu yazan ayrı bir modeli, FDA'nın hızlandırılmış inceleme programında "çığır açan cihaz" statüsü almış. Bu model henüz piyasa izni almış değil.

Bu tablo bir çıkar sorusunu da beraberinde getiriyor. Rapor üreten yapay zekâ geliştiren bir şirket, aynı alanın ölçüm yöntemini de tasarlıyor. Radiology Partners ağının kendi açıklamasına göre 4.000'i aşkın radyolog yılda 55 milyondan fazla tetkik yorumluyor. Bu ölçek veri avantajı sağlıyor ama bağımsızlığı kendiliğinden garanti etmiyor.

Dil modelinin hakem olarak kullanılması yeni bir fikir değil. NeurIPS 2023'te yayımlanan bir çalışma, güçlü bir modelin insan tercihleriyle yüzde 80'i aşan uyum gösterebildiğini bildirdi. Aynı çalışma belirgin yanlılıkları da sıraladı. Model, önce gösterilen yanıtı, daha uzun yanıtı ve kendi ürettiği metni kayırabiliyordu.

Jüri fikri bu sorunun bir kısmına yanıt arıyor. 2024 tarihli bir ön baskı, farklı model ailelerinden küçük modellerin tek büyük hakemi geçebildiğini öne sürdü. Çalışma arXiv'de ön baskı olarak duruyor; hakemli yayın kaydına ulaşamadık. Ayrıca tıbbi raporlar üzerinde değil, genel dil görevlerinde yapıldı.

Asıl belirsizlik şu: Jüri üyeleri benzer verilerle eğitildiyse aynı hatayı birlikte yapabilir. Oy birliği o zaman doğruluk değil, ortak kör nokta anlamına gelir. Radyolog incelemesinin yalnızca uyuşmazlıklara ayrılması bu yüzden kritik bir tasarım tercihi. Jürinin hep birlikte yanıldığı vakaların nasıl yakalanacağı duyuruda açık değil.

Hekim için ne anlama geliyor?

FDA'nın bu sözleşmesi, üretken yapay zekâyı sınamak için küçük okuyucu çalışmalarının ötesinde yollar aradığını gösteriyor. Radyologlar için çıkarım şu: Rapor yazan bir aracı tek bir doğruluk yüzdesiyle değerlendirmek yetmez. Satın alma ya da pilot kararında şu sorular öne çıkıyor.

  • Model hangi cihazlarda, hangi hasta gruplarında ve kaç tetkikte sınandı?
  • Pnömotoraks ya da serbest hava gibi nadir ama kritik bulgular ayrı analiz edildi mi?
  • Otomatik değerlendirme yapıldıysa hakem model kimdi, radyologla uyumu nasıl ölçüldü?
  • Hakem modeller ile rapor modeli aynı şirketten ya da aynı model ailesinden mi?
  • Hatalı bir rapor imzalandıktan sonra bunu yakalayacak bir izleme planı var mı?

Türkiye'den bakınca

Planlanan çalışma ABD'deki İngilizce raporlar üzerinde yürüyecek. Türkçe rapor yazan bir model için ne jürinin ne de rapor modelinin başarısı kendiliğinden aktarılabilir. Türkçe tıbbi terminoloji ve yerel rapor alışkanlıkları ayrı bir doğrulama gerektirir.

Düzenleyici tarafta, AB yazılım rehberi MDCG 2019-11'in Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK) tarafından yayımlanan Türkçe çevirisi yol gösteriyor. Buna göre tanı kararlarına bilgi sağlayan yazılım en az Sınıf IIa sayılıyor. Taslak radyoloji raporu yazan bir araç da büyük olasılıkla bu gruba girer. Arşivini böyle bir doğrulamada kullanacak hastane de bir noktayı baştan hesaba katmalı: Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli sayıyor.

Sık sorulan sorular

FDA bir yapay zekâ ürününü onayladı mı?

Hayır. Bu, düzenleyici bilim alanında bir araştırma sözleşmesi. Şirketin duyurusu da sözleşmenin ürün onayı ya da desteği anlamına gelmediğini açıkça yazıyor.

Dil modeli jürisi radyoloğun yerini alacak mı?

Planlanan yapı bunun tersini öngörüyor. Jüri geniş taramayı yapacak, klinik açıdan önemli uyuşmazlıkları radyologlar çözecek. Yöntemin işe yarayıp yaramadığı ise henüz bilinmiyor.

Sonuçlar ne zaman belli olur?

Federal kayda göre sözleşme Aralık 2027'ye kadar sürüyor. Bulguların ne zaman ve hangi biçimde kamuya açılacağı duyuruda belirtilmemiş.

Kaynaklar

  • Cognita Imaging / Business Wire (2026) — Cognita Imaging Receives $1.29 Million FDA Contract to Test New Approach to Evaluating Generative AI in Radiology: https://www.businesswire.com/news/home/20260916329852/en/Cognita-Imaging-Receives-$1.29-Million-FDA-Contract-to-Test-New-Approach-to-Evaluating-Generative-AI-in-Radiology

  • USAspending.gov (2026) — Contract 75F40126C00035, Food and Drug Administration, Cognita Imaging Inc: https://www.usaspending.gov/award/CONT_AWD_75F40126C00035_7524_-NONE-_-NONE-/

  • MedTech Dive (2026) — Cognita Imaging wins FDA contract to test LLMs in evaluating radiology AI: https://www.medtechdive.com/news/cognita-imaging-wins-fda-contract-to-test-llms-in-evaluating-radiology-ai/830788/

  • Zheng L ve ark. (2023) — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (NeurIPS 2023): https://arxiv.org/abs/2306.05685

  • Verga P ve ark. (2024) — Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models (ön baskı): https://arxiv.org/abs/2404.18796

  • TİTCK — Tıbbi Cihaz mevzuatı sayfası: https://titck.gov.tr/faaliyetalanlari/tibbicihaz/52

  • TİTCK (2021) — MDCG 2019-11 Yazılımın Sınıflandırılması ve Kalifikasyonu Hakkında Rehber (Türkçe): https://titck.gov.tr/storage/Archive/2021/contentFile/42.%20MDCG%202019-11_tr_ad43182e-2d26-4adc-94d3-d7661f302c72.pdf

Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.


İlgili Yazılar

Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:

  • Not yazan yapay zekâya 440 milyon dolar: Kanıt yetişiyor mu?
  • NHS'te 104 salonda yapay zekâ: Kapasite iddiası sınanıyor
  • Epic'in yapay zekâ vakaları: %31 ve %32 neyi kanıtlıyor?
DoktorClub Görüşü

FDA, yapay zekânın yazdığı radyoloji raporlarını birkaç dil modelinden oluşan bir jüriyle denetleme yöntemine 1,29 milyon dolar ayırdı. Neyi çözer, neyi çözmez?

Paylaş:

Kanıt ve inceleme

  • Kanıt: Resmî kaynak
  • İnceleme durumu: Editör inceledi
  • Editör: DoktorClub Yayın Kurulu
  • Reviewer: Dr. Hamza Gemici

Kaynak rozetleri

Cognita Imaging / Business Wire (2026) — Cognita Imaging Receives $1.29 Million FDA Contract to Test New Approach to Evaluating Generative AI in Radiology:referenceUSAspending.gov (2026) — Contract 75F40126C00035, Food and Drug Administration, Cognita Imaging Inc:referenceMedTech Dive (2026) — Cognita Imaging wins FDA contract to test LLMs in evaluating radiology AI:referenceZheng L ve ark. (2023) — Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (NeurIPS 2023):referenceVerga P ve ark. (2024) — Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models (ön baskı):referenceTİTCK — Tıbbi Cihaz mevzuatı sayfası:referenceTİTCK (2021) — MDCG 2019-11 Yazılımın Sınıflandırılması ve Kalifikasyonu Hakkında Rehber (Türkçe):reference

İlgili içerikler

Ana akışa dön
Yapay zekâ tahmin modeli makalesi TRIPOD+AI ile nasıl okunur?

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

Firma klinik çalışma gösterdiğinde neye bakmalı? CONSORT-AI ve DECIDE-AI

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.

Düşük prevalanslı taramada iyi bir yapay zekâ neden çok yanlış alarm verir?

Kapak görseli yapay zekâ ile üretilmiş temsili bir editoryal görseldir; gerçek hasta veya tanısal görüntü değildir.