OpenAI, GPT-6 Astra modelini sağlık ve siber güvenlik iddialarıyla duyurdu. Şirket skorları, bağımsız kanıt eksikliği ve hekim için pratik öneriler.
OpenAI, eylül başında GPT-6 Astra adlı yeni yapay zekâ modelini duyurdu ve sağlık ölçütlerinde önceki modelleri geçtiğini açıkladı. Sağlık skoru, şirketin kendi geliştirdiği ve kendi modeliyle puanladığı bir ölçüte…
Haberi paylaş
İlgilenecek birine ulaştırın.

OpenAI, GPT-6 Astra modelini sağlık ve siber güvenlik iddialarıyla duyurdu. Şirket skorları, bağımsız kanıt eksikliği ve hekim için pratik öneriler.
OpenAI, eylül başında GPT-6 Astra adlı yeni yapay zekâ modelini duyurdu ve sağlık ölçütlerinde önceki modelleri geçtiğini açıkladı. Sağlık skoru, şirketin kendi geliştirdiği ve kendi modeliyle puanladığı bir ölçüte dayanıyor. Aynı skor, şirketin iki resmi sayfasında farklı değerlerle yer alıyor. Bağımsız bir klinik değerlendirme henüz yok; hasta verisi ve doğrulama konusunda temkin sürmeli.
OpenAI'ın model için hazırladığı sistem kartı (modelin yetenek, risk ve güvenlik testlerini özetleyen teknik belge) 3 Eylül 2026 tarihini taşıyor. Duyuruya göre Astra önce sınırlı sayıda kuruma açıldı. Ardından ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarına yayılacağı bildirildi. Model ayrıca OpenAI API, Microsoft Azure ve AWS Bedrock üzerinden sunuluyor.
Duyuru sayfasındaki tabloda sağlık için tek bir ölçüt öne çıkıyor. HealthBench Professional'da (uzunluk düzeltmeli) Astra'ya 63,4 puan veriliyor. Aynı tabloda önceki GPT-5.6 Sol 60,5, Anthropic'in Claude Fable 5.1 modeli 58,1 puanda gösteriliyor. Google'ın Gemini 3.8 Flash modeli 52,1 puanla listede.
Sayfadaki dipnota göre Claude modellerinin skorlarını da OpenAI kendisi ölçtü. Yani tablodaki karşılaştırma tek bir şirketin ölçümüne dayanıyor.
Siber güvenlik tarafında şirket daha çarpıcı bir tespit yapıyor. Sistem kartına göre Astra, OpenAI'ın risk hazırlık çerçevesinde siber güvenlikte en üst eşik olan kritik düzeye ulaşan ilk model. Biyolojik ve kimyasal alanda ise model yüksek yetenek eşiğinde ele alınıyor. Şirket bu nedenle ek kısıtlamalar ve izleme sistemleri devreye aldığını belirtiyor.
HealthBench Professional, OpenAI araştırmacılarının Nisan 2026'da arXiv'de paylaştığı bir ön baskıda (hakem değerlendirmesinden geçmemiş makale) tanımlandı. Ölçüt, ChatGPT for Clinicians geliştirilirken hekimlerin sistemi sınadığı sohbetlerden seçilen 525 görevden oluşuyor. Görevlerin yaklaşık üçte biri hata bulmak için bilinçli zorlama (red teaming) amacıyla yazıldı.
Görevler konsültasyon, belgeleme ve tıbbi araştırma başlıklarına ayrılıyor. Her görev hekimlerin yazdığı puanlama ölçütleriyle değerlendiriliyor.
Burada üç sınırlılık öne çıkıyor. Birincisi, puanlamayı hekimler değil, OpenAI'ın kendi dil modeli yapıyor. İkincisi, seçimde OpenAI modellerini zorlayan örneklerin payı yaklaşık 3,5 kat artırıldı. Üçüncüsü, ölçütü geliştiren şirket ile sonucu duyuran şirket aynı.
Sistem kartında ilginç bir ayrıntı daha var. Kart, 22 Eylül'de bir yapılandırma hatasının düzeltildiği notuyla güncellenmiş ve Astra'nın HealthBench Professional skorunu 64,7 olarak veriyor. Duyuru sayfasındaki 63,4 ile arada fark bulunuyor. Aynı kartta HealthBench Hard skoru 36,6, önceki modelde 33,1; HealthBench Consensus ise iki modelde de 95,5.
Kart, 2025'te yayımlanan asıl HealthBench'in öncü modeller için gürültü tavanına yaklaştığını da kabul ediyor. Yani modeller arasındaki birkaç puanlık fark, klinikte anlamlı bir fark olduğu anlamına gelmeyebilir. Güvenlik tarafında İngiltere Yapay Zekâ Güvenlik Enstitüsü (UK AISI) ve Apollo Research gibi dış ekipler test yaptı. Ancak bu testler klinik doğruluğu değil, hizalama ve kötüye kullanım risklerini ölçüyor.
Genel amaçlı bir modelin sağlık skorundaki artış, ürünün klinik karar desteğine hazır olduğu anlamına gelmiyor. Skorlar şirket ölçümü; hasta sonuçlarına dair prospektif bir çalışma yok. Pratik açıdan şu adımlar önemli:
İstem enjeksiyonu konusunda sistem kartı bir iyileşme bildiriyor. Gray Swan adlı dış ekibin 1.810 saldırılık setinde başarı oranı Astra'da yüzde 8,5, önceki modelde yüzde 27,0 olarak ölçüldü. Oran düşse de sıfır değil.
Astra genel amaçlı bir model ve tıbbi cihaz olarak ruhsatlandırıldığına dair bir bilgi yok. Türkiye'de tıbbi cihaz otoritesi Türkiye İlaç ve Tıbbi Cihaz Kurumu (TİTCK). Klinik kararda kullanılan bir çıktının sorumluluğu bu nedenle hekimde kalıyor.
6698 sayılı Kişisel Verilerin Korunması Kanunu (KVKK), sağlık verisini özel nitelikli kişisel veri sayıyor. Kanun, verinin yurt dışına aktarılmasını da ayrı şartlara bağlıyor. Yurt dışında işlenen bir sohbet hizmetine hasta bilgisi girmeden önce kurumunuzun hukuki değerlendirmesini almak gerekir.
Hayır, genel amaçlı bir model. Sağlık ölçütlerindeki skoru duyuruda öne çıkarılıyor, ancak tıbbi kullanım için ayrı bir ruhsat bilgisi yok. Klinik kullanımda yardımcı araç olarak ele alınmalı.
Duyuru sayfası 63,4, sistem kartı ise 22 Eylül düzeltmesinden sonra 64,7 değerini veriyor. Kart farkı bir yapılandırma hatasının düzeltilmesine bağlıyor. Bu durum, şirket skorlarının bağımsız tekrar olmadan kesin kabul edilmemesi gerektiğini gösteriyor.
Kişisel hesaplarda tanımlayıcı hasta bilgisi girmek KVKK açısından ciddi risk taşır. Soruyu kimliksizleştirerek (kişiyi tanımlayan bilgilerden arındırarak) sormak daha güvenli. Kurumsal kullanımda sözleşme ve veri işleme koşulları önceden netleşmeli.
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler: