Yapay Zeka Haber
ChatGPT sohbetlerinde ruh sağlığı payı: %0,21 mi, %4,9 mu?

Haberi paylaş
İlgilenecek birine ulaştırın.
30 saniyede özet
Sohbet botlarıyla yapılan konuşmaların ne kadarı ruh sağlığıyla ilgili? Yanıt, kullanılan tanıma göre yaklaşık 23 kat değişiyor. JAMA Network Open'da 24 Ağustos 2026'da yayımlanan analiz, halka açık 620.699 ChatGPT sohbetinde dar tanımla %0,21, geniş tanımla %4,90 oran buldu. Yazarlar, yaygınlık rakamlarını okurken önce tanımın sorulması gerektiğini vurguluyor.
Ne oldu?
RAND ve Harvard Tıp Fakültesi'nden Ryan McBain ve ekibi, JAMA Network Open'da kısa bir kesitsel analiz yayımladı. Çıkış noktası, kamuoyuna yansıyan tahminlerin birbirinden çok uzak olmasıydı.
Makalede aktarılan iki örnek bu farkı gösteriyor. OpenAI, belirli bir haftadaki mesajların %0,01'inde psikoz ya da maniyle ilişkili olası acil durum işaretleri gördüğünü açıklamıştı. Common Sense Media ise gençlerin %72'sinin yapay zekâ sohbet botlarını "yoldaş" (companion) olarak kullanmış olduğunu bildirmişti.
Yazarlara göre bu rakamlar aynı şeyi ölçmüyor olabilir. Ekip bu nedenle aynı veri setine iki farklı tanım uyguladı.
Veri kaynağı, insan–sohbet botu konuşmalarından oluşan halka açık WildChat-4.8M koleksiyonuydu. Sohbetler, büyük dil modeline (LLM; metin üreten yapay zekâ modeli) dayalı bir sınıflandırıcıyla dört alanda puanlandı. Bu alanlar konunun merkezîliği, yardım arama niyeti, klinik dil kullanımı ve duygusal risk düzeyiydi.
Kanıt ne kadar güçlü?
Tasarım kesitsel ve tanımlayıcı. Dar tanım, gerçek bir kişinin psikolojik bir sorun için açıkça yardım istemesini şart koşuyordu. Geniş tanım ise ruh sağlığı konusunun sohbette herhangi bir düzeyde yer almasını yeterli sayıyordu.
Dar tanımla 1.317 sohbet (%0,21; %95 GA %0,20–0,22) ruh sağlığıyla ilgili bulundu. Geniş tanımla bu sayı 30.394'e (%4,90; %95 GA %4,84–4,95) çıktı. Geniş tanıma giren sohbetler, dar tanımın gerçek kişi odağı ve açık yardım talebi şartlarını daha sık karşılamıyordu.
Sınıflandırıcı, rastgele seçilen 370 sohbette insan değerlendiricilerle karşılaştırıldı. Duyarlılık %87, özgüllük %95 idi. Pozitif kestirim değeri ise %67'de kaldı.
Bu son değer önemli. Sınıflandırıcının "ruh sağlığı" dediği her üç sohbetten biri insan gözünde öyle değildi. İki insan değerlendirici arasındaki uyum da orta düzeydeydi (kappa 0,65).
Yazarlar birkaç sınırlılığı açıkça yazıyor. Veri tek bir halka açık koleksiyondan geliyor ve dış doğrulama yapılmadı. Otomatik etiketleme, belirsiz sıkıntı ifadelerini yanlış sınıflayabilir. Önerilen sınıflama ile izlemenin toplum sağlığını iyileştirip iyileştirmediği de sınanmadı.
Bir düzeltme de yapmak gerekiyor. PubMed'deki kısa özet çalışmayı ergenlerle ilişkilendiriyor, ancak tam metinde yaşa göre bir analiz yok. Bu nedenle bulgular ergenlere özgü bir yaygınlık tahmini değil.
Çalışma ABD Ulusal Ruh Sağlığı Enstitüsü (NIMH) tarafından desteklendi. Yazarların beyan ettiği çıkar ilişkileri çalışma dışı hibe ve ücretlerle sınırlı.
Hekim için ne anlama geliyor?
Bir haberde "sohbet botu kullanıcılarının yüzde X'i ruh sağlığı desteği arıyor" ifadesini gördüğünüzde önce tanımı sorun. Kriz sinyali, klinik yardım arayışı ve genel duygusal sohbet aynı şey değil. Yazarlara göre bu ayrım pratik bir sonuç doğuruyor. Bakım yükümlülüğü ve güvenlik testlerinin eşiği, bir konuşmanın ruh sağlığı sayılıp sayılmamasına bağlı.
Yazarlar bu yüzden araştırmacıların, klinisyenlerin ve düzenleyicilerin ortak dili olabilecek üç katmanlı bir sınıflama öneriyor. Birinci katman kriz ya da yüksek risk taşıyan sohbetler. Bunlar güvenilir tespit ve yönlendirme gerektiriyor.
İkinci katman klinik çerçevede yardım arayan sohbetler. Burada doğruluk, uygunluk ve sevk davranışı değerlendirilmeli. Üçüncü katman geniş duygusal ve ilişkisel sohbetler. Bu grupta duygusal bağımlılık ve gelişim dönemine uygunluk öne çıkıyor.
Klinikte şu sorular yol gösterebilir:
- Hasta sohbet botunu bilgi almak için mi, yoksa duygusal destek için mi kullanıyor?
- Botun verdiği öneriler tedavi planıyla çelişiyor mu?
- Kullanım süresi ve sıklığı son dönemde arttı mı?
- Kriz anında 112'yi ve tedavi ekibini arayabileceğini biliyor mu?
Türkiye'den bakınca
Çalışmadaki veri seti Türkiye'ye özgü değil ve dil kırılımı raporlanmadı. Türkiye'de ruh sağlığı amaçlı sohbet botu kullanımına dair bu çalışmadan bir oran çıkarmak doğru olmaz. Yine de Türkçe sohbetlerde yapılacak bir araştırma, aynı üç katmanlı tanım çerçevesini kullanarak karşılaştırılabilir sonuçlar üretebilir.
Böyle bir araştırma, gerçek kişilerin sohbet içeriğini işleyeceği için baştan planlama ister. Sohbetlerde geçen ruh sağlığı ayrıntıları, Kişisel Verilerin Korunması Kanunu (KVKK) kapsamında özel nitelikli sağlık verisi sayılabilir. Anonimleştirme ve etik kurul onayı bu yüzden tasarımın parçası olmalı. Kendine zarar verme düşüncesi ya da akut kriz varsa kişi 112 Acil Çağrı Merkezi'ne yönlendirilmeli.
Sık sorulan sorular
Hangi oran doğru, %0,21 mi yoksa %4,90 mı?
İkisi de doğru, ama farklı soruları yanıtlıyor. Dar tanım açık yardım arayışını, geniş tanım konunun sohbette geçmesini ölçüyor.
Bu çalışma sohbet botlarının güvenli olup olmadığını söylüyor mu?
Hayır. Çalışma yalnızca ne sıklıkla ruh sağlığı konuşulduğunu ölçtü. Botların yanıtlarının kalitesi ya da güvenliği değerlendirilmedi.
Bulgular gençler için geçerli mi?
Tam metinde yaş bilgisine dayalı bir analiz yok. Gençlere ilişkin sonuç çıkarmak için ayrı çalışmalar gerekiyor.
Kaynaklar
- McBain RK, Zhang LA, Burnett A, Cantor JH, Yu H (2026) — Prevalence of Mental Health Discussions in Publicly Available Generative AI Conversations, JAMA Network Open doi.org (yeni pencerede açılır)
- PubMed Central (2026) — Açık erişimli tam metin, PMC13504430 pmc.ncbi.nlm.nih.gov (yeni pencerede açılır)
- PubMed (2026) — Makale kaydı, PMID 42635990 pubmed.ncbi.nlm.nih.gov (yeni pencerede açılır)
- Allen Institute for AI — WildChat-4.8M veri seti sayfası huggingface.co (yeni pencerede açılır)
- Kişisel Verileri Koruma Kurumu — Personal Data Protection Law (6698 sayılı Kanun) kvkk.gov.tr (yeni pencerede açılır)
- Yazan
- DoktorClub Yayın Kurulu
- Tıbbi gözetim
- Dr. Hamza Gemici
- Güncelleme
- 25 Eylül 2026
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez. Bir hata mı gördünüz? Bize bildirin · Yayın ilkelerimiz · Tıbbi inceleme politikası


