30 Saniyede Özet
Penn State ve Mozilla.ai araştırmacıları, büyük dil modellerinin (LLM, metin üreten yapay zekâ) böbrek paylaşımı ikilemlerinde insanlardan farklı seçtiğini gösterdi. Modeller çoğu zaman tek bir özelliğe takıldı ve yazı tura seçeneğini insanlara göre çok seyrek kullandı. Çalışma ACM FAccT 2026 bildiri kitabında yayımlandı; senaryolar sentetik ve gerçek klinik kararı temsil etmiyor. Hekim için ana mesaj şu: etik yükü olan bir soruda modelin kendinden emin tonu, doğruluğun göstergesi değildir.
Ne oldu?
Pennsylvania Eyalet Üniversitesi (Penn State) 14 Eylül 2026'da bir araştırmayı duyurdu. Çalışma, Bilgisayar Makineleri Derneği'nin Adalet, Hesap Verebilirlik ve Şeffaflık Konferansı'nda (ACM FAccT) Haziran 2026'da sunuldu. Makale konferansın bildiri kitabında yer aldı (DOI: 10.1145/3805689.3806437). Bir ön baskı sürümü 2025'te arXiv'de paylaşılmıştı.
Ekibin başında Penn State'ten Hadi Hosseini var. Doktora öğrencisi Samarth Khanna, lisans öğrencisi Leona Pierce ve Mozilla.ai'den John Dickerson da yazarlar arasında. Çalışma ABD Ulusal Bilim Vakfı (NSF) tarafından desteklendi.
Araştırmacılar, daha önce insanlarla yapılmış iki böbrek paylaşımı çalışmasının verisini kullandı. Birinde 132 katılımcı, her biri 40 farklı paylaşım senaryosunu değerlendirmişti. Diğerinde 289 katılımcının ikili tercihleri vardı. Aynı ikilemler yapay zekâ modellerine de soruldu.
Kanıt ne kadar güçlü?
Senaryolarda iki hasta karşılaştırılıyor. Hastalar yaş, alkol kullanımı ve bakmakla yükümlü olunan kişi sayısı gibi özelliklerle tanımlanıyor. Katılımcı ve modellerden birini seçmeleri ya da yazı tura atılmasını tercih etmeleri isteniyor. Yazı tura seçeneği, kararsızlığı ölçmenin bir yolu olarak kullanılıyor.
Ön baskı sürümünde sekiz model test edildi. Bunlar arasında GPT-4o, Claude-3.5-Haiku, Gemini-1.5-Pro ve Gemini-2.0-Flash gibi ticari modeller var. DeepSeek-V3, DeepSeek-R1, Gemma3-27B ve Llama-3.3-70B gibi açık modeller de değerlendirildi. Yayımlanan sürümdeki model listesinin aynı olup olmadığını doğrulayamadık.
Bulgular üç başlıkta toplanıyor. Birincisi, tek bir özellik değiştiğinde modeller yaş ve alkol kullanımında çoğunluk insan tercihine uydu. Bakmakla yükümlü kişi sayısında ise sapma gösterdiler. Ancak özellikler karşı karşıya geldiğinde, insanlar yaşa daha çok ağırlık verirken tüm modeller düşük alkol kullanımını öne koydu.
İkincisi, modeller sıklıkla tek bir özelliğin baskın olduğu bir sıralama izledi. Yazarlar buna sözlük sırası benzeri (leksikografik) karar diyor; yani bir özellik öndeyse diğerleri hesaba katılmıyor. Örneğin DeepSeek'in iki sürümü, sağlık durumu ya da alkol kullanımından bağımsız olarak hep genç hastayı seçti.
Üçüncüsü, modeller kararsızlığı çok seyrek dile getirdi. En sık kararsız kalan model Claude-3.5-Haiku oldu, ama o da insan düzeyinin belirgin altında kaldı. Kararsızlık seçeneğinin farklı ifade edilmesi tabloyu pek değiştirmedi.
Ekip bir düzeltme yolu da denedi. Dört açık model, düşük dereceli uyarlama (LoRA, modelin küçük bir kısmını yeniden eğiten yöntem) ile 3.960 örnekle ince ayardan geçirildi. Doğrulukta yaklaşık 20 yüzde puana varan iyileşme bildirildi. Yine de ince ayarlı modeller, insanların kararsız kaldığı yanıtların yüzde 75'inden fazlasında kararsızlık göstermedi.
Sınırlılıklar net. Yazarlar senaryoların sentetik olduğunu ve sağlık profesyonellerinin gerçek kararlarına doğrudan karşılık gelmediğini belirtiyor. İnsan verisi hekimlerden ya da nakil kurullarından değil, araştırma katılımcılarından geliyor. Modeller hızla güncellendiği için bulgular bugünkü sürümlere birebir taşınamayabilir.
Hekim için ne anlama geliyor?
Çalışma, organ paylaşımında yapay zekâ kullanımını test etmiyor. Test ettiği şey, dil modellerinin etik açıdan belirsiz bir soruda insan değerlerini ne ölçüde yansıttığı. Bu soru, klinik etik danışmanlığı, triyaj ya da kısıtlı kaynak tartışmaları için de önemli.
Modelin akıcı ve kararlı bir yanıt vermesi, kararın doğru ya da adil olduğu anlamına gelmiyor. İyi bir etik akıl yürütme, çoğu zaman birden fazla değeri tartmayı ve belirsizliği açıkça söylemeyi gerektirir. Bu çalışmada modeller tam da bu iki noktada zayıf kaldı.
Bir sohbet robotunu etik bir tartışmada yardımcı olarak kullanıyorsanız şu adımlar işe yarayabilir.
Tek bir yanıt yerine, dikkate alınması gereken tüm etkenleri listelemesini isteyin.
Karşıt görüşü ve belirsizlik alanlarını ayrıca sorun.
Kararı kurumsal etik kurulunun ve mevzuatın çerçevesinde tutun.
Hasta verisini genel amaçlı sohbet araçlarına girmeyin.
Türkiye'den bakınca
Türkiye'de organ nakli hizmetleri, Sağlık Bakanlığı'nın Organ Nakli Hizmetleri Yönetmeliği ile düzenleniyor. Bu süreçte bir sohbet robotunun kullanıldığına dair bir bilgi yok. Çalışmanın buradaki değeri, kurumların yapay zekâ politikalarına etik açıdan hassas kararları ayrıca ele alma gerekçesi sunması.
Sağlık verisi Kişisel Verilerin Korunması Kanunu (KVKK) kapsamında özel nitelikli veri sayılıyor. Etik danışma sırasında hasta bilgisinin yurt dışındaki bir modele gönderilmesi, bu açıdan ayrıca değerlendirilmeli. Hastane etik kurulları, yapay zekâ destekli karar önerileri için bir kullanım ilkesi belirlemeyi düşünebilir.
Sık sorulan sorular
Bu çalışma yapay zekânın organ paylaşımında kullanıldığını mı gösteriyor?
Hayır. Çalışma, varsayımsal senaryolarda modellerin seçimlerini önceki insan verileriyle karşılaştırıyor. Gerçek bir nakil programında model kullanımı incelenmedi.
Modeller neden kararsız kalmıyor?
Makale nedenini kesin olarak açıklamıyor, davranışı tanımlıyor. Kararsızlık seçeneğinin farklı ifade edilmesi ve ince ayar, durumu yalnızca kısmen iyileştirdi. İnsanların kararsız kaldığı durumların çoğunda modeller yine bir taraf seçti.
Hekim etik tartışmada yapay zekâya hiç başvurmamalı mı?
Bu çalışma yasak için değil, dikkat için bir gerekçe sunuyor. Model, etkenleri hatırlatmada yardımcı olabilir. Ancak değer yargısı ve son karar insanda ve kurumsal süreçte kalmalı.
Kaynaklar
Hosseini H ve ekibi (2026) — Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values, ACM FAccT bildiri kitabı: https://dl.acm.org/doi/10.1145/3805689.3806437
arXiv ön baskı (2025) — Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values: https://arxiv.org/abs/2506.00079
arXiv ön baskı tam metin (2025) — HTML sürümü: https://arxiv.org/html/2506.00079v1
Penn State (2026) — Who gets the kidney? AI chatbots do not make the same moral choices humans do: https://www.psu.edu/news/information-sciences-and-technology/story/who-gets-kidney-ai-chatbots-do-not-make-same-moral
T.C. Sağlık Bakanlığı Doku, Organ Nakli ve Diyaliz Hizmetleri Daire Başkanlığı — Yönetmelikler: https://shgmorgandb.saglik.gov.tr/TR-78358/yonetmelikler.html
News-Medical (2026) — haber kaynağı, Study raises questions about AI's role in decision support for ethically sensitive situations: https://www.news-medical.net/news/20260915/Study-raises-questions-about-AIs-role-in-decision-support-for-ethically-sensitive-situations.aspx
Bu içerik bilgilendirme amaçlıdır ve bireysel tıbbi tavsiye yerine geçmez.
İlgili Yazılar
Bu konuyla ilgili Doktorclub'da ele aldığımız diğer hekim onaylı rehberler:
Penn State çalışması: dil modelleri sentetik böbrek paylaşımı senaryolarında insanlardan farklı öncelik veriyor ve kararsızlığı neredeyse hiç dile getirmiyor.
