Explainable medical ai systems for visual and speech based medical diagnosis
Tarih
Yazarlar
Dergi Başlığı
Dergi ISSN
Cilt Başlığı
Yayıncı
Erişim Hakkı
Özet
Tıbbi tanı süreçlerinde yapay zekâ (AI) sistemleri giderek daha karmaşık veri kaynaklarına ve derin öğrenme modellerine dayanmaktadır; ancak klinik kullanım açısından yalnızca yüksek sınıflandırma doğruluğu yeterli değildir. Gerçek sağlık hizmeti ortamlarında, tanı çıktılarının yorumlanabilir, kanıta dayalı ve klinisyenlerin ile hastaların olasılıksal bilgiyi değerlendirme biçimleriyle uyumlu olması gerekmektedir. Bu çalışma, farklı tıbbi görüntüleme ve konuşma temelli tanı senaryolarında sınıflandırma performansı, açıklama kalitesi ve kullanıcı odaklı güvenilirliğin birlikte nasıl değerlendirilebileceğini incelemektedir. Fundus görüntülerinden çok etiketli retinal hastalık sınıflandırması, birden fazla patolojinin eşzamanlı olarak gözlemlenebildiği görsel bir tanı problemi olarak ele alınmaktadır. Bu bağlamda, derin öğrenme tabanlı bir sınıflandırma çerçevesi, klinik yorumlanabilirliği desteklemek amacıyla retrieval-augmented açıklama mekanizmalarıyla birleştirilmiştir. Bu senaryoda, tanısal belirsizliğin açık biçimde modellenmesinden ziyade, model çıktılarının ilgili tıbbi literatür ile ilişkilendirilerek bağlamsallaştırılmasına odaklanılmıştır. Geliştirilen yaklaşım, otomatik tahminleri klinik kanıtlarla ilişkilendirerek şeffaflığı artırmakta ve daha bilinçli klinik yorumlamayı desteklemektedir. Yarık dudak ve damak (CL/P) tanısı ise, yüksek değişkenlik, zamansal dinamikler ve modaliteye özgü gürültü içeren tamamlayıcı bir tanı senaryosu olarak; ultrason dil görüntüleme (UTI) ve konuşma ses verileri üzerinden incelenmektedir. Bu zorlukları ele almak amacıyla, çoklu modaliteye dayalı bir sınıflandırma çerçevesi müfredat öğrenmesi ve belirsizlik farkındalıklı retrieval-augmented generation (RAG) ile bütünleştirilmiştir. Sınıflandırma çıktıları, olasılık ağırlıklı retrieval mekanizmaları aracılığıyla açıklama sürecine doğrudan entegre edilerek, üretilen açıklamaların tek bir deterministik sonuca bağlı kalmak yerine birden fazla olası tanı hipotezini yansıtması sağlanmıştır. Bulgular birlikte değerlendirildiğinde, tıbbi yapay zekâ sistemlerinde açıklanabilirlik ve güvenilirliğin, ele alınan tanı görevinin ve kullanılan veri türünün özelliklerine göre uyarlanması gerektiği görülmektedir. Fundus görüntüleme gibi görece kararlı görsel alanlarda, destekleyici kanıtlara dayalı açıklamalar yorumlanabilirliği artırmak için çoğu zaman yeterliyken; CL/P tanısı gibi daha karmaşık ve heterojen çok modlu ortamlarda belirsizliğin açık biçimde fark edilmesi ve iletilmesi temel bir gereklilik hâline gelmektedir. Bu nedenle, önerilen sistemler tam otonom tanı sistemleri olarak değil, klinisyenleri ve hastaları desteklemeyi amaçlayan klinik karar destek araçları olarak tasarlanmıştır ve profesyonel tıbbi yargının yerini almayı hedeflemez. Sınıflandırma ve açıklama süreçlerinin birbirinden bağımsız değil, sıkı biçimde ilişkili olarak ele alınması ise, daha şeffaf, daha temkinli çıktılar üreten ve klinik akıl yürütme pratikleriyle daha iyi uyumlu yapay zekâ tabanlı karar destek sistemlerinin geliştirilmesini mümkün kılmaktadır.
Artificial intelligence (AI) systems in medical diagnosis increasingly rely on complex data sources and deep learning models; however, high classification accuracy alone is insufficient for clinical adoption without reliable explanations and appropriate handling of uncertainty. In real-world healthcare settings, diagnostic outputs must be interpretable, evidence-grounded, and aligned with how clinicians and patients reason about probabilistic information. This work investigates how classification performance, explanation quality, and user-oriented reliability can be evaluated jointly across different medical imaging and speech-based diagnostic scenarios. Multi-label retinal disease classification from fundus images is examined as a visual diagnostic task in which visual patterns may correspond to multiple coexisting pathologies. A deep learning based classification framework is combined with retrieval-augmented explanation mechanisms to support clinical interpretability. In this setting, the emphasis is placed on generating literature-grounded explanations that contextualize model predictions, rather than explicitly modeling diagnostic uncertainty. The resulting framework improves transparency by linking automated predictions to relevant medical evidence, facilitating more informed clinical interpretation. Cleft lip and palate (CL/P) diagnosis using ultrasound tongue imaging (UTI) and speech audio is investigated as a complementary diagnostic scenario characterized by high variability, temporal dynamics, and modality-specific noise. To address these challenges, a multimodal classification framework is integrated with curriculum learning and uncertainty-aware retrieval-augmented generation (RAG). Classification outputs are explicitly incorporated into the explanation process through probability weighted retrieval, allowing generated explanations to reflect multiple plausible diagnostic hypotheses instead of a single deterministic outcome. When considered together, these findings show that explainability and reliability in medical AI systems should be tailored to the specific diagnostic task and the type of data being used. In relatively stable visual domains such as fundus imaging, explanations grounded in supporting evidence are often sufficient to improve interpretability. In contrast, in more complex and heterogeneous multimodal settings such as CL/P diagnosis, explicit awareness and communication of uncertainty become essential. For this reason, the proposed systems are designed as clinical decision-support tools rather than fully autonomous diagnostic systems, with the goal of supporting clinicians and patients without replacing professional medical judgment. By treating classification and explanation as closely connected processes, the resulting AI systems become more transparent, more cautious in their outputs, and better aligned with clinical reasoning practices.








