Uzman Karışımı Füzyonu ile Öz-Denetimli Ses Temsilleri Kullanarak Derin Sahte Ses Tespiti
Karadeniz Fen Bilimleri Dergisi, cilt.16, sa.2, ss.514-526, 2026 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 16 Sayı: 2
- Basım Tarihi: 2026
- Doi Numarası: 10.31466/kfbd.1828944
- Dergi Adı: Karadeniz Fen Bilimleri Dergisi
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.514-526
- Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
- Karadeniz Teknik Üniversitesi Adresli: Evet
Özet
Derin sahte ses manipülasyonları, gerçek insan seslerini neredeyse ayırt edilemeyecek kadar yüksek bir doğrulukla taklit edebilir; bu da ciddi güvenlik açıkları oluşturur, medyanın güvenilirliğini zedeler ve dijital kimlik doğrulama sistemlerinin güvenilirliğini tehdit eder. Bu çalışma, derin sahte ses örneklerini tespit etmek için Öz Denetimli Öğrenme (Self Supervised Learning, SSL) modellerinden elde edilen ses gösterimlerinin ve dikkat mekanizmalarına sahip NeXt-TDNN (NeXt Time Delay Neural Network) mimarisi ile sınıflandırılmasına dayalı sağlam bir tespit çerçevesi önermektedir. Önerilen yaklaşımda, girdi konuşma sinyallerinden ses özellikleri, HuBERT-Large ve WavLM-Large olarak isimlendirilen ön eğitimli SSL modelleri kullanılarak çıkarılmaktadır. Çıkarılan iki ayrı özellik bilgisinin birleştirilmesi amacı ile Uzman Karışımı (Mixture of Experts, MoE) mekanizması kullanılmıştır. MoE, farklı uzman ağlarının çıktılarının dinamik olarak ağırlıklandırılmasıyla birden fazla özelliğin daha etkili ve esnek bir şekilde birleştirilmesini sağlar. Bu yaklaşım, modelin hesaplama karmaşıklığını optimize ederken kanal ve zamansal boyutlarda daha ayrıntılı ve güvenilir bir gösterim öğrenimine imkân tanımaktadır. MoE tabanlı füzyon, özellikle heterojen ve yüksek boyutlu ses özelliklerini birleştirmede uzmanlaşmış alt modeller aracılığıyla derin sahte örnekleri ayırt etmede üstün performans sergilemektedir. Ayrıca MoE mimarisi, modelin genelleme yeteneğini artırarak farklı saldırı türlerine karşı daha sağlam ve ölçeklenebilir bir derin sahte ses tespit sistemi ortaya çıkarmaktadır. Bu bağlamda, MoE tabanlı özellik füzyonuna sahip önerilen tespit yöntemi, derin sahte ses tespitinde önemli avantajlar sunmaktadır. Deneysel sonuçlara göre önerilen yaklaşım ASVspoof 2019 LA veri kümesinde %0,34 EER ve 0,01 min t-DCF değerlerine ulaşmıştır.
Deepfake audio manipulation can imitate real human voices with extremely high accuracy—often making them nearly indistinguishable from authentic speech. This poses serious security vulnerabilities, undermines the credibility of media, and threatens the reliability of digital identity verification systems. This study proposes a robust detection framework for identifying deepfake voice samples, based on audio representations obtained from Self-Supervised Learning (SSL) models and classification using the Next-TDNN (NeXt Time Delay Neural Network) architecture equipped with attention mechanisms. In the proposed approach, audio features are extracted from input speech signals using pre-trained SSL models, specifically HuBERT-Large and WavLM-Large. To combine the two distinct sets of extracted features, a Mixture of Experts (MoE) mechanism is employed. MoE enables more effective and flexible fusion of multiple features by dynamically weighting the outputs of different expert networks. This approach optimizes computational complexity while enabling more detailed and reliable representation learning across channel and temporal dimensions. MoE-based fusion demonstrates superior performance in distinguishing deepfake samples, particularly through sub-models specialized in merging heterogeneous and high-dimensional audio features. Furthermore, the MoE architecture enhances the model’s generalization capability, resulting in a more robust and scalable deepfake voice detection system against various types of attacks. In this context, the proposed detection method featuring MoE-based feature fusion offers significant advantages in deepfake voice detection. Experimental results show that the proposed approach achieves a 0.34% EER and a 0.01 min t-DCF on the ASVspoof 2019 LA dataset.