Robust Malware Detection Using Optimized Machine Learning and Hybrid Deep Learning Architectures with Semantic and Structural Fusion
Par : Monsieur Walid EL MOUHTADI
Le samedi 3 octobre 2026 à 10:00
Le Doyen de la Faculté des Sciences et Techniques de Béni Mellal porte à la connaissance du public que Monsieur Walid EL MOUHTADI, soutiendra une thèse de Doctorat intitulée : « Robust Malware Detection Using Optimized Machine Learning and Hybrid Deep Learning Architectures with Semantic and Structural Fusion».
La soutenance publique aura lieu le Samedi 3 Octobre 2026 à 10h00 à l'Ecole Nationale des Sciences Appliquées, Université Sultan Moulay Slimane, Khouribga, devant le jury composé de :
Monsieur MOUGHIT Mohamed : Professeur, Ecole Nationale Supérieur d'Arts et Métiers, Université Hassan II, Casablanca, Président ;
Monsieur SAADANE Rachid : Professeur, Ecole Hassania Travaux Publics, Casablanca, Rapporteur ;
Monsieur BADDI Youssef : Maître de Conférences Habilité, Ecole Supérieure de Technologies, Universié Chouaib Doukkali, Sidi Bennour, Rapporteur ;
Monsieur EL GHOLAMI Khalid : Maître de Conférences Habilité, Ecole Nationale des Sciences Appliquées, Université Sultan Moulay Slimane, Khouribga, Rapporteur ;
Monsieur KHOURDIFI Youness : Maître de Conférences Habilité, Faculté Polydisciplinaires, Université Sultan Moulay Slimane, Khouribga, Examinateur ;
Monsieur MOUNIR Soufyane : Professeur, Ecole Nationale des Sciences Appliquées, Université Sultan Moulay Slimane, Khouribga, Co-directeur de thèse ;
Monsieur MALEH Yassine : Maître de Conférences Habilité, Ecole Nationale des Sciences Appliquées, Université Sultan Moulay Slimane, Khouribga, Directeur de thèse .
Résumé:
L'évolution rapide des logiciels malveillants (malwares), alimentée par le polymorphisme, l'obfuscation et les techniques d'évasion adverses, met en évidence des limites critiques des systèmes de détection statique. Les approches actuelles présentent des défaillances à plusieurs niveaux : les modèles d'apprentissage automatique ne sont ni suffisamment adaptés ni optimisés pour les tâches de détection ; les architectures d'apprentissage profond restent fortement sensibles aux choix de conception et aux configurations des hyperparamètres ; les représentations fondées sur les opcodes, inspirées du traitement automatique du langage naturel, peinent à capturer des comportements sémantiques robustes face à l'obfuscation ; enfin, les architectures hybrides ne parviennent pas à intégrer de manière efficace et adaptative les informations sémantiques et structurelles. Il en résulte des systèmes instables, dont la capacité de généralisation et la robustesse demeurent limitées en conditions réelles.
Pour répondre à ce problème multiniveau, cette thèse propose un cadre progressif et unifié de détection qui améliore systématiquement les performances à travers quatre contributions complémentaires.
Premièrement, les algorithmes d'apprentissage automatique sont adaptés au contexte de la détection de logiciels malveillants par la sélection de caractéristiques, l'équilibrage des données et l'optimisation des hyperparamètres, ce qui améliore la stabilité et la capacité de généralisation.
Deuxièmement, les architectures neuronales, convolutives et récurrentes (ANN, CNN, RNN) sont optimisées par des stratégies avancées d'ajustement des hyperparamètres et d'affinement de l'architecture, améliorant l'exactitude et l'adaptabilité face aux menaces évolutives.
Troisièmement, une approche fondée sur le traitement automatique du langage naturel, appliquée aux séquences d'opcodes, est introduite afin d'enrichir la représentation sémantique et de mieux capturer les comportements des exécutables.
Quatrièmement, une architecture hybride adaptative est proposée, combinant une modélisation sémantique de type transformeur appliquée aux opcodes et des réseaux d'attention sur graphes (GAT) appliqués aux graphes de flot de contrôle. Un mécanisme de fusion contrôlée (gated fusion) y équilibre dynamiquement les informations sémantiques et structurelles, ce qui renforce nettement la robustesse face aux techniques d'obfuscation préservant la sémantique.
Des expérimentations approfondies, menées sur des jeux de données diversifiés et de grande taille, montrent que le cadre proposé surpasse systématiquement les approches de référence et les modèles unimodaux en exactitude, en robustesse et en généralisation entre jeux de données. L'intégration de mécanismes d'explicabilité permet en outre d'attribuer les décisions aux caractéristiques déterminantes, facilitant le triage des alertes et le déploiement au sein des centres opérationnels de sécurité (SOC).
Au total, ce travail propose un cadre unifié, adaptatif et orienté sécurité, qui comble le fossé entre les modèles d'apprentissage génériques et les exigences propres à la détection de logiciels malveillants, et contribue ainsi à l'avancement de l'état de l'art en détection statique.
Mots-clés : Détection de logiciels malveillants, Machine Learning, Deep Learning, réglage des hyperparamètres, analyse des opcodes, Graph, modèles de langage, fusion sémantique structurelle, obfuscation adversariale, intelligence artificielle explicable