Khaf, Sadia (2026). Reinforcement learning-driven adaptive spectrum utilization in cognitive B5G networks. Thèse de doctorat électronique, Montréal, École de technologie supérieure.
Prévisualisation |
PDF
Télécharger (2MB) | Prévisualisation |
Résumé
In recent years, the growth of wireless services and connected devices increased the demand for radio spectrum. Static spectrum allocation could not fully address this demand, because licensed bands may remain underused across time and location. Cognitive radio networks (CRNs) allowed secondary users (SUs) to access available spectrum while preserving primary user (PU) priority. In these networks, efficient spectrum use required reliable sensing, effective access decisions, infrastructure-side coordination, resilience, and trust management.
Accordingly, in the research reported in the present thesis, we improved spectrum utilization by addressing cooperative spectrum sensing, SU-side spectrum access, and coordination between spectrum-consuming and spectrum-granting nodes. These tasks involved sequential decisions under uncertainty and coupled interactions across users and network tiers. Therefore, we used reinforcement learning to support adaptive sensing, access, and coordination decisions.
First, we developed Partially Cooperative Multi-Agent Reinforcement Learning (PCMARL) for cooperative spectrum sensing in cognitive radio Internet-of-Things networks under spectrum sensing data falsification attacks. PCMARL allowed SUs to selectively cooperate and improved sensing reliability and energy efficiency without full network cooperation.
Second, we extended SU-side optimization from sensing to joint sensing and access. The proposed IMPACT framework optimized sensing participation, cooperation, channel selection, and transmission power under imperfect channel state information. Since access control required both discrete decisions and continuous power control, we introduced a hybrid-action learning formulation for cooperative spectrum access.
Third, we added the spectrum granting and coordination side of the network. The proposed Federated Hierarchical Reinforcement Learning (F-HRL) framework coordinated SUs, next generation Node Bs, uncrewed aerial vehicles, and high-altitude platform stations. This architecture supported grant allocation, PU priority, trust-aware scheduling, privacy-preserving federation, and service continuity during infrastructure disruption.
The results revealed that improved spectrum utilization required SU-side sensing and access optimization together with granting side coordination, infrastructure resilience, federated aggregation, and trust-aware control. Overall, in this research, we developed an integrated learning-based framework for resilient spectrum management in future wireless networks.
Titre traduit
Utilisation adaptative du spectre guidée par l’apprentissage par renforcement dans les réseaux B5G cognitifs
Résumé traduit
La croissance des services sans fil et des appareils connectés a accru la demande en spectre radio. L’allocation statique du spectre ne pouvait pas répondre pleinement à cette demande, car les bandes licenciées peuvent demeurer sous-utilisées selon le lieu et le moment. Les réseaux radio cognitifs (CRN) ont permis aux utilisateurs secondaires (SU) d’accéder au spectre disponible tout en préservant la priorité des utilisateurs primaires (PU). Une utilisation efficace du spectre dans ces réseaux exigeait une détection fiable, des décisions d’accès efficaces, une coordination du côté infrastructure, de la résilience et une gestion de la confiance.
Dans ces travaux, nous avons amélioré l’utilisation du spectre en abordant la détection coopérative du spectre, l’accès au spectre du côté SU et la coordination entre les nœuds qui consomment le spectre et ceux qui l’allouent. Ces tâches impliquaient des décisions séquentielles sous incertitude et des interactions couplées entre utilisateurs et niveaux du réseau. Nous avons donc utilisé l’apprentissage par renforcement pour soutenir des décisions adaptatives de détection, d’accès et de coordination.
Premièrement, nous avons développé l’apprentissage par renforcement multi-agent partiellement coopératif (PCMARL) pour la détection coopérative du spectre dans les réseaux radio cognitifs de l’Internet des objets soumis à des attaques de falsification des données de détection du spectre. PCMARL a permis aux SU de coopérer de manière sélective et a amélioré la fiabilité de la détection et l’efficacité énergétique sans coopération complète de tout le réseau.
Deuxièmement, nous avons étendu l’optimisation du côté SU de la détection vers la détection et l’accès conjoints. Le cadre IMPACT a optimisé la participation à la détection, la coopération, la sélection des canaux et la puissance de transmission sous information imparfaite sur l’état du canal. Comme le contrôle d’accès exigeait à la fois des décisions discrètes et un contrôle continu de la puissance, nous avons introduit une formulation d’apprentissage à actions hybrides pour l’accès coopératif au spectre.
Troisièmement, nous avons ajouté le côté allocation et coordination du réseau. Le cadre d’apprentissage par renforcement hiérarchique fédéré (F-HRL) a coordonné les SU, les stations de base de nouvelle génération, les véhicules aériens sans pilote et les stations à plateformes de haute altitude. Cette architecture a soutenu l’allocation des accès, la priorité des PU, l’ordonnancement tenant compte de la confiance, la fédération préservant la confidentialité et la continuité du service lors de perturbations de l’infrastructure.
Dans l’ensemble, les résultats ont montré que l’amélioration de l’utilisation du spectre exigeait l’optimisation de la détection et de l’accès du côté SU, ainsi que la coordination du côté allocation, la résilience de l’infrastructure, l’agrégation fédérée et le contrôle tenant compte de la confiance. Ces travaux ont développé un cadre intégré fondé sur l’apprentissage pour une gestion résiliente du spectre dans les futurs réseaux sans fil.
| Type de document: | Mémoire ou thèse (Thèse de doctorat électronique) |
|---|---|
| Renseignements supplémentaires: | "Manuscript-based thesis presented to École de technologie supérieure in partial fulfillment for the degree of Doctor of Philosophy". Comprend des références bibliographiques (pages 127-139). |
| Mots-clés libres: | radio cognitive, apprentissage par renforcement, gestion du spectre, apprentissage fédéré, résilience |
| Directeur de mémoire/thèse: | Directeur(-trice) Kaddoum, Georges |
| Programme: | Doctorat en génie > Génie |
| Date de dépôt: | 24 juill. 2026 14:52 |
| Dernière modification: | 24 juill. 2026 14:52 |
| URI: | https://espace.etsmtl.ca/id/eprint/4024 |
Gestion Actions (Identification requise)
![]() |
Dernière vérification avant le dépôt |

Statistiques de téléchargement
Statistiques de téléchargement