La vitrine de diffusion des mémoires et thèses de l'ÉTS
RECHERCHER

Gradual domain generalization for visible-infrared person re-identification

Téléchargements

Téléchargements par mois depuis la dernière année

Alehdaghi, Mahdi (2026). Gradual domain generalization for visible-infrared person re-identification. Thèse de doctorat électronique, Montréal, École de technologie supérieure.

[thumbnail of ALEHDAGHI_Mahdi.pdf]
Prévisualisation
PDF
Télécharger (14MB) | Prévisualisation

Résumé

Visible-infrared person re-identification (V-I ReID) has emerged as a crucial task for modern surveillance systems, requiring the accurate matching of individuals captured across different modalities—visible (V) and infrared (I) cameras. However, significant challenges arise from the substantial domain gap between modalities, resulting in pronounced discrepancies in appearance, texture, and illumination. This gap severely hampers the generalization ability of deep learning models, leading to degraded cross-modal retrieval performance. Furthermore, conventional feature extraction approaches often lack discriminability due to their reliance on global representations, overlooking fine-grained, identity-specific attributes critical for robust person matching. Existing evaluation protocols exacerbate these limitations by assuming a unimodal gallery during testing, which is unrealistic for real-world 24-hour surveillance systems that naturally operate under mixed-modality conditions.

This thesis, titled Gradual domain generalization for visible-infrared person re-identification, systematically addresses these challenges through a gradual and structured domain generalization framework. Three major contributions are proposed: (1) Adaptive generation of privileged intermediate information (AGPI2), introducing dynamic intermediate modalities to guide the learning of modality-invariant features; (2) Bidirectional multi-step domain generalization (BMDG), progressively refining part-based feature alignments to bridge domain gaps more effectively; and (3) Mixed-modality re identification (MixER), disentangling modality-specific and identity-specific features to enhance performance under realistic mixed-gallery conditions. Extensive experiments conducted on benchmark datasets such as SYSU-MM01, RegDB, and LLCM demonstrate that the proposed approaches achieve state-of-the-art results across a variety of challenging scenarios, including occlusion, extreme lighting variations, and mixed-modal settings.

Beyond cross-modal person re-identification, this thesis also investigates a complementary and timely problem: enhancing the interpretability and interoperability of deep vision models. Inspired by the prototype discovery mechanisms introduced for ReID, a novel framework for interpretable classification is developed, enabling the automatic discovery of part prototypical primitive concepts without requiring manual annotations. This approach not only improves the transparency and faithfulness of deep models but also ensures robust and stable explanations even under challenging conditions. By bridging the gap between performance and interpretability, this thesis contributes toward the development of more trustworthy and practically deployable deep learning systems for real world applications.

Titre traduit

Généralisation progressive de domaine pour la ré-identification de personnes en mode visible–infrarouge

Résumé traduit

L’identification de personnes en mode visible infrarouge (Visible-infrared person re-identification, V-I ReID) est devenue une tâche essentielle pour les systèmes de surveillance modernes, puisqu’elle vise à associer correctement des individus capturés par des caméras de modalités différentes — visible (V) et infrarouge (I). Cependant, cette tâche reste difficile en raison de l’important décalage de domaine entre les modalités, se traduisant par de fortes divergences d’apparence, de texture et d’illumination. Ce décalage limite gravement la capacité de généralisation des modèles d’apprentissage profond et réduit la performance en recherche cross-modale. De plus, les méthodes classiques d’extraction de caractéristiques manquent souvent de discriminabilité car elles reposent sur des représentations globales, négligeant des attributs fins et spécifiques à l’identité, pourtant essentiels pour un appariement robuste. Les protocoles d’évaluation existants renforcent ces limites en supposant, lors des tests, une galerie uni-modale, ce qui ne correspond pas aux conditions réelles des systèmes de surveillance 24h/24, qui doivent naturellement traiter des galeries multi-modales.

Cette thèse, intitulée Gradual Domain Generalization for Visible-Infrared Person Re-Identification, aborde ces défis de manière systématique à travers un cadre progressif et structuré de généralisation de domaine. Trois contributions majeures y sont proposées :
1. AGPI2 (Adaptive Generation of Privileged Intermediate Information), qui introduit des modalités intermédiaires dynamiques afin de guider l’apprentissage de caractéristiques invariantes aux modalités ;
2. BMDG (Bidirectional Multi-step Domain Generalization), qui affine progressivement l’alignement des caractéristiques locales pour réduire plus efficacement l’écart entre domaines ;
3. MixReID, qui sépare les informations spécifiques à la modalité de celles propres à l’identité, afin d’améliorer la performance dans des conditions mixtes et réalistes.

Des expérimentations approfondies sur les bases de données SYSU-MM01, RegDB et LLCM démontrent que les approches proposées atteignent des résultats à l’état de l’art dans divers scénarios difficiles, incluant l’occlusion, les variations extrêmes de luminosité et les contextes multi-modaux.

Au-delà de l’identification visible-infrarouge, cette thèse s’intéresse également à un problème complémentaire et actuel : renforcer l’interprétabilité et l’interopérabilité des modèles de vision profonds. Inspirée par les mécanismes de découverte de prototypes développés pour la ReID, elle propose un cadre d’explicabilité permettant la découverte automatique de concepts primitifs et prototypiques, sans annotation manuelle. Cette approche améliore la transparence et la robustesse des explications produites, même dans des conditions difficiles. En comblant le fossé entre performance et interprétabilité, cette thèse contribue au développement de systèmes d’intelligence artificielle plus fiables et déployables dans des applications réelles.

Type de document: Mémoire ou thèse (Thèse de doctorat électronique)
Renseignements supplémentaires: "Manuscript-based thesis presented to École de technologie supérieure in partial fulfillment for the degree of Doctor of Philosophy". Comprend des références bibliographiques (pages 167-193).
Mots-clés libres: ré-identification visible-infrarouge de personnes, adaptation au domaine, généralisation au domaine
Directeur de mémoire/thèse:
Directeur(-trice)
Granger, Éric
Codirecteur:
Codirecteur(-trice) de mémoire/thèse
Menelau Oliveira Cruz, Rafael
Programme: Doctorat en génie > Génie
Date de dépôt: 24 juill. 2026 14:49
Dernière modification: 24 juill. 2026 14:49
URI: https://espace.etsmtl.ca/id/eprint/4021

Gestion Actions (Identification requise)

Dernière vérification avant le dépôt Dernière vérification avant le dépôt