La vitrine de diffusion des mémoires et thèses de l'ÉTS
Rechercher

The hidden costs of efficient visual representation learning

Téléchargements

Téléchargements par mois depuis la dernière année

Dastani Oghani, Sahar (2026). The hidden costs of efficient visual representation learning. Thèse de doctorat électronique, Montréal, École de technologie supérieure.

[thumbnail of DASTANI_OGHANI_Sahar.pdf]
Prévisualisation
PDF
Télécharger (6MB) | Prévisualisation

Résumé

Efficient visual representation learning is a key challenge in modern computer vision. As visual models are increasingly used for high-resolution images and dense prediction tasks, they must capture long-range dependencies without becoming computationally prohibitive. Vision Transformers address this by using self-attention to model global interactions between image patches, but the quadratic complexity of self-attention limits their scalability. This has motivated more efficient alternatives, such as State Space Models (SSMs) and linear attention, which reduce the cost of token interactions. However, computational efficiency alone is not enough for reliable visual representation learning. These models must also be robust to changes in input conditions and expressive enough to capture complex relationships across image regions. This thesis investigates the hidden costs introduced by efficient token interaction mechanisms in visual representation learning.

First, we examine the robustness of SSMs under geometric transformations. SSMs process image patches using fixed sequential scan orders, enabling global modeling with linear complexity. However, this design imposes a fixed one-dimensional order on inherently two-dimensional image data. Consequently, the learned representations can become sensitive to the chosen traversal path and unstable under geometric transformations such as rotation. To address this limitation, we introduce Spectral VMamba, a vision SSM that uses spectral decomposition of the graph Laplacian of image patches to define patch traversal according to the intrinsic structure of the image rather than fixed spatial directions. This enables rotation-invariant patch processing while preserving the efficiency advantages of SSMs.

Second, we examine the robustness of SSMs under distribution shift, where test images differ from training data due to corruptions, domain changes, or acquisition variability. In SSMs, patches are processed sequentially, and the hidden state at each step carries accumulated context from all previously processed patches. Under distribution shift, corrupted patch embeddings are injected into the hidden state and propagate through all subsequent updates, and because fixed scan orders always inject these artifacts at the same position in the traversal sequence, their influence is consistently amplified rather than diluted. To address this, we propose TRUST, a test-time adaptation method tailored for Mamba-based vision models. TRUST generates complementary causal views of the input via diverse traversal permutations, filters predictions by uncertainty to retain only reliable permutations, and updates Mamba specific parameters at inference time, requiring neither source data nor retraining. This allows the model to adapt its parameters toward more robust representations under shifted test distributions.

Third, we address the expressiveness limitations of linear attention. Although linear attention improves scalability by avoiding the quadratic cost of self attention, standard kernelized formulations mainly rely on direct, first-order interactions between tokens. As a result, they may struggle to capture higher-order or transitive relationships between image regions. To overcome this limitation, we introduce LiSA, a Linear Stochastic Attention module that reformulates attention as a truncated random walk over a graph of image patches. Through multi-hop information propagation, LiSA captures richer token relationships while preserving linear complexity and stable training.

Across image classification, semantic segmentation, and object detection, the proposed methods improve robustness and representation quality while maintaining computational efficiency. Overall, this thesis shows that efficient visual backbone design should not be evaluated by computational cost alone. Instead, scalability must be considered together with the robustness and expressiveness of token interactions, especially when models are expected to operate reliably under real-world visual variations.

Titre traduit

Les coûts cachés de l’apprentissage efficace des représentations visuelles

Résumé traduit

L’apprentissage efficace de représentations visuelles constitue un défi central en vision par ordinateur moderne. À mesure que les modèles visuels sont de plus en plus utilisés pour des images à haute résolution et des tâches de prédiction dense, ils doivent capturer des dépendances à longue portée sans devenir prohibitifs sur le plan computationnel. Les Vision Transformers répondent à ce besoin en utilisant l’auto-attention pour modéliser les interactions globales entre les patchs d’image, mais la complexité quadratique de l’auto attention limite leur passage à l’échelle. Cela a motivé le développement d’alternatives plus efficaces, telles que les modèles à espace d’états (State Space Models, SSMs) et l’attention linéaire, qui réduisent le coût des interactions entre tokens. Cependant, l’efficacité computationnelle seule ne suffit pas pour assurer un apprentissage fiable des représentations visuelles. Ces modèles doivent également être robustes aux changements des conditions d’entrée et suffisamment expressifs pour capturer des relations complexes entre les régions de l’image. Cette thèse étudie les coûts cachés introduits par les mécanismes efficaces d’interaction entre tokens dans l’apprentissage de représentations visuelles.

Premièrement, nous examinons la robustesse des SSMs face aux transformations géométriques. Les SSMs traitent les patchs d’image selon des ordres de balayage séquentiels fixes, ce qui permet une modélisation globale avec une complexité linéaire. Cependant, cette conception impose un ordre unidimensionnel fixe à des données d’image intrinsèquement bidimensionnelles. Par conséquent, les représentations apprises peuvent devenir sensibles au chemin de parcours choisi et instables face à des transformations géométriques telles que la rotation. Pour remédier à cette limitation, nous introduisons Spectral VMamba, un SSM visuel qui utilise la décomposition spectrale du laplacien de graphe des patchs d’image afin de définir le parcours des patchs selon la structure intrinsèque de l’image, plutôt que selon des directions spatiales fixes. Cela permet un traitement des patchs invariant à la rotation tout en préservant les avantages d’efficacité des SSMs.

Deuxièmement, nous examinons la robustesse des SSMs en présence de décalage de distribution, lorsque les images de test diffèrent des données d’entraînement en raison de corruptions, de changements de domaine ou de variations liées à l’acquisition. Dans les SSMs, les patchs sont traités séquentiellement, et l’état caché à chaque étape transporte le contexte accumulé à partir de tous les patchs précédemment traités. En présence de décalage de distribution, les embeddings de patchs corrompus sont injectés dans l’état caché et se propagent à travers toutes les mises à jour suivantes. De plus, comme les ordres de balayage fixes injectent toujours ces artefacts à la même position dans la séquence de parcours, leur influence est systématiquement amplifiée plutôt que diluée. Pour répondre à ce problème, nous proposons TRUST, une méthode d’adaptation au moment du test conçue pour les modèles visuels basés sur Mamba. TRUST génère des vues causales complémentaires de l’entrée à l’aide de permutations diverses du parcours, filtre les prédictions selon l’incertitude afin de ne conserver que les permutations fiables, et met à jour les paramètres spécifiques à Mamba au moment de l’inférence, sans nécessiter de données sources ni de réentraînement. Cela permet au modèle d’adapter ses paramètres vers des représentations plus robustes sous des distributions de test décalées.

Troisièmement, nous abordons les limitations d’expressivité de l’attention linéaire. Bien que l’attention linéaire améliore le passage à l’échelle en évitant le coût quadratique de l’autoattention, les formulations kernelisées standards reposent principalement sur des interactions directes et de premier ordre entre les tokens. Par conséquent, elles peuvent avoir des difficultés à capturer des relations d’ordre supérieur ou transitives entre les régions de l’image. Pour surmonter cette limitation, nous introduisons LiSA, un module d’attention stochastique linéaire qui reformule l’attention comme une marche aléatoire tronquée sur un graphe de patchs d’image. Grâce à la propagation d’information multi sauts, LiSA capture des relations plus complexes entre tokens tout en préservant une complexité linéaire et un entraînement stable.

À travers la classification d’images, la segmentation sémantique et la détection d’objets, les méthodes proposées améliorent la robustesse et la qualité des représentations tout en maintenant l’efficacité computationnelle. Dans l’ensemble, cette thèse montre que la conception de backbones visuels efficaces ne doit pas être évaluée uniquement en fonction du coût computationnel. La scalabilité doit plutôt être considérée conjointement avec la robustesse et l’expressivité des interactions entre tokens, en particulier lorsque les modèles sont appelés à fonctionner de manière fiable face aux variations visuelles du monde réel.

Type de document: Mémoire ou thèse (Thèse de doctorat électronique)
Renseignements supplémentaires: "Manuscript-based thesis presented to École de technologie supérieure in partial fulfillment for the degree of Doctor of Philosophy". Comprend des références bibliographiques (pages 123-145).
Mots-clés libres: apprentissage de représentations visuelles, modèles de vision efficaces, modèles d’espace d’états, Mamba, attention linéaire, robustesse, décalage de distribution, adaptation au test, invariance à la rotation
Directeur de mémoire/thèse:
Directeur(-trice)
Desrosiers, Christian
Codirecteur:
Codirecteur(-trice) de mémoire/thèse
Lombaert, Hervé
Programme: Doctorat en génie > Génie
Date de dépôt: 25 sept. 2026 19:01
Dernière modification: 25 sept. 2026 19:01
URI: https://espace.etsmtl.ca/id/eprint/4118

Gestion Actions (Identification requise)

Dernière vérification avant le dépôt Dernière vérification avant le dépôt