Desbos, Mélodie (2026). Modèles de diffusion pour la génération d’images personnalisées et la variation guidée par référence d’effets sonores. Mémoire de maîtrise électronique, Montréal, École de technologie supérieure.
Prévisualisation |
PDF
Télécharger (11MB) | Prévisualisation |
Résumé
Les modèles de diffusion atteignent aujourd’hui des performances de pointe en génération multimodale. Néanmoins, leur adoption en pratique demeure limitée par (i) le coût élevé de l’échantillonnage itératif et (ii) la difficulté à adapter un modèle de diffusion préentraîné à de nouveaux domaines à partir de seulement quelques références. Ce mémoire étudie l’utilisation des modèles de diffusion pour l’adaptation, la génération multimodale personnalisée et l’édition dans le contexte de la génération d’images et d’effets sonores en régime de faibles données. Elle met l’accent sur l’adaptation efficace, la préservation de l’identité et la génération contrôlable de variations pour des flux de production.
Dans un premier temps, ce mémoire présente des contributions issues d’un travail collaboratif autour de l’article Uni-DAD. Cet article introduit un cadre d’entraînement unifié pour la distillation et l’adaptation simultanées, permettant la génération d’images en few-shot et en few-step. Ce travail confronte les pipelines classiques en deux étapes de type adapt-then-distill ou distill-then-adapt, qui impliquent des structures complexes, un risque de surapprentissage et une diversité limitée. La principale contribution porte sur la personnalisation guidée par sujet (Subject-Driven Personalization, SDP), renforcée par l’intégration d’un conditionnement textuel. Évalué sur le benchmark DreamBooth, Uni-DAD SDP atteint une qualité d’image compétitive par rapport aux méthodes d’adaptation de référence tout en ne nécessitant qu’une seule étape d’échantillonnage. Le résultat final est un générateur en une seule étape, capable de produire des images diversifiées et de haute qualité dans de nouveaux domaines de données, sous conditions restreintes. En définitive, cette méthode agnostique facilite le déploiement des modèles de diffusion dans des applications personnalisées en temps réel.
Dans un second temps, la continuité de ce travail contribue à la recherche appliquée sur la génération audio pour la production d’effets sonores (SFX). Plus précisément, il étudie la capacité des modèles génératifs modernes à produire des variations diversifiées à partir d’un clip de référence tout en préservant l’identité de l’événement sonore. Une analyse expérimentale évalue l’aptitude des modèles à reproduire ou éditer des caractéristiques clés du signal, telles que la structure temporelle et l’enveloppe d’énergie, sous des contraintes orientées vers la production (durée, transfert de style et indices d’alignement). Par ailleurs, cette analyse permet de structurer un état de l’art et d’établir des comparaisons équitables entre méthodes pour la variation et l’édition de SFX, afin de rapprocher les récentes avancées de la génération audio aux exigences de l’industrie. Ce travail établit également une base pour de futures recherches appliquées sur la génération efficace et contrôlable de variations dans des contextes de production.
Titre traduit
Diffusion models for personalized image generation and reference-guided sound-effect variation
Résumé traduit
Diffusion models achieve state-of-the-art performance in multimodal generation. Yet, their practical adoption remains limited by (i) the high computational cost of iterative sampling and (ii) the difficulty of adapting a pretrained diffusion model to new domains from few references. This thesis investigates the use of diffusion models for adaptation, personalized multimodal generation, and editing in image and sound-effect generation under low-data regimes, with a focus on efficient adaptation, identity preservation, and controllable variation generation for production workflows.
First, this thesis presents contributions stemming from a collaborative work on the Uni DAD paper. It introduces a unified training framework for simultaneous distillation and adaptation of diffusion models, enabling few-shot and few-step image generation. The work contrasts classical two-stage pipelines of adapt-then-distill or distill-then-adapt, which entail complex designs, overfitting, and limited diversity. The contribution presented here focuses on subject-driven personalization (SDP), enhanced by integrating textual conditioning. Evaluated on the DreamBooth benchmark, Uni-DAD SDP achieves competitive image quality compared to reference adaptation methods while requiring only a single sampling step. The end result is a few-step generator capable of adapting and producing diverse, high-quality images in novel domains under few-shot conditions. Ultimately, this checkpoint-agnostic method facilitates the deployment of diffusion models in personalized, real-time applications.
Second, this work contributes to applied research on audio generation for sound effect (SFX) production. In particular, it investigates the ability of modern generative models to produce diverse variations from a reference clip while preserving the sound event’s identity. Experiments analyze the models’ capacity to reproduce or edit key signal characteristics, such as temporal structure and energy curve, under production-oriented constraints (e.g., duration control, style transfer, and alignment cues). Furthermore, this analysis helps structure an overview and enables fair comparisons between existing methods for SFX variation and editing, thereby bridging recent advances in audio generation with practical industry requirements. This work also establishes a foundation for future applied research on efficient, controllable variation generation in production settings.
By bridging the efficiency of diffusion-based generation and the expressiveness of reference-guided modeling across modalities, these contributions enable user-friendly, controllable adaptation and editing of both images and SFX clips.
| Type de document: | Mémoire ou thèse (Mémoire de maîtrise électronique) |
|---|---|
| Renseignements supplémentaires: | "Mémoire présenté à l'École de technologie supérieure comme exigence partielle à l'obtention de la maîtrise avec mémoire génie des systèmes et de la production automatisée". Comprend des références bibliographiques (pages 119-137). |
| Mots-clés libres: | IA générative, modèles de diffusion, adaptation, distillation des connaissances, multimodalité, images et effets sonores |
| Directeur de mémoire/thèse: | Directeur(-trice) Shateri, Mohammadhadi |
| Codirecteur: | Codirecteur(-trice) de mémoire/thèse Granger, Éric |
| Programme: | Maîtrise en ingénierie > Génie de la production automatisée |
| Date de dépôt: | 29 mai 2026 14:20 |
| Dernière modification: | 29 mai 2026 14:20 |
| URI: | https://espace.etsmtl.ca/id/eprint/3922 |
Gestion Actions (Identification requise)
![]() |
Dernière vérification avant le dépôt |

Statistiques de téléchargement
Statistiques de téléchargement