Amar, Fouzia (2026). Vers une interopérabilité sémantique des données en santé. Thèse de doctorat électronique, Montréal, École de technologie supérieure.
|
PDF
Administrateur seulement jusqu'à 27 novembre 2026. Télécharger (6MB) |
Résumé
Le domaine de la santé fait face à des enjeux majeurs d’interopérabilité. Une complexité induite par la diversité de la représentation des données provenant de multiples sources, telles que les dossiers électroniques, les équipements ou dispositifs biomédicaux ainsi que les objets connectés. L’interopérabilité est un élément névralgique de la transformation numérique qui fait l’objet des recherches ciblant une normalisation progressive qui a pour objectif de faciliter les échanges entre les différents systèmes d’information utilisés dans le parcours des soins du patient.
L’objectif principal de cette recherche est de contribuer à faciliter l’interopérabilité d’information normalisée et de qualité concernant les conditions médicales d’un patient dans le contexte francophone québécois et canadien.
Dans un premier temps, cette recherche présente une vue d’ensemble des travaux et de l’état de l’art concernant le standard d’interopérabilité HL7 FHIR, qui est une norme spécifiquement développée pour le domaine de la santé, qui vise à assurer une sémantique partagée dans les échanges entre les différents logiciels de la santé. Il est question ici d’identifier les données ciblées par cette sémantisation ainsi que les approches utilisées à ce jour. Cette revue présente une classification des méthodologies utilisées à différentes étapes du processus d’échange de données: extraction, annotation, modélisation, mise en correspondance et transformation. Les conclusions de cette revue indiquent que l’apprentissage machine et le traitement du langage naturel (AM/TLN ou NLP), récemment introduit pour les données non structurées, représentent des avenues encourageantes de solution à ce problème. De plus, le recours à la normalisation des échanges, fondés sur des terminologies telles que SNOMED, offre des avenues intéressantes de solutions pour assurer une interopérabilité sémantique à l’avenir.
Dans un deuxième temps, un modèle favorisant l’interopérabilité sémantique des données concernant les conditions médicales du patient, notamment pour les allergies, est proposé. Un cadre hybride est conçu, utilisant à la fois des techniques de traitement de langage naturel accompagné par des règles qui permettent d’extraire et de transformer des textes cliniques francophones en format libre et de les convertir par la suite à un modèle normalisé basé sur le standard international HL7 FHIR et la terminologie SNOMED CT. Pour ce faire, le corpus FRASIMED, de données médicales ouvertes francophones, a été utilisé avec une mise en correspondance vers le modèle international du sommaire du patient utilisant la plateforme MedSpacy. Les résultats expérimentaux sont prometteurs et pourront contribuer à améliorer l’interopérabilité sémantique des données non structurées en français.
Par la suite, pour faciliter le déploiement en pratique clinique, une démarche en trois étapes a été effectuée: 1) Analyse des méthodologies actuelles permettant la vérification et la validation des approches NLP-to-FHIR, 2) Réalisation d’une analyse «root-causes», conformément aux principes du génie logiciel, afin d’identifier les biais potentiels, 3) Développement d’une feuille de route en cinq phases pour pallier aux défis du processus de vérification et de validation notamment : (a) gouvernance et cadre de confidentialité; b) disponibilité et diversité des jeux de données; c) sélection des données et méthodologie d’annotation; d) développement linguistique; et e) validation, détection des biais et amélioration continue.
En conclusion, les données francophones non structurées concernant l’état de santé d’un patient peuvent être converties et mise en correspondance à l’aide de terminologie normalisée du domaine de la santé pour assurer un échange simple et de qualité entre les différents systèmes impliqués dans la prise en charge d’un patient. Un cadre rigoureux de vérification et de validation s’impose pour assurer l’opérationnalisation des modèles basés sur NLP en milieu clinique.
Titre traduit
Toward a semantic interoperability of medical data
Résumé traduit
The healthcare sector faces major interoperability challenges. This complexity stems from the diversity of data representation from multiple sources, such as electronic records, biomedical equipment or devices, and connected objects. Interoperability is a key element of digital transformation and is the subject of intensified research aimed at progressive standardization to facilitate exchanges between the various information systems used in patient care pathways.
The main objective of this thesis is to contribute to promoting the interoperability of standardized, high-quality information concerning a patient's medical conditions in the Frenchspeaking Canadian and Quebec context.
The first step presents an overview of the publications and state of the art concerning the HL7 FHIR interoperability standard, a standard specifically developed for the healthcare sector, which aims to ensure shared semantics in exchanges between different systems exchanging data. The aim here is to identify the data targeted by this semantization as well as the approaches used to date. This review presents a classification of the methodologies used at different stages of the data exchange process: extraction, annotation, modeling, mapping, and transformation. The conclusions of this study indicate that machine learning and natural language processing (ML/NLP), recently introduced for unstructured data, offer promising avenues. In addition, the use of exchange standardization based on terminologies such as SNOMED is becoming an essential approach to ensuring semantic interoperability in the future.
Secondly, a model promoting the semantic interoperability of data concerning the patient’s medical conditions, particularly allergies, is proposed. A hybrid framework is proposed that uses both natural language processing techniques and rules to extract and transform free-form French clinical texts and then convert them to a standardized model based on the international HL7 FHIR standard and SNOMED CT terminology. To do this, the FRASIMED corpus of open French-language medical data was used and mapped to the international patient summary model using the MedSpacy platform. The experimental results are promising and could help improve the semantic interoperability of unstructured data in French.
Subsequently, the following three-step process was carried out toward making NLP-to-FHIR systems production-ready for clinical deployment: (1) analyze current methodologies for verification and validation of NLP-to-FHIR pipelines; (2) conduct root-causes analysis identifying potential sources of bias in these systems; and (3) develop a comprehensive, fivephased research roadmap that research teams can follow to systematically address verification and validation challenges ((a) Governance and Privacy Framework; (b) Dataset Availability and Diversity; (c) Data Selection and Annotation Methodology; (d) Linguistic Development; and (e) Validation, Bias Detection, and Refinement).
In conclusion, unstructured French-language data concerning a patient's health status can be converted and matched using standardized healthcare terminology to ensure simple, highquality exchange between the various systems involved in patient care. A methodology framework is required for verification and validation process for a successful deployment in clinical setting.
| Type de document: | Mémoire ou thèse (Thèse de doctorat électronique) |
|---|---|
| Renseignements supplémentaires: | "Thèse par articles présentée à l’École de technologie supérieure comme exigence partielle à l’obtention du doctorat en génie". Comprend des références bibliographiques (pages 175-192). |
| Mots-clés libres: | apprentissage machine, AM, ML, DSÉ, HL7 FHIR, interopérabilité, intégration des données, IPS, LOINC, ontologie, sémantique, SNOMED, terminologie, SMS, TLN, NLP, vérification and validation, détection de biais, apprentissage profond, DL, LLM |
| Directeur de mémoire/thèse: | Directeur(-trice) April, Alain |
| Codirecteur: | Codirecteur(-trice) de mémoire/thèse Abran, Alain |
| Programme: | Doctorat en génie > Génie |
| Date de dépôt: | 29 mai 2026 16:03 |
| Dernière modification: | 29 mai 2026 16:03 |
| URI: | https://espace.etsmtl.ca/id/eprint/3925 |
Gestion Actions (Identification requise)
![]() |
Dernière vérification avant le dépôt |

Statistiques de téléchargement
Statistiques de téléchargement