Aminnezhad, Aysheh (2026). ExploitGen: automated smart contract vulnerability verification via taxonomy specialized multi-agent detection and proof-of-concept exploit generation. Mémoire de maîtrise électronique, Montréal, École de technologie supérieure.
Prévisualisation |
PDF
Télécharger (676kB) | Prévisualisation |
Résumé
Smart contracts underpin decentralized finance (DeFi), where software vulnerabilities cause irreversible financial losses. Existing automated auditing approaches face a detection–verification gap: static analyzers and single-agent large language model (LLM) systems exhibit low recall, whereas unverified multi-agent architectures achieve high recall at the cost of prohibitive false-positive rates that overwhelm human auditors and negate the efficiency benefits of automation.
This thesis presents ExploitGen, a LangGraph orchestrated multi-agent pipeline that closes this gap by coupling taxonomy-specialized detection with executable verification. Eight detection agents, each scoped to a single OpenSCV category, first maximize recall. Each candidate then passes through a verification sequence: static graph extraction, falsification-first validation, semantic characterization, Structured Chain-of-Thought (SCoT) attack planning, proof-of-concept (PoC) synthesis, and counterfactual confirmation. A vulnerability is confirmed only when its generated Foundry PoC passes on the vulnerable contract and fails on a signature-preserving patched counterpart, establishing exploitability causally rather than by syntactic resemblance.
Evaluated on the SB Curated benchmark against 139 ground truth vulnerabilities, ExploitGen verifies 86 counterfactually confirmed exploits at a confirmation yield of 0.741 and an F1-score of 0.675. Against a single-attempt configuration of the same pipeline, unconfirmed candidates fall by 23.1% while confirmed exploits rise from 73 to 86. Against the detection-only paradigm, which uses unscoped parallel detection, unconfirmed findings fall from 342 to 30. A controlled ablation shows that SCoT planning improves reentrancy F1 by 0.200 but degrades access-control performance, establishing that component selection must be adapted to the vulnerability class. The augmented dataset of 139 patched contracts is released to support reproducibility.
Titre traduit
ExploitGen : vérification automatisée de vulnérabilités dans les contrats intelligents par détection multi-agents spécialisée par taxonomie et génération automatique d’exploits
Résumé traduit
Les contrats intelligents constituent l’infrastructure des protocoles de finance décentralisée (DeFi), où les vulnérabilités logicielles entraînent fréquemment des pertes financières irréversibles. Les approches d’audit automatisées existantes souffrent d’un écart critique entre la détection et la vérification : les systèmes multi-agents fondés sur de grands modèles de langage (LLM) atteignent un rappel élevé, mais génèrent des taux de faux positifs prohibitifs qui submergent les auditeurs et annulent les bénéfices attendus de l’automatisation.
Cette thèse présente ExploitGen, un pipeline multi-agents orchestré par LangGraph qui comble cet écart en intégrant une détection spécialisée par taxonomie à une vérification automatisée. Le système déploie d’abord huit agents de détection alignés sur la classification OpenSCV, chacun limité à une seule catégorie afin de maximiser la couverture. Chaque candidat est ensuite soumis à une séquence de vérification en plusieurs étapes : extraction de graphes statiques, validation par falsification, caractérisation sémantique, planification d’attaque structurée (SCoT), synthèse d’une preuve de concept (PoC) exécutable et confirmation contrefactuelle. Une vulnérabilité n’est confirmée que si le test PoC réussit sur le contrat vulnérable et échoue sur une version corrigée préservant la même interface.
Évalué sur le banc d’essai SB Curated, ExploitGen vérifie 86 exploits confirmés par contre-exemple sur 139 vulnérabilités de référence, avec un taux de confirmation de 0,741 et un score F1 de 0,675. Par rapport à une configuration à tentative unique du même pipeline, les candidats non confirmés diminuent de 23,1 %. Par rapport à la détection seule, les signalements non confirmés passent de 342 à 30. Une étude d’ablation montre que la sélection des composants doit être adaptée à chaque catégorie de vulnérabilité plutôt qu’appliquée uniformément.
| Type de document: | Mémoire ou thèse (Mémoire de maîtrise électronique) |
|---|---|
| Renseignements supplémentaires: | "Thesis presented to École de technologie supérieure in partial fulfillment of a master's degree with thesis in software engineering". Comprend des références bibliographiques (pages 75-78). |
| Mots-clés libres: | contrats intelligents, détection de vulnérabilités, systèmes multi-agents, vérification automatisée, sécurité blockchain |
| Directeur de mémoire/thèse: | Directeur(-trice) Zhang, Kaiwen |
| Codirecteur: | Codirecteur(-trice) de mémoire/thèse Coti, Camille |
| Programme: | Maîtrise en ingénierie > Génie |
| Date de dépôt: | 25 sept. 2026 19:10 |
| Dernière modification: | 25 sept. 2026 19:10 |
| URI: | https://espace.etsmtl.ca/id/eprint/4120 |
Gestion Actions (Identification requise)
![]() |
Dernière vérification avant le dépôt |

Statistiques de téléchargement
Statistiques de téléchargement