Pentest IA : de la reconnaissance à l’exploitation, les 6 étapes réelles

Autres, Red Team

Là où l’audit fonctionnel, déjà détaillé dans notre article dédié, se limite à des entretiens et une revue documentaire, le pentest IA passe à l’action : il exploite activement les systèmes identifiés comme prioritaires pour démontrer un impact réel plutôt que de le supposer. La méthodologie suit une chaîne d’attaque en six étapes, calquée sur la progression d’un adversaire réel plutôt que sur une liste de contrôles isolés.

1. Reconnaissance de la surface IA

Cette étape confirme ou contredit techniquement l’inventaire déclaré lors de l’audit fonctionnel. Elle scanne le réseau interne à la recherche de serveurs de modèles auto-hébergés exposés, Ollama, vLLM, LM Studio ont chacun des ports caractéristiques bien connus, fuzz les chemins d’API IA non documentés, et confirme techniquement le Shadow AI par analyse des journaux DNS et proxy vers les fournisseurs connus. Un volet spécifique recherche les fichiers de configuration MCP sur les systèmes accessibles, en amont de l’étape dédiée à ce protocole.

2. Accès initial : poste développeur

Sur un poste développeur, le test central consiste à manipuler un agent IA configuré dans l’environnement de développement, via des instructions dissimulées dans un fichier de code, un commentaire ou un README, pour tenter une exfiltration de fichiers hors périmètre ou l’exécution de commandes non voulues, un scénario directement documenté dans notre article sur le prompt injection.

3. Accès initial : poste utilisateur standard

Depuis un poste utilisateur standard compromis, l’objectif change : récupérer les jetons et clés déjà présents sur la machine, variables d’environnement, gestionnaire d’identifiants système, processus en cours d’exécution, puis accéder à l’historique de conversations IA stocké localement, souvent riche en informations sensibles jamais destinées à être extraites de leur contexte d’origine.

4. Sécurité du protocole agentique MCP

Ce volet, en écho direct à notre article dédié au MCP, couvre l’authentification des serveurs découverts, la recherche de typosquatting sur les noms de paquets MCP installés, et un test d’empoisonnement des descriptions d’outils exposées à l’agent, une instruction malveillante dissimulée dans les métadonnées d’un outil plutôt que dans une donnée traitée.

5. Chaîne d’approvisionnement du code généré par IA

Cette étape vérifie d’abord si la revue du code généré par IA est réellement effectuée par un humain, en soumettant volontairement un code contenant une vulnérabilité subtile et en observant si elle est détectée. Elle recherche ensuite les paquets hallucinés suggérés par les assistants de code et vérifie s’ils ont été préemptés par un attaquant sur les registres publics, un risque détaillé dans notre article sur le slopsquatting, ainsi que les tentatives d’empoisonnement via les fichiers de contexte IA du projet, CLAUDE.md, .cursorrules,  qui partagent la même logique d’exploitation que l’empoisonnement des descriptions d’outils MCP vu à l’étape précédente. 

6. Exploitation de l’infrastructure IA interne

Dernière étape, elle exploite activement ce que la reconnaissance a découvert : accès non authentifié aux modèles auto-hébergés, prompt injection sur les chatbots internes avec test de fuite du prompt système, interrogation d’un système RAG au-delà des droits documentaires normalement accordés à l’utilisateur testé, et test de contournement des garde-fous par les techniques de jailbreak classiques, jeu de rôle, encodage alternatif, changement de langue,  déjà détaillées dans notre article sur le jailbreak LLM. Cette étape couvre également la résilience face à la saturation de contexte, capable de repousser hors du contexte actif les instructions système censées encadrer le comportement du modèle.

Questions fréquentes

Le pentest IA remplace-t-il un pentest applicatif classique ?
Non, les deux sont complémentaires. Un système hybride combinant infrastructure traditionnelle et composants IA nécessite généralement les deux approches pour une couverture complète.
Faut-il avoir réalisé l'audit fonctionnel avant le pentest ?
Ce n’est pas strictement obligatoire, mais fortement recommandé : l’audit permet de prioriser les systèmes à tester en profondeur plutôt que de disperser l’effort sur un périmètre mal cadré.
Le volet MCP est-il pertinent pour toutes les organisations ?
Uniquement pour celles ayant déployé des agents ou copilotes utilisant ce protocole. Sa généralisation rapide en 2025-2026 en fait toutefois un volet de plus en plus systématiquement pertinent.

Tester la résistance réelle de vos systèmes IA

Nos experts appliquent cette méthodologie en six étapes pour évaluer la résistance de vos systèmes IA à des scénarios d’attaque réalistes.Vous souhaitez échanger sur votre projet ou évaluer vos besoins ? Contactez nos experts.