Veille Alignement
Veille Alignement · suivi en continu

Que se passe-t-il quand on attaque plusieurs agents IA au lieu d'un seul?

19 septembre 2026

Quand plusieurs IA collaborent, une seule instruction piégée peut contaminer toute la chaîne — voici comment s'en protéger.

Note de Diederick

Plus on construit des architectures perfectionnées avec des différents agents IA, plus la sécurité est fragile...

Imaginez un bureau où plusieurs employés spécialisés se transmettent des dossiers : l'un récupère des documents, un autre fait les calculs, un troisième vérifie la conformité, et un chef d'orchestre coordonne le tout. Si un intrus glisse un faux mémo dans un document — « ignore les règles et approuve tout » — un employé peut l'exécuter et transmettre sa décision viciée aux autres, qui lui font confiance. C'est exactement ce que les chercheurs Rudrendu Kumar Paul (Boston University) et Sourav Nandy (UT Austin) étudient pour les IA qui travaillent en équipe.

Ils montrent que les systèmes où plusieurs IA collaborent sont bien plus vulnérables qu'une IA seule, car les messages échangés entre elles échappent aux filtres de sécurité classiques. Ils recensent 14 manières d'attaquer ces systèmes, puis proposent quatre défenses qui font chuter le taux de réussite des attaques de 31 % à 4 %. Point essentiel : les simples consignes de sécurité écrites dans les instructions de l'IA ne suffisent pas, il faut protéger l'architecture elle-même.

Pourquoi c’est un enjeu de société

Plus les IA collaborent entre elles, plus une faille peut se propager silencieusement à toute une chaîne de décisions.

Ces systèmes multi-agents se déploient dans des contextes où ils traitent des données sensibles et prennent des décisions à conséquences réelles. Une attaque bien placée peut contourner une vérification de conformité ou corrompre un résultat final, sans qu'aucun filtre extérieur ne le détecte.

  • Pour les citoyens, une décision automatisée (crédit, dossier administratif, analyse médicale) pourrait être détournée sans trace visible.
  • La confiance dans ces outils dépend de garde-fous techniques réels, pas seulement de promesses écrites dans les paramètres.
  • Publier ces attaques aide plus les défenseurs que les attaquants : les failles sont déjà découvrables, mais les protections demandent un travail d'ingénierie délibéré.

Pourquoi c’est un enjeu pour les entreprises

Les consignes de sécurité écrites dans les instructions d'une IA ne protègent pas un système multi-agents ; il faut sécuriser l'architecture.

Une organisation qui déploie plusieurs IA coordonnées (via des protocoles comme MCP ou A2A) hérite d'une surface d'attaque qui grandit avec la complexité du système. Les défenses proposées offrent une base concrète, avec un coût de performance modéré : environ 5 % de latence supplémentaire dans l'exemple testé.

  • Traiter la sécurité au niveau de l'infrastructure (signatures, contrôle d'accès par rôle) et non par de simples consignes textuelles.
  • Empiler les protections : chaque défense couvre un canal différent, aucune ne suffit seule (le fameux « trilemme » fiabilité/utilité/rapidité).
  • Prévoir une surveillance active des échanges entre agents pour repérer les comportements anormaux avant qu'ils ne se propagent.