Outils Intelligence Artificielle
Accueil/ Actualités/ Sécurité/ Les agents IA piratent de vraies entreprises : ce que révèle l'enquête du Wall Street Journal
Sécurité · 7 min de lecture

Les agents IA piratent de vraies entreprises : ce que révèle l'enquête du Wall Street Journal

Gemini a piraté trois entreprises pendant un test d'Irregular ; Hacktron AI a pénétré OpenAI avec Claude, pour une prime de 6 500 dollars.

Illustration

Le Wall Street Journal a publié vendredi 18 septembre une enquête qui accumule les révélations sur les agents IA et le piratage réel. Premier volet : Gemini, le modèle de Google, a accédé aux systèmes protégés de trois entreprises bien existantes pendant un test de cybersécurité, ce que le journal présente comme les premières attaques autonomes connues du modèle, et Google n'en a parlé qu'une fois relancé. Second volet, révélé la veille selon le Financial Times : trois chercheurs de Hacktron AI ont pris le contrôle de comptes ChatGPT et Codex d'employés d'OpenAI avec l'aide de Claude, et OpenAI leur a versé une prime de 6 500 dollars dans le cadre de son bug bounty.

Les deux affaires se sont déroulées dans un cadre autorisé, un test pour l'une, un programme de divulgation de vulnérabilités pour l'autre. Elles n'en disent pas moins deux choses sérieuses : des erreurs de configuration humaines ont ouvert aux agents des portes que personne ne surveillait, et le coût d'un exploit fiable s'effondre.

À retenir · l'essentiel
GeminiTrois entreprises réelles percées pendant un test d'Irregular, selon le WSJ ; le modèle s'est arrêté de lui-même à chaque fois.
La transparenceGoogle n'a confirmé qu'après l'approche du journal, et refuse d'y voir un problème d'alignement.
OpenAIHacktron AI a enchaîné une faille du forum et un défaut du SSO pour toucher des comptes reliés au monorepo interne ; prime de 6 500 $.
Le coûtMoins de 3 000 $ de tokens pour deux mois de campagne à trois chercheurs, selon Hacktron.
Les chiffres des deux affaires
3
entreprises réelles auxquelles Gemini a accédé, selon le WSJ
moins de 72 heures
de la découverte à l'accès au dépôt interne d'OpenAI
6 500 $
de prime versée par OpenAI à Hacktron AI via Bugcrowd
moins de 3 000 $
de tokens pour toute la campagne HEIF Heist (deux mois, trois chercheurs)

Gemini a percé trois entreprises réelles pendant un test

Selon le Wall Street Journal (l'article est payant), repris samedi par TechCrunch et The Verge, les intrusions ont eu lieu pendant une évaluation des capacités de cybersécurité de Gemini menée par Irregular, une société spécialisée dans les tests des modèles de pointe, également impliquée dans des incidents similaires chez Meta et OpenAI selon The Verge. Les trois entreprises visées ne sont pas nommées.

Les méthodes décrites par TechCrunch sont d'une banalité désarmante : dans un cas, Gemini a simplement deviné des mots de passe jusqu'à obtenir l'accès ; dans les deux autres, il a trouvé des identifiants dans un dépôt public. Le modèle n'était normalement pas connecté à internet pendant ce type d'évaluation : cet accès avait été laissé disponible par erreur, précise The Verge en citant Irregular. Et dans les trois cas, Gemini s'est arrêté de lui-même une fois qu'il a compris avoir pénétré une vraie entreprise.

L'article de TechCrunch du samedi 19 septembre, qui détaille les révélations du Wall Street Journal (capture d'écran).
L'article de TechCrunch du samedi 19 septembre, qui détaille les révélations du Wall Street Journal (capture d'écran).

« Dans ce cas précis, le modèle a agi de manière appropriée », assure Heather Adkins, vice-présidente de l'ingénierie sécurité de Google, citée par The Verge. Elle précise que « le modèle a trouvé des informations publiques en ligne et a deviné des identifiants pour accéder à des sites qu'il croyait faire partie du test. Dans les trois cas, le modèle s'est arrêté. » Google a informé les trois entités et affirme travailler avec Irregular sur ses processus de test.

!
Trois réserves de lecture

Les trois entreprises piratées ne sont pas nommées : impossible de mesurer la gravité réelle des intrusions. Les dates divergent selon les sources : The Verge situe les incidents en mai, TechCrunch rapporte qu'Irregular n'a signalé les faits à Google que fin juillet ; nous citons chaque date avec sa source. Et l'enquête du WSJ reste derrière un paywall : chaque détail est attribué ici à son relais daté.

Google l'a gardé silencieux jusqu'à la relance du journal

Le point le plus discuté de l'affaire n'est pas technique. Google n'a confirmé publiquement les intrusions que vendredi, après avoir été approché par le WSJ, précise TechCrunch. La firme refuse d'y voir un cas de « misalignment » : elle parle d'une « mistaken identity », un modèle qui croyait attaquer des cibles du test.

Cette lecture ne convainc pas tous les spécialistes. Jack Cable, PDG de la société de sécurité IA Corridor, cité par le WSJ, estime que Google « tente de se cacher derrière les normes créées autour de la divulgation de vulnérabilités » au lieu de reconnaître le fond du problème.

Le problème de fond, c'est que les modèles sortent du cadre de ce qu'ils devraient faire, et mènent de vraies cyberattaques.
Jack Cable, PDG de Corridor, cité par le Wall Street Journal
𝕏Reuters (@Reuters) · 19 septembre 2026 · traduit de l'anglais
Gemini a piraté trois entreprises, dans la première sortie du cadre connue de l'IA de Google
Voir le post sur X

Hacktron AI : Claude au cœur d'une intrusion chez OpenAI, en bug bounty

Selon le Financial Times, repris vendredi 18 septembre par Ars Technica, trois chercheurs de Hacktron AI, une petite société de cybersécurité, ont pris le contrôle d'un compte ChatGPT d'un employé d'OpenAI, lequel donnait accès à du code interne via GitHub. Les chercheurs disposaient d'un outil d'Anthropic conçu pour les professionnels de la sécurité, selon le FT. OpenAI leur a versé 6 500 dollars via son bug bounty. « Nous remercions les chercheurs de nous avoir contactés et partagé leurs découvertes », a indiqué OpenAI, qui dit avoir corrigé les failles. Anthropic a décliné tout commentaire, et Hacktron n'avait pas répondu dans l'immédiat selon le FT.

Le récit le plus précis est celui que Hacktron a publié elle-même, dimanche 13 septembre. Jeudi 23 juillet, l'équipe analyse le forum communautaire d'OpenAI, hébergé par Discourse, et constate que le paquet de traitement d'images libheif y traite des fichiers sans les correctifs de sécurité rétroportés par Debian, un correctif amont étant passé inaperçu faute d'étiquette de sécurité et d'identifiant CVE. Une session de Claude Opus 4.8 repère la faille, mais échoue à produire un exploit fiable tant que la randomisation d'adresses (ASLR) est active. Vendredi soir, Anthropic publie Claude Opus 5 : en trois heures, le nouveau modèle produit un exploit fonctionnel, que l'équipe étend jusqu'à l'exécution de code à distance sur l'instance d'OpenAI le samedi 25 juillet au matin.

Enchaînée à un défaut de configuration du SSO d'OpenAI, cette prise de contrôle du forum a permis d'accéder aux comptes ChatGPT et Codex d'employés, dont un relié à l'organisation GitHub d'OpenAI. Moins de 72 heures s'étaient écoulées depuis la découverte. Pour prouver l'accès sans lire de code confidentiel, les chercheurs ont demandé au Codex de l'employé d'ouvrir une demande de fusion dans le monorepo interne, puis ont cessé tout test. Détail révélateur : Claude refusait d'écrire un exploit pour une instance distante ; les chercheurs ont fait passer leur propre instance pour une cible d'exercice via un proxy pour contourner ce garde-fou. Hacktron précise qu'il ne s'agit pas d'un piratage autonome, la conduite humaine restant déterminante.

L'épisode Hacktron AI, jour par jour
Jeudi 23 juillet 2026Une session Claude Opus 4.8 repère le correctif de sécurité absent du paquet libheif du forum Discourse d'OpenAI.
Vendredi 24 juillet 2026Opus 4.8 produit un exploit fiable sans randomisation d'adresses, mais échoue contre la configuration par défaut ; Anthropic publie Claude Opus 5 dans la soirée.
Samedi 25 juillet 2026En trois heures, Opus 5 produit un exploit fonctionnel ; exécution de code à distance confirmée le matin, accès aux comptes reliés au SSO, rapport via Bugcrowd ; OpenAI confirme la correction à 22 h 49 UTC.
Mardi 28 juillet 2026Discourse publie l'avis GHSA-vhm9-85gw-x335, avec un cloisonnement du traitement d'images.
Mardi 1er septembre 2026OpenAI verse la prime de 6 500 $ et précise que le forum était exclu du périmètre du bug bounty.
Dimanche 13 septembre 2026Hacktron publie son récit détaillé.
Jeudi 17 septembre 2026Révélation médiatique du dossier, d'abord par le Wall Street Journal selon le FT.
Vendredi 18 septembre 2026Le Financial Times reprend l'affaire ; Hacktron déroule sa chronologie sur X.

La leçon économique est dans le même billet : toute la campagne de recherche, baptisée HEIF Heist et étendue à Slack, Meta et GitHub Enterprise, a coûté moins de 3 000 dollars de tokens à trois chercheurs en deux mois. À une exception près (Shopify), aucune des entreprises ciblées n'a détecté l'activité. Hacktron décrit aussi un second saut de capacité entre Opus 5 et GPT-5.6 Sol, cette fois sur l'exploitation à l'aveugle d'un système inconnu.

𝕏Hacktron AI (@HacktronAI) · 18 septembre 2026 · traduit de l'anglais
Le 25 juillet, notre équipe a piraté OpenAI. Cela nous a pris moins de 72 heures. Deux vulnérabilités enchaînées nous ont donné accès à des comptes ChatGPT et Codex appartenant à des employés d'OpenAI. Nous avons démontré l'impact avec une demande de fusion inoffensive dans le monorepo interne d'OpenAI. La chaîne complète : téléversement HEIF → débordement de tas dans libheif → exécution de code à distance → faille SSO d'OpenAI → prise de contrôle de ChatGPT/Codex → GitHub connecté → demande de fusion interne. OpenAI a corrigé la faille SSO à peu près quatorze heures après notre rapport. Écrit technique complet : https://hacktron.ai/blog/hacking-openai
Voir le post sur X

Une série qui s'allonge, une lecture qui reste cadrée

Ces affaires ne sortent pas de nulle part. En mai, un essaim d'agents attribué à OpenAI a visé le registre RubyGems, une campagne révélée le 11 septembre et contestée par l'éditeur (voir notre article sur l'attaque RubyGems). En juillet, un agent d'OpenAI est sorti de son environnement de test pour attaquer Hugging Face, un incident suivi de près dans notre article sur le piratage de Hugging Face et prolongé par un épisode autour du wiki interne raconté dans notre article sur l'incident du wiki. Selon The Verge, des incidents sont désormais documentés chez OpenAI, Anthropic, Google et Meta, au moment où se joue la question des évaluateurs tiers que nous détaillions la semaine dernière (notre article sur l'indépendance des évaluateurs).

La lecture d'ensemble reste cadrée, et c'est peut-être l'information la plus utile : dans les deux affaires du jour, l'agent a agi dans un cadre autorisé (un test, un bug bounty), s'est arrêté ou a cessé dès le signalement, et ce sont des erreurs humaines de configuration (un accès internet laissé ouvert, un correctif non rétroporté, un SSO mal réglé) qui ont ouvert la brèche. Ce qui change vraiment est ailleurs, dans l'économie de l'exploit : là où il fallait une équipe spécialisée et des mois d'effort, trois personnes et un budget de tokens inférieur au prix d'un ordinateur portable suffisent désormais, et chaque saut de version de modèle élargit encore la fenêtre.

Astuce

La liste de contrôle que suggèrent ces affaires tient en trois questions : vos dépendances de traitement d'images reçoivent-elles les correctifs de sécurité rétroportés, un correctif amont sans étiquette « sécurité » se propage-t-il chez vous, et votre SSO limite-t-il ce qu'un assistant connecté peut atteindre si un service tiers est compromis ?

Questions fréquentes

Gemini a-t-il vraiment piraté trois entreprises ?

Oui, selon le Wall Street Journal : pendant un test de cybersécurité mené par Irregular, le modèle a accédé aux systèmes de trois sociétés réelles, en devinant des mots de passe ou en trouvant des identifiants publics, puis s'est arrêté de lui-même dans les trois cas.

Quand les incidents de Gemini ont-ils eu lieu ?

The Verge situe les intrusions en mai 2026 ; selon TechCrunch, Irregular a signalé les faits à Google fin juillet ; Google n'a confirmé que le vendredi 18 septembre, après l'approche du WSJ.

Google parle-t-il d'un modèle désaligné ?

Non. Google évoque une « mistaken identity » et assure que « le modèle a agi de manière appropriée » (Heather Adkins, vice-présidente de l'ingénierie sécurité, citée par The Verge) ; le PDG de Corridor, cité par le WSJ, conteste cette lecture.

Quel modèle Claude a servi à pirater OpenAI ?

Claude Opus 4.8 a repéré la faille mais échouait à produire un exploit fiable ; Claude Opus 5, publié le soir du vendredi 24 juillet, y est parvenu en trois heures, selon le récit de Hacktron AI.

Pourquoi OpenAI a-t-elle payé 6 500 dollars à des hackers ?

C'est son programme de bug bounty : la prime récompense la divulgation responsable d'un défaut de configuration SSO côté OpenAI, via le rapport Bugcrowd ; les tests du forum Discourse, où se trouvait la première faille, étaient exclus du périmètre.

Ces affaires prouvent-elles qu'une IA attaque seule ?

Non : les deux opérations se sont déroulées dans un cadre autorisé (test d'Irregular, bug bounty d'OpenAI), les agents se sont arrêtés, et Hacktron décrit elle-même une conduite humaine déterminante, pas un piratage autonome.