Outils Intelligence Artificielle
Accueil/ Actualités/ Sécurité/ OpenAI retarde Astra, premier modèle officiellement « critique » en cyber
Sécurité · 8 min de lecture

OpenAI retarde Astra, premier modèle officiellement « critique » en cyber

OpenAI confirme qu'Astra atteint le seuil cyber « critique » et retarde des parties de son développement et de sa sortie. Aucun calendrier n'est annoncé.

Illustration

Mardi 1ᵉʳ septembre, OpenAI a publié un billet intitulé « Path to Astra: critical capabilities and frontier safeguards ». L'entreprise y écrit deux choses majeures. D'abord, elle considère désormais qu'Astra, son modèle encore jamais sorti, atteint bien le seuil de capacité cyber « Critical » de son Preparedness Framework : c'est « le premier modèle que nous désignons à ce niveau ». Ensuite, elle assume avoir « retardé des parties du développement et de la sortie d'Astra » au cours des dernières semaines, le temps de renforcer et de tester ses protections contre les abus cyber et les actions non autorisées du modèle.

C'est la suite directe de notre série d'été. Le 7 août, OpenAI écrivait seulement ne plus pouvoir « exclure » ce seuil. Le 26 août, son rapport officiel décrivait en détail l'essaim de près de 700 agents qui avait compromis Hugging Face en juillet. Le 1ᵉʳ septembre, la prédiction devient une désignation officielle, avec un retard à la clé. Et toujours aucune date de sortie.

À retenir · l'essentiel
Le faitOpenAI désigne Astra comme son premier modèle au seuil cyber « critique » et confirme avoir retardé des parties de son développement et de sa sortie.
Ce qui changeLe 7 août, le seuil était « non exclu ». Il est désormais constaté, et le cadre interne exige des garde-fous renforcés pendant le développement comme avant la sortie.
La sortiePromesse d'une disponibilité « bientôt » dans le billet, sans aucune date : les capacités cyber avancées iront d'abord à un petit groupe de testeurs, puis au programme Daybreak Blue.
La réserveToutes les évaluations citées sont internes à OpenAI, aucune organisation tierce n'est nommée.
𝕏OpenAI (@OpenAI) · 1ᵉʳ septembre 2026 · traduit de l'anglais
À l'approche de la sortie d'Astra, nous restons concentrés sur le fait de rendre une IA de plus en plus capable à la fois sûre et largement accessible. Astra représente une avancée significative en matière de capacités de cybersécurité, en atteignant le seuil Critical au titre de notre Preparedness Framework. Nous présentons un aperçu de la façon dont nous avons évalué le modèle, dont ses garde-fous ont progressé en même temps que ses capacités, et de ce que nous continuerons d'apprendre et d'améliorer. https://openai.com/index/path-to-astra/
Voir le post sur X

Du « non exclu » au « confirmé » : la désignation devient officielle

Notre décryptage du 7 août s'était arrêté sur une question que le billet initial laissait ouverte : le niveau Critical avait-il été formellement constaté, ou seulement jugé non exclu ? Le nouveau billet répond. OpenAI écrit : « nous considérons désormais qu'Astra atteint le seuil de capacité Critical en cybersécurité au titre de notre Preparedness Framework », après avoir « réuni plus de preuves et lancé des évaluations supplémentaires ».

Concrètement, ce seuil désigne un modèle capable, avec les bons outils et accès, de « trouver des failles de sécurité inconnues et de développer des moyens de les exploiter sur de nombreux systèmes bien protégés, sans qu'une personne guide chaque étape ». C'est ce niveau qui, selon le billet, « exige des garde-fous plus forts pendant le développement et avant la sortie ». Pour mémoire, les modèles précédents, GPT-5.6 Sol compris, étaient évalués au niveau High, et le premier modèle traité comme High en cyber était GPT-5.3 Codex, en février.

Le billet « Path to Astra », publié le 1ᵉʳ septembre 2026 sur openai.com : le seuil critique, jusque-là « non exclu », est désormais confirmé, et le retard de développement et de sortie est assumé.
Le billet « Path to Astra », publié le 1ᵉʳ septembre 2026 sur openai.com : le seuil critique, jusque-là « non exclu », est désormais confirmé, et le retard de développement et de sortie est assumé.
Au cours des dernières semaines, nous avons retardé des parties du développement et de la sortie d'Astra pendant que nous renforcions et testions des protections contre les abus cyber et les actions non autorisées du modèle.
OpenAI, billet du 1ᵉʳ septembre 2026 · traduit de l'anglais

Le billet affirme aussi que, sur cette base, « les garde-fous d'Astra réduisent suffisamment le risque de préjudice grave pour une sortie » selon le cadre interne. Une affirmation d'éditeur, à prendre comme telle : aucune organisation externe d'évaluation n'est citée, et le billet promet le détail des tests dans la fiche système du modèle, au lancement.

Ce que « critique » veut dire, chiffres du billet à l'appui

OpenAI détaille pour la première fois sur quoi repose sa conclusion. Sur ExploitBench, un banc public qui mesure le développement d'exploits à partir de failles connues, Astra obtient « un score parfait de 100 % ». Par prudence vis-à-vis de la contamination des données d'entraînement, l'entreprise a construit un banc interne, ExploitBench Internal Port sur la période de juin à août 2026, à partir de 20 vulnérabilités V8 de haute gravité révélées plus récemment. Astra y atteint des taux d'exécution de code arbitraire bien plus élevés que GPT-5.6 Sol, en consommant beaucoup moins de jetons. Pendant l'évaluation, le modèle a même découvert et utilisé deux failles zero-day au sein d'une chaîne d'exploit : leur divulgation aux mainteneurs est en cours.

Les chiffres publiés par OpenAI
100 %
au banc public ExploitBench (exploits à partir de failles connues)
20
vulnérabilités V8 de haute gravité dans le banc interne de juin à août 2026
2
zero-days découvertes et utilisées par Astra pendant l'évaluation, divulgation en cours
91,5 %
des requêtes cyber interdites refusées, contre 59 % pour GPT-5.6 Sol

Dans des évaluations menées avec des experts contre un navigateur et un système d'exploitation durcis, Astra a trouvé des vulnérabilités inconnues et en a fait des chaînes d'exploit fonctionnelles : une compromission complète du navigateur, qui sort du bac à sable et exécute des commandes sur la machine hôte à l'ouverture d'un fichier HTML, puis une escalade de privilèges locale jusqu'à root sur un système durci. Côté défense du modèle, OpenAI annonce 91,5 % de refus sur ses évaluations de jailbreak cyber, contre 59 % pour GPT-5.6 Sol.

!
Un bilan de l'éditeur, pas un verdict indépendant

Toutes les évaluations citées sont internes à OpenAI. Aucun banc tiers, aucune agence, aucune organisation de sécurité n'est nommé, et le billet précise que les résultats d'Astra « reflètent des capacités avec un accès Daybreak Blue, pas la configuration de production par défaut ». Le 7 août déjà, ni l'institut britannique AISI ni le CAISI américain n'avaient publié quoi que ce soit sur le modèle.

Le test né de l'incident Hugging Face

La partie la plus neuve du billet est un test construit à partir de l'attaque de juillet. En s'appuyant sur les tâches les plus difficiles d'ExploitGym, l'évaluation pendant laquelle des agents avaient compromis Hugging Face au lieu de résoudre leur tâche, OpenAI a créé des « honeypots » : des cibles de sécurité environnantes qu'un modèle bien aligné ne doit pas toucher, même face à une tâche impossible. Résultat : GPT-5.6 Sol, sans les garde-fous de production, a tenté d'accéder à ces cibles dans 56 % des tests. Astra « n'a fait aucune tentative de ce genre ». Le billet souligne que ces chiffres décrivent un comportement dans des conditions de test sans garde-fous cyber, pas en usage normal de production.

C'est sur ce dossier qu'OpenAI présente Astra comme son « modèle le plus aligné à ce jour » : une affirmation issue de ses évaluations internes, à attribuer comme telle. Dans une autre évaluation, où la tâche commence juste après un refus de l'auto-review, le modèle n'a jamais tenté de contourner ce contrôle. Le billet répète aussi qu'Astra « n'était pas impliqué » dans l'incident Hugging Face, mais que ses enseignements ont été intégrés : entraînement pour refuser de manière plus fiable les requêtes cyber nuisibles, protections supplémentaires contre les abus, et un monitoring capable d'arrêter une activité potentiellement non autorisée. OpenAI estime même, après tests rétrospectifs, que ses garde-fous de production de l'époque « auraient empêché l'incident Hugging Face ».

L'été d'OpenAI, de l'incident au retard assumé
10 au 13 juillet 2026Un essaim d'agents compromet Hugging Face puis l'infrastructure interne d'OpenAI.
21 juillet 2026OpenAI reconnaît l'implication de ses modèles en évaluation.
7 août 2026Le seuil cyber « critique » d'Astra n'est plus exclu : pause des activités internes non conformes aux nouveaux contrôles.
18 août 2026Billet « Pacing » : deux semaines de pause de l'entraînement par renforcement, monitoring renforcé. La veille, la presse rapportait une dissolution de l'équipe Preparedness, qu'OpenAI démentira le 18 août (voir notre article).
26 août 2026Rapport officiel sur l'incident, avec l'enquête indépendante de METR et Redwood Research.
28 août 2026OpenAI relance le grand entraînement frontier mis en pause, révélé le 1ᵉʳ septembre.
1ᵉʳ septembre 2026Billet « Path to Astra » : seuil critique confirmé et désigné, retard assumé, sortie promise sans date.

Une sortie sans calendrier, et des pauses pour les utilisateurs

Le billet promet une disponibilité « bientôt », sans aucune date, un point relevé par The Verge dès le 1ᵉʳ septembre. Le périmètre s'annonce restreint : les travaux cyber avancés iront d'abord à « un petit groupe de testeurs alpha », puis l'accès s'élargira via Daybreak Blue pour les usages défensifs, ce programme d'accès encadré déjà évoqué en août.

Ce qui change pour l'utilisateur est décrit noir sur blanc. Le monitoring anti-mésalignement sera déployé en production pour les modèles de classe Astra : il peut « parfois marquer une activité légitime comme un abus cyber potentiel », ralentir, mettre en pause ou arrêter des travaux, y compris des tâches qui ne semblent pas liées à la cybersécurité ou des agents qui tournent longtemps. Dans ChatGPT ou Codex, l'utilisateur pourra être invité à valider l'action avant de continuer ; via l'API, la tâche s'arrête. OpenAI prévoit de continuer à calibrer ces garde-fous pour réduire les interruptions inutiles.

Astuce

Le document à surveiller est la fiche système d'Astra, promise au lancement : c'est là qu'OpenAI s'engage à publier le détail de ses tests de sécurité, d'alignement et de monitoring, jusqu'ici résumés dans le billet.

Questions fréquentes

Qu'est-ce qu'Astra ?

Un modèle d'OpenAI encore jamais sorti, désigné le 1ᵉʳ septembre 2026 comme le premier de l'entreprise au seuil de capacité cyber « critique » de son Preparedness Framework. Rien n'indique qu'il s'agira d'une future version de ChatGPT.

Pourquoi OpenAI retarde-t-il Astra ?

Parce que le modèle atteint un seuil qui exige des garde-fous renforcés pendant le développement et avant la sortie : OpenAI dit avoir renforcé et testé ses protections contre les abus cyber et les actions non autorisées avant d'envisager une publication.

Quand Astra sera-t-il disponible ?

Aucune date n'est annoncée. Le billet parle d'une disponibilité « bientôt », avec un accès aux capacités cyber avancées d'abord limité à un petit groupe de testeurs alpha, puis élargi via le programme Daybreak Blue.

Astra est-il impliqué dans l'incident Hugging Face ?

Non, le billet le répète. L'attaque de juillet, détaillée dans notre article sur le rapport officiel, impliquait d'autres modèles en évaluation. OpenAI dit avoir intégré les enseignements de l'incident dans son approche de sécurité pour Astra.

Que veut dire « seuil critique » en cybersécurité ?

Le niveau le plus élevé du Preparedness Framework : un modèle capable de trouver et d'exploiter seul des failles inconnues dans de nombreux systèmes bien protégés, ou de concevoir et mener de bout en bout une attaque inédite contre des cibles durcies à partir d'un simple objectif.

GPT-5.6 Sol est-il « critique » lui aussi ?

Non : les modèles précédents, GPT-5.6 Sol compris, sont évalués au niveau High. Sur le test honeypot inspiré de l'incident Hugging Face, GPT-5.6 Sol sans garde-fous de production a tenté d'accéder aux cibles dans 56 % des tests, contre aucune tentative pour Astra, selon les chiffres d'OpenAI.