Le 3 septembre 2026, OpenAI a lancé GPT-6 Astra, présenté par l'entreprise elle-même comme « le modèle le plus intelligent et le plus aligné au monde ». Le déploiement a d'abord concerné un groupe restreint d'organisations et, selon l'annonce, il s'étendra dans les prochains jours à tous les forfaits ChatGPT Plus, Pro, Business et Enterprise, ainsi qu'à l'API d'OpenAI, à Microsoft Azure et à AWS Bedrock.
Le président de l'entreprise, Greg Brockman, a déclaré aux journalistes qu'« il n'est pas déraisonnable de sentir que nous sommes désormais entrés dans l'ère de l'AGI ». C'est la phrase qui a fait la une. Derrière elle se trouvent trois éléments qui changent la décision de ceux qui utilisent l'IA pour travailler : ce que la machine sait désormais faire, ce que les chiffres signifient réellement et combien cela coûte.
Ce qu'il fait que le précédent ne faisait pas
Le saut mis en avant par OpenAI est l'utilisation de l'ordinateur : remplir un formulaire à l'écran, mettre à jour une fiche client dans le CRM, organiser un agenda, faire des recherches et rédiger un résumé directement dans l'éditeur de texte, construire un site puis vérifier que les boutons fonctionnent. C'est le modèle qui manipule l'interface lui-même, au lieu de vous renvoyer un texte à exécuter.
Les chiffres publiés par l'entreprise, tous comparés à GPT-5.6 Sol, la génération précédente :
- OSWorld 2.0 (tâches réelles sur ordinateur) : 72,6 % contre 65,7 %, en environ 47 % de temps en moins par tâche — approximativement 40 minutes contre 75.
- ScreenSpot-Pro (trouver et cliquer sur le bon élément dans une interface chargée) : 92,7 % contre 76,9 %.
- Agents' Last Exam (travail professionnel sur des logiciels réels) : 59,3 %, contre 55,5 % pour Claude Opus 5 et 53,6 % pour Sol.
Fiche technique : fenêtre de contexte de 1 050 000 tokens, sortie allant jusqu'à 128 000 tokens et date limite des connaissances au 30 avril 2026.
Le même test, deux résultats : 62,7 % et 99,9 %
Dans son annonce, OpenAI écrit qu'Astra « sature l'ARC-AGI-3 avec 99,9 % ». L'ARC-AGI-3 est un test de raisonnement dans des environnements inédits, maintenu par l'ARC Prize Foundation — une organisation indépendante d'OpenAI. Or, l'ARC Prize a publié, le même jour, deux résultats pour le même modèle :
- 62,7 % avec le harnais standard, l'interface minimale et identique pour tous les modèles, pour un coût de 26 098 $ en appels.
- 99,9 % avec un « provider adapter », un harnais spécifique au fournisseur qui préserve l'état de raisonnement entre les appels et compresse la conversation, permettant au modèle de réutiliser le travail déjà effectué. Coût : 18 817 $.
Ce n'est ni une fraude ni un détail. Sur les 167 parties résolues par les deux harnais, la version avec adaptateur a été environ 3,66 fois plus rapide et a consommé 49 % de tokens en moins. Et les 62,7 % obtenus avec le harnais standard constituent déjà, à eux seuls, le meilleur résultat jamais mesuré par l'ARC Prize : Claude Opus 5 a obtenu 30,2 % et GPT-5.6 Sol, 7,8 %. L'ARC Prize elle-même écrit que saturer ce test ne constituerait pas une preuve d'AGI, car sa portée reste étroite par rapport au monde réel. Pour ajouter à la confusion, une partie de la presse a publié le chiffre de 98,6 %, qui correspond encore à une autre configuration de la même mesure.
La leçon pratique vaut pour n'importe quel fournisseur. Le chiffre d'un test d'IA n'est pas une propriété du modèle : c'est le résultat du modèle combiné à l'échafaudage dans lequel il fonctionne. Lorsque quelqu'un vous montre un pourcentage, les deux questions qui séparent l'information de la propagande sont « mesuré avec quel harnais ? » et « avec quel niveau d'effort ? ». Nous avons écrit sur ce type de piège dans comment évaluer une IA.
Le prix a changé de catégorie, et le calcul ne se fait pas par token
Sur l'API, Astra coûte 10 $ par million de tokens en entrée et 50 $ par million en sortie, avec une entrée en cache à 1 $. Le mode Fast coûte le double, Batch et Flex la moitié, et au-delà de 272 000 tokens en entrée, le calcul change à nouveau. Cela représente environ 2,5 fois le prix de GPT-5.6 Sol.
Brockman a répondu à cette hausse en affirmant que « ce que vous voulez vraiment, c'est le prix par tâche ». L'argument est légitime : si la tâche se termine avec moins de tokens et en moins de temps, le coût total baisse même avec un token plus cher. OpenAI présente un cas de ce type dans le Terminal-Bench Science, où Astra obtient 64,6 % contre 52,6 % pour Claude Fable 5.1, avec un coût d'API estimé environ 31 % inférieur.
Sauf qu'Artificial Analysis, qui effectue des mesures indépendantes, est arrivée au résultat inverse dans son indice général : Astra utilise moins de tokens que Sol pour une performance comparable, et pourtant revient plus cher, car la hausse de prix dépasse l'économie réalisée. Dans l'indice d'intelligence de cet organisme, Astra obtient 61 contre 66 pour Claude Fable 5.1.
Autrement dit : le « prix par tâche » est le bon critère, et c'est précisément pour cela qu'il ne peut pas être défini par le fournisseur. Le prix par tâche se mesure sur votre propre tâche. Si vous payez déjà par token en production, ce lancement est une raison de refaire votre feuille de calcul, pas de changer de modèle par défaut. Le raisonnement sur les coûts est détaillé dans le prix de l'IA a baissé de 80 %.
Une première : le niveau « Critique » de sécurité
Astra est le premier modèle d'OpenAI à atteindre le niveau Critique en capacité cybernétique au sein même du Preparedness Framework de l'entreprise. Testé sans les garde-fous de production, il a obtenu 100 % sur ExploitBench (contre 78,5 % pour Sol) et 42,4 % sur ExploitGym (contre 30,3 %). Sur SRE-Bench, qui mesure la rétro-ingénierie de binaires, il a résolu 88,0 % des tâches dès la première tentative et 99,2 % en quatre tentatives maximum — contre 55,9 % et 68,7 % pour Sol.
La donnée la plus concrète : dans une évaluation construite à partir de failles des trois mois précédents, le modèle a découvert et exploité deux vulnérabilités zero-day jusqu'alors inconnues. OpenAI affirme les avoir signalées toutes les deux aux mainteneurs des logiciels concernés.
La version mise à disposition refuse les tâches offensives — créer un exploit de démonstration de faisabilité (proof of concept), par exemple — et accepte le travail défensif, comme la revue de code et l'application de correctifs. Via le programme Daybreak, l'entreprise prévoit d'assouplir ces restrictions pour les équipes de défense dans les prochaines semaines.
Pour une entreprise ordinaire, l'effet n'est pas abstrait : trouver une faille est devenu bien moins coûteux, tandis que la corriger continue de dépendre des équipes humaines et des files d'attente de maintenance. C'est le décalage que nous avions déjà mesuré dans l'IA trouve les failles plus vite que les entreprises ne les corrigent.
Ce qu'OpenAI n'a pas mis en avant
- Le modèle est devenu plus difficile à surveiller. L'entreprise elle-même écrit que le raisonnement écrit d'Astra est plus difficile à surveiller que celui de Sol, car il contrôle mieux ce qu'il écrit et résout les problèmes avec moins d'étapes visibles. Elle qualifie cela de régression qu'elle prend au sérieux.
- Tous les tableaux ne sont pas favorables. Sur Humanity's Last Exam avec outils, Astra obtient 57,2 % contre 65,0 % pour Claude Fable 5.1. En codage agentique sur DeepSWE, Muse Spark 1.3, de Meta, arrive en tête avec 75,4 % contre 74,1 %.
- L'un des tests phares a un historique de conflit d'intérêts. FrontierMath, où Astra obtient 98 %, a été créé par Epoch AI avec un financement d'OpenAI — un arrangement révélé seulement fin 2024 et qui a suscité des critiques publiques de la part de mathématiciens ayant collaboré sans le savoir.
- Presque tous les chiffres ont été obtenus en effort maximal, une configuration qui augmente les scores et qui n'est pas celle que vous utilisez au quotidien.
Rien de tout cela ne remet en cause le lancement. Cela sert simplement à rappeler que celui qui publie la plupart des chiffres est la partie intéressée — et que la vérification indépendante, quand elle existe, arrive généralement après coup.
Que faire cette semaine
- Ne changez pas de modèle par défaut. Identifiez les dix tâches que votre équipe répète le plus souvent et exécutez ces mêmes dix tâches sur le modèle actuel et sur le nouveau, en mesurant le coût par tâche terminée et le nombre de cas ayant nécessité une reprise.
- Révisez votre budget si vous payez par token. Une hausse de 2,5 fois du prix catalogue change les projections, même si la consommation diminue.
- Commencez par le travail à l'écran. C'est là que le gain mesuré est le plus important : remplir un formulaire, mettre à jour une fiche, vérifier une feuille de calcul, contrôler qu'un site fonctionne toujours après une modification. Choisissez une tâche ennuyeuse, répétitive, et que vous savez déjà chronométrer.
- Traitez la sécurité comme une file d'attente, pas comme une actualité. Si la découverte de failles s'est accélérée, le goulot d'étranglement devient votre routine de mise à jour et de correction.
- Exigez une traçabilité. Un agent qui opère sur un système doit laisser une trace de ce qu'il a fait, avec une approbation humaine pour les actions qui dépensent de l'argent ou suppriment des données.
C'est exactement ce type d'approche — tâche mesurée, coût par tâche, approbation humaine au bon endroit — que nous mettons en œuvre dans l'implémentation de l'IA pour les entreprises. La question utile n'est pas de savoir quel modèle est le meilleur au monde, mais quelle tâche de votre entreprise mérite d'être confiée à une machine cette semaine.
Sources
Annonce officielle et page de sécurité de GPT-6 Astra (OpenAI, 3 septembre 2026) ; documentation des modèles et des prix de l'API d'OpenAI ; analyse de l'ARC-AGI-3 publiée par l'ARC Prize Foundation ; mesures indépendantes d'Artificial Analysis ; couverture de Fortune, d'Engadget et de The New Stack ; commentaire de Gary Marcus ; et historique du financement de FrontierMath publié par Epoch AI.
Questions fréquentes
Qu’est-ce que GPT-6 Astra et quand a-t-il été lancé ?
C’est le nouveau modèle de pointe d’OpenAI, annoncé le 3 septembre 2026 comme « le modèle le plus intelligent et le mieux aligné au monde ». Il a d’abord été ouvert à un groupe limité d’organisations et, selon l’annonce, arrive dans les jours suivants sur les formules ChatGPT Plus, Pro, Business et Enterprise, ainsi que sur l’API d’OpenAI, Microsoft Azure et AWS Bedrock.
GPT-6 est-il une AGI ?
Aucune déclaration formelle en ce sens. Le président d’OpenAI, Greg Brockman, a dit qu’« il n’est pas déraisonnable de sentir que nous sommes maintenant dans l’ère de l’AGI », ce qui est une impression, pas une mesure. La ARC Prize Foundation, qui maintient le test de raisonnement où le modèle s’est le mieux comporté, écrit explicitement que saturer ce test ne prouverait pas l’AGI, car sa portée reste étroite face au monde réel.
Pourquoi le même test affiche-t-il 62,7 % et 99,9 % ?
Parce que les harnais diffèrent. Avec le harnais standard d’ARC Prize, identique pour tous les modèles, Astra obtient 62,7 %. Avec un adaptateur propre au fournisseur, qui conserve l’état de raisonnement entre les appels et laisse le modèle réutiliser le travail déjà fait, il obtient 99,9 %. Les deux chiffres sont réels et mesurent des choses différentes : le second inclut l’échafaudage, pas seulement le modèle.
Combien coûte GPT-6 Astra ?
Dans l’API, 10 dollars par million de tokens en entrée et 50 dollars par million en sortie, l’entrée en cache étant à 1 dollar. Le mode Fast coûte le double, les modes Batch et Flex la moitié. C’est environ 2,5 fois le prix de la génération précédente, GPT-5.6 Sol.
Faut-il changer de modèle maintenant ?
Seulement après avoir mesuré. Faites tourner les tâches que votre équipe répète le plus sur les deux modèles et comparez le coût par tâche terminée et le taux de reprise, pas le prix par token. Un modèle plus cher au token peut revenir moins cher à la tâche s’il termine en moins d’étapes, et l’inverse arrive aussi.
Qu’est-ce que cela change pour la sécurité de mon entreprise ?
C’est le premier modèle d’OpenAI classé au niveau Critique de capacité cyber selon le critère de l’entreprise elle-même, et il a découvert deux vulnérabilités inédites au cours d’une évaluation. La version publique refuse les tâches offensives et accepte les tâches défensives. En pratique, trouver une faille est devenu moins cher des deux côtés, et le goulot d’étranglement devient votre routine de correctifs et de mises à jour.


