GPT-6 Astra vs Fable 5.1 : benchmarks, tests et verdict terrain
En trois jours, Anthropic a sorti Claude Fable 5.1 et OpenAI a répondu avec GPT-6 Astra. Les deux se disputent le titre de meilleur modèle du moment, et les tableaux de scores semblent donner raison à chacun selon la ligne qu'on regarde.
J'ai passé du temps avec les deux. Voici ce que disent vraiment les chiffres, ce que j'ai observé en conditions réelles, et comment je choisirais aujourd'hui pour une équipe en entreprise.
GPT-6 Astra et Fable 5.1 en bref
Anthropic a lancé Claude Fable 5.1 le 1er septembre 2026. Le modèle est pensé pour les projets ambitieux qui s'étalent sur plusieurs heures : il planifie, utilise les outils nécessaires et se rattrape quand une étape échoue.
OpenAI a annoncé GPT-6 Astra le 3 septembre 2026, avec un déploiement d'abord réservé à un groupe limité d'organisations, puis élargi aux abonnés ChatGPT Plus, Pro, Business et Enterprise dans les jours suivants. Le lancement a d'ailleurs été un peu chaotique, la presse ayant publié avant que la page officielle soit en ligne (Forbes). Son argument phare : le contrôle de l'ordinateur et du navigateur.
Sur le papier, les deux modèles sont très proches.
| GPT-6 Astra | Claude Fable 5.1 | |
|---|---|---|
| Sortie | 3 septembre 2026 | 1er septembre 2026 |
| Prix API (par million de tokens) | 10 $ en entrée, 50 $ en sortie | 10 $ en entrée, 50 $ en sortie |
| Lecture du cache | 1 $ | 0,25 $ |
| Fenêtre de contexte | 1,05 million de tokens | 1 million de tokens |
| Sortie maximale | 128 000 tokens | 128 000 tokens |
Même tarif de base, même ordre de grandeur de contexte (documentation Anthropic). La différence se joue ailleurs.
Mise à jour : GPT-6.1 Sol, l'alternative cinq fois moins chère
Le 29 septembre 2026, OpenAI a lancé GPT-6.1 Sol, qu'il présente comme proche d'Astra en code agentique, en computer use et en travail professionnel, pour un cinquième du prix. Côté API, Sol est facturé 2 $ en entrée et 10 $ en sortie par million de tokens (0,10 $ en lecture du cache), contre 10 $ et 50 $ pour Astra. Il est accessible via l'API et dans Codex pour les abonnés ChatGPT payants.
Pour une PME, l'enjeu est le rapport coût/qualité : sur des tâches répétitives à fort volume, une facture divisée par cinq peut compter davantage que l'écart de niveau. Ces performances sont celles annoncées par OpenAI ; mesurez-les sur vos propres tâches avant de basculer.
Les benchmarks : une avance qui dépend de ce qu'on mesure
Dans le tableau publié par OpenAI, Astra devance Fable 5.1 sur Terminal-Bench 4.0, un test de tâches dans un terminal : 57,9 % contre 55,8 %. L'écart se creuse sur AutomationBench, qui mesure l'automatisation de tâches : 41,4 % contre 31,4 %.
Mais dans ce même tableau, Fable 5.1 garde l'avantage sur Humanity's Last Exam avec outils, un examen de niveau doctorat : 65 % contre 57,2 %.
Les évaluations indépendantes vont dans le même sens nuancé. Artificial Analysis classe Fable 5.1 premier de son indice d'intelligence avec 66 points. GPT-6 Astra obtient 61, soit le même score que son prédécesseur GPT-5.6 Sol. Sur le Coding Agent Index, Fable 5.1 mène aussi d'une courte tête, 70 contre 67 (Gigazine).
Sur WebDev Arena, où des utilisateurs votent pour la meilleure création web, Astra passe devant Fable 5.1 dans leurs configurations à effort maximal, avec quelques dizaines de points d'écart. Ce classement mesure des préférences sur des pages web, pas l'ensemble des compétences d'un modèle.
Dire qu'Astra gagne partout serait donc aller trop vite. Fable 5.1 reste un outil de très haut niveau ; contrairement à ce qu'on lit un peu partout, je le trouve excellent.
ARC-AGI-3 : 99,9 %, mais avec quel harnais ?
Le chiffre qui a fait le tour des réseaux, c'est le score d'Astra sur ARC-AGI-3. Imaginez un jeu dont personne ne vous explique les règles : il faut comprendre ce qui se passe, expérimenter, puis trouver comment réussir. Vous pouvez d'ailleurs essayer l'un de ces jeux vous-même.
Selon l'ARC Prize, Astra atteint 99,9 % avec un adaptateur qui conserve son état de raisonnement entre les appels, contre 62,7 % dans le dispositif standard. Le test regarde aussi combien d'actions l'IA utilise par rapport à un humain.
La leçon est simple : la manière dont on fait tourner un modèle (le harnais) compte presque autant que le modèle lui-même. Et attention aux comparaisons : un score obtenu avec un harnais sur mesure ne se compare pas à un score obtenu en dispositif standard.
Sur le terrain : computer use et browser use
Les avis des praticiens restent partagés. Ruben Hassid affiche une préférence nette pour Astra, surtout pour le contrôle de l'ordinateur. Chez Every, le verdict est partagé : Astra séduirait pour l'écriture et la conception visuelle, tandis que Fable conserverait des atouts sur certains projets complexes et sur la simplicité des applications produites.
Je trouve cette divergence utile. Notre travail quotidien ne se résume pas à un score : il faut regarder le nombre de corrections, le résultat réellement utilisable et le temps passé à accompagner l'outil.
Mes tests avec Astra
Astra est réputé fort en computer use et browser use, c'est donc là-dessus que je l'ai testé. Je l'ai connecté à Canva et je lui ai demandé de me dessiner, en pilotant mon navigateur.
Résultat : un dessin en 9 minutes. Ce n'est pas parfait, mais Astra dessine plus vite que moi, et mieux que ce que j'aurais produit dans ces conditions. Voici l'enregistrement du test. Voir l'outil agir dans l'interface change nettement l'expérience.
J'ai aussi testé la récupération d'informations dans un e-learning et la création de captures d'écran. L'outil est impressionnant.
Enfin, je lui ai confié une tâche complexe avec un prompt simple : jouer le directeur artistique qui recrute et délègue à toute une équipe, pour produire le clip d'une chanson, monté dans CapCut sur mon Mac, en utilisant l'API de Gemini Omni. Astra a excellé pour orchestrer plusieurs agents, récupérer les paroles, créer les scènes, manier l'API et monter le clip. Le résultat est visible ici.
Trois façons de brancher l'IA sur vos outils
Ces essais m'ont permis de clarifier une chose. Il existe selon moi trois manières de donner à une IA l'accès à vos sources pour qu'elle en fasse davantage :
- la connexion aux outils métiers via MCP : Fable et Astra sont tous deux excellents ;
- l'ouverture d'un outil métier en local avec le computer use : Astra est légèrement meilleur ;
- l'ouverture d'une source avec le browser use : Astra est légèrement meilleur, même si le navigateur intégré de Claude Code et Cowork est excellent.
En pratique, l'écart entre les deux modèles est donc faible sur la première voie, la plus robuste et la plus facile à encadrer en entreprise. Si vous hésitez entre les environnements de travail des deux éditeurs, j'en parle en détail dans mon comparatif Codex ou Claude Code pour un non-développeur.
Le vocal, vrai point fort d'Astra
Dans mon usage de Codex avec Astra, le mode vocal est un vrai point fort. Sur ce terrain, les technologies vocales d'OpenAI me semblent nettement supérieures.
Je peux expliquer ce que je veux, préciser une idée, puis ajuster la direction pendant que le travail avance. Pour la première version de la newsletter dont est tiré cet article, je n'ai pas touché le clavier : j'ai tout dicté à Codex, connecté à mon outil de newsletter, puis retouché le texte ensuite.
Mais je ressens aussi un malaise à l'idée de passer mes journées seul à parler à une IA pour produire davantage. Une partie de la créativité naît des échanges entre personnes, des désaccords et des idées qu'on n'aurait pas eues seul. Je n'ai pas envie de perdre cela au nom de la productivité. Et une question m'obsède : que fait-on du temps libéré ?
Ce que ce duel change pour une entreprise
Le choix entre GPT-6 Astra et Fable 5.1 ne se fait pas sur un classement. Dans les organisations que j'accompagne, les questions de confidentialité, de souveraineté et de droits d'accès vont ralentir l'intégration d'un modèle comme Astra, surtout avec le vocal et le contrôle de l'ordinateur. Donner à une IA la main sur un poste de travail, c'est lui ouvrir tout ce que ce poste contient.
La dépendance à un fournisseur mérite aussi réflexion. Pour mémoire, l'accès à Fable 5 a été suspendu du 12 juin au 1er juillet 2026, à la suite d'une mesure de contrôle des exportations du Département du Commerce américain, avant d'être rétabli (VentureBeat). Pouvoir basculer d'un modèle à l'autre est un vrai atout ; j'aborde ces enjeux dans mon article sur l'IA souveraine en Suisse.
Ma recommandation reste la même à chaque vague de modèles : prenez une tâche que vous connaissez, faites-la réaliser par les deux, et comparez ce qu'il vous reste à corriger. C'est exactement ce que nous faisons avec les équipes que nous formons chez MAIjin : partir de leurs processus réels plutôt que des benchmarks, choisir le bon modèle tâche par tâche, et poser les garde-fous avant de donner des accès à un agent. Pour aller plus loin sur ce dernier point, mon guide des agents IA pour les PME détaille les étapes.
Et si vous voulez voir ce que donnait déjà la génération précédente sur des cas concrets, mon retour d'expérience sur Claude Fable 5 reste d'actualité.
Ce qu'il faut retenir
- •GPT-6 Astra et Claude Fable 5.1 affichent le même prix API de base : 10 $ en entrée et 50 $ en sortie par million de tokens.
- •Astra mène sur Terminal-Bench 4.0 et AutomationBench ; Fable 5.1 mène sur Humanity's Last Exam et sur l'indice d'Artificial Analysis (66 contre 61).
- •Le 99,9 % d'Astra sur ARC-AGI-3 dépend du harnais utilisé (62,7 % en dispositif standard) : comparez toujours à harnais égal.
- •Astra prend l'avantage en computer use, browser use et vocal ; via MCP, les deux modèles se valent.
- •En entreprise, confidentialité, droits d'accès et dépendance au fournisseur pèsent autant que les scores.
Questions fréquentes
À propos de l'auteur
Jean-Baptiste Berthoux est co-fondateur et Chief AI Officer de MAIjin. Depuis 2023, il a accompagné plus de 150 organisations et formé plus de 4 500 professionnels à l'IA générative en Suisse romande. En savoir plus
Chaque semaine, je décrypte les nouveaux modèles et je les teste sur des cas concrets. Pour recevoir L'hebdo de MAIjin avec plus de 5 800 professionnels, abonnez-vous à la newsletter.
Articles recommandés
Claude Fable 5 : retour d'expérience après un mois de tests
Un mois avec Claude Fable 5 : 4 tests concrets, un jeu vidéo créé de A à Z, et mes recommandations pour les PME suisses et françaises.
Codex vs Claude Code : lequel si vous ne codez pas ?
Prix, accès et sécurité comparés en août 2026. Et pourquoi, si vous ne codez pas, la vraie réponse s'appelle Claude Cowork ou ChatGPT Work.