Gemini 4 Argon High et GPT-6 Astra Max obtiennent tous deux 53 à l’Artificial Analysis Intelligence Index dans les données du 5 octobre 2026. Les évaluations détaillées les départagent : Argon domine AutomationBench-AA, tandis qu’Astra est devant sur Terminal-Bench 4.0, GDP.pdf et AA-LCR. Le coût estimé par tâche est également inférieur pour Argon. Ces résultats suggèrent des usages différents selon les tâches, mais ne désignent pas un vainqueur universel du code.
Source : Logan Kilpatrick, d’après les graphiques du lancement Google du 30 septembre. Cette colonne AutomationBench indique 51,3 % pour Argon, 41,4 % pour Astra, 31,4 % pour Fable 5.1 et 42,5 % pour Opus 5.5. Il ne s’agit pas d’AutomationBench-AA d’Artificial Analysis. Le tableau ci-dessous est l’état AA, où Argon et Astra sont indiqués à 78 % et 68 %.
Argon High et Astra Max en un coup d’œil
La comparaison d’Artificial Analysis utilise Gemini 4 Argon High et GPT-6 Astra Max. Les chiffres correspondent aux données publiées par cette page le 5 octobre 2026 ; la colonne des coûts indique un coût d’évaluation estimé par tâche.
| Évaluation | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| Artificial Analysis Intelligence Index | 53 | 53 |
| Coût estimé par tâche | 1,99 $ | 3,26 $ |
| AutomationBench-AA | 78 % | 68 % |
| Terminal-Bench 4.0 | 57 % | 59 % |
| GDP.pdf | 22 % | 31 % |
| AA-LCR v1.1 | 80 % | 81 % |
Le score identique à l’indice masque un détail utile. Argon devance Astra de 10 points de pourcentage sur AutomationBench-AA. Astra devance Argon de 2 points sur Terminal-Bench 4.0, de 9 points sur GDP.pdf et d’un point sur AA-LCR v1.1.
Ce que ces scores suggèrent selon les tâches
Il s’agit d’inférences tirées des évaluations, et non de spécialités attribuées par les fournisseurs :
- Choisissez Argon pour un flux où l’automatisation de bout en bout est le principal critère. Dans ces données, son résultat de 78 % à AutomationBench-AA est supérieur.
- Testez Astra en premier lorsque l’exécution dans le terminal, le raisonnement documentaire mesuré par GDP.pdf ou l’ensemble AA-LCR est central. Astra est devant sur ces trois colonnes.
- Considérez l’égalité à 53 comme une raison d’examiner les résultats par tâche, et non comme la preuve que les modèles se comportent de la même manière.
Les chiffres ne permettent pas d’affirmer qu’un modèle est intrinsèquement frontend ou que l’autre est intrinsèquement backend. Le travail sur un vrai dépôt dépend aussi des prompts, des outils, du contexte, des tests et de la récupération après un échec. Testez une version réduite de votre propre charge avant de choisir un fournisseur.
Tarifs au token et coût par tâche répondent à des questions différentes
La même comparaison indique les tarifs au token suivants pour les configurations évaluées :
| Élément tarifaire | Gemini 4 Argon High | GPT-6 Astra Max |
|---|---|---|
| Entrée / sortie par 1M de tokens | 2 $ / 10 $ | 10 $ / 50 $ |
| Entrée en cache par 1M de tokens | 0,10 $ | 1,00 $ |
Les montants de 1,99 $ et 3,26 $ sont des coûts d’évaluation pondérés, pas des frais fixes pour chaque requête client. Une longue exécution d’agent peut utiliser un volume différent de tokens et d’outils par rapport aux tâches qui servent à calculer l’indice. Comparez la grille tarifaire et le coût mesuré par tâche terminée.
L’accès influence aussi le choix pratique
L’annonce de Google du 30 septembre indique qu’Argon est d’abord proposé aux défenseurs cyber de confiance via Fairwind et utilisé en interne, puis que l’élargissement commence avec les clients API payants et les abonnés Google AI Ultra. Elle ne précise pas que l’API passerait avant Ultra. Consultez les informations actuelles sur le lancement d’Argon avant de transformer cette comparaison de benchmarks en décision d’achat.
À lire aussi
Essayez Gemma 4 en ligne
~/gemma4 $ Essayez Gemma 4 dans votre navigateur avant de l’installer sur votre machine.
Essayer Gemma 4 />

