Gemini 4 Argon n’a pas un classement de benchmark unique. Le tableau du lancement de Google, la fiche du modèle d’Artificial Analysis et le classement FrontierSWE V2 mesurent des tâches différentes et fournissent des types de données différents. Les scores ci-dessous restent dans des tableaux distincts afin qu’un résultat à une évaluation ne soit pas présenté comme une victoire à toutes les autres.
Source : Sundar Pichai, 30 septembre 2026. Il s’agit du tableau comparatif du lancement de Google. Les cellules ombrées correspondent aux lignes où un autre modèle est en tête. La ligne de méthodologie imprimée sur l’image est deepmind.google/models/evals-methodology/gemini-4-argon.
Scores du tableau de Google du 30 septembre
L’annonce de Google rapporte les scores suivants :
| Évaluation | Score d’Argon | Affirmation publiée par Google |
|---|---|---|
| DeepSWE v1.1 | 77,9 % | Nouveau meilleur résultat pour des tâches d’ingénierie logicielle de longue durée |
| AutomationBench (Zapier) | 51,3 % | Première place pour l’exécution de tâches métier de bout en bout |
| LVBench | 91,7 % | Meilleur résultat en compréhension de vidéos longues |
| CWE-bench v1 | 68 % | Égalité à la première place pour la correction de vulnérabilités de sécurité |
L’article d’annonce met en avant ces quatre lignes. Le tableau publié présente un ensemble plus large issu du même lancement. Sur cette image, le Vals Index est à 68,9 % pour Argon et le Harvey’s Legal Agent Benchmark à 19,6 %. FrontierSWE v2 est à 55,0 % pour Argon et 65,5 % pour Astra, dont la cellule est ombrée. Terminal-bench 4.0 est à 57,4 % pour Argon et 66,4 % pour Opus 5.5, dont la cellule est ombrée. Ces chiffres sont lus sur l’image ci-dessus ; ils ne constituent pas une deuxième série de scores ajoutée à cette page.
Données publiées par Artificial Analysis
La fiche du modèle Artificial Analysis, consultée le 5 octobre 2026, donne un autre résumé :
| Champ Artificial Analysis | Capture |
|---|---|
| Intelligence Index v4.3.2 | 53 (valeur sous-jacente : 52.5606) |
| Coût par tâche de l’Intelligence Index | Environ 1,99 $ |
| Fenêtre de contexte | 1M tokens |
| Statut d’accès | Non disponible publiquement |
L’Intelligence Index est une évaluation composite : son score arrondi de 53 ne doit donc pas être fusionné avec les pourcentages par tâche de Google. Le coût par tâche est une estimation d’évaluation, et non une facturation client fixe. Consultez les tarifs API et limites de sortie pour les tarifs au token.
FrontierSWE V2 : un classement de code de référence
Le marqueur FrontierSWE V2 présente un autre résultat de programmation avec sa propre méthodologie. Son tableau principal utilise le harness proximus, les 34 tâches, cinq essais par tâche et un budget de 20 heures. Les scores sont mean@5 ; les moustaches indiquent les valeurs worst@5 et best@5 et ne constituent pas des intervalles de confiance.
| Modèle | Moyenne@5 FrontierSWE V2 |
|---|---|
| Gemini 4 Argon | 55,0 % |
| GPT-6 Astra | 65,5 % |
| Claude Opus 5.5 | 62,3 % |
Dans cette configuration, Astra devance Argon de 10,5 points de pourcentage. FrontierSWE n’est ni DeepSWE ni le Terminal-Bench 4.0 d’Artificial Analysis ; ce tableau ne réécrit donc pas le résultat DeepSWE de Google et n’établit pas un classement universel du code.
Un graphique Text Arena tiers
Source : @AI_Screening. Ce graphique appartient à ce compte ; ce n’est pas un export d’arena.ai et il ne fait pas partie des trois sources des tableaux ci-dessus. Il place Gemini 4 Argon (High) à un Elo de 1 525 et au premier rang. La deuxième barre correspond à Claude Opus 4.6, et non à Opus 5.5. Lisez-le comme un classement de préférences issu de cette publication.
Comment lire l’écart
La conclusion utile est plus nuancée que « Argon gagne partout ». Le résultat publié d’Argon dépend de la tâche, du harness, de la configuration du modèle et de la règle de notation. Pour le chiffre distinct de 15,1 % d’AA-Omniscience, consultez ce que mesure le taux d’hallucination. Pour comprendre la différence entre Argon et Gemma 4, consultez Gemma 4 face à Gemini.
Essayez Gemma 4 en ligne
~/gemma4 $ Essayez Gemma 4 dans votre navigateur avant de l’installer sur votre machine.
Essayer Gemma 4 />


