0% lu

Benchmarks de Gemini 4 Argon : Google et FrontierSWE

5 oct. 2026

Gemini 4 Argon n’a pas un classement de benchmark unique. Le tableau du lancement de Google, la fiche du modèle d’Artificial Analysis et le classement FrontierSWE V2 mesurent des tâches différentes et fournissent des types de données différents. Les scores ci-dessous restent dans des tableaux distincts afin qu’un résultat à une évaluation ne soit pas présenté comme une victoire à toutes les autres.

Tableau comparatif de Google pour Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5.

Source : Sundar Pichai, 30 septembre 2026. Il s’agit du tableau comparatif du lancement de Google. Les cellules ombrées correspondent aux lignes où un autre modèle est en tête. La ligne de méthodologie imprimée sur l’image est deepmind.google/models/evals-methodology/gemini-4-argon.

Scores du tableau de Google du 30 septembre

L’annonce de Google rapporte les scores suivants :

ÉvaluationScore d’ArgonAffirmation publiée par Google
DeepSWE v1.177,9 %Nouveau meilleur résultat pour des tâches d’ingénierie logicielle de longue durée
AutomationBench (Zapier)51,3 %Première place pour l’exécution de tâches métier de bout en bout
LVBench91,7 %Meilleur résultat en compréhension de vidéos longues
CWE-bench v168 %Égalité à la première place pour la correction de vulnérabilités de sécurité

L’article d’annonce met en avant ces quatre lignes. Le tableau publié présente un ensemble plus large issu du même lancement. Sur cette image, le Vals Index est à 68,9 % pour Argon et le Harvey’s Legal Agent Benchmark à 19,6 %. FrontierSWE v2 est à 55,0 % pour Argon et 65,5 % pour Astra, dont la cellule est ombrée. Terminal-bench 4.0 est à 57,4 % pour Argon et 66,4 % pour Opus 5.5, dont la cellule est ombrée. Ces chiffres sont lus sur l’image ci-dessus ; ils ne constituent pas une deuxième série de scores ajoutée à cette page.

Données publiées par Artificial Analysis

La fiche du modèle Artificial Analysis, consultée le 5 octobre 2026, donne un autre résumé :

Champ Artificial AnalysisCapture
Intelligence Index v4.3.253 (valeur sous-jacente : 52.5606)
Coût par tâche de l’Intelligence IndexEnviron 1,99 $
Fenêtre de contexte1M tokens
Statut d’accèsNon disponible publiquement

L’Intelligence Index est une évaluation composite : son score arrondi de 53 ne doit donc pas être fusionné avec les pourcentages par tâche de Google. Le coût par tâche est une estimation d’évaluation, et non une facturation client fixe. Consultez les tarifs API et limites de sortie pour les tarifs au token.

FrontierSWE V2 : un classement de code de référence

Le marqueur FrontierSWE V2 présente un autre résultat de programmation avec sa propre méthodologie. Son tableau principal utilise le harness proximus, les 34 tâches, cinq essais par tâche et un budget de 20 heures. Les scores sont mean@5 ; les moustaches indiquent les valeurs worst@5 et best@5 et ne constituent pas des intervalles de confiance.

ModèleMoyenne@5 FrontierSWE V2
Gemini 4 Argon55,0 %
GPT-6 Astra65,5 %
Claude Opus 5.562,3 %

Dans cette configuration, Astra devance Argon de 10,5 points de pourcentage. FrontierSWE n’est ni DeepSWE ni le Terminal-Bench 4.0 d’Artificial Analysis ; ce tableau ne réécrit donc pas le résultat DeepSWE de Google et n’établit pas un classement universel du code.

Un graphique Text Arena tiers

Graphique Text Arena tiers plaçant Gemini 4 Argon High à un Elo de 1 525 et au premier rang.

Source : @AI_Screening. Ce graphique appartient à ce compte ; ce n’est pas un export d’arena.ai et il ne fait pas partie des trois sources des tableaux ci-dessus. Il place Gemini 4 Argon (High) à un Elo de 1 525 et au premier rang. La deuxième barre correspond à Claude Opus 4.6, et non à Opus 5.5. Lisez-le comme un classement de préférences issu de cette publication.

Comment lire l’écart

La conclusion utile est plus nuancée que « Argon gagne partout ». Le résultat publié d’Argon dépend de la tâche, du harness, de la configuration du modèle et de la règle de notation. Pour le chiffre distinct de 15,1 % d’AA-Omniscience, consultez ce que mesure le taux d’hallucination. Pour comprendre la différence entre Argon et Gemma 4, consultez Gemma 4 face à Gemini.

gemma4 — interact

Essayez Gemma 4 en ligne

~/gemma4 $ Essayez Gemma 4 dans votre navigateur avant de l’installer sur votre machine.

Essayer Gemma 4 />
Gemma 4 AI

Gemma 4 AI

Guides associés