Gemini 4 Argon no tiene una única clasificación de benchmark. La tabla de lanzamiento de Google, el registro del modelo de Artificial Analysis y la clasificación FrontierSWE V2 miden tareas diferentes y presentan distintos tipos de evidencia. Las puntuaciones siguientes se mantienen en tablas separadas para que un resultado en una evaluación no se presente como una victoria en todas.
Fuente: Sundar Pichai, 30 de septiembre de 2026. Esta es la tabla comparativa del lanzamiento de Google. Las celdas sombreadas son filas en las que lidera otro modelo. La línea de metodología impresa en la imagen es deepmind.google/models/evals-methodology/gemini-4-argon.
Puntuaciones de la tabla de Google del 30 de septiembre
El anuncio de Google informa de estas puntuaciones:
| Evaluación | Puntuación de Argon | Afirmación de la publicación de Google |
|---|---|---|
| DeepSWE v1.1 | 77,9 % | Nuevo estado del arte en tareas de ingeniería de software de larga duración |
| AutomationBench (Zapier) | 51,3 % | Primer puesto en ejecución de tareas empresariales de extremo a extremo |
| LVBench | 91,7 % | Estado del arte en comprensión de vídeos largos |
| CWE-bench v1 | 68 % | Empate en el primer puesto al corregir vulnerabilidades de seguridad |
El artículo del anuncio destaca esas cuatro filas. La tabla publicada incluye un conjunto más amplio del mismo lanzamiento. En esa imagen, Vals Index registra 68,9 % para Argon y Harvey’s Legal Agent Benchmark, 19,6 %. FrontierSWE v2 registra 55,0 % para Argon y 65,5 % para Astra, cuya celda aparece sombreada. Terminal-bench 4.0 registra 57,4 % para Argon y 66,4 % para Opus 5.5, cuya celda aparece sombreada. Esas cifras se leen en la imagen anterior; no son una segunda serie de puntuaciones añadida en esta página.
Instantánea de Artificial Analysis
El registro del modelo de Artificial Analysis, consultado el 5 de octubre de 2026, informa de otro resumen:
| Campo de Artificial Analysis | Instantánea |
|---|---|
| Intelligence Index v4.3.2 | 53 (subyacente: 52.5606) |
| Coste por tarea del Intelligence Index | Aproximadamente $1.99 |
| Ventana de contexto | 1M tokens |
| Estado de acceso | No disponible públicamente |
El Intelligence Index es una evaluación compuesta, por lo que su 53 redondeado no debe mezclarse con los porcentajes específicos de tareas de Google. El coste por tarea es una estimación de evaluación, no un cargo fijo para clientes. Consulta precios de la API y límites de salida para conocer las tarifas por token.
FrontierSWE V2: resultados de programación con su propia metodología
El marcador de FrontierSWE V2 presenta otro resultado de programación. Su tabla principal usa el harness proximus, las 34 tareas, cinco pruebas por tarea y un presupuesto de 20 horas. Las puntuaciones son mean@5; los bigotes muestran los valores worst@5 y best@5 y no son intervalos de confianza.
| Modelo | Media@5 de FrontierSWE V2 |
|---|---|
| Gemini 4 Argon | 55,0 % |
| GPT-6 Astra | 65,5 % |
| Claude Opus 5.5 | 62,3 % |
Con esta configuración, Astra está 10,5 puntos porcentuales por encima de Argon. FrontierSWE no es DeepSWE ni Terminal-Bench 4.0 de Artificial Analysis, por lo que esta tabla no reescribe el resultado de DeepSWE de Google ni establece una clasificación universal de programación.
Un gráfico de Text Arena de terceros
Fuente: @AI_Screening. Es el gráfico de esa cuenta, no una exportación de arena.ai, y no forma parte de las tres fuentes de las tablas anteriores. El gráfico sitúa a Gemini 4 Argon (High) con un Elo de 1.525 y en el primer puesto. La segunda barra corresponde a Claude Opus 4.6, no a Opus 5.5. Interprétalo como un gráfico de preferencias tomado de esa publicación.
Cómo interpretar la diferencia
La conclusión útil es más acotada que “Argon gana en todo”. El resultado publicado de Argon depende de la tarea, el harness, la configuración del modelo y la regla de puntuación. Para la cifra independiente del 15,1 % de AA-Omniscience, consulta qué mide la tasa de alucinación. Para conocer la diferencia entre Argon y Gemma 4, consulta Gemma 4 frente a Gemini.
Prueba Gemma 4 online
~/gemma4 $ Prueba Gemma 4 en el navegador antes de instalarlo en tu equipo.
Probar Gemma 4 />


