0% leído

Benchmarks de Gemini 4 Argon: Google y FrontierSWE

5 oct 2026

Gemini 4 Argon no tiene una única clasificación de benchmark. La tabla de lanzamiento de Google, el registro del modelo de Artificial Analysis y la clasificación FrontierSWE V2 miden tareas diferentes y presentan distintos tipos de evidencia. Las puntuaciones siguientes se mantienen en tablas separadas para que un resultado en una evaluación no se presente como una victoria en todas.

Tabla comparativa de Google para Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5.

Fuente: Sundar Pichai, 30 de septiembre de 2026. Esta es la tabla comparativa del lanzamiento de Google. Las celdas sombreadas son filas en las que lidera otro modelo. La línea de metodología impresa en la imagen es deepmind.google/models/evals-methodology/gemini-4-argon.

Puntuaciones de la tabla de Google del 30 de septiembre

El anuncio de Google informa de estas puntuaciones:

EvaluaciónPuntuación de ArgonAfirmación de la publicación de Google
DeepSWE v1.177,9 %Nuevo estado del arte en tareas de ingeniería de software de larga duración
AutomationBench (Zapier)51,3 %Primer puesto en ejecución de tareas empresariales de extremo a extremo
LVBench91,7 %Estado del arte en comprensión de vídeos largos
CWE-bench v168 %Empate en el primer puesto al corregir vulnerabilidades de seguridad

El artículo del anuncio destaca esas cuatro filas. La tabla publicada incluye un conjunto más amplio del mismo lanzamiento. En esa imagen, Vals Index registra 68,9 % para Argon y Harvey’s Legal Agent Benchmark, 19,6 %. FrontierSWE v2 registra 55,0 % para Argon y 65,5 % para Astra, cuya celda aparece sombreada. Terminal-bench 4.0 registra 57,4 % para Argon y 66,4 % para Opus 5.5, cuya celda aparece sombreada. Esas cifras se leen en la imagen anterior; no son una segunda serie de puntuaciones añadida en esta página.

Instantánea de Artificial Analysis

El registro del modelo de Artificial Analysis, consultado el 5 de octubre de 2026, informa de otro resumen:

Campo de Artificial AnalysisInstantánea
Intelligence Index v4.3.253 (subyacente: 52.5606)
Coste por tarea del Intelligence IndexAproximadamente $1.99
Ventana de contexto1M tokens
Estado de accesoNo disponible públicamente

El Intelligence Index es una evaluación compuesta, por lo que su 53 redondeado no debe mezclarse con los porcentajes específicos de tareas de Google. El coste por tarea es una estimación de evaluación, no un cargo fijo para clientes. Consulta precios de la API y límites de salida para conocer las tarifas por token.

FrontierSWE V2: resultados de programación con su propia metodología

El marcador de FrontierSWE V2 presenta otro resultado de programación. Su tabla principal usa el harness proximus, las 34 tareas, cinco pruebas por tarea y un presupuesto de 20 horas. Las puntuaciones son mean@5; los bigotes muestran los valores worst@5 y best@5 y no son intervalos de confianza.

ModeloMedia@5 de FrontierSWE V2
Gemini 4 Argon55,0 %
GPT-6 Astra65,5 %
Claude Opus 5.562,3 %

Con esta configuración, Astra está 10,5 puntos porcentuales por encima de Argon. FrontierSWE no es DeepSWE ni Terminal-Bench 4.0 de Artificial Analysis, por lo que esta tabla no reescribe el resultado de DeepSWE de Google ni establece una clasificación universal de programación.

Un gráfico de Text Arena de terceros

Gráfico de Text Arena de terceros que sitúa a Gemini 4 Argon High con un Elo de 1.525 y en el primer puesto.

Fuente: @AI_Screening. Es el gráfico de esa cuenta, no una exportación de arena.ai, y no forma parte de las tres fuentes de las tablas anteriores. El gráfico sitúa a Gemini 4 Argon (High) con un Elo de 1.525 y en el primer puesto. La segunda barra corresponde a Claude Opus 4.6, no a Opus 5.5. Interprétalo como un gráfico de preferencias tomado de esa publicación.

Cómo interpretar la diferencia

La conclusión útil es más acotada que “Argon gana en todo”. El resultado publicado de Argon depende de la tarea, el harness, la configuración del modelo y la regla de puntuación. Para la cifra independiente del 15,1 % de AA-Omniscience, consulta qué mide la tasa de alucinación. Para conocer la diferencia entre Argon y Gemma 4, consulta Gemma 4 frente a Gemini.

gemma4 — interact

Prueba Gemma 4 online

~/gemma4 $ Prueba Gemma 4 en el navegador antes de instalarlo en tu equipo.

Probar Gemma 4 />
Gemma 4 AI

Gemma 4 AI

Guías relacionadas