Gemini 4 Argon no ha resuelto las alucinaciones. En los datos consultados el 5 de octubre de 2026, Artificial Analysis registra una tasa de alucinación del 15,1 % y una precisión del 49,9 % en AA-Omniscience. Son dos mediciones diferentes, y el 15,1 % no representa la proporción de respuestas falsas sobre el total.
Los datos del 5 de octubre
El registro del modelo de Artificial Analysis muestra:
| Campo de AA-Omniscience | Argon (High) |
|---|---|
| Precisión | 49,9 % (0.499) |
| Tasa de alucinación | 15,1 % (0.1506986) |
| Tasa complementaria sin alucinación | Aproximadamente 84,9 % |
La cifra complementaria es aproximadamente uno menos la tasa de alucinación reportada. Si Artificial Analysis actualiza el registro del modelo, hay que volver a comprobar la fecha y los valores antes de tratarlos como una puntuación actual.
Fuente: @rdominguezibar. El titular reproduce el texto de esa publicación. La nota al pie fecha las barras en Artificial Analysis AA-Omniscience del 30 de septiembre de 2026 y redondea Argon (High) a un 15 % de alucinaciones y un 50 % de respuestas correctas. También dice que Argon no estaba disponible públicamente y que solo se probó la configuración High. La tabla anterior usa el registro del modelo del 5 de octubre: 15,1 % (0.1506986) y 49,9 % de precisión.
Qué cuenta el denominador
Según la metodología de AA-Omniscience, la precisión es el número de respuestas correctas dividido por el total de preguntas. La tasa de alucinación es:
incorrect / (incorrect + partial + not attempted)Las respuestas correctas quedan fuera de ese denominador de alucinación. La métrica pregunta con qué frecuencia el modelo afirma una respuesta incorrecta entre los casos en que no obtuvo una puntuación correcta; no es una tasa de error sobre todas las respuestas.
Fuente: @Cozycanvas53144, una captura del gráfico de Artificial Analysis. Argon (High) figura con 15 % y aparece como no disponible públicamente. La definición impresa en el gráfico es la misma proporción que la fórmula anterior: incorrectas divididas entre incorrectas, respuestas parciales y no intentadas.
Un cálculo ilustrativo
La siguiente distribución de 1.000 preguntas es un ejemplo hipotético de la fórmula, no el recuento de respuestas observado de Argon:
| Resultado ilustrativo | Cantidad |
|---|---|
| Correctas | 800 |
| Incorrectas | 30 |
| Parciales o no intentadas | 170 |
La tasa de alucinación condicional es 30 / (30 + 170) = 15%. La proporción de respuestas directamente incorrectas sobre el total es 30 / 1,000 = 3%. La precisión real de Argon en AA-Omniscience en estos datos es aproximadamente del 49,9 %, así que el ejemplo 800/30/170 no debe presentarse como la distribución de Argon.
Qué permite afirmar la puntuación
La puntuación permite una afirmación limitada: en esta evaluación, la tasa de respuestas incorrectas de Argon entre los resultados no correctos es de aproximadamente el 15,1 %. No demuestra que todas las respuestas sean fiables, que el modelo se abstenga cuando carece de conocimientos ni que las alucinaciones hayan desaparecido. Una precisión inferior al 50 % en el mismo registro también significa que el modelo no respondió correctamente a aproximadamente la mitad de esa evaluación.
Para el resto de evaluaciones publicadas de Argon, consulta los benchmarks por fuente. Para las tarifas por token y el calendario de acceso, consulta los precios de la API y el estado del lanzamiento. Gemma 4 es un modelo independiente de pesos abiertos; su guía práctica para solucionar problemas está aquí.
Prueba Gemma 4 online
~/gemma4 $ Prueba Gemma 4 en el navegador antes de instalarlo en tu equipo.
Probar Gemma 4 />

