Gemini 4 Argon n’a pas résolu le problème des hallucinations. Dans les données consultées le 5 octobre 2026, Artificial Analysis indique un taux d’hallucination de 15,1 % et une précision de 49,9 % sur AA-Omniscience. Ces deux mesures sont différentes, et le chiffre de 15,1 % ne représente pas la part des réponses fausses parmi toutes les réponses.
Les données du 5 octobre
La fiche du modèle Artificial Analysis affiche :
| Champ AA-Omniscience | Argon (High) |
|---|---|
| Précision | 49,9 % (0.499) |
| Taux d’hallucination | 15,1 % (0.1506986) |
| Taux complémentaire sans hallucination | Environ 84,9 % |
La valeur complémentaire correspond environ à un moins le taux d’hallucination rapporté. Si Artificial Analysis met à jour la fiche du modèle, il faudra vérifier à nouveau la date et les valeurs avant de considérer ce score comme actuel.
Source : @rdominguezibar. Le titre reprend le texte de cette publication. La note date les barres de l’AA-Omniscience d’Artificial Analysis au 30 septembre 2026 et arrondit Argon (High) à 15 % d’hallucinations et 50 % de réponses correctes. Elle indique aussi qu’Argon n’était pas disponible publiquement et que seule la configuration High a été testée. Le tableau ci-dessus utilise la fiche du modèle au 5 octobre : 15,1 % (0.1506986) et 49,9 % de précision.
Ce que compte le dénominateur
Selon la méthodologie AA-Omniscience, la précision correspond aux bonnes réponses divisées par le nombre total de questions. Le taux d’hallucination est :
incorrect / (incorrect + partial + not attempted)Les bonnes réponses sont exclues de ce dénominateur d’hallucination. La métrique demande à quelle fréquence le modèle affirme une réponse incorrecte parmi les cas où il n’a pas obtenu un score correct ; ce n’est pas un taux d’erreur sur l’ensemble des réponses.
Source : @Cozycanvas53144, une capture du graphique d’Artificial Analysis. Argon (High) est à 15 % et indiqué comme indisponible publiquement. La définition imprimée sur le graphique est le même ratio que dans la formule ci-dessus : réponses incorrectes divisées par réponses incorrectes, partielles et sans tentative.
Un calcul illustratif
La répartition suivante sur 1 000 questions est un exemple hypothétique de la formule, et non le décompte observé des réponses d’Argon :
| Résultat illustratif | Nombre |
|---|---|
| Correct | 800 |
| Incorrect | 30 |
| Partiel ou sans tentative | 170 |
Le taux d’hallucination conditionnel est 30 / (30 + 170) = 15 %. La part des réponses franchement fausses sur l’ensemble des questions est 30 / 1,000 = 3 %. La précision réelle d’Argon sur AA-Omniscience dans ces données est d’environ 49,9 %, donc l’exemple 800/30/170 ne doit pas être présenté comme la répartition d’Argon.
Ce que le score permet d’affirmer
Le score permet une conclusion limitée : dans cette évaluation, le taux de réponses incorrectes d’Argon parmi les résultats non corrects est d’environ 15,1 %. Il ne montre pas que chaque réponse est fiable, que le modèle s’abstient toujours quand il ne connaît pas la réponse, ni que les hallucinations ont disparu. Une précision inférieure à 50 % dans la même fiche signifie également que le modèle n’a pas répondu correctement à environ la moitié de cette évaluation.
Pour les autres évaluations publiées d’Argon, consultez les benchmarks par source. Pour les tarifs au token et le calendrier d’accès, consultez les tarifs API et le statut du lancement. Gemma 4 est un modèle distinct à poids ouverts ; son guide pratique de dépannage se trouve ici.
Essayez Gemma 4 en ligne
~/gemma4 $ Essayez Gemma 4 dans votre navigateur avant de l’installer sur votre machine.
Essayer Gemma 4 />

