L’annonce de Google sur Gemini 4 Argon indique un tarif API de lancement de 2 $ par million de tokens en entrée et de 10 $ par million de tokens en sortie. Elle indique aussi des tarifs ultérieurs de 4 $ et 20 $, sans date de fin pour la période de lancement. L’entrée en cache coûte 95 % moins cher, et la sortie maximale passe de 64K à 1 million de tokens.
Source : Google DeepMind. Cette carte n’affiche pas les tarifs de 2 $ et 10 $ ; ils figurent dans le texte de l’annonce. La publication de lancement de Logan Kilpatrick indique elle aussi le prix de lancement dans son texte, et non sur une carte tarifaire distincte.
Prix et limites de Gemini 4 Argon
| Spécification | Valeur | Source et date des données |
|---|---|---|
| Entrée au lancement | 2 $ par 1M de tokens | Annonce de Google, 30 septembre 2026 |
| Sortie au lancement | 10 $ par 1M de tokens | Annonce de Google, 30 septembre 2026 |
| Entrée ultérieure | 4 $ par 1M de tokens | Annonce de Google ; date de fin non précisée |
| Sortie ultérieure | 20 $ par 1M de tokens | Annonce de Google ; date de fin non précisée |
| Entrée en cache | Remise de 95 % sur le prix d’entrée | Annonce de Google |
| Sortie maximale | 1M de tokens, contre 64K | Annonce de Google |
| Fenêtre de contexte | 1M de tokens partagés entre entrée et sortie | Fiche du modèle Artificial Analysis, consultée le 5 octobre |
Les tarifs de lancement correspondent aux prix annoncés à ce moment-là ; ils ne promettent pas que la période promotionnelle se terminera à une date donnée. La page consacrée au statut du lancement précise à qui Google a annoncé l’accès ; selon les données consultées, les utilisateurs ordinaires ne pouvaient pas appeler Argon.
Comment fonctionne la remise cache de 95 %
« 95 % de remise » signifie que l’entrée en cache coûte 5 % du tarif d’entrée affiché. Au tarif de lancement de 2 $, cela représente environ 0,10 $ par million de tokens d’entrée en cache. Au tarif ultérieur de 4 $, cela représente environ 0,20 $. La remise s’applique aux lectures d’entrées en cache ; elle ne réduit pas le tarif de sortie.
Pour un calcul hypothétique, une requête avec 100 000 tokens d’entrée nouvellement traités et 20 000 tokens de sortie aux tarifs de lancement coûterait 0,20 $ + 0,20 $ = 0,40 $ avant l’effet de la mise en cache. Les entrées réutilisées sont facturées au tarif réduit lorsqu’elles remplissent les conditions de cache ; les requêtes réelles peuvent avoir d’autres volumes et comportements de cache.
La capacité de sortie n’est pas la capacité de contexte
L’annonce de Google fait passer le plafond de sortie de 64K à 1M de tokens dans une seule réponse. La fiche d’Artificial Analysis indique également une fenêtre de contexte de 1M de tokens partagée entre entrée et sortie. Ce sont deux limites différentes : la sortie indique la quantité que le modèle peut générer dans une réponse, tandis que le contexte décrit la capacité combinée disponible pour une requête.
Une limite de sortie de 1M ne signifie pas qu’une requête peut utiliser simultanément 1M de tokens d’entrée et 1M de tokens de sortie. Elle laisse davantage de marge aux travaux longs avant la coupure de la réponse, tandis que la qualité, la latence et le nombre de tokens réellement utiles dépendent toujours de la requête.
Ce que le prix affiché ne vous dit pas
Artificial Analysis indique un coût estimé de 1,99 $ par tâche de l’Intelligence Index. Il s’agit d’une estimation d’évaluation pondérée, pas d’un tarif client fixe ni d’une prévision pour chaque charge de travail. Pour les scores séparés par source, consultez les benchmarks de Gemini 4 Argon. Pour la métrique à l’origine du chiffre souvent cité de 15,1 %, consultez ce que signifie le taux d’hallucination d’Argon.
Si vous avez besoin d’un modèle local sans facture API au token, téléchargez Gemma 4 et consultez ses options d’installation. Gemma 4 et Gemini 4 Argon sont deux familles de modèles distinctes.
Essayez Gemma 4 en ligne
~/gemma4 $ Essayez Gemma 4 dans votre navigateur avant de l’installer sur votre machine.
Essayer Gemma 4 />

