Gemini 4 Argon de Google progresse sur les tâches longues
Google annonce Gemini 4 Argon pour les tâches longues de code et de sécurité. Les scores progressent, mais coûts et protocoles limitent les comparaisons.
Dans cet article
- Un million de tokens en sortie, pas une mesure de précision
- Le Vals Index permet une comparaison chiffrée avec Gemini 3.8 Flash
- Les scores de code et de sécurité ne mesurent pas la même chose
- Les gains internes portent sur des systèmes précis
- Un correctif qui supprime un crash n’est pas forcément sûr
- Les tarifs annoncés ne donnent pas le coût d’un workflow
Gemini 4 Argon, le nouveau modèle d’intelligence artificielle de Google annoncé le 30 septembre 2026, vise les workflows longs de développement et de cybersécurité. Son accès reste réservé à des défenseurs sélectionnés via Fairwind, le programme de Google destiné aux partenaires de confiance. Pour les développeurs, l’annonce décrit donc des capacités à évaluer, pas encore un remplacement immédiatement accessible.
Un million de tokens en sortie, pas une mesure de précision
Google porte la limite de sortie à un million de tokens, contre 64 000 auparavant. Il s’agit du budget de génération annoncé, pas d’une nouvelle taille de contexte d’entrée. Cette extension donne davantage de place aux trajectoires de raisonnement longues.
Un plafond plus élevé ne prouve toutefois ni une meilleure réponse à budget égal, ni une exécution plus rapide. Pour isoler le progrès du modèle, il faudrait comparer les mêmes tâches avec les mêmes outils et des budgets de génération contrôlés.
Le Vals Index permet une comparaison chiffrée avec Gemini 3.8 Flash
Le Vals Index, l’évaluation de tâches professionnelles conçue par Vals AI, affiche Argon à 68,90 %, contre 54,83 % pour Gemini 3.8 Flash, le modèle rapide de la génération précédente de Google. L’écart atteint 14,07 points. Mais le coût par test passe de 5,73 à 15,68 dollars : le gain de score s’accompagne d’une dépense environ 2,7 fois supérieure dans ce protocole.
L’indice agrège six benchmarks privés et deux publics, pondérés selon le poids économique des secteurs américains concernés. C’est une mesure composite de tâches de finance, de code, de droit et de fiscalité, pas un pourcentage de métiers automatisables. Autre réserve : le tableau actualisé place Argon premier, tandis que le commentaire de synthèse conserve un classement antérieur. Il faut distinguer les résultats tabulaires de ce résumé décalé.
Les scores de code et de sécurité ne mesurent pas la même chose
Google annonce 77,9 % sur DeepSWE v1.1, une évaluation de tâches longues d’ingénierie logicielle, et 68 % sur CWE-bench v1, consacré à la correction de vulnérabilités. Sur ce dernier, Argon arrive premier ex æquo.
Ces chiffres ne constituent pas un taux général de réussite sur un dépôt quelconque. Surtout, le résultat de Gemini 3.8 Flash Cyber, la variante de Google spécialisée en cyberdéfense, est évoqué sur CWE-bench v0. Passer de v0 à v1 empêche de lire les scores comme un gain direct entre générations sans examiner les changements de protocole.
Les gains internes portent sur des systèmes précis
Google rapporte plus de 300 TiB de mémoire libérés après déploiement d’optimisations trouvées par une équipe d’agents Argon. L’estimation de 500 TiB à 1 PiB reste distincte de ce volume déjà obtenu. L’entreprise décrit aussi des migrations de bases C/C++ vers Rust allant jusqu’à plus de 800 000 lignes pour Zircon, le noyau de son système Fuchsia. Ces réécritures font l’objet d’audits automatisés et manuels avant leur déploiement.
Ces exemples montrent des interventions sur des systèmes de production, mais ne comparent pas Argon à son prédécesseur sur un ensemble identique de tâches. Ils ne permettent donc pas de déduire un multiplicateur général de productivité.
Un correctif qui supprime un crash n’est pas forcément sûr
CodeMender, l’agent de réparation de code développé par Google DeepMind, illustre l’importance de l’environnement d’exécution : analyse de programmes, tests et validation des modifications entourent le modèle. Dès sa présentation en octobre 2025, son fonctionnement prévoyait de ne soumettre à la revue humaine que les correctifs ayant passé ces contrôles.
PatchBench, un benchmark de réparation de vulnérabilités proposé par une équipe de recherche, apporte une réserve méthodologique utile. Sur onze agents étudiés, une validation limitée au déclencheur du crash surestime le taux de résolution d’un facteur moyen de 1,83. Certains correctifs suppriment le symptôme sans réparer la cause. Ce résultat n’est pas une évaluation d’Argon : il explique pourquoi le protocole de validation compte autant que le score annoncé.
Les tarifs annoncés ne donnent pas le coût d’un workflow
Le tarif de lancement prévu est de 2 dollars par million de tokens d’entrée et 10 dollars en sortie, puis de 4 et 20 dollars après la période introductive. Google ne donne pas de date ferme d’ouverture générale.
Pour décider d’une migration, la comparaison utile reste le coût d’une tâche correctement terminée : génération, outils, reprises et validation compris. Les résultats publiés indiquent un progrès sur plusieurs évaluations, pas encore un avantage garanti pour chaque workflow de développement.
Sources
- blog.google /innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- www.vals.ai /benchmarks/vals_index
- blog.google /innovation-and-ai/technology/safety-security/fairwind-program/
- deepmind.google /blog/introducing-codemender-an-ai-agent-for-code-security/
- www.axios.com /2026/09/30/google-gemini-4
- arxiv.org /abs/2609.04075