Une annonce majeure, pas un lancement grand public

Google DeepMind présente Argon comme un modèle conçu pour soutenir un raisonnement approfondi au fil de flux de travail complexes. Il ne s’agit pas seulement d’améliorer une réponse isolée dans une fenêtre de discussion : le groupe met en avant des tâches à plusieurs étapes, où l’IA doit lire des informations, agir sur un environnement, vérifier ses résultats et poursuivre jusqu’à une issue exploitable. Les domaines cités sont l’ingénierie logicielle, le travail intellectuel en entreprise — notamment juridique et financier — ainsi que la cybersécurité défensive. C’est la thèse de l’annonce officielle de Google et de la page du modèle chez DeepMind.

La distinction décisive concerne l’accès. Au 1er octobre, Google indique qu’Argon commence à être déployé auprès d’un groupe de cyberdéfenseurs de confiance dans son programme Fairwind. Le modèle est également utilisé en interne. Cela ne constitue ni une ouverture générale de l’application Gemini ni une mise à disposition libre dans Google AI Studio. Google prévoit ensuite une extension aux développeurs, aux entreprises et aux particuliers, en commençant par certains clients de l’API payante et les abonnés Google AI Ultra. L’entreprise n’a pas donné de date précise pour ces étapes, encore moins pour un accès universel. Source : Google.

Ce lancement progressif n’est pas un détail de calendrier. Il détermine ce qui peut être vérifié aujourd’hui par des utilisateurs extérieurs : les caractéristiques et les scores communiqués par Google peuvent être étudiés, mais la plupart des lecteurs ne peuvent pas encore reproduire eux-mêmes les essais sur leurs propres dossiers, logiciels ou langues. L’article de FLUXAI distingue donc les démonstrations de Google des performances qui devront être confirmées à l’usage.

Le million de jetons de sortie : ce que ce chiffre signifie vraiment

Google annonce pour Argon une limite de sortie pouvant atteindre un million de jetons, contre 64 000 auparavant dans la comparaison avancée par l’entreprise. La sortie désigne le texte — ou les autres éléments pris en charge — que le modèle peut générer sur une trajectoire. Cette capacité pourrait compter pour un audit logiciel détaillé, la production d’une longue analyse structurée ou un travail agentique qui doit documenter de nombreuses étapes. Google y voit un moyen de prolonger le raisonnement sur des problèmes complexes. Source : annonce officielle.

Il faut toutefois éviter une confusion fréquente : un million de jetons de sortie n’est pas synonyme d’une fenêtre de contexte illimitée. La quantité que le modèle peut produire, la quantité de documents qu’il peut recevoir et la qualité de son attention sur une tâche longue sont des dimensions distinctes. Le chiffre ne garantit pas non plus qu’une réponse très longue sera toujours préférable. Sur un projet professionnel, cohérence, coût, temps de traitement et possibilité de relire le résultat pèseront autant que la longueur maximale affichée.

La page DeepMind montre par ailleurs des évaluations de compréhension de longues vidéos, de graphiques et de contexte étendu. Ces résultats suggèrent que Google cherche à faire d’Argon un modèle polyvalent pour les dossiers volumineux et multimodaux. Ils ne prouvent pas, à eux seuls, qu’il sera le meilleur choix pour tout document, toute vidéo ou toute tâche en français.

Les exemples internes de Google : impressionnants, mais à qualifier

Pour illustrer son intérêt pratique, Google décrit plusieurs usages internes. Une équipe d’agents Argon aurait analysé la télémétrie de ses centres de données et permis de libérer plus de 300 Tio de mémoire une fois les optimisations déployées ; le groupe estime le potentiel total entre 500 Tio et 1 Pio. Google cite également des migrations de code C/C++ vers Rust, depuis des bibliothèques comme re2 et libgav1 jusqu’à un chantier portant sur plus de 800 000 lignes du noyau Zircon de Fuchsia. Source : Google.

Le cas de libgav1 est plus précis. Selon Google, des agents ont repris un portage Rust existant, retravaillé 32 000 lignes de code SIMD et obtenu un décodeur 2,7 fois plus rapide que ce portage Rust, avec une sortie vidéo identique. La référence de comparaison est importante : ce n’est pas une annonce selon laquelle le nouveau code serait 2,7 fois plus rapide que la version C++ optimisée. Google indique qu’il s’en rapproche. Pour les systèmes critiques, l’entreprise précise aussi que ces réécritures passent par des audits, des tests et une revue avant toute mise en production.

Ces exemples racontent une évolution du travail avec l’IA : confier un problème circonscrit à plusieurs agents, puis intégrer le résultat dans une chaîne de vérification humaine et automatisée. Ils restent néanmoins des cas rapportés par le concepteur du modèle, dans son propre environnement. Les reproduire dans une autre entreprise supposerait des données comparables, des autorisations adaptées, une infrastructure de test et une équipe capable de contrôler les changements.

Benchmarks : où Argon progresse, et où il ne domine pas

Google publie une série de résultats comparant Argon à GPT-6 Astra et à des modèles Claude. Ils donnent des repères utiles, à condition de ne pas les lire comme un classement universel. Sur DeepSWE v1.1, consacré à l’ingénierie logicielle de longue durée, Argon atteint 77,9 % dans le tableau de Google. Sur AutomationBench, orienté processus métier de bout en bout, il affiche 51,3 %. Sur LVBench, consacré à la compréhension de longues vidéos, le score communiqué est 91,7 %. Enfin, sur CWE-bench v1, lié à la correction de vulnérabilités, Argon se situe à 68 %, à égalité avec GPT-6 Astra dans le tableau présenté. Source : tableau DeepMind.

ÉvaluationScore d’Argon publié par GoogleCe qu’il faut en retenir
DeepSWE v1.177,9 %Un signal favorable pour certaines tâches de développement longues ; le protocole compte autant que le score.
AutomationBench51,3 %Une progression sur des processus métier évalués, pas la réussite automatique d’une tâche en entreprise.
LVBench91,7 %Une bonne performance rapportée sur la compréhension de longues vidéos, avec des conditions de comparaison à examiner.
CWE-bench v168,0 %Une première place partagée dans le tableau, pas une preuve de détection de toutes les failles.

Les chiffres publiés comportent aussi des contre-exemples à un récit de domination totale. Sur FrontierSWE v2, Argon est donné à 55,0 %, derrière les 65,5 % indiqués pour GPT-6 Astra. Sur Terminal-bench 4.0, ses 57,4 % sont inférieurs aux 66,4 % attribués à Claude Opus 5.5. Sur Terminal-Bench Science 0.1, Google affiche 57,6 % pour Argon et 68,1 % pour Astra. Le choix d’un modèle dépend donc du type de tâche : coder dans un dépôt, agir dans un terminal, traiter une longue vidéo ou effectuer une recherche financière ne mesure pas la même chose. Source : DeepMind.

Pourquoi la méthode de test compte autant que les scores

Google a publié une note méthodologique qui mérite d’être lue avec le tableau. Elle précise que les résultats d’Argon sont généralement mesurés en pass@1, avec les réglages de raisonnement les plus élevés, sauf exception. Pour plusieurs tests, les résultats des modèles concurrents viennent des chiffres communiqués par leurs fournisseurs ou de classements publics. Les protocoles, les environnements d’agent et le calcul autorisé pendant l’épreuve peuvent varier. Une différence de quelques points n’équivaut donc pas toujours à une différence certaine dans un usage réel.

Deux exemples montrent l’importance des détails. Pour LVBench, Google indique avoir utilisé une image par seconde pour Gemini, mais des nombres de vues fixes différents pour les autres modèles, en raison de contraintes d’API. Pour OSWorld 2.0, la société rapporte un score partiel sur un sous-ensemble hors ligne et retient le meilleur de trois essais, ce qui appelle une lecture distincte d’une mesure en un seul passage. La note explique aussi que certains tests cyber sont internes à Google ou à Wiz. Ils renseignent sur des capacités observées dans ces cadres, sans offrir la même reproductibilité qu’une évaluation publique entièrement ouverte.

La conclusion raisonnable n’est ni de rejeter les benchmarks ni de proclamer un vainqueur définitif. Les résultats dessinent des forces et des faiblesses à examiner ; les évaluations indépendantes, l’accès élargi et les retours sur des tâches réelles permettront ensuite de juger leur portée. Cette prudence est d’autant plus nécessaire qu’Argon n’est pas encore testable par le grand public.

Cyberdéfense : pourquoi les premiers accès vont à Fairwind

Google insiste particulièrement sur la capacité d’Argon à repérer, valider et corriger des vulnérabilités. Le programme Fairwind donne un accès anticipé à des défenseurs de confiance. Le groupe affirme que Wiz utilise déjà le modèle dans son initiative Scan for Good, qui vise à protéger gratuitement des infrastructures publiques critiques. Google évoque également une vulnérabilité grave découverte dans un logiciel de santé utilisé par des hôpitaux. Ces exemples restent des informations rapportées par Google ; ils ne doivent pas être présentés comme la preuve qu’Argon sécuriserait à lui seul un système hospitalier.

La difficulté tient au double usage. Un modèle capable de rechercher une faille et de produire un correctif peut aider les défenseurs, mais des compétences proches pourraient aussi intéresser des attaquants. Google indique que les équipes internes et les défenseurs de confiance bénéficient d’un accès sans les restrictions cyber prévues pour une diffusion plus large. Ce régime particulier rend le choix des partenaires, la traçabilité des usages et la validation des correctifs essentiels. Une preuve de concept n’est pas un feu vert pour agir sans autorisation sur un système tiers.

Dans ses données publiées, Google affiche pour Argon 68 % sur CWE-bench v1 et des progrès sur deux évaluations de découverte de failles par rapport à Gemini 3.8 Flash Cyber. La page cyber de DeepMind décrit aussi des essais de pénétration en boîte noire, où le modèle ne dispose que du comportement public d’une application Web. Là encore, les tests internes ne disent pas à quel taux le modèle détecterait des vulnérabilités inédites dans toutes les infrastructures réelles.

Les garde-fous que Google dit renforcer avant la diffusion large

L’entreprise met en avant quatre axes de sûreté : refus des demandes dangereuses, résistance aux injections d’instructions, surveillance des comportements qui s’écartent de l’intention de l’utilisateur et durcissement des environnements de test. L’injection d’instructions consiste, par exemple, à glisser des consignes trompeuses dans un document ou une page Web que l’agent doit simplement consulter. Pour un modèle susceptible d’utiliser des outils, cette menace est plus concrète qu’une simple erreur de rédaction : une instruction externe pourrait détourner la suite des actions. Source : Google.

Google affirme qu’Argon résiste mieux à ce type d’attaque sur l’évaluation Gray Swan IPI. Il dit aussi déployer des mécanismes capables de surveiller le raisonnement et les actions de l’agent, puis d’arrêter l’exécution si nécessaire. Ce sont des mesures annoncées par le fournisseur, pas une garantie que les injections, les usages abusifs ou les erreurs d’autonomie auraient disparu. Pour un déploiement en entreprise, la question pratique sera de savoir quelles permissions l’agent reçoit, quelles opérations restent soumises à validation et comment les incidents peuvent être audités.

Prix annoncés et disponibilité en France : les deux questions pratiques

Google indique qu’Argon sera lancé sur l’API à un prix de lancement de 2 dollars par million de jetons en entrée et 10 dollars par million de jetons en sortie. Les jetons d’entrée mis en cache bénéficieraient d’une réduction de 95 % sur le prix de l’entrée. Une note de l’annonce précise qu’après la période promotionnelle, les montants passeraient à 4 dollars en entrée et 20 dollars en sortie par million de jetons. Google ne précise pas dans cette annonce la durée de la période de lancement. Il s’agit d’un tarif annoncé pour un accès futur, pas de la preuve qu’un développeur français peut déjà appeler le modèle aujourd’hui. Source : annonce Google et sa note tarifaire.

Ces chiffres ne suffisent pas à calculer le coût d’un projet. Une tâche longue peut multiplier les échanges, les lectures de documents et les jetons générés. Les limites d’usage, les éventuels coûts des outils, les modalités de facturation et la disponibilité selon les régions devront être vérifiés au moment de l’ouverture effective. De même, Google AI Ultra est cité parmi les premiers abonnements visés après la phase de test, sans date ni engagement d’accès simultané dans tous les pays.

Pour les lecteurs français, la formulation exacte est donc la suivante : aucun accès public général à Gemini 4 Argon en France n’est confirmé au 1er octobre 2026. Cette phrase ne signifie pas que la France serait définitivement exclue ; elle signifie que Google n’a pas publié, dans ses annonces consultées, de calendrier français opposable. Il serait prématuré de conseiller un abonnement uniquement pour obtenir Argon, ou de publier un tutoriel prétendant montrer son usage courant dans l’application Gemini.

Ce qui permettra de juger Argon au-delà de l’annonce

Le modèle réunit sur le papier plusieurs ambitions fortes : une très grande sortie possible, des résultats compétitifs en développement logiciel et en travail documentaire, une attention particulière à la cybersécurité et un usage interne déjà revendiqué par Google. Son lancement restreint donne cependant à l’annonce une portée différente d’une sortie grand public. À ce stade, les meilleurs éléments disponibles sont la présentation du fournisseur, sa page de scores et sa méthodologie — pas une expérience largement reproductible par les utilisateurs de FLUXAI.

Les prochaines vérifications seront concrètes : date et périmètre d’ouverture de l’API, disponibilité effective pour Google AI Ultra en France, fiches de prix et de limites à jour, publication d’évaluations indépendantes, puis qualité des résultats sur des dossiers réels et des langues autres que l’anglais. Un modèle peut exceller sur une batterie de tests et demander encore beaucoup de supervision dans un contexte professionnel. C’est entre ces deux réalités — promesse technique et usage contrôlable — que Gemini 4 Argon devra faire ses preuves.

Sources