Gemini 4 est officiellement sorti, et nous avons enfin un modèle de pointe où l’écriture prime sur la programmation
Le modèle phare Gemini, qui était en pause depuis sept mois et demi, a finalement été mis à jour.
À l'instant, plusieurs comptes liés à Google ont annoncé simultanément : Gemini 4 Argon est officiellement disponible.
De plus, il s'agit peut-être du seul modèle de pointe récent où les capacités d'écriture, de connaissance et de traitement de textes longs sont nettement supérieures aux capacités de programmation et d'agent.
En seulement trois jours, même la convention de nommage de Gemini 4 a changé, lui donnant presque l'apparence d'un modèle d' OpenAI . L'explication officielle de ce changement de nom est minimale ; on sait seulement qu'il s'agit d'un nom de code interne utilisé lors de la phase de test et désormais employé dans la version finale.
Littéralement, il représente l'élément 18, l'argon, un gaz inerte, ce qui forme un parallèle intéressant avec le chrome.
Ne vous précipitez pas pour l'essayer sur l'application Gemini : dans la lignée du discours actuel sur la « sécurité », Gemini 4 Argon n'est pour l'instant disponible que pour un nombre limité de partenaires en cybersécurité via le programme Fairwind. L'annonce officielle ne précise pas de date de sortie publique, indiquant seulement que « la fonctionnalité sera d'abord accessible aux utilisateurs payants de l'API et aux abonnés Google AI Ultra ». Les abonnés classiques devront patienter encore un peu.

Auparavant, une version prototype présentée comme étant celle du Gemini 4 avait fuité lors de tests. Cependant, aucune confirmation officielle n'ayant été faite, il est impossible de savoir s'il s'agit du véritable Gemini 4 ou s'il intègre les technologies Fable et Astra. De ce fait, les résultats de ces prétendus tests comparatifs sont peu fiables. Pour l'instant, nous ne pouvons que relayer les données publiées par les autorités compétentes (ce qui allège considérablement la charge de travail de cet article).
À en juger par les scores de référence officiels, le Gemini 4 Argon est extrêmement puissant :

Vous avez bien lu. Sur les 18 tests répertoriés, le Gemini 4 a obtenu des résultats exceptionnels dans 13 d'entre eux.
L'avantage le plus significatif réside dans le traitement des connaissances. Dans les tests Vals Finance Agent v2 et Harvey's Legal Agent Benchmark, qui impliquent de véritables analyses financières et des tâches juridiques concrètes, il n'est pas exagéré d'affirmer que Gemini 4 surpasse tous les autres modèles de deux niveaux. Ce n'est pas surprenant : même dans ses pires moments, les capacités de Gemini en matière de connaissances générales n'ont jamais été remises en question.

Un autre atout traditionnel de Gemini réside dans sa gestion des contextes longs. Lors du test GraphWalks, qui évalue la capacité à exploiter efficacement des contextes ultra-longs allant de 256 000 à 1 million d'éléments, Gemini 4 a également surpassé les autres modèles phares de plus de 10 %.
Une nouvelle fonctionnalité peut expliquer cette avance.

Gemini 4 Argon augmente la limite de sortie de 64 000 jetons (génération précédente) à 1 million de jetons. Autrement dit, si votre portefeuille le permet et que Gemini est prêt à s'exprimer, il peut émettre simultanément entre 700 000 et 1 million de caractères chinois, une avancée majeure pour la construction de la chaîne de caractères. Explication officielle :
Lorsqu'un modèle dispose de suffisamment d'espace pour penser en profondeur et génère des centaines de milliers d'unités lexicales dans une seule trajectoire de raisonnement, il apporte un tout nouveau niveau de profondeur au raisonnement, résolvant ainsi des problèmes épineux en une seule fois.
En revanche, les performances de programmation de Gemini 4 sont quelque peu inégales. Sur DeepSWE v1.1, le test de compilation logicielle à cycle long le plus couramment utilisé en conditions réelles, Gemini 4 a obtenu un score de 77,9 %, devançant GPT-6 Astra et Claude Opus 5.5 de près de 4 points de pourcentage.

Cependant, Gemini 4 est peu performant dans FrontierSWE v2, qui nécessite de construire des projets à partir de zéro pour résoudre les problèmes, et dans Terminal-Bench 4.0, qui utilise des terminaux Linux pour gérer des tâches complexes.
On peut résumer approximativement les caractéristiques de Gemini 4 comme suit : Connaissance/Écriture > Programmation > Terminal.
Des tests effectués par un tiers peuvent également corroborer ce jugement.
Dans le système de vote à l'aveugle d'Arena.ai, Gemini 4 s'est classé premier dans l'arène de texte grâce à ses excellents résultats face à des consignes complexes, au respect des instructions et à la créativité en écriture. Cependant, dans les arènes de code : WebDev et Agent, davantage axées sur les compétences d'ingénierie, Gemini 4 n'a obtenu que la 8e place.

D'une certaine manière, les capacités de programmation limitées de Gemini sont un mal pour un bien. La sur-optimisation de la programmation des agents semble avoir rendu de nombreux modèles de pointe « peu communicatifs », notamment à cause des sauts de ligne intempestifs hérités de GPT-5.3 et du jargon obscur apparu avec Opus 4.7. Dans ce contexte, un modèle Gemini qui conserve un certain sens esthétique du langage malgré ses capacités de programmation limitées peut résoudre bien des problèmes d'écriture.
Un autre changement notable est la diminution significative du taux d'hallucinations.

Lors du test d'analyse artificielle, Gemini 4 a affiché un taux d'hallucinations de seulement 15 %, le plus bas parmi tous les modèles de pointe. Cela signifie que face à des réponses incertaines, il est plus probable qu'il dise « Je ne sais pas » plutôt que d'inventer une réponse.
Mais pour les utilisateurs ordinaires, la question la plus importante est bien sûr le prix, et Google a toujours été très généreux à cet égard.
Le tarif officiel de l'API Gemini 4 Argon est de 2 $ par million de jetons entrants et de 10 $ par million de jetons sortants, avec un taux de réussite de 5 % (0,10 $). L'annonce officielle indique que le prix doublera après la période de lancement promotionnelle, mais l'expérience montre qu'il est fort probable que cette période se poursuive jusqu'à la sortie du modèle de nouvelle génération.

Avec sa réduction de prix, le Gemini 4 coûte cinq fois moins cher que le GPT-6 Astra et le Fable 5.1, et se situe à peu près au même niveau que le GPT-6.1 Sol et le Sonnet 5.5. Autrement dit, sauf publicité mensongère, le Gemini 4 est actuellement le modèle offrant le meilleur rapport intelligence/prix, proposant une intelligence de niveau haut de gamme à un prix moyen.
La sortie du Gemini 4 Argon a également mis fin à un record embarrassant : pendant près de six mois, les avantages du pack Google AI Pro étaient décrits comme « la possibilité d’utiliser le modèle 3 Pro »… Sachant que même les modèles Flash peuvent surpasser les modèles Pro depuis l’ère Flash 3.5, ce pack d’abonnement paraît assez risible ; la plupart des gens l’ont acheté uniquement pour les 5 To de Google Drive.

Au moins, Google peut désormais promouvoir ouvertement son programme d'adhésion.
À ce stade, j'aimerais également dire quelques mots sur un sujet différent.
Chacun a son outil de prédilection, et pour moi, dans le domaine de l'IA, c'est le Gemini 2.5 Pro. Début 2018, ses capacités de traitement de texte étaient tout simplement stupéfiantes, et c'est après cela que j'ai officiellement intégré l'IA à mon flux de travail. Plus tard, dès la sortie du Gemini 3, je l'ai partagé sur WeChat Moments.
En ce sens, personne ne souhaite plus que moi que le Gemini 4 se démarque.

Il nous faut toutefois respecter les lois objectives. Comme beaucoup l'ont souligné, la production à grande échelle est, en définitive, une forme d'industrie manufacturière, au même titre que la fabrication de téléphones portables et de puces. On ne peut espérer qu'un modèle obsolète domine soudainement le marché ; ce serait aussi irréaliste qu'une usine de semi-conducteurs bloquée à la gravure en 10 nm se mette soudainement à produire des puces en 2 nm.
L'écart important entre les scores des benchmarks Flash du Gemini 3.8 et ses performances réelles laisse penser que Google a peut-être mis en œuvre des « optimisations spécifiques » pour gonfler artificiellement les scores et tenter de masquer ses résultats décevants. De même, il est fort douteux que le Gemini 4 atteigne des niveaux de performance de pointe dans la plupart des tests de benchmarks.
Presque simultanément à l'annonce du Gemini 4, Bloomberg a également rapporté que des employés de Google étaient sceptiques quant à ses performances réelles. Ils ont cité des sources internes qui affirmaient que le Gemini 4 était peu performant dans les tâches concrètes et « avait du mal à gérer certaines tâches de programmation ».

Bien que Google ait rapidement réfuté ces affirmations et que certains employés aient déclaré que Gemini 4 était plutôt performant, il est probable que la version finale de Gemini 4 ne soit pas aussi puissante que le suggèrent les scores des tests de performance. De plus, le temps nécessaire à l'implémentation de Gemini 4 est suffisant pour que ChatGPT et Claude puissent évoluer d'une version à l'autre.
Quoi qu'il en soit, le point positif est que la sortie du Gemini 4 Argon signifie que Google est enfin de retour dans la compétition.
Sa limite supérieure n'est peut-être pas très élevée, mais sa limite inférieure est garantie. Il s'agit maintenant de rattraper progressivement ce retard grâce aux méthodes de fabrication de modèles à grande échelle.
