Gemini 4 Argon : Rival D’Astra, Pas D’Opus

Un score de 53 sur un indice d’intelligence ne ressemble pas, à première vue, à une révolution. Pourtant, lorsqu’il arrive pile au même niveau que GPT-6 Astra, qu’il dépasse ce rival sur l’automatisation de processus métier et qu’il divise presque par trois le taux d’erreurs assumées, le chiffre change de statut. Gemini 4 Argon, évalué fin septembre 2026 par Artificial Analysis en mode de raisonnement élevé, replace Google dans le peloton de tête. La question qui compte pour une direction marketing n’est plus de savoir si Mountain View a rattrapé le retard de Gemini 3.1 Pro Preview, plafonné à 30 sur le même indice. Elle est plus concrète : ce modèle vaut-il la peine d’être attendu, testé, puis intégré, alors qu’il n’est pas encore achetable, que Claude Opus 5.5 conserve cinq points d’avance, et que le prix affiché au million de tokens raconte une histoire très différente du coût réel d’une tâche terminée ?

Pour une équipe qui produit des contenus chiffrés, route des leads, prépare des reportings et branche des outils entre eux, la course aux scores globaux n’a d’intérêt que si elle se traduit en livrables fiables, en factures maîtrisées et en délais supportables. Argon coche deux cases rares. Il échoue encore sur d’autres. Le reste de cet article détaille ce que les chiffres disent vraiment, ce qu’ils ne disent pas, et comment arbitrer sans se laisser hypnotiser par une grille tarifaire promotionnelle.

Ce que le score de 53 change vraiment pour Google

L’évaluation publiée le 30 septembre 2026 place Gemini 4 Argon à 53 points sur l’indice d’intelligence d’Artificial Analysis, en mode high. C’est exactement le niveau de GPT-6 Astra en mode maximal, et un point au-dessus de GPT-6.1 Sol. Claude Opus 5.5 culmine à 58 dans son mode le plus poussé. Claude Sonnet 5.5 atteint 56. Autrement dit, le modèle que Google présente comme son retour dans le trio de tête égale le fleuron d’OpenAI, mais reste derrière les deux modèles Anthropic les plus visibles du moment, y compris celui qui n’est pas positionné comme le sommet de gamme.

Ce décalage mérite d’être lu sans dramatisation. Un indice agrège des épreuves très différentes : raisonnement, connaissance, suivi d’instructions, robustesse. Cinq points d’écart avec Opus 5.5 ne signifient pas qu’Argon est inutilisable sur un brief marketing. Ils signifient qu’il n’a pas encore le même plafond lorsqu’on lui demande le maximum de profondeur. Trois points de retard sur Sonnet 5.5 sont plus gênants commercialement, parce que la grille d’Anthropic pour ce modèle tourne autour de 2 dollars en entrée et 10 dollars en sortie par million de tokens, soit le tarif de lancement d’Argon. À prix comparable, le modèle intermédiaire d’Anthropic affiche encore un indice supérieur.

Le saut, lui, est indiscutable. Gemini 3.1 Pro Preview plafonnait à 30 sur le même barème. Passer de 30 à 53 en une génération, c’est sortir de la zone où beaucoup d’équipes avaient cessé de tester Google faute de niveau. Si vos comparatifs internes excluaient encore la famille Gemini pour cette raison, le moment est venu de rouvrir le dossier, même si l’accès public n’est pas ouvert. Un modèle qui double presque son score d’indice ne se juge pas sur la mémoire des versions précédentes.

Égaler Astra ne veut pas dire détrôner Opus. Le bon réflexe est de classer les modèles par usage, pas par podium unique.

– Lecture des scores Artificial Analysis, septembre 2026

Sundar Pichai a longtemps défendu l’idée que Google pouvait réunir recherche, données et modèles dans une même stack. Argon est le premier signal chiffré, depuis plusieurs cycles, qui rend cette promesse crédible face à Astra. Il ne la rend pas encore crédible face à Opus 5.5 sur l’ensemble des plans. Cette nuance doit rester au centre de toute note de veille destinée à une direction.

Quatre épreuves qui parlent aux équipes marketing

Un indice global flatte ou déçoit, mais il mélange des compétences que vous n’utilisez pas au même rythme. Pour un pôle acquisition, contenu ou opérations marketing, quatre lectures d’Artificial Analysis suffisent à cadrer le débat : l’automatisation de processus métier, la fiabilité factuelle, la qualité d’un livrable professionnel, et le travail d’agent en environnement technique. Le tableau mental est simple. Argon mène sur les deux premiers terrains utiles au quotidien. Il recule sur le troisième aspect visuel et sur le quatrième terrain technique.

Sur AutomationBench-AA, Argon atteint 77,5 %. Claude Sonnet 5.5 est crédité de 71,3 %, Opus 5.5 de 69,5 %, Astra de 68,5 %, selon les chiffres repris notamment par OfficeChai. Ce n’est pas un quiz de culture générale. C’est l’épreuve la plus proche d’un agent qui enchaîne des étapes dans vos outils : mettre à jour un CRM, router un lead, assembler un reporting, vérifier qu’une action a bien été écrite avant de passer à la suivante. Neuf points d’avance sur Astra et huit sur Opus 5.5, à ce niveau de difficulté, ne sont pas un détail de laboratoire.

Sur la fiabilité, AA-Omniscience mesure la part de mauvaises réponses lorsque le modèle aurait dû admettre qu’il ne savait pas. Argon tombe à 15 %. GPT-6 Astra est à 51 %, GPT-6.1 Sol à 54 %. Le taux d’Opus 5.5 n’était pas publié dans les données consultées au moment de la synthèse. Artificial Analysis précise toutefois que la précision brute d’Argon reste inférieure : 50 % contre 63 % pour Astra. Argon sait moins de choses. Il l’avoue plus souvent. Pour une équipe qui produit des fiches produits, des pages comparatives ou des argumentaires chiffrés, ce comportement change le coût de vérification, souvent plus long aujourd’hui que le temps de rédaction lui-même.

Sur Terminal-Bench 4, qui évalue des agents travaillant en ligne de commande, l’ordre s’inverse. Sonnet 5.5 mène à 64 %, devant Opus 5.5 à 60 %, Astra à 59 % et Argon à 57 %. Argon sort du top 3. Pour des scripts de tracking, des automatisations maison ou des intégrations techniques, Anthropic conserve l’avantage. Ce n’est pas le cœur de métier de la plupart des marketers, mais c’est le cœur de métier de ceux qui industrialisent le marketing.

Côté livrables, AA-Briefcase crédite Argon de 1 494 Elo, avec le meilleur taux de réussite aux critères jamais relevé dans cette série, à 65 %. La note de présentation tombe à 1 308 Elo. Le fond tient. La mise en forme et le soin visuel restent en retrait. Si votre chaîne de production sépare déjà la rédaction et le design, ce profil est exploitable. Si vous attendez d’un seul modèle une page prête à publier, il faudra encore un passage humain ou un modèle plus à l’aise sur la forme.

Le tableau comparatif à garder sous les yeux

Les ordres de grandeur ci-dessous reprennent les lectures publiques d’Artificial Analysis et les tarifs catalogues évoqués pour octobre 2026. Ils ne remplacent pas un test sur vos propres prompts. Ils empêchent en revanche de comparer des pommes et des poires lorsque quelqu’un brandit uniquement le prix au million de tokens.

Indice d’intelligence : Opus 5.5 à 58, Astra à 53, Argon à 53. AutomationBench-AA : 69,5 % pour Opus, 68,5 % pour Astra, 77,5 % pour Argon. Terminal-Bench 4 : 60 %, 59 % et 57 %. Hallucinations AA-Omniscience : non publié pour Opus dans les données retenues, 51 % pour Astra, 15 % pour Argon. Prix catalogue entrée et sortie par million de tokens : 4 et 20 dollars pour Opus, 10 et 50 pour Astra, 2 et 10 en promotion pour Argon puis 4 et 20 au tarif standard. Coût par tâche de l’indice : 5,98 dollars pour Opus, 3,26 pour Astra, 1,99 en promo pour Argon et 3,98 au tarif standard. Tokens de sortie pour passer l’indice : environ 260 millions pour Opus, 60 millions pour Astra, 110 millions pour Argon. Vitesse de sortie : 91,2 tokens par seconde pour Opus, 63,3 pour Astra, non mesurée publiquement pour Argon.

Ce dernier trou est important. Une équipe qui enchaîne des briefs en temps réel ne peut pas arbitrer uniquement sur l’intelligence et le prix. La latence et le débit déterminent si un agent tient dans une fenêtre de travail ou s’il force l’opérateur à changer de tâche en attendant. Tant que la vitesse d’Argon n’est pas publiée, toute promesse de productivité reste incomplète.

Pourquoi le prix au million de tokens trompe

Au tarif de lancement, Argon affiche un rapport spectaculaire : environ 26,6 points d’indice par dollar dépensé sur une tâche de l’indice, contre 16,3 pour Astra et 9,7 pour Opus 5.5. Le calcul part des coûts par tâche publiés par Artificial Analysis. Pour une intelligence équivalente à celle d’Astra, la facture promotionnelle tombe d’environ 40 %. C’est l’argument que les slides retiendront. Ce n’est pas l’argument qui doit clore un appel d’offres interne.

La promotion ne dure pas. Au tarif standard de 4 dollars en entrée et 20 dollars en sortie, la même tâche remonte à 3,98 dollars. Le ratio tombe à 13,3 points par dollar, sous celui d’Astra, pourtant affiché deux fois et demie plus cher au million de tokens. L’explication tient dans la verbosité. Argon produit en moyenne 62 000 tokens de sortie par tâche, contre 27 000 pour Astra. Il réfléchit plus longtemps à l’écrit, ou du moins il écrit davantage pour arriver au bout de l’épreuve. Le prix unitaire bas est alors mangé par le volume.

C’est le piège classique des modèles de raisonnement. Comparer des grilles entrée et sortie sans mesurer les tokens réellement consommés, y compris les tokens de réflexion lorsque la facturation les compte, donne une illusion de sobriété. Le bon indicateur est le coût d’une tâche terminée, sur vos prompts, avec vos contraintes de format, vos outils et votre seuil de relecture. Une tâche d’indice n’est pas une fiche produit de 800 mots. Elle donne un ordre de grandeur, pas un budget.

Autre signal : pour passer l’indice, Argon a mobilisé environ 110 millions de tokens de sortie, contre 60 millions pour Astra et 260 millions pour Opus 5.5. Opus est le plus bavard à l’échelle de la campagne de tests, Argon se situe au milieu, Astra est le plus économe. Si votre usage est un agent qui boucle des dizaines d’actions par jour, cette différence de volume se voit sur la facture mensuelle bien avant de se voir sur un benchmark isolé.

Automatisation : le terrain où Argon prend la tête

AutomationBench-AA est l’épreuve à montrer en comité produit. Un score de 77,5 % signifie qu’Argon enchaîne mieux que ses rivaux directs une suite d’actions métier, avec des vérifications intermédiaires. Dans une stack marketing réelle, cela ressemble à ceci : lire un formulaire entrant, qualifier le lead selon des règles, créer ou mettre à jour la fiche CRM, assigner un commercial, déposer une note dans l’outil de projet, puis préparer un extrait pour le reporting hebdomadaire. Chaque étape peut échouer silencieusement. Le modèle qui admet une incertitude plutôt que d’inventer un statut a ici un avantage structurel, et le faible taux d’hallucination d’Argon renforce ce profil.

Ce n’est pas pour autant un agent clé en main. Un benchmark ne connaît pas vos champs personnalisés, vos droits d’accès, ni vos exceptions commerciales. Il dit seulement que, sur un protocole standardisé, Argon se trompe moins souvent dans l’enchaînement. La bonne traduction opérationnelle est un pilote borné : un flux, un outil, un critère de succès mesurable, une relecture humaine sur les cas ambigus. Étendre trop vite à tout le CRM, c’est confondre un classement de laboratoire et une mise en production.

Les usages où cette avance a le plus de chances de se voir :

  • qualification et routage de leads entrants, avec une règle d’escalade dès qu’une donnée manque ;
  • préparation de reportings récurrents à partir d’exports déjà structurés ;
  • mise à jour de statuts dans un CRM lorsque les champs sont normalisés ;
  • contrôle de cohérence entre une brief créa et une liste de contraintes légales simples.

Les usages où l’avance est moins évidente : scripts sur mesure, pipelines analytics complexes, et tout ce qui exige une ligne de commande fiable. Là, Terminal-Bench 4 rappelle que Sonnet 5.5 et Opus 5.5 restent devant. Une architecture multi-modèles n’est pas une coquetterie. C’est la conséquence logique de ces écarts.

Fiabilité factuelle : savoir moins, avouer mieux

Le couple précision brute et taux d’aveu est le point le plus subtil du dossier. Astra connaît davantage de réponses justes : 63 % de précision contre 50 % pour Argon. Argon invente beaucoup moins souvent lorsqu’il devrait se taire : 15 % contre 51 %. Pour un chatbot grand public, la précision brute peut primer, parce que l’utilisateur veut une réponse. Pour une équipe marketing qui publie des chiffres, des comparatifs de prix ou des allégations produit, l’aveu vaut souvent plus que l’aplomb.

Le temps de vérification est devenu le goulot. Produire un paragraphe douteux en dix secondes, puis passer vingt minutes à retrouver la source, n’est pas un gain. Un modèle qui écrit « je ne dispose pas de cette donnée » oblige à aller chercher la source, mais il évite la fausse piste. Sur des fiches produits, des pages SEO transactionnelles ou des études de cas, ce comportement réduit le risque réputationnel. Il ne supprime pas le besoin de sources. Il le rend plus visible.

La limite est claire. Si votre sujet est pointu et qu’Argon sait moins de choses, vous aurez plus de blancs à combler. Astra, plus précis mais beaucoup plus enclin à répondre quand même, demandera une relecture plus méfiante. Opus 5.5, en tête d’indice, reste le candidat naturel lorsque la profondeur prime et que le budget token le permet. Aucun de ces profils ne dispense d’une charte de sources.

Livrables : un fond solide, une forme à reprendre

Le score de 1 494 Elo sur AA-Briefcase, associé à 65 % de critères réussis, indique qu’Argon respecte mieux que ses prédécesseurs une liste d’exigences professionnelles : structure demandée, couverture des points, tenue du brief. La note de présentation à 1 308 Elo dit autre chose : la hiérarchie visuelle, le rythme, le soin perçu restent en dessous. Dans un univers où le premier écran décide souvent de la lecture, ce n’est pas un détail cosmétique.

La parade est organisationnelle. Confiez à Argon la matière : plan, arguments, objections, données à vérifier. Confiez la mise en page à un profil ou à un outil plus à l’aise sur le design, ou à un modèle qui score mieux sur la forme. Cette séparation existait déjà dans les équipes sérieuses. Argon la rend simplement plus rationnelle. Vouloir un seul modèle pour le fond, la forme, l’automatisation et le code, c’est optimiser un slogan, pas une chaîne de production.

Sur le contenu long, la verbosité peut même devenir un atout si vous imposez un format. Un modèle qui développe trop peut être cadré par une longueur cible, une structure imposée et une consigne de coupe. Sans ce cadre, les 62 000 tokens moyens observés sur les tâches d’indice se traduiront par des brouillons trop longs, donc par un coût de relecture et un coût API qui montent ensemble.

Un modèle que presque personne ne peut encore acheter

Selon la communication de Google DeepMind, Argon est pour l’instant réservé au programme Fairwind, destiné aux spécialistes de la cyberdéfense, aux opérateurs d’infrastructures critiques et aux mainteneurs de logiciels. Ces testeurs reçoivent le modèle sans les garde-fous cyber prévus pour le grand public. Google évoque un déploiement prochain aux clients API payants et aux abonnés Google AI Ultra, sans date ferme, et sans précision particulière pour l’Europe.

Artificial Analysis indique avoir évalué un modèle en cours de déploiement auprès d’utilisateurs sélectionnés. Le risque est réel : la version qui arrivera sur l’API grand public pourrait être davantage bridée, et donc moins alignée avec les benchmarks. Ce n’est pas une théorie du complot. C’est la conséquence mécanique d’un programme qui retire des garde-fous pour des publics spécialisés, puis les réintroduit pour le reste du marché. Un score mesuré sur la variante ouverte aux experts n’est pas un engagement contractuel sur la variante API.

Opus 5.5, Sonnet 5.5 et GPT-6 Astra sont, eux, utilisables maintenant. Pour un classement interne des modèles à recommander à la direction, Argon mérite une ligne « à évaluer dès l’ouverture », pas une ligne « standard de production ». Attendre une date floue pour geler des choix déjà possibles serait une erreur. Ignorer le saut de Google en serait une autre.

Ce que Fairwind change pour la lecture des risques

Réserver d’abord un modèle à la cyberdéfense et aux infrastructures critiques n’est pas anodin. Cela suggère qu’Argon est jugé assez capable pour intéresser des acteurs qui craignent les usages offensifs, et assez sensible pour ne pas être lâché tel quel. Les testeurs Fairwind voient une variante sans certains garde-fous. Le marché verra autre chose. Entre les deux, l’écart de comportement peut porter sur le refus de certaines requêtes, sur la longueur des raisonnements, ou sur la capacité à enchaîner des actions dans des outils.

Pour le marketing, le sujet n’est pas de contourner des protections. Il est de ne pas construire un business case sur une variante que vous n’aurez pas. Dès l’ouverture API, le premier travail utile sera de rejouer vos tâches témoins et de comparer au benchmark, pas de reprendre les 77,5 % d’AutomationBench comme une garantie. Si la version publique perd plusieurs points sur l’enchaînement d’actions ou remonte en hallucinations, le dossier change. Si elle tient, Google aura un argument solide face à Astra sur deux usages très demandés.

Comment chiffrer un pilote sans se raconter d’histoires

La méthode la plus saine tient en une phrase : mesurez la facture finale sur vos tâches, ne multipliez pas une grille. Concrètement, choisissez cinq à dix scénarios représentatifs. Un brief de campagne. Une fiche produit avec chiffres à sourcer. Un routage de lead. Un reporting hebdomadaire. Un script simple de contrôle. Faites tourner chaque scénario sur les modèles déjà accessibles, avec le même cahier des charges, puis archivez tokens entrée, tokens sortie, temps, nombre de reprises et erreurs factuelles.

Lorsque Argon sera disponible, rejouez exactement les mêmes scénarios. Comparez le coût par tâche réussie, pas le coût par million de tokens. Une tâche réussie est une tâche qui passe votre seuil de relecture sans reprise majeure. Si Argon coûte 3,98 dollars au tarif standard là où Astra coûte 3,26 sur l’indice, vos scénarios peuvent inverser l’ordre, parce que vos prompts sont plus courts, ou le confirmer, parce que la verbosité se reproduit. Seul le test tranche.

Ajoutez le coût humain. Un modèle à 15 % d’hallucinations assumées peut faire économiser des heures même s’il est un peu plus cher en tokens. Un modèle rapide mais trop sûr de lui peut coûter une erreur publique. Le tableur qui ne contient que la ligne API est incomplet. Celui qui ignore la latence l’est aussi, dès que le flux est synchrone.

Cas d’usage marketing : où placer Argon le jour J

Le jour où l’API s’ouvre, le placement le plus rationnel n’est pas « remplacer tous les modèles ». C’est une carte d’usages.

Sur l’automatisation de processus déjà cadrés, Argon devient le candidat prioritaire à tester, parce que c’est là qu’il mène. Pensez aux files de leads, aux relances conditionnelles, aux mises à jour de pipeline, aux compilations de chiffres déjà extraits. Le critère de succès n’est pas un texte élégant. C’est un enchaînement juste, avec un refus propre quand une donnée manque.

Sur les contenus à forts enjeux factuels, Argon mérite un essai en première passe, précisément pour son aveu d’ignorance. La seconde passe peut rester humaine, ou passer par un modèle plus précis si le sujet exige une couverture large. L’objectif n’est pas d’éliminer la relecture. Il est de réduire les fausses certitudes.

Sur la création pure, le design de pages et la mise en forme soignée, rien dans AA-Briefcase ne justifie d’en faire le modèle par défaut. La note de présentation plus faible invite à garder un concurrent plus à l’aise sur la forme, ou un humain, en fin de chaîne.

Sur le technique, scripts, tracking, connecteurs, Sonnet 5.5 et Opus 5.5 restent les références à battre. Argon à 57 % sur Terminal-Bench 4 n’est pas disqualifié. Il n’est simplement pas en tête. Le confier d’emblée à la maintenance de vos automatisations critiques serait prématuré.

Sur les tâches où la profondeur maximale compte plus que le coût, Opus 5.5 à 58 conserve la pole. Le payer 5,98 dollars par tâche d’indice n’a de sens que si cette profondeur évite des erreurs chères. Pour une majorité de flux répétitifs, ce n’est pas le bon défaut.

Une stratégie multi-modèles, pas un champion unique

Le verdict opérationnel tient en une habitude : affecter le meilleur modèle disponible à chaque usage, après comparaison sur vos cas, plutôt que de couronner un gagnant annuel. Argon, s’il confirme ses scores en version publique, devient la référence à challenger sur l’automatisation et la retenue factuelle. Astra reste le point de comparaison sur le rapport intelligence et sobriété de tokens, avec une grille très élevée mais un volume de sortie plus faible. Opus 5.5 reste le plafond de l’indice. Sonnet 5.5 reste le concurrent gênant, parce qu’il combine un indice de 56, un prix proche du lancement d’Argon, et la tête de Terminal-Bench 4.

Cette carte évite deux erreurs symétriques. La première consiste à figer Google hors du comparatif parce que Gemini avait décroché. La seconde consiste à annoncer qu’Argon a réglé la course parce qu’il égale Astra et mène un benchmark. Les deux postures vieillissent mal. Les grilles bougent, les promotions s’arrêtent, les garde-fous changent le comportement, et vos propres tâches ne ressemblent qu’en partie aux épreuves publiques.

Le prix au million de tokens est un indicateur trompeur dès que l’on compare des modèles de raisonnement. Le coût d’une tâche terminée dépend autant du volume produit que du tarif.

– Principe de lecture des grilles 2026

Ce que les équipes devraient préparer avant l’ouverture

Attendre ne signifie pas rester passif. Le travail utile se fait sur les modèles déjà accessibles, pour avoir une base de comparaison le jour où Argon arrive.

  • figer une batterie de dix tâches réelles, avec données non sensibles ou anonymisées ;
  • noter pour chacune le coût API, le temps, le nombre de reprises et les erreurs factuelles ;
  • séparer les flux d’automatisation, les flux de contenu et les flux techniques ;
  • définir un seuil d’aveu acceptable : quand le modèle doit s’arrêter plutôt que compléter ;
  • prévoir une relecture humaine sur tout chiffre publié, quel que soit le modèle ;
  • suivre la date d’ouverture API et la disponibilité européenne, sans construire le plan 2027 sur une rumeur de calendrier.

Cette préparation prend quelques jours. Elle évite le réflexe du lancement : tout migrer parce que le score est flatteur, puis tout revenir en arrière parce que la facture ou les garde-fous ne correspondent pas au benchmark. Les équipes qui gagnent du temps avec ces modèles sont celles qui ont déjà un protocole, pas celles qui découvrent leurs critères au moment de la démo.

Limites à ne pas oublier dans la note de veille

Plusieurs zones restent floues, et les présenter comme tranchées serait malhonnête. La vitesse et la latence d’Argon ne sont pas mesurées publiquement. Le taux d’hallucination d’Opus 5.5 n’était pas dans les données retenues pour cette synthèse, ce qui empêche un classement complet sur la fiabilité. La version évaluée n’est pas forcément la version API. Le tarif promotionnel de 2 et 10 dollars ne durera pas, et le tarif standard inverse déjà l’avantage de coût face à Astra sur la tâche d’indice. La précision brute inférieure signifie qu’Argon laissera plus de trous sur les sujets pointus. La note de présentation plus faible limite son usage en dernier kilomètre éditorial.

Aucune de ces limites n’annule le saut depuis Gemini 3.1 Pro Preview, ni la première place sur AutomationBench-AA, ni le taux d’aveu le plus bas mesuré par AA-Omniscience parmi les modèles cités. Elles empêchent simplement de transformer une évaluation de laboratoire, menée sur un accès restreint, en standard d’entreprise. Le vrai rival d’Astra est là, sur le papier. Le rival d’Opus 5.5 ne l’est pas encore sur tous les plans. L’outil du quotidien, lui, n’est pas encore en rayon.

Verdict pour une direction marketing

Gemini 4 Argon remet Google dans la conversation sérieuse. À 53 points, il égale GPT-6 Astra et laisse loin derrière le plafond de 30 affiché par Gemini 3.1 Pro Preview. Il prend la tête sur l’automatisation de processus, avec 77,5 %, et affiche un taux d’hallucinations assumées de 15 %, très en dessous d’Astra. Il ne détrône pas Claude Opus 5.5, à 58, ni même Claude Sonnet 5.5 sur l’indice, à 56. Au tarif standard, sa verbosité lui fait perdre l’avantage de coût face à Astra. Il reste enfermé dans Fairwind, avec un calendrier public flou et un risque d’écart entre la variante testée et la variante vendue.

La décision raisonnable n’est donc ni l’adoption immédiate, impossible, ni l’indifférence. C’est une veille active, une batterie de tests prête, et une architecture qui peut accueillir un modèle de plus sans tout reconstruire. Le meilleur rapport entre intelligence, coût et attente se jouera sur vos tâches, pas sur une slide de lancement. En attendant l’ouverture, Opus 5.5, Sonnet 5.5 et Astra restent les modèles que l’on peut vraiment mettre au travail.

À lire également