Mistral Large 4 : Rival Français Des Géants IA ?

Le 5 octobre 2026, Arthur Mensch a publié un simple mot, presque taquin : Excited. Le lendemain, Mistral AI ouvrait la préversion publique de Mistral Large 4, surnommé en interne Le Chonk. Environ 1 000 milliards de paramètres, entraînés dans des datacenters européens, un score qui bondit de 9 à 38 sur l’index indépendant d’Artificial Analysis. Pour une équipe marketing, un cabinet juridique ou une direction des systèmes d’information qui hésite encore entre les géants américains et les laboratoires chinois, la question n’est plus théorique. Peut-on enfin confier des dossiers sensibles à un modèle français sans accepter un écart de qualité trop coûteux ?

La réponse tient en une nuance. Mistral Large 4 revient dans la course, et le saut qualitatif est réel. Il ne rattrape pas Claude Opus 5.5, GPT-6 Astra ni Gemini 4 Argon sur l’intelligence générale. En revanche, sur la cybersécurité défensive, l’automatisation de tâches métiers et le traitement de documents, il mérite un banc d’essai sérieux, surtout si vos données ne doivent pas sortir du droit européen. Cet article décortique l’annonce, les scores, la facture réelle, les usages où il tient la route, et ceux où les modèles frontier restent plus rentables.

Ce que l’éditeur a vraiment mis sur la table

Depuis le 6 octobre 2026, le modèle est accessible en préversion via l’API de Mistral Studio. Les poids doivent être publiés avant la fin du mois. En pratique, très peu d’organisations pourront les faire tourner : un réseau de neurones de cette taille suppose un parc GPU que seules quelques infrastructures possèdent. Mistral a aussi annoncé un red-teaming avec des acteurs de la cybersécurité et des autorités publiques, avant la stabilisation.

Côté conception, Mistral Large 4 est un modèle à mélange d’experts, ou Mixture of Experts. Il n’active qu’une fraction de ses paramètres à chaque requête. L’annonce parle d’environ 1 000 milliards de paramètres au total, dont 49 milliards actifs, plus un encodeur visuel de 1,6 milliard. Entrées : texte et images. Sortie : texte. Les données d’entraînement couvriraient plus de 160 langues, dont l’ensemble des langues officielles de l’Union européenne.

Le tarif d’introduction s’affiche à 1,36 dollar par million de tokens en entrée et 4,18 dollars en sortie. Ce barème promotionnel est temporaire. Autre point souvent oublié dans les threads enthousiastes : l’entraînement par renforcement n’est pas terminé. Les scores d’aujourd’hui ne vaudront pas pour la version stable, et Mistral indique qu’ils devraient encore bouger, plutôt vers le haut. Tester maintenant a du sens pour cartographier les forces et les failles. Décider d’un basculement définitif sur la seule préversion serait prématuré.

Un tarif au token ressemble au prix du litre à la pompe. Ce qui pèse sur le budget, c’est la consommation du moteur, pas seulement l’étiquette sur la pompe.

– Lecture des coûts réels sur l’index Artificial Analysis

Un retour dans le classement, pas encore une place sur le podium

Sur l’Intelligence Index v4.3.2 d’Artificial Analysis, Mistral Large 4 Preview obtient 38 points. Cet indice agrège dix évaluations indépendantes : travail agentique, code en terminal, lecture de PDF professionnels, raisonnement scientifique, contexte long. La médiane des modèles comparables se situe autour de 26. Le français dépasse donc nettement le milieu de tableau. La progression interne est encore plus parlante : Mistral Medium 3.5 affichait 14 points, et la génération Large précédente plafonnait à 9. Passer de 9 à 38 en une génération, c’est un rattrapage brutal, pas un simple ajustement marketing.

Le contexte international remet toutefois les choses à leur place. Claude Opus 5.5 (max) mène à 58. GPT-6 Astra (max) et Gemini 4 Argon (high) sont à 53. GPT-6.1 Sol (high) atteint 50. Côté modèles à poids ouverts ou annoncés comme tels, MiMo-V2.6-Pro de Xiaomi score 46, GLM-5.3 (max) 45, Kimi K3 autour de 44, DeepSeek V4 Pro 0813 (max) 36. Mistral Large 4 se glisse donc dans le top 30 mondial, une première pour le laboratoire parisien sur cet index, tout en restant à une vingtaine de points du leader et derrière le trio chinois le plus visible.

Mistral affirme rivaliser avec les meilleurs modèles ouverts. Sur l’indice général, ce n’est pas encore le cas. MiMo-V2.6-Pro le devance de 8 points, pour un coût par tâche environ neuf fois plus bas. La comparaison utile n’est donc pas un slogan, mais une batterie de cas d’usage. Un écart de 8 points peut être invisible sur une reformulation d’e-mail, et décisif sur un agent qui enchaîne vingt actions dans un dépôt de code.

Le tableau qui compte vraiment : score, facture, ouverture

Voici la photographie d’octobre 2026, telle que la restitue Artificial Analysis. Elle mélange intelligence agrégée, coût par tâche et statut des poids. C’est cette combinaison, et non le seul score, qui doit guider un arbitrage d’achat.

Claude Opus 5.5 (max) : 58 points, 5,98 dollars par tâche, poids fermés. GPT-6 Astra (max) : 53 points, 3,26 dollars, fermé. Gemini 4 Argon (high) : 53 points, 1,99 dollar, fermé. GPT-6.1 Sol (high) : 50 points, 0,32 dollar, fermé. MiMo-V2.6-Pro : 46 points, 0,13 dollar, poids ouverts. GLM-5.3 (max) : 45 points, 2,01 dollars, ouvert. Mistral Large 4 Preview : 38 points, 1,13 dollar, poids annoncés pour fin octobre. DeepSeek V4 Pro 0813 (max) : 36 points, 0,67 dollar, ouvert.

Deux lectures s’imposent. D’abord, Mistral n’est plus hors jeu : il dépasse DeepSeek V4 Pro sur cet instantané et s’approche de la zone où un acheteur européen peut justifier un essai pour des raisons autres que le patriotisme technologique. Ensuite, il n’est pas le choix rationnel par défaut si l’unique critère est le rapport intelligence / dollar. GPT-6.1 Sol livre 50 points pour 0,32 dollar la tâche. MiMo livre 46 points pour 0,13 dollar. Mistral livre 38 points pour 1,13 dollar. L’écart de facture ne se justifie que si un autre critère pèse : la localisation juridique, la politique de refus du modèle, ou une compétence ciblée.

La verbosité, vrai défaut de fabrication de cette préversion

Le détail le plus gênant n’est pas le score. C’est le débit de texte. Pour passer l’index, Mistral Large 4 a généré environ 200 millions de tokens, contre une médiane de 81 millions. Cette logorrhée fait grimper le coût réel à 1,13 dollar par tâche, alors que le prix affiché au million de tokens paraissait déjà dans la moyenne haute des modèles sérieux.

En production, la verbosité a trois effets. Elle allonge les réponses que vos utilisateurs doivent lire. Elle sature les fenêtres de contexte des agents qui réinjectent leurs propres sorties. Elle multiplie la facture sur les boucles longues, typiques des workflows de qualification de leads, de revue de contrats ou de génération de reportings. Un modèle un peu moins brillant mais plus sobre peut donc livrer un meilleur résultat économique, surtout si un humain doit relire chaque sortie.

Sur la vitesse, en revanche, la préversion s’en sort bien : 116 tokens par seconde, et un premier token servi en 1,46 seconde, au-dessus de la moyenne de sa catégorie selon Artificial Analysis. Pour un chatbot interne ou une extraction de champs dans un PDF, cette latence reste acceptable. Pour un agent qui enchaîne cinquante appels, le temps total dépendra surtout du nombre de tokens produits, pas seulement du débit. Un modèle bavard rapide peut finir plus tard qu’un modèle concis un peu plus lent.

Cybersécurité défensive : l’argument le plus solide

C’est le terrain sur lequel Mistral insiste le plus. L’éditeur place son modèle dans le top 5 de l’Artificial Analysis Cyber Index, un indice lancé fin septembre 2026 pour mesurer la capacité à trouver, reproduire et corriger des vulnérabilités dans du code réel. Grok 4.7 (xhigh) et MiMo-V2.6-Pro y mènent avec 56 points. Tous les modèles n’ont pas été testés : le classement est donc une indication, pas un verdict définitif.

Le sous-test CyberGym-E2E est plus parlant pour une équipe opérationnelle. Mistral revendique 82 %, le meilleur score mesuré à ce stade, tandis que Claude Opus 5.5 et GPT-6 Astra tombent près de zéro parce qu’ils refusent la tâche. Le mécanisme est connu : les modèles frontier appliquent des garde-fous qui bloquent la reproduction d’une faille, même dans un cadre défensif. Pour un chercheur en sécurité ou un prestataire d’audit, un refus n’est pas une vertu. C’est une interruption de travail.

Concrètement, trois profils ont intérêt à tester Mistral Large 4 sur ce créneau.

  • Une équipe SOC qui veut un second regard sur des extraits de code ou des journaux, sans envoyer le dépôt entier chez un fournisseur soumis au Cloud Act.
  • Un développeur qui n’est pas spécialiste sécurité, et qui a besoin d’une preuve reproductible qu’une faille existe avant d’ouvrir un ticket.
  • Un cabinet d’audit qui enchaîne des revues de pull requests et qui ne peut pas se permettre qu’un modèle refuse la moitié des cas au nom d’une politique de contenu.

Ce point fort a une limite. Accepter de prouver une faille n’est pas la même chose que la corriger proprement, ni que respecter le style du dépôt. Un score élevé sur un benchmark de cybersécurité ne dispense pas d’une revue humaine, surtout si le correctif touche à l’authentification, aux paiements ou aux données de santé. Le bon usage est un copilote d’audit, pas un merge automatique.

Workflows métiers et travail documentaire : le terrain des équipes marketing

Sur AutomationBench, qui couvre 657 workflows dans Gmail, Google Sheets, Slack ou Salesforce, Mistral annonce 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro. Sur AA-Briefcase, un banc d’essai de travail intellectuel long mêlant tableurs, slides et PDF, le modèle atteint 1 393 Elo selon l’éditeur. Ces chiffres viennent de Mistral : ils doivent être recoupés sur vos propres fichiers. Ils indiquent toutefois une orientation claire. Le modèle n’est pas seulement un chatbot. Il vise les enchaînements d’actions dans les outils du quotidien.

Pour une direction marketing ou une startup B2B, les scénarios concrets sont faciles à lister. Qualification de leads dans un CRM à partir d’e-mails entrants. Consolidation d’un reporting hebdomadaire à partir de trois exports. Extraction de clauses dans des contrats d’apporteur d’affaires. Lecture d’un rapport financier pour en sortir les variations anormales. Préparation d’un brief de campagne à partir d’un PDF de brief client et de captures d’écran. Aucune de ces tâches n’exige le modèle le plus intelligent du marché. Elles exigent de la constance, un respect des formats, et une politique de données acceptable.

Mistral revendique aussi de bons résultats en finance et en droit, évalués par vals.ai et sur le benchmark Legal Agent de Harvey, ainsi qu’un léger avantage sur GPT-6 Astra en ancrage visuel : 42 % contre 41 % sur Dense 200. L’écart est mince. Il suffit toutefois à rappeler que le modèle accepte des images, pas seulement du texte. Pour une équipe qui annote des maquettes, des captures d’outils d’analytics ou des slides concurrentes, cette entrée multimodale évite une étape de transcription manuelle.

Un protocole de test utile, sur deux semaines, tient en cinq gestes.

  • Choisir dix workflows réels, pas des démos : un export CRM sale, un fil Slack ambigu, un PDF scanné.
  • Fixer un barème humain sur 5 : exactitude des champs, respect du format, volume de retouches, temps gagné.
  • Comparer Mistral Large 4 à un modèle sobre (GPT-6.1 Sol) et à un modèle frontier (Claude Opus 5.5) sur les mêmes prompts.
  • Mesurer les tokens de sortie, pas seulement la note qualitative. La verbosité se voit dans la facture.
  • Noter les refus. Un modèle qui bloque une tâche d’audit n’est pas interchangeable avec un modèle qui l’accepte.

Contenus multilingues européens : un argument sous-estimé

Avec plus de 160 langues dans les données d’entraînement, dont les 24 langues officielles de l’Union, Mistral Large 4 devient un candidat sérieux pour la traduction de fiches produits, de pages de sites, d’articles, de campagnes et de bases de connaissance. Le marché européen n’est pas un marché anglophone avec une option française. Une marque qui vend en France, en Allemagne, en Pologne et en Suède perd du temps dès que chaque adaptation repart chez un prestataire ou dans un modèle dont les sorties doivent être relues deux fois.

Cela ne signifie pas que le modèle remplace un traducteur spécialisé sur un slogan ou une page juridique. Cela signifie qu’il peut absorber le premier jet sur un catalogue de 2 000 références, à condition de verrouiller un glossaire. Les termes métier, les noms de produits et les formulations réglementaires doivent être imposés dans le prompt, puis contrôlés sur un échantillon. Une couverture linguistique large est une promesse de couverture, pas une garantie de ton.

Pour une équipe contenu, le bon découpage est simple. Le modèle produit les variantes. Un relecteur natif valide les pages à fort enjeu : page d’accueil, pages de prix, mentions légales, séquences d’e-mail de bienvenue. Le reste peut passer avec un contrôle statistique. Ce schéma réduit le coût sans faire semblant que 160 langues égalent 160 rédactions parfaites.

Quand les modèles frontier restent le meilleur choix

Vous pilotez des tâches où chaque point de qualité se paie en chiffre d’affaires ou en heures de contrôle ? L’écart de 15 à 20 points avec Claude Opus 5.5, GPT-6 Astra ou Gemini 4 Argon compte. Trois situations penchent clairement vers la concurrence, même si la souveraineté vous tient à cœur.

La première est le développement logiciel agentique complexe. Mistral Large 4 affiche 28,3 % sur Terminal-Bench 4.0. Dans l’évaluation humaine menée avec Surge AI, Claude Opus 5 le devance nettement : 4,22 contre 3,74 sur 5. Pour un agent qui doit naviguer dans un dépôt, lancer des tests, corriger, relancer, cet écart se transforme en boucles ratées. Un développeur senior peut compenser. Une équipe qui veut industrialiser la génération de correctifs ne devrait pas commencer par ce modèle.

La deuxième situation est le raisonnement très avancé : analyses stratégiques, synthèses multi-sources délicates, recherche pointue. Les meilleurs modèles fermés gardent une avance nette sur l’index général. Si votre livrable est une note de positionnement lue par un comité de direction, ou une revue de littérature pour un produit réglementé, le surcoût d’Opus ou d’Astra s’amortit souvent dès la première relecture évitée.

La troisième situation est le volume. À cause de sa verbosité, GPT-6.1 Sol ou MiMo-V2.6-Pro livrent plus d’intelligence pour moins cher par tâche. Une startup qui génère des milliers de variantes publicitaires, de réponses support ou de fiches SEO a intérêt à optimiser le coût marginal avant de optimiser le passeport du modèle. La souveraineté ne disparaît pas de l’équation. Elle cesse d’être le critère unique dès que la facture mensuelle dépasse le gain de conformité.

Vous n’avez pas besoin du modèle le plus intelligent du marché pour chaque tâche. Vous avez besoin du modèle qui ne vous fait pas regretter la tâche que vous lui avez confiée.

– Principe d’arbitrage pour une équipe produit

Hébergement européen : le poids réel dans la balance

Mistral Large 4 a été entraîné sur 3 800 GPU NVIDIA Grace Blackwell dans les datacenters européens de Mistral. La préversion tourne sur cette même infrastructure. L’entreprise annonce un déploiement européen opéré de bout en bout, indépendant des autres fournisseurs de services numériques, et soumis au droit européen. C’est l’argument que les comparatifs de scores n’absorbent pas, et c’est souvent celui qui fait basculer un comité d’achat.

Pourquoi cela vous concerne. Avec un fournisseur américain, même si les serveurs sont en Europe, les données restent exposées au Cloud Act, la loi américaine de 2018 qui autorise les autorités des États-Unis à exiger des données détenues par des entreprises américaines, y compris à l’étranger. Pour une PME qui traite des données clients, des dossiers RH ou des informations de santé, ce point peut suffire à trancher, au même titre que le choix d’un stockage cloud européen. Le débat n’est pas de savoir si une réquisition arrivera demain. Il est de savoir si votre analyse d’impact peut accepter cette possibilité.

L’ouverture annoncée des poids ajoute une option plus stricte pour les organisations qui en ont les moyens : faire tourner le modèle en propre, ou sur un cloud privé, sans qu’aucune donnée ne quitte votre périmètre. Attention toutefois. Avec environ 1 000 milliards de paramètres, l’auto-hébergement suppose une infrastructure GPU que peu d’entreprises ont sous la main, et un budget d’exploitation que peu de directions financières valideront pour un usage marketing. Publier les poids n’est pas la même chose que démocratiser l’inférence.

Un hébergement européen ne vaut pas conformité automatique. Le modèle sera proposé dans plusieurs régions du monde. Il faut donc vérifier la région configurée sur le compte, signer l’accord de traitement publié par Mistral, et appliquer les obligations habituelles du RGPD : minimisation, base légale, analyse d’impact si les données sont sensibles, durée de conservation, information des personnes. La localisation rassure le comité. Elle ne remplace pas le registre des traitements.

Ce que cela change pour une direction marketing

Les équipes acquisition, contenu et CRM sont souvent les premières à brancher un nouveau modèle, parce que le gain se voit en heures. Elles sont aussi les premières à envoyer des données clients dans une API : extraits de conversations, fichiers de leads, briefs contenant des chiffres non publics. Mistral Large 4 ne change pas cette tension. Il la déplace. On peut enfin opposer à un outil américain un outil dont l’opérateur se réclame du droit européen, avec un niveau qui n’est plus celui d’un modèle de seconde zone.

Trois usages marketing méritent un pilote dès la préversion. La rédaction assistée de séquences d’e-mail à partir d’un brief interne, sans y coller de base clients brute. La synthèse de comptes rendus commerciaux pour alimenter un CRM, après avoir retiré les données directement identifiantes. La déclinaison multilingue de pages déjà validées en français. Trois usages à éviter tant que la version stable n’est pas là : la génération autonome de pages qui se publient sans relecture, les agents qui écrivent dans le CRM en production, et tout flux qui mélange données de santé ou données de mineurs.

Le coût doit être suivi comme une campagne. Fixez un plafond de tokens par workflow. Si Mistral dépasse ce plafond à cause de réponses trop longues, ce n’est pas un détail de prompt. C’est un critère d’élimination, au même titre qu’un taux de clic trop faible. Un modèle qui explique trop est un modèle qui facture trop, et qui fatigue le lecteur.

Architecture MoE : ce que 49 milliards actifs veulent dire

Le chiffre de 1 000 milliards impressionne. Le chiffre utile est ailleurs : 49 milliards de paramètres actifs par requête. Dans un mélange d’experts, le réseau route chaque token vers un sous-ensemble de spécialistes. L’intérêt est double. L’inférence coûte moins cher qu’un modèle dense de taille équivalente. La spécialisation peut aider sur des domaines étroits, comme le code de sécurité ou le droit. L’inconvénient est la variabilité. Deux questions proches peuvent activer des experts différents, et produire des styles légèrement distincts.

Pour un intégrateur, cela implique de tester la stabilité, pas seulement la moyenne. Posez dix fois la même extraction de contrat. Mesurez l’écart entre les sorties. Si les champs critiques bougent, le modèle n’est pas prêt pour une automatisation sans contrôle, quelle que soit sa place dans un classement. L’encodeur visuel de 1,6 milliard ajoute une deuxième variable : la qualité dépendra du type d’image. Une capture nette d’interface n’a rien à voir avec une photo de tableau blanc.

Comment lire les benchmarks sans se faire embarquer

Artificial Analysis a le mérite d’être indépendant de Mistral. Cela ne le rend pas neutre sur vos tâches. Un index agrège des épreuves que vos équipes ne font peut-être jamais. Terminal-Bench parle aux équipes produit. AA-Briefcase parle aux métiers du conseil et du marketing. CyberGym parle aux équipes sécurité. Un score global de 38 peut cacher un 82 sur la cybersécurité et un 28 sur le code agentique. Acheter le modèle pour le score global, c’est acheter une moyenne.

Autre biais : les garde-fous. Un modèle qui refuse une tâche d’exploitation défensive obtient zéro sur cette tâche, même s’il serait excellent s’il acceptait. Pour un usage marketing, ce refus est sans importance. Pour un usage audit, il est rédhibitoire. Inversez le raisonnement avant de conclure qu’un leader de l’index général est automatiquement le meilleur outil pour votre pile.

Dernier biais, le coût par tâche tel que le calcule l’index. Il reflète la verbosité sur les épreuves du banc d’essai, pas sur vos prompts. Un prompt court, contraint, avec un format de sortie imposé, peut réduire fortement la facture. Un prompt vague du type « analyse ce document et dis-moi tout ce qui est important » maximise la logorrhée. Avant d’écarter Mistral Large 4 pour son 1,13 dollar, mesurez-le avec vos gabarits de sortie. La préversion reste chère si vous la laissez parler. Elle peut redevenir compétitive si vous la faites répondre en JSON.

Préversion : ce qu’il faut figer avant de conclure

Mistral le dit lui-même : l’entraînement par renforcement continue, les performances vont évoluer. Vos tests d’octobre ne vaudront pas mécaniquement pour la version stable. Ils restent utiles si vous les archivez. Notez la date, le nom exact du modèle, la température, le plafond de tokens, et un échantillon de sorties. Quand la version stable arrivera, vous saurez si le gain annoncé est réel sur vos dossiers, ou seulement sur les slides.

Le red-teaming annoncé avec des acteurs de la cybersécurité et des autorités publiques est un signal, pas une certification. Il peut faire bouger les refus, les biais et certains comportements sur le code sensible. Un pilote lancé maintenant doit donc prévoir une seconde passe après publication des poids et après ce passage au crible. Traiter la préversion comme un produit fini, c’est confondre une bande-annonce et le film.

Open source annoncé : promesse et limite matérielle

La publication des poids, prévue d’ici la fin octobre 2026, change le statut juridique et technique du modèle. Une entreprise pourra, en théorie, l’auditer, le spécialiser, le faire tourner derrière son pare-feu. En pratique, le ticket d’entrée est un datacenter. Peu de scale-up européennes ont 3 800 GPU Grace Blackwell sous la main. L’option réaliste pour la plupart des lecteurs reste l’API opérée par Mistral, avec un contrat de traitement et une région européenne verrouillée.

Il existe un entre-deux : des hébergeurs européens spécialisés qui proposeront le modèle une fois les poids publics. Ce schéma peut concilier contrôle et absence d’investissement matériel lourd, à condition de lire qui opère vraiment les machines, où sont les sauvegardes, et quel droit s’applique au sous-traitant. « Open source » ne veut pas dire « hors du cloud ». Cela veut dire que vous pouvez choisir le cloud, ou le refuser si vous en avez les moyens.

Une grille de décision pour les quinze prochains jours

Si vous devez trancher rapidement, cette grille évite les débats abstraits. Elle part de la contrainte, pas du classement.

  • Vos données ne peuvent pas être exposées au Cloud Act, et la tâche est documentaire ou défensive : testez Mistral Large 4 en priorité.
  • Vous cherchez le meilleur agent de code, sans contrainte de localisation : restez sur un modèle frontier, et mesurez Opus ou Astra sur votre dépôt.
  • Vous avez un volume élevé et une marge faible : comparez GPT-6.1 Sol et MiMo-V2.6-Pro avant de regarder le score français.
  • Vous produisez des contenus dans plusieurs langues officielles de l’UE : incluez Mistral dans l’échantillon, avec un glossaire figé.
  • Vous voulez un déploiement on-premise immédiat : attendez les poids, puis chifrez l’inférence. Le slogan ne paie pas les GPU.

Cette grille n’interdit pas les combinaisons. Beaucoup d’équipes finiront avec deux modèles : un frontier pour les tâches rares à fort enjeu, un modèle européen pour le flux courant de documents internes. Le coût de cette dualité est une couche de routage. Le gain est de ne plus choisir entre qualité maximale et contrainte juridique sur chaque appel.

Ce que Le Chonk ne règle pas

Le surnom amuse. Il ne doit pas faire oublier les limites structurelles. Mistral Large 4 ne comble pas l’écart avec les laboratoires qui dépensent davantage en calcul et en données propriétaires. Il ne supprime pas la verbosité, du moins dans cette préversion. Il ne rend pas l’auto-hébergement accessible à une PME. Il ne certifie pas, à lui seul, une conformité RGPD. Il ne remplace pas une revue humaine sur le code de sécurité, les contrats ou les pages qui engagent la marque.

Il fait autre chose, et ce n’est pas rien. Il remet un laboratoire européen dans une zone où la comparaison a un sens. À 9 points, le débat était clos. À 38, avec un argument cybersécurité et une infrastructure opérée en Europe, le débat redevient un arbitrage. C’est exactement ce qu’un acheteur peut demander à une alternative : ne pas être un symbole, être une option chiffrable.

Verdict : tester maintenant, basculer plus tard

Mistral Large 4 marque un vrai retour du laboratoire français dans la course aux modèles de premier plan, tout en restant en retrait face aux meilleurs modèles américains et chinois sur l’intelligence générale. Pour la cybersécurité défensive, l’automatisation de workflows et le traitement de données qui doivent rester en Europe, il mérite un test dès cette préversion. Pour le code agentique exigeant, le raisonnement avancé, les tâches longues qui demandent un respect strict des consignes, ou un bon rapport qualité-prix à gros volume, les alternatives privées ou ouvertes restent plus intéressantes, dès lors qu’aucune contrainte d’hébergement européen ne s’impose.

La bonne décision, pour la plupart des équipes, n’est pas un remplacement. C’est un couloir. Branchez Mistral Large 4 sur un échantillon de dossiers réels, mesurez la qualité, les refus et les tokens, archivez les prompts. Quand les poids sortiront et que l’entraînement par renforcement sera figé, vous saurez si Le Chonk devient un outil de production ou s’il reste une option de souveraineté, précieuse mais pas universelle. Dans un marché où les classements bougent chaque mois, cette méthode vaut plus qu’un score isolé de 38.

À lire également