Résumé

  • Mistral Large 4 est accessible en préversion par API depuis le 6 octobre. Mistral prévoit de publier les poids avant la fin du mois ; au 8 octobre, l’exploitation par les clients reste une option future.
  • La fiche tarifaire affiche une promotion temporaire à 0,68 dollar par million de jetons d’entrée et 2,09 dollars par million de jetons de sortie, contre des tarifs standard de 1,36 et 4,18 dollars. Un essai peu coûteux mesure une facture d’API, pas le coût d’une exploitation autonome.
  • Les acheteurs peuvent tester leurs tâches réelles maintenant, puis comparer le coût par résultat accepté et les exigences de contrôle après la publication des fichiers, de la licence et des détails techniques.

Deux calendriers pour une même annonce

L’annonce du 6 octobre lance deux calendriers. Le premier est déjà actif : Mistral Large 4 peut être essayé via l’API de Mistral Studio. Le second est annoncé pour la fin du mois : la publication des poids. L’accès hébergé et l’exploitation par le client ne sont pas deux formats équivalents. Dans le premier cas, Mistral fait tourner le modèle et le client achète de l’inférence. Dans le second, le client pourrait l’exploiter lui-même, selon la publication effective et ses conditions.

Cette séquence a un intérêt économique. Une entreprise peut commencer à vérifier la valeur du modèle avant de décider si elle veut l’héberger en privé. Elle réduit ainsi le coût d’apprentissage sur un processus réel. Mais la comparaison disponible aujourd’hui oppose l’API payante à la solution actuelle de l’acheteur, pas à un système local qui n’est pas encore disponible.

La promotion rend le premier essai chiffrable. La fiche de Mistral affiche actuellement 0,68 dollar par million de jetons d’entrée non mis en cache et 2,09 dollars par million de jetons de sortie ; les tarifs standard barrés sont de 1,36 et 4,18 dollars. L’entrée mise en cache est facturée séparément à 0,07 dollar en promotion et 0,14 au tarif standard. Le changelog indique une remise de 50 % pendant deux semaines.

À titre d’illustration, 10 millions de jetons d’entrée non mis en cache et un million de sortie coûtent 8,89 dollars aux tarifs promotionnels, avant les nouvelles tentatives, les outils, les taxes ou l’orchestration ; avec les tarifs standard, le même volume revient à 17,78 dollars. Ce calcul n’est pas une prévision.

Pour l’acheteur, le chiffre utile n’est pas le prix au million de jetons pris isolément. C’est le coût par résultat accepté, compte tenu de la longueur des requêtes, du cache, des réponses, des appels d’outils, des reprises et de la vérification humaine. Une tâche agentique longue peut consommer autrement qu’une classification courte. Si une sortie échoue et doit être recommencée, le faible prix d’une tentative ne garantit pas un faible coût de réalisation.

Un classement ne vaut pas décision d’achat

Les premières évaluations donnent une image contrastée. Le profil de Vals AI du 7 octobre place Large 4 au 33e rang sur 45 dans son Vals Index, avec 48,05 %, tout en affichant son meilleur résultat au 6e rang sur 76 pour le Harvey’s Legal Agent Benchmark. L’indice agrège des tâches de finance, de programmation, de droit et de fiscalité, pondérées par leur part approximative du PIB américain. Vals le décrit comme un indicateur indirect et avertit que certains essais peuvent utiliser un fournisseur ou des paramètres différents. C’est une grille de lecture, pas une mesure universelle de la qualité.

Il faut donc tester les tâches de l’acheteur plutôt que reprendre le discours de lancement ou un rang agrégé. Mistral dit continuer à affiner la préversion et promet davantage de détails sur l’architecture, les benchmarks et l’entraînement après la publication des poids. Au lancement, Le Monde indiquait que les performances revendiquées restaient à confirmer de manière indépendante. Une entreprise peut collecter ses propres résultats par API, mais elle doit les rattacher à cette version et à cette configuration de service.

L’option n’a pas encore de coût d’exploitation

La fiche technique indique 52 milliards de paramètres actifs, 1 050 milliards au total, un encodeur visuel de 1,6 milliard et une fenêtre de contexte d’un million de jetons. Aucun de ces chiffres ne précise la mémoire requise pour atteindre un objectif donné de latence et de concurrence. Les paramètres actifs par jeton ne représentent pas toute la mémoire nécessaire au chargement des poids. La précision, la quantification, la bande passante mémoire, le routage, la longueur du contexte et la pile d’inférence comptent aussi.

Les poids futurs ont donc une valeur possible mais conditionnelle. Ils pourraient permettre un déploiement sur cloud privé ou serveurs internes, modifier certains réglages de modération ou conserver une solution de repli si l’accès hébergé change. Ils transfèreraient aussi au client les tâches de mise à jour, de sécurité, de montée en charge, de disponibilité et de réponse aux incidents. Télécharger le modèle ne rend pas son exécution gratuite.

Une séquence d’achat prudente consiste à tester maintenant un jeu de tâches représentatif et à consigner la qualité, la latence et les dépenses de jetons. Il faut conserver les requêtes, la version, les contrôles de sortie, les hypothèses de cache et le nombre de reprises. Lorsque les poids seront disponibles, les mêmes tâches pourront être relancées et comparées en coût par résultat accepté, en ajoutant l’infrastructure et le travail d’exploitation. Licence, matériel, sécurité et disponibilité doivent faire l’objet de vérifications séparées.

Le lancement est donc tarifé d’un côté et encore sans prix de l’autre. L’API transforme l’évaluation en facture dès aujourd’hui. Les poids pourraient déplacer le point de contrôle, mais leur coût et leur intérêt opérationnel ne sont pas encore établis.

Sources : annonce de Mistral ; fiche technique et tarifs ; changelog ; profil Vals ; méthodologie du Vals Index ; Le Monde.