Écrit par



Si vous utilisez Vibe au quotidien, vous n’avez jamais eu à choisir un modèle : l’assistant bascule automatiquement entre Medium 3.5 en gratuit et Large 3 en Pro, sans vous demander votre avis. Mais dès que vous construisez votre propre application, un chatbot interne, un outil de classification de tickets, un plugin d’autocomplétion pour votre éditeur de code, la question change de nature. Vous appelez l’API de Mistral directement, et là, le choix du modèle a un impact réel sur la facture et sur la qualité du résultat.
Cet article s’adresse à ce second public : développeurs, équipes techniques, ou toute personne qui doit choisir explicitement entre Mistral Large 3, Small 4 et Codestral pour un projet précis. Pour l’usage grand public de Vibe, consultez plutôt notre guide sur Vibe Pro ou notre comparatif avec ChatGPT.
En bref
Large 3 reste le modèle de référence quand la qualité de la réponse compte plus que le coût par token. Il repose sur une architecture en mélange d’experts (675 milliards de paramètres au total, 41 milliards activés par requête), une conception qui lui permet de rivaliser avec les meilleurs modèles du marché sur le raisonnement complexe tout en gardant un coût d’inférence maîtrisé par rapport à un modèle dense de taille équivalente.
Sur l’API, Large 3 coûte 0,50 $ par million de tokens en entrée et 1,50 $ en sortie, un tarif qui reste dix à trente fois inférieur à celui des modèles phares de la concurrence américaine, comme détaillé dans notre comparatif Mistral contre ChatGPT. L’écart se creuse encore. C’est un modèle propriétaire : impossible de le télécharger ou de l’auto-héberger, contrairement à Small 4.
Privilégiez Large 3 pour l’analyse de documents juridiques ou financiers complexes, la rédaction de contenus stratégiques qui demandent une compréhension fine du contexte, ou toute application où une erreur de raisonnement coûte plus cher que l’écart de prix avec Small 4.
Small 4, sorti le 16 mars 2026, marque un changement d’approche chez Mistral : plutôt que de multiplier les modèles spécialisés, cette version unifie dans un seul système le raisonnement de la gamme Magistral, la compréhension multimodale héritée de Pixtral, et les capacités de codage agentique de Devstral. Un seul modèle qui gère l’analyse complexe, le développement logiciel et les tâches visuelles dans le même flux de travail, là où il fallait auparavant en choisir plusieurs.
Techniquement, Small 4 utilise une architecture en mélange d’experts avec 119 milliards de paramètres au total, dont seulement 6,5 milliards s’activent par requête. Cette efficacité se répercute directement sur le prix : 0,15 $ par million de tokens en entrée, 0,60 $ en sortie, environ trois fois moins cher que Large 3. La fenêtre de contexte atteint 262 000 tokens, aussi large que celle de Large 3 malgré un tarif nettement inférieur.
Le vrai différenciateur reste la licence. Small 4 est publié en open weight sous licence Apache 2.0 : vous pouvez télécharger les poids du modèle et l’exécuter sur votre propre infrastructure, sans jamais transmettre vos données à Mistral. Pour une organisation qui doit garder ses données à l’intérieur de son propre périmètre technique, ou qui veut éviter toute dépendance à une API externe pour un cas d’usage critique, c’est la seule option des trois modèles présentés ici.
Privilégiez Small 4 pour les applications à fort volume (chatbots de support, classification automatique, extraction d’information), les cas d’usage multimodaux qui demandent une compréhension d’image ou de document sans passer par un modèle dédié séparé, et tout projet qui nécessite ou pourrait nécessiter un auto-hébergement.
Codestral cible un besoin précis : l’autocomplétion et la génération de code directement dans un environnement de développement. Un usage, une tâche. Contrairement à Large 3 et Small 4, qui traitent le code comme une capacité parmi d’autres, Codestral a été entraîné spécifiquement pour cette tâche, avec un support natif du remplissage contextuel (fill-in-the-middle), la technique qui permet à un modèle de compléter du code au milieu d’un fichier existant plutôt que seulement à la fin, comme le fait un autocomplétion classique d’IDE. Sa fenêtre de contexte atteint aujourd’hui 256 000 tokens, contre 32 000 seulement lors de son lancement en 2024.
Sur l’API, Codestral facture 0,30 $ par million de tokens en entrée et 0,90 $ en sortie. Un détail de facturation mérite d’être clarifié, car il prête souvent à confusion : Codestral utilisé dans Vibe (via le mode Code ou en conversation classique) est inclus sans surcoût dans l’abonnement Pro, tandis que Codestral appelé directement via l’API se facture séparément, au token. Ce sont deux circuits de facturation distincts, même si le modèle sous-jacent reste identique.
Comparé à Small 4 sur des tâches de code pur, Codestral garde l’avantage sur les workflows d’autocomplétion en temps réel grâce à son support FIM natif, quand Small 4 reste compétitif, voire moins cher, pour de la génération de code complète sans besoin d’insertion contextuelle précise. Le choix entre les deux dépend donc moins de la qualité brute que du type d’intégration technique visée : plugin d’éditeur pour Codestral, génération autonome ou agent pour Small 4.
| Critère | Large 3 | Small 4 | Codestral |
|---|---|---|---|
| Statut | Propriétaire | Open weight (Apache 2.0) | Propriétaire |
| Paramètres | 675 Md (41 Md actifs) | 119 Md (6,5 Md actifs) | Non communiqué publiquement |
| Contexte | 256 000 tokens | 262 000 tokens | 256 000 tokens |
| Prix API (entrée/sortie, par M tokens) | 0,50 $ / 1,50 $ | 0,15 $ / 0,60 $ | 0,30 $ / 0,90 $ |
| Auto-hébergement possible | Non | Oui | Non |
| Spécialité | Raisonnement général le plus poussé | Polyvalence (texte, image, code, agent) | Autocomplétion et génération de code |
| Inclus dans Vibe Pro | Oui (modèle par défaut) | Non (accessible via API uniquement) | Oui (mode Code et conversation) |
Pour un chatbot de support client à fort volume de requêtes simples, Small 4 offre le meilleur rapport coût-qualité : le trafic important rend chaque centime par token significatif à l’échelle, et la qualité du modèle dépasse largement ce qu’exige une conversation de support standard.
Pour l’analyse de contrats, de rapports financiers ou de tout document où une erreur de compréhension a des conséquences réelles, Large 3 justifie son surcoût par une fiabilité de raisonnement supérieure sur les cas complexes, les documents ambigus ou les demandes qui mêlent plusieurs domaines d’expertise.
Pour un plugin d’autocomplétion dans un IDE d’entreprise, Codestral reste le choix technique le plus naturel grâce à son support FIM natif, sauf si votre équipe veut économiser sur les gros volumes de complétion, auquel cas Small 4 mérite un test comparatif sur votre propre code base avant de trancher.
Pour une organisation soumise à des contraintes strictes de localisation des données, qui ne peut transmettre aucune information à un service tiers même hébergé en Europe, Small 4 reste la seule option des trois. Aucune alternative. Son statut open weight permet un déploiement entièrement interne, avec les investissements en infrastructure que cela implique en contrepartie.
Ces trois modèles ne représentent qu’une partie de la gamme. Six autres existent au moins. Pour les besoins encore plus spécifiques, Mistral propose Devstral, un modèle de code agentique en open weight nettement moins cher que Codestral (0,10 $ / 0,30 $ par million de tokens), pensé pour les agents autonomes plutôt que l’autocomplétion en temps réel. Magistral cible le raisonnement en chaîne de pensée explicite, à un tarif nettement plus élevé (2 $ / 5 $), pour les cas où la traçabilité du raisonnement compte autant que le résultat final. Ministral, dans sa version 14B, couvre les besoins de vision à bas coût, avec un tarif plat de 0,20 $ quel que soit le sens du flux. La version 3B de Ministral, à 0,10 $ / 0,10 $, reste le modèle le moins cher de toute la gamme active, réservé aux tâches simples où le volume prime sur la capacité.
Ce foisonnement de modèles, souvent critiqué comme difficile à suivre pour un non-spécialiste, reflète une stratégie assumée chez Mistral : proposer un modèle dédié pour chaque profil de coût et de tâche plutôt qu’un modèle unique à tout faire. Pour la grande majorité des projets, les trois modèles détaillés plus haut couvrent l’essentiel des besoins sans avoir à explorer le reste du catalogue.
Au-delà du choix entre les trois modèles, une question revient souvent chez les équipes techniques : peut-on entraîner une version spécialisée sur ses propres données plutôt que de se contenter du modèle générique ?
La réponse dépend du modèle choisi. Sur Small 4, le statut open weight permet un fine-tuning complet sur votre propre infrastructure, avec un contrôle total sur les données d’entraînement et le résultat final. C’est l’option la plus flexible, au prix d’une charge d’ingénierie non négligeable : préparer un jeu de données de qualité, disposer de la puissance de calcul nécessaire, et valider que le modèle affiné ne régresse pas sur les capacités générales qu’il possédait avant l’ajustement.
Sur Large 3 et Codestral, tous deux propriétaires, Mistral propose un service de fine-tuning géré directement sur la Plateforme : vous fournissez vos données d’entraînement, Mistral s’occupe du calcul et vous restitue un modèle personnalisé accessible via l’API, sans jamais avoir à gérer l’infrastructure vous-même. Cette option convient aux équipes qui veulent un modèle plus précis sur leur domaine métier (vocabulaire juridique, jargon technique interne, ton de marque spécifique) sans investir dans des compétences MLOps en interne.
Pour la majorité des projets, mieux vaut tester d’abord un prompt bien conçu et, éventuellement, une base documentaire en RAG (génération augmentée par récupération) avant d’envisager un fine-tuning : ces deux approches coûtent moins cher à mettre en place et couvrent souvent le besoin sans jamais toucher aux poids du modèle.
Trois portes d’entrée existent, selon votre profil. Trois profils, trois chemins. Si vous n’êtes pas développeur, l’abonnement Vibe Pro (14,99 € HT par mois) reste la voie la plus simple : Large 3 et Codestral y sont directement accessibles sans configuration technique, l’assistant choisissant lui-même le modèle adapté à votre demande.
Si vous développez une application, l’API de Mistral (La Plateforme) permet d’appeler chaque modèle individuellement, facturé à l’usage au token. La documentation officielle détaille les identifiants de modèles à utiliser dans vos appels et les quotas de débit selon votre palier de compte.
Si vous voulez auto-héberger Small 4, les poids du modèle sont téléchargeables librement depuis les dépôts officiels de Mistral, avec les prérequis matériels documentés selon la configuration choisie (quantification, nombre de GPU). Ce choix demande un investissement en infrastructure et en compétences techniques internes que l’API à l’usage ne demande pas, un arbitrage à faire selon vos contraintes de conformité et votre budget.
Si votre équipe hésite entre ces trois options ou veut structurer un choix d’architecture IA plus large, Proactive Academy accompagne le cadrage technique et la montée en compétence de vos développeurs.
Vibe est un produit grand public où le choix du modèle reste invisible : l’assistant sélectionne automatiquement Medium 3.5 ou Large 3 selon votre abonnement et votre demande. L’API s’adresse aux développeurs qui construisent leur propre application et veulent choisir explicitement quel modèle appeler pour chaque type de requête.
Pour une large majorité des tâches courantes, oui, avec un coût trois fois inférieur. L’écart de qualité se creuse surtout sur les tâches de raisonnement complexe ou ambiguës, où Large 3 garde un avantage mesurable.
Codestral couvre un large éventail de langages courants (Python, JavaScript, Java, C++, entre autres). Sa qualité varie cependant selon la popularité du langage dans les données d’entraînement : les langages très répandus donnent de meilleurs résultats que les langages de niche.
Oui, un GPU professionnel avec suffisamment de mémoire vidéo reste nécessaire pour un déploiement en production, même si la quantification du modèle (réduction de la précision numérique des poids) permet de réduire les besoins matériels au prix d’une légère perte de qualité. Les prérequis exacts dépendent de la configuration choisie et sont documentés officiellement par Mistral.
Rien n’a été annoncé en ce sens à ce jour. Mistral réserve historiquement ses modèles les plus performants à un statut propriétaire, tandis que la gamme Small et certains modèles spécialisés (Devstral, Ministral) restent publiés en open weight.
Oui, c’est même une pratique courante : router les requêtes simples vers Small 4 pour économiser, et n’appeler Large 3 que pour les cas identifiés comme complexes. Cette architecture de routage demande un peu plus de travail d’ingénierie mais optimise sensiblement le coût global à l’échelle.
Pour un chatbot FAQ à réponses courtes et prévisibles, Ministral 3B, à 0,10 $ / 0,10 $ par million de tokens, suffit largement et reste, avec Ministral 8B, le choix le plus économique de toute la gamme Mistral active, avant même Small 4.
Choisir entre ces trois modèles revient rarement à trouver « le meilleur » dans l’absolu : c’est un arbitrage entre le coût par token, le besoin d’auto-hébergement, et le niveau de raisonnement réellement nécessaire pour votre cas d’usage. Commencez par Small 4 si le doute persiste : son rapport qualité-prix couvre la majorité des projets, et l’upgrade vers Large 3 reste possible à tout moment sans changement d’architecture.
Laisser un commentaire