Mistral AI présente Forge, un système destiné aux entreprises qui veulent entraîner, aligner et évaluer des modèles sur leurs propres données. L’offre va plus loin qu’un chatbot connecté à des documents : elle couvre le pré-entraînement, le post-entraînement, l’apprentissage par renforcement, la génération de données synthétiques et le suivi du modèle jusqu’à l’inférence.

La promesse répond à une limite fréquente de l’IA d’entreprise. Un modèle généraliste comprend le français, le code et de nombreux domaines, mais il ne connaît pas spontanément les procédures, normes d’ingénierie, historiques de décision ou contraintes réglementaires d’une organisation. Forge propose d’intégrer cette connaissance dans le comportement du modèle, tout en permettant un déploiement sur une infrastructure choisie par le client.

La réponse rapide

QuestionRéponse
Que fait Mistral Forge ?Il prépare les données, entraîne ou adapte des modèles, les aligne, les évalue et gère leur cycle de vie.
Est-ce un simple RAG ?Non. Le RAG fournit des documents au moment de la requête ; Forge modifie aussi les paramètres ou le comportement du modèle.
Faut-il entraîner un modèle depuis zéro ?Non. L’offre couvre aussi LoRA, SFT, DPO et d’autres formes de post-entraînement.
Où le modèle peut-il fonctionner ?Mistral annonce des options cloud privé, sur site ou sur son infrastructure, selon le projet.
Forge est-il en libre-service avec un prix public ?Mistral oriente actuellement les entreprises vers un échange commercial et technique.
À qui cela s’adresse-t-il ?Aux organisations disposant de données spécifiques, d’évaluations solides et d’un besoin que le prompt ou le RAG ne résout pas suffisamment.

Pourquoi un modèle généraliste ne suffit pas toujours

Une entreprise emploie des acronymes, des outils et des règles qui n’existent pas dans les données publiques. Une usine possède des procédures de maintenance et des tolérances propres à ses équipements. Une banque applique des contrôles internes plus précis que la réglementation générale. Un éditeur de logiciel a accumulé des conventions d’architecture dans des milliers de commits.

Un modèle généraliste peut expliquer le domaine sans respecter automatiquement ces détails. Le prompt peut ajouter quelques règles et le RAG retrouver les documents pertinents. Mais certaines tâches exigent un comportement répété : choisir les bons outils, produire un format stable, suivre une méthode de diagnostic ou refuser une action interdite dans des milliers de situations légèrement différentes.

Forge vise ce niveau d’adaptation. Mistral cite des partenaires comme ASML, Ericsson, l’Agence spatiale européenne et HTX à Singapour. Ces références montrent l’orientation industrielle et réglementée de l’offre, sans constituer à elles seules une preuve de performance pour chaque client.

RAG, fine-tuning et pré-entraînement ne résolvent pas le même problème

Le RAG recherche des informations dans une base documentaire puis les ajoute au contexte de la requête. Il convient aux faits qui changent, aux documents devant être cités et aux droits d’accès appliqués au moment de la demande. Une politique mise à jour peut être réindexée sans réentraîner le modèle.

Le fine-tuning ou post-entraînement modifie la manière dont le modèle répond. Il peut apprendre un format, une terminologie, une utilisation d’outil ou une préférence. Mistral mentionne notamment le SFT, l’optimisation directe des préférences, le RLHF et LoRA. Cette dernière méthode adapte une petite partie des paramètres et peut réduire le coût par rapport à un entraînement complet.

Le pré-entraînement continu ou spécialisé expose le modèle à de grands volumes de données métier pour lui faire internaliser un domaine. C’est l’option la plus lourde : elle demande des données propres, une infrastructure importante et des évaluations capables de démontrer un gain. Elle est pertinente lorsque le vocabulaire et les raisonnements du domaine sont profondément absents du modèle de départ.

Ces approches se combinent souvent. Un modèle adapté peut mieux comprendre le métier, tandis que le RAG apporte les chiffres et documents récents. Un agent ajoute ensuite les outils nécessaires pour agir. Choisir une seule technique par principe crée soit un système trop coûteux, soit un assistant qui connaît le ton de l’entreprise sans connaître les faits actuels.

Forge couvre toute la chaîne de personnalisation

Mistral décrit six étapes : préparation des données, entraînement, alignement, évaluation, gestion du cycle de vie et inférence. La préparation peut inclure des exemples synthétiques, notamment pour les cas rares mais critiques. Ces données ne doivent pas devenir une vérité artificielle : elles nécessitent une revue et une séparation claire des données réelles.

Forge prend en charge des architectures denses et Mixture-of-Experts. Un modèle dense active l’ensemble de ses paramètres à chaque requête. Un MoE sélectionne certains experts, ce qui peut permettre une grande capacité avec un coût d’inférence inférieur à celui d’un modèle dense équivalent. Le choix dépend de la latence, du matériel, du volume et de la difficulté des tâches.

L’offre prévoit aussi des entrées multimodales lorsque le besoin le justifie. Dans l’industrie, un modèle peut devoir rapprocher texte, schéma, photographie et mesure. La simple présence de plusieurs modalités ne garantit pas leur alignement : il faut tester les cas où une image contredit un rapport ou lorsqu’un capteur est incomplet.

L’évaluation devient plus importante que l’entraînement

Personnaliser un modèle peut améliorer une tâche et en dégrader une autre. Il peut apprendre une ancienne procédure, mémoriser une donnée sensible ou devenir trop confiant dans le vocabulaire interne. Forge met donc en avant des évaluations liées aux indicateurs métier, des suites de régression et la détection de dérive.

Une organisation doit construire ces tests avant de lancer un entraînement coûteux. Ils devraient couvrir la précision, les refus, les citations, l’usage des outils, la confidentialité, la robustesse aux instructions hostiles et le coût. Les exemples doivent inclure des cas normaux, des exceptions et des demandes impossibles.

Une moyenne élevée ne suffit pas pour un processus critique. Un modèle de maintenance peut réussir 95 % des questions simples et échouer sur le scénario qui arrête une ligne de production. Les résultats doivent être segmentés par type de risque et comparés à une référence : modèle généraliste, RAG seul, opérateur humain ou système existant.

Les agents rendent le modèle plus utile et plus dangereux

Mistral présente les modèles personnalisés comme une base pour des agents d’entreprise. Un modèle qui comprend la terminologie interne peut sélectionner un outil, interpréter un état et exécuter une procédure avec moins d’ambiguïté. Forge est aussi conçu pour être piloté par des agents capables de préparer des données, chercher des hyperparamètres et lancer des expériences.

Cette automatisation ne doit pas supprimer les contrôles. Un agent d’entraînement peut consommer beaucoup de calcul, contaminer un jeu d’évaluation ou promouvoir un modèle qui optimise un indicateur incomplet. Les budgets, jeux de données autorisés, environnements et droits de publication doivent être imposés hors du modèle.

En production, la permission d’agir doit rester distincte de la capacité à comprendre. Un modèle spécialisé dans les procédures financières n’a pas besoin d’un accès illimité aux paiements. Des approbations humaines, limites de montant, journaux et identités techniques dédiées restent nécessaires.

Contrôle des données et souveraineté

Forge met en avant l’isolation des données, la traçabilité et la possibilité de fonctionner dans différents environnements. Le modèle peut être déployé dans un cloud privé, sur site ou sur l’infrastructure Mistral selon l’accord. Cette flexibilité intéresse les secteurs où la localisation des données et le contrôle opérationnel sont obligatoires.

Il faut néanmoins documenter précisément ce qui quitte le périmètre : données brutes, gradients, journaux, télémétrie, résultats d’évaluation et assistance technique. « Sur site » ne signifie pas automatiquement qu’aucune métadonnée ne sort, tout comme « cloud européen » ne suffit pas à définir les rôles juridiques et les accès du fournisseur.

La propriété du modèle personnalisé, les droits sur les poids, la portabilité des jeux de données et les conditions de sortie doivent apparaître dans le contrat. Un modèle stratégique ne doit pas devenir inutilisable si l’entreprise change d’infrastructure ou de prestataire.

Le vrai coût dépasse les GPU

Forge ne publie pas de tarif standard adapté à tous les projets. Le coût dépendra du modèle de départ, du volume de données, des méthodes d’entraînement, des expériences et du déploiement. Le calcul représente une part visible, mais la préparation des données et les experts métier peuvent coûter davantage.

Il faut également financer les évaluations, la sécurité, les mises à jour et l’inférence. Un modèle spécialisé plus petit peut réduire le coût par requête, mais seulement si son entretien ne mobilise pas en permanence une équipe de recherche. Le retour sur investissement doit être mesuré sur un processus précis : temps de diagnostic, taux de correction accepté, incidents évités ou dossiers traités.

Quand faut-il envisager Forge ?

Une entreprise devrait commencer par un modèle existant, un prompt clair et un RAG bien construit. Si les évaluations montrent une limite répétée de comportement ou de connaissance profonde du domaine, un post-entraînement devient justifiable. Le pré-entraînement spécialisé vient ensuite, lorsque le gain attendu couvre réellement sa complexité.

Forge est donc moins un bouton « créer notre IA » qu’une plateforme de cycle de vie. Sa valeur dépend de la qualité des données, des tests et de la gouvernance fournis par le client. Une entreprise qui ne sait pas mesurer son assistant actuel ne saura pas davantage prouver qu’un modèle sur mesure est meilleur.

L’annonce de Mistral confirme néanmoins un déplacement important : les grandes organisations ne veulent plus seulement consommer un modèle externe. Elles cherchent à contrôler la manière dont leur savoir devient un comportement logiciel, avec la possibilité de l’évaluer, de le versionner et de le déployer dans leur propre environnement.