Jusqu'à présent, la plupart des garde-fous de la sécurité et de la modération des contenus générés par l'IA reposaient sur des modèles rigides, configurés selon des catégories de risques prédéfinies et gravées dans le marbre. Dans ce contexte, Mistral AI vient de dévoiler Shieldstral, un nouveau classifieur de sécurité multimodal de 3 milliards de paramètres, distribué sous licence open source Apache 2.0.

Il permet de définir les politiques de sécurité à la volée, en langage naturel, sans nécessiter le moindre réentraînement. Chaque produit qui intègre un modèle d'intelligence artificielle doit répondre à des questions déterminentes de modération.

Les modèles de modération traditionnels souffrent d'une grande rigidité car leurs catégories de risques sont intégrées directement lors de leur entraînement. Modifier ces règles implique souvent de réentraîner le modèle au complet, un processus lourd et coûteux. Shieldstral résout ce problème en abordant la modération sous un tout autre angle.

Au lieu d'imposer une taxonomie rigide, il traite la modération comme une tâche de réponse à une question binaire. Chaque demande adressée au modèle s'articule autour de trois éléments complémentaires.

D'abord, une instruction fixe le cadre d'évaluation et la sévérité voulue. Ensuite, une question explicite en langage naturel définit le critère à vérifier. Enfin, le document à analyser regroupe le contenu à évaluer, qu'il s'agisse d'un texte, d'une image ou d'une combinaison des deux.

Lors de l'inférence, le modèle calcule un score de sécurité continu sous la forme d'une probabilité d'acceptation ou de refus en une seule passe. Cette formulation élégante rassemble en une seule interface la détection de toxicité, la vérification des requêtes, le contrôle des réponses et la modération d'images.

Malgré sa taille contenue de 3 milliards de paramètres, Shieldstral parvient à rivaliser avec des modèles de garde-fous jusqu'à sept fois plus volumineux, tout en établissant une nouvelle référence pour la modération multimodale. Son architecture légère lui permet d'exécuter l'inférence sur un simple GPU de 16 Go, ce qui facilite grandement son déploiement au sein d'infrastructures existantes.

Son efficacité repose sur un entraînement minutieux réalisé grâce à Forge, la plateforme propriétaire de Mistral dédiée à la création et à l'évaluation de modèles. L'équipe a consolidé des jeux de données hétérogènes, formulé des exemples contrastés pour enseigner la discrimination fine au modèle, et ancré l'évaluation visuelle à l'aide de données d'images de haute qualité.

Proposé gratuitement sous licence Apache 2.0, Shieldstral s'inscrit dans le cadre du lancement de l'Open Secure AI Alliance aux côtés de partenaires de premier plan comme NVIDIA. En rendant les poids de ce modèle accessibles à tous, l'entreprise française réaffirme son engagement en faveur d'un écosystème d'IA transparent, sûr et sur mesure.

Avec Shieldstral, la modération cesse d'être une contrainte figée pour devenir un outil adaptatif aux besoins de chaque application, marquant une avancée vers des déploiements d'IA plus sûrs et mieux maîtrisés.