Évaluer le service complet
Un modèle performant dans une démonstration peut échouer sur vos documents, vos langues ou vos exceptions métier. Le profil du NIST consacré à l’IA générative propose un cadre volontaire pour considérer les risques tout au long du cycle de vie. Ce cadre n’est pas une certification.
Nous recommandons de constituer un jeu d’évaluation représentatif avant le lancement. Incluez des demandes simples, des documents contradictoires, des informations absentes et des tentatives de faire sortir le service de son périmètre. Évaluez aussi sa capacité à signaler qu’il ne sait pas.
Versionner ce qui change les réponses
Le modèle n’est qu’un élément du système. Consignez également les instructions, les paramètres, les outils disponibles et la version des données de recherche. Une modification doit pouvoir être reliée à une évolution de qualité, de coût ou de délai. Pour les agents, Anthropic décrit l’importance d’évaluations adaptées aux trajectoires et aux résultats.
Préparer l’exploitation
Notre conseil : fixer des seuils d’alerte compréhensibles et nommer la personne qui peut suspendre le service. Prévoir une réponse manuelle ou un retour à la version précédente évite d’improviser pendant un incident. Ne stockez pas systématiquement tous les échanges : définissez les informations réellement nécessaires au diagnostic et leur durée de conservation.
Les sources et les fonctionnalités peuvent évoluer. Vérifiez leur version au moment de votre projet.
Tous les articles ↗