Deux phases, cinq étapes chacune
Évaluer une solution IA avant de l'acheter, puis avant de la déployer.
Les démonstrations fournisseurs se ressemblent toutes et se passent toujours bien. Elles ne disent rien de ce qui compte : le comportement de la solution sur vos données, vos cas limites et vos volumes. Methodia est la méthode que j'applique pour trancher sur des faits observés plutôt que sur une impression favorable, d'abord sur le marché, ensuite chez vous.
Transposable à tout secteur et à tout type de solution. À la fin de la mission, la grille et le jeu d'évaluation restent chez vous.
Acheter sur la foi d'une démonstration, c'est acheter à l'aveugle.
Une démonstration est un objet préparé. Elle est jouée sur des exemples choisis par celui qui vend, dans un ordre choisi par lui, sur une version qu'il maîtrise. Elle prouve que la solution sait faire ce qu'on lui a appris à montrer. Elle ne dit rien de la suite.
Le coût de l'erreur, lui, ne se révèle qu'une fois le déploiement engagé : quand les cas réels arrivent, quand les volumes montent, quand un cas ambigu tombe sur un agent qui doit rendre une décision. À ce moment, le contrat est signé et le projet est lancé.
Puis vient le second piège, celui d'après. La solution est choisie, une expérimentation démarre, les premiers retours sont encourageants, et plus personne ne sait à quelle condition on arrêterait. L'expérimentation s'installe, devient un service de fait sans budget ni propriétaire, et la décision finit par se prendre toute seule, sans avoir jamais été prise.
La difficulté n'est technique dans aucun des deux cas, elle est méthodologique. Personne ne manque d'outils pour tester. Ce qui manque, c'est un protocole qui rende les résultats comparables et opposables, et des critères de décision fixés avant d'avoir vu les résultats.
Les trois pièges les plus fréquents
- Le jeu de test fourni par l'éditeur. Il est calibré sur ce que la solution sait faire. Qui construit le jeu décide de qui gagne.
- Le passage unique. Un système génératif ne répond pas deux fois exactement pareil. Une bonne réponse observée une fois n'est pas une bonne réponse.
- Les critères réécrits après coup. On découvre à la fin que la vraie valeur du projet était ailleurs, précisément là où les résultats sont bons.
Deux phases. La première dit quoi choisir, la seconde dit s'il faut y aller.
Chaque étape a un livrable et un critère de passage. On ne passe pas à la suivante parce que le calendrier l'impose, on passe parce que le critère est rempli.
Qualifier la maturité avant de comparer
L'échelle TRL pour situer une technologie et éviter de traiter un sujet de recherche comme un produit disponible. Beaucoup de projets échouent parce qu'ils étaient prématurés, pas parce qu'ils étaient mal conduits.
Construire un jeu d'évaluation ancré sur le métier
Le jeu se constitue avec vos experts, à partir de cas réels et notamment des cas difficiles et ambigus, jamais à partir des exemples fournis par l'éditeur.
Faire concourir les solutions sur un protocole identique
Mêmes entrées, mêmes critères, plusieurs passages. Qualité de la réponse, couverture fonctionnelle, robustesse aux cas limites, coût à l'usage, conformité.
Itérer en campagnes successives
Une campagne unique mesure un instant, sur un état de version. Plusieurs campagnes mesurent une trajectoire, et c'est la trajectoire qui permet de s'engager sur plusieurs années.
Produire un livrable décisionnel
Une grille comparée, une recommandation argumentée et les conditions de réussite. Pas un rapport de tests que personne ne lit.
Jalon : une solution est retenue, ou aucune ne l'est.
Si aucune ne l'est, la démarche s'arrête ici et elle a fait son travail, pour le prix d'une évaluation.
Cadrage
Une note courte qui pose l'enjeu, le périmètre et les indicateurs de décision, fixés dès le départ. On passe quand l'enjeu est formulé de façon vérifiable, pas seulement intéressante.
Diagnostic
État des lieux partagé de l'organisation, des données, de la technologie et des contraintes réglementaires. On passe quand les options sont réduites à celles qui méritent un test réel.
Expérimentation ciblée
Une hypothèse précise, un périmètre limité, un délai borné, un protocole explicite. On passe quand des résultats observables existent, favorables ou non.
Évaluation mesurée
Grille renseignée sur la faisabilité, l'impact métier réel, la maturité et les risques, confrontée aux critères du cadrage, sans les réécrire après coup.
Décision : industrialiser, ajuster ou arrêter
Une note argumentée, qui vaut autant si elle conclut à l'arrêt. L'arrêt documenté est une décision de gestion, pas un échec à dissimuler.
Ce que vous avez à la fin
- Le jeu d'évaluation
Les cas réels, la vérité de référence établie par vos experts. - La grille renseignée
Les critères, les poids, les notes et le cas qui porte chaque note. - Le protocole
De quoi rejouer la campagne l'an prochain, avec ou sans moi. - Les deux notes de décision
Quelle solution retenir, puis faut-il l'industrialiser et à quelles conditions.
La méthode est transposable à tout secteur et à tout type de solution. Je vous laisse la grille pour conduire vos évaluations suivantes sans moi.
Cette méthode n'a pas été écrite pour un site, elle a été construite en la pratiquant.
Appliquée à des sujets très différents au sein d'une DSI de 1 500 personnes, avec les équipes métier concernées.
campagnes successives d'évaluation de grands modèles de langage pour l'aide à l'indemnisation, sur un jeu de 129 questions
solutions de reconnaissance vocale comparées sur un protocole identique
plateformes low code comparées avant engagement
qualification d'une technologie de langue des signes sur l'échelle de maturité, avant toute comparaison
Ces travaux ont surtout servi à écarter des solutions séduisantes en démonstration, et à sécuriser celles qui sont effectivement passées en production. Une évaluation qui conclut à l'arrêt est une décision de gestion, pas un échec.
Un outil, pas une plaquette.
La promesse de la méthode est que vous puissiez la rejouer sans moi. Autant commencer tout de suite : la page suivante contient le constructeur de grille. Vous choisissez les familles de critères, vous ajustez les poids, vous nommez les solutions candidates, et vous repartez avec un fichier prêt à remplir.
Tout se passe dans votre navigateur. Aucune donnée n'est transmise, aucune inscription n'est demandée, aucun compte n'est créé.
Les six familles de critères
- Qualité de la réponse
- Couverture fonctionnelle
- Robustesse aux cas limites
- Coût à l'usage
- Conformité
- Réversibilité, dépendance et souveraineté
Un évaluateur qui vend la solution qu'il évalue n'évalue rien.
C'est la raison d'être de cette page. Le seul intérêt que j'ai dans le résultat de votre évaluation, c'est qu'il soit juste.
Ce que je ne fais pas
- Pas de développement
- Pas de revente de solution
- Pas de partenariat éditeur, pas de commission d'apport
- Pas de reconduction automatique
- Pas de publication de vos résultats, sous aucune forme
Une décision à prendre, et une démonstration qui s'est bien passée.
Un premier échange de trente minutes suffit à dire si la méthode s'applique à votre cas, sur quelle phase, et dans quel délai. S'il n'y a pas matière, je le dis à ce moment.