Du score du modèle à la preuve de workflow : ce que CelestyxAI doit démontrer avant un pilote
Un plan de validation reliant les travaux modernes sur l’évaluation des LLM médicaux aux principes d’évaluation clinique précoce de l’IA.
Un pré-pilote ne doit pas demander si le modèle est « bon ». Il doit tester si le workflow humain-IA complet se comporte de manière sûre et utile pour un usage prévu précisément défini.
Unité de preuve
La cible d’évaluation est le workflow : complétude de l’admission, taux de correction, gestion de l’escalade, gravité des échecs, acceptation professionnelle, charge temporelle et traçabilité — pas un score unique.
Facteurs humains
DECIDE-AI et les travaux récents insistent sur les utilisateurs réels, la formation, le comportement des opérateurs et l’évaluation clinique à petite échelle. L’override humain et le désaccord sont des données à mesurer, pas du bruit à masquer.
Barrière proposée pour CelestyxAI
Avant tout déploiement prospectif, CelestyxAI devrait réussir les tests de régression déterministes, cas limites simulés, revue clinique par rubriques, analyses de sous-groupes et une revue documentée de préparation à la gouvernance avec l’institution partenaire.
Cette synthèse est une analyse CelestyxAI fondée sur les preuves externes citées et les décisions accumulées du projet. Elle n’est pas une publication scientifique évaluée par les pairs et n’établit aucune efficacité clinique.
