Ce registre privilégie les travaux qui influencent directement le problème actuel de CelestyxAI : une assistance à l’admission clinique sûre, auditable et destinée aux professionnels. Il est volontairement sélectif plutôt qu’exhaustif.
01
02 janv. 2025Nature MedicineÉTUDE
L’évaluation clinique des LLM exige des critères spécifiques aux tâches et définis par des experts
ÉvaluationFacteurs humainsWorkflow clinique
Résultat publié
Johri et ses collègues proposent un cadre multidimensionnel pour évaluer les LLM dans des tâches cliniques d’interaction, en intégrant justesse clinique, pertinence, qualité de communication, sécurité et revue experte spécifique à la tâche.
Implication de conception pour CelestyxAI
CelestyxAI doit valider chaque tâche d’admission déléguée avec des rubriques explicites et des experts du domaine, plutôt que d’utiliser un benchmark médical général comme proxy de maturité clinique.
Lire la source originale ↗02
08 janv. 2025Nature MedicineÉTUDE
Des LLM médicaux peuvent conserver de bons scores malgré des connaissances médicales empoisonnées
SécuritéGouvernanceÉvaluation
Résultat publié
Le remplacement de seulement 0,001 % des tokens d’entraînement par de la désinformation médicale a augmenté les sorties nuisibles, alors que les benchmarks médicaux conventionnels restaient largement inchangés.
Implication de conception pour CelestyxAI
La provenance des connaissances, des politiques externes autoritaires et la validation en aval sont des exigences de sécurité; les scores de benchmark ne certifient pas l’intégrité du savoir médical d’un modèle.
Lire la source originale ↗03
27 janv. 2025npj Digital MedicineÉTUDE
L’évaluation des LLM médicaux doit couvrir des tâches cliniques plus variées
ÉvaluationWorkflow clinique
Résultat publié
MedS-Bench évalue les LLM médicaux sur 11 tâches cliniques de niveau supérieur plutôt que sur une logique étroite de questions-réponses.
Implication de conception pour CelestyxAI
L’évaluation doit refléter la taxonomie exacte des tâches d’admission : extraction, normalisation, synthèse, soutien à l’escalade et génération structurée doivent être mesurés séparément.
Lire la source originale ↗04
05 févr. 2025The BMJGUIDE
FUTURE-AI transforme l’IA de confiance en exigences couvrant tout le cycle de vie
GouvernanceSécuritéFacteurs humainsÉvaluation
Résultat publié
Un consortium international de 117 experts provenant de 50 pays a défini six principes — équité, universalité, traçabilité, utilisabilité, robustesse et explicabilité — ainsi que 30 bonnes pratiques du design au monitoring.
Implication de conception pour CelestyxAI
Traçabilité, utilisabilité et surveillance post-déploiement doivent être des exigences produit de premier ordre, et non une documentation de conformité ajoutée après la construction technique.
Lire la source originale ↗05
06 mars 2025npj Digital MedicineANALYSE
Implémenter des LLM en santé est un problème de contrôle, d’infrastructure et de dépendance fournisseur — pas seulement de modèle
GouvernanceSécuritéWorkflow clinique
Résultat publié
Les auteurs structurent le déploiement des LLM autour des arbitrages entre contrôle institutionnel, collaboration, coûts, sécurité des données, ouverture et dépendance aux fournisseurs externes.
Implication de conception pour CelestyxAI
La couche d’orchestration de CelestyxAI doit rester indépendante du modèle, versionnée et remplaçable afin que les contrôles institutionnels ne dépendent pas d’un fournisseur ou de son cycle de versions.
Lire la source originale ↗06
07 mars 2025npj Digital MedicineÉTUDE
Le red teaming clinique révèle des modes d’échec invisibles aux évaluations standards
SécuritéÉvaluationFacteurs humains
Résultat publié
Des tests adversariaux menés par des cliniciens ont classé 20,1 % de 1 504 réponses comme inappropriées, notamment pour la sécurité, la confidentialité, les hallucinations/l’exactitude et les biais.
Implication de conception pour CelestyxAI
La validation pré-pilote doit inclure des scénarios d’admission volontairement adversariaux, ambigus et rares, avec revue clinique et classification explicite des échecs.
Lire la source originale ↗07
17 mars 2025npj Digital MedicineÉTUDE
Des outils déterministes spécifiques aux tâches peuvent réduire fortement les erreurs des LLM dans les calculs cliniques
SécuritéÉvaluationWorkflow clinique
Résultat publié
Sur 10 000 essais, l’accès des agents LLM à des outils de calcul clinique spécifiques aux tâches a produit les plus fortes réductions de réponses incorrectes par rapport aux modèles non assistés.
Implication de conception pour CelestyxAI
Lorsqu’une tâche peut être représentée de manière déterministe, CelestyxAI doit la router vers un outil ou une règle explicite plutôt que demander au LLM de reproduire probabilistiquement la logique.
Lire la source originale ↗08
19 mars 2025Applied SciencesÉTUDE
Les LLM peuvent transformer du texte clinique en FHIR, mais le prompting, la correction et la validation modifient fortement la qualité
InteropérabilitéÉvaluation
Résultat publié
L’étude compare plusieurs approches LLM de conversion de rapports cliniques en bundles FHIR et montre que les exemples et les corrections itératives influencent les performances.
Implication de conception pour CelestyxAI
La génération orientée FHIR doit se terminer par une validation déterministe de schéma, des contrôles terminologiques et des sorties rejetables, plutôt que de traiter du JSON plausible comme une donnée clinique interopérable.
Lire la source originale ↗09
09 mai 2025npj Digital MedicineÉTUDE
Les workflows LLM montrent un potentiel pour le triage et l’orientation, mais le jugement clinique reste déterminant dans l’évaluation
Workflow cliniqueÉvaluationFacteurs humains
Résultat publié
Une évaluation sur 2 000 cas MIMIC-IV a testé des workflows LLM et RAG pour le triage, l’orientation vers une spécialité et le diagnostic, tandis que la notation clinique a montré une variation inter-évaluateurs importante.
Implication de conception pour CelestyxAI
CelestyxAI ne doit pas réduire les désaccords professionnels à une vérité terrain artificiellement unique; les protocoles doivent prévoir adjudication et mesure transparente de l’accord inter-évaluateurs.
Lire la source originale ↗10
12 mai 2025OpenAIBENCHMARK
HealthBench rapproche l’évaluation de l’IA santé de scénarios réalistes notés par des experts
ÉvaluationFacteurs humains
Résultat publié
HealthBench introduit des conversations de santé réalistes, des rubriques propres à chaque cas élaborées par des médecins et une notation experte plutôt qu’une simple exactitude à choix multiples.
Implication de conception pour CelestyxAI
Des rubriques propres au cas et la gravité des erreurs doivent compléter les tests déterministes; il s’agit d’un modèle d’évaluation utile, pas d’une preuve de performance de CelestyxAI.
Lire la source originale ↗11
13 juin 2025npj Digital MedicineÉTUDE
L’évaluation de l’IA clinique est plus robuste lorsqu’elle combine revue humaine, métriques automatisées et simulation
ÉvaluationFacteurs humainsWorkflow clinique
Résultat publié
Le cadre SCRIBE pour la documentation clinique ambiante combine simulation, métriques computationnelles, revue humaine et évaluation intelligente, incluant des simulations adversariales et d’équité.
Implication de conception pour CelestyxAI
Le protocole pré-pilote de CelestyxAI doit combiner tests de régression déterministes, simulation de scénarios, revue experte et mesures opérationnelles, plutôt que dépendre d’une seule famille de métriques.
Lire la source originale ↗12
07 juill. 2025npj Digital MedicineÉTUDE
L’audit des biais doit être calibré à une population clinique et à une tolérance au risque spécifiques
ÉvaluationGouvernanceFacteurs humains
Résultat publié
Un cadre en cinq étapes relie engagement des parties prenantes, calibration à la population locale et scénarios cliniquement pertinents pour auditer exactitude et biais des LLM.
Implication de conception pour CelestyxAI
L’évaluation de l’équité doit être locale et spécifique au workflow. CelestyxAI doit définir les analyses par sous-groupes avec les institutions partenaires avant d’interpréter une performance agrégée.
Lire la source originale ↗13
07 oct. 2025npj Digital MedicineANALYSE
L’« illusion d’évaluation » avertit que les benchmarks médicaux peuvent surestimer l’utilité réelle
ÉvaluationWorkflow cliniqueFacteurs humains
Résultat publié
Les auteurs décrivent les écarts entre données de benchmark, tâches, métriques automatisées et impact translationnel réel, et appellent à des évaluations contextualisées et transparentes.
Implication de conception pour CelestyxAI
Le plan de preuve de CelestyxAI doit mesurer des résultats extrinsèques du workflow — corrections, complétude, temps, gestion des escalades et utilisabilité — en plus de la qualité des sorties.
Lire la source originale ↗14
05 nov. 2025npj Digital MedicineÉTUDE
Les LLM-juges peuvent accélérer l’évaluation des synthèses cliniques, à condition d’être ancrés à des instruments humains validés
ÉvaluationFacteurs humains
Résultat publié
Un modèle de raisonnement a montré un fort accord avec des évaluateurs humains sur un instrument validé de synthèse clinique et a réduit le temps d’évaluation, la revue experte restant la référence.
Implication de conception pour CelestyxAI
Des évaluateurs automatisés peuvent aider à industrialiser les tests de régression, mais CelestyxAI doit les calibrer sur des rubriques notées par des cliniciens avant d’en faire des barrières qualité.
Lire la source originale ↗15
26 déc. 2025npj Digital MedicineÉTUDE
Sécurité et efficacité peuvent diverger — surtout dans les scénarios cliniques à haut risque
SécuritéÉvaluationWorkflow clinique
Résultat publié
CSEDB utilise 30 métriques de sécurité/efficacité sur 2 069 cas rédigés par des experts et observe une baisse de performance de 13,3 % dans les scénarios à haut risque pour les modèles testés.
Implication de conception pour CelestyxAI
Les moyennes ne peuvent pas être le critère principal d’acceptation. CelestyxAI doit pondérer signaux d’alarme, reconnaissance des situations critiques et échecs d’escalade selon la gravité des conséquences.
Lire la source originale ↗16
06 juin 2026BMC Health Services ResearchREVUE
Aucune stratégie unique de réduction des hallucinations n’est suffisante en santé
SécuritéÉvaluationGouvernance
Résultat publié
Une revue systématique de 44 études identifie sept familles majeures de mitigation, dont RAG, graphes de connaissances, human-in-the-loop, évaluations spécialisées et red teaming.
Implication de conception pour CelestyxAI
CelestyxAI doit utiliser des contrôles en couches : règles autoritaires, connaissances curées, génération bornée, validation de schéma, revue humaine et tests adversariaux plutôt que miser la sécurité sur le prompting seul.
Lire la source originale ↗17
25 juin 2026Cell Reports MedicineÉTUDE
S.C.O.R.E. formalise l’évaluation experte multidimensionnelle des sorties ouvertes de LLM en santé
ÉvaluationSécuritéFacteurs humains
Résultat publié
S.C.O.R.E. évalue Safety, Consensus & Context, Objectivity, Reproducibility et Explainability et montre que des métriques génériques de similarité textuelle peuvent mal classer des réponses cliniquement appropriées.
Implication de conception pour CelestyxAI
La grille de revue experte de CelestyxAI doit séparer explicitement sécurité, alignement aux preuves, équité/objectivité, reproductibilité et explicabilité au lieu de les fusionner en un score unique.
Lire la source originale ↗18
23 juill. 2026PLOS Digital HealthÉTUDE
Le mapping de données de santé vers FHIR par LLM est faisable, mais des erreurs systématiques persistent
InteropérabilitéÉvaluationGouvernance
Résultat publié
Le mapping de quatre modèles de données de santé vers FHIR obtient des scores F1 prometteurs mais révèle confusion sémantique, mauvais alignement structurel, ambiguïtés terminologiques et variations de nommage; les auteurs recommandent validation humaine et gouvernance.
Implication de conception pour CelestyxAI
CelestyxAI doit traiter l’interopérabilité comme un pipeline de transformation gouverné avec terminologies, validation de schéma, provenance et voies de rejet/revue — pas comme une génération directe LLM-vers-DSE.
Lire la source originale ↗19
19 août 2026NatureREVUE
La sécurité des LLM en santé doit être conçue sur l’ensemble du cycle de vie du système
SécuritéGouvernanceFacteurs humainsWorkflow clinique
Résultat publié
Une large revue cartographie les risques des LLM de santé à travers le design, les données, le modèle, l’inférence et l’environnement de déploiement, avec des mitigations en couches autour des interactions humaines et systèmes.
Implication de conception pour CelestyxAI
La sécurité clinique est une propriété du système de bout en bout. Le choix du modèle n’est qu’une couche parmi gouvernance des politiques, intégrité des données, contrôles d’accès, monitoring, workflow humain et gestion des incidents.
Lire la source originale ↗20
20 août 2026Online Journal of Public Health InformaticsREVUE
Les études sur les LLM en santé sous-évaluent encore confidentialité, sécurité, robustesse, explicabilité et vérifiabilité
ÉvaluationSécuritéGouvernance
Résultat publié
Une revue systématique de 247 études guidée par des critères d’IA de confiance montre que l’évaluation se concentre sur l’exactitude et l’équité, alors que la protection de la vie privée n’apparaît que dans 0,8 % des études et l’assurance de sécurité dans aucune.
Implication de conception pour CelestyxAI
La matrice de preuve de CelestyxAI doit rendre confidentialité, sécurité, robustesse, explicabilité et vérifiabilité obligatoires, plutôt que de les reléguer à des annexes techniques.
Lire la source originale ↗