Recherche & preuves

Une base de preuves vivante derrière l’orientation de CelestyxAI.

Nous suivons la recherche mondiale sur l’IA clinique comme un intrant d’ingénierie : ce qu’elle démontre, ce qu’elle ne démontre pas et ce qu’elle change dans notre architecture, notre validation et notre usage prévu.

Politique de preuve

Les résultats externes restent attribués à leurs sources. Les implications et synthèses CelestyxAI sont nos analyses propres — elles ne sont pas présentées comme des publications évaluées par les pairs ni comme des preuves d’efficacité de CelestyxAI.

20 entrées de preuve6 synthèses2025–2026 horizon suivi
Carte des preuves

De la publication à la décision de conception.

Chaque élément est analysé sous les mêmes angles : validité de tâche, sécurité, facteurs humains, gouvernance, interopérabilité et adéquation au workflow clinique.

01Évaluation
02Sécurité
03Facteurs humains
04Interopérabilité
05Gouvernance
06Workflow clinique
Registre mondial de preuves

Recherche vérifiée, organisée chronologiquement.

Ce registre privilégie les travaux qui influencent directement le problème actuel de CelestyxAI : une assistance à l’admission clinique sûre, auditable et destinée aux professionnels. Il est volontairement sélectif plutôt qu’exhaustif.

02 janv. 2025Nature MedicineÉTUDE

L’évaluation clinique des LLM exige des critères spécifiques aux tâches et définis par des experts

ÉvaluationFacteurs humainsWorkflow clinique

Résultat publié

Johri et ses collègues proposent un cadre multidimensionnel pour évaluer les LLM dans des tâches cliniques d’interaction, en intégrant justesse clinique, pertinence, qualité de communication, sécurité et revue experte spécifique à la tâche.

Implication de conception pour CelestyxAI

CelestyxAI doit valider chaque tâche d’admission déléguée avec des rubriques explicites et des experts du domaine, plutôt que d’utiliser un benchmark médical général comme proxy de maturité clinique.

Lire la source originale ↗
08 janv. 2025Nature MedicineÉTUDE

Des LLM médicaux peuvent conserver de bons scores malgré des connaissances médicales empoisonnées

SécuritéGouvernanceÉvaluation

Résultat publié

Le remplacement de seulement 0,001 % des tokens d’entraînement par de la désinformation médicale a augmenté les sorties nuisibles, alors que les benchmarks médicaux conventionnels restaient largement inchangés.

Implication de conception pour CelestyxAI

La provenance des connaissances, des politiques externes autoritaires et la validation en aval sont des exigences de sécurité; les scores de benchmark ne certifient pas l’intégrité du savoir médical d’un modèle.

Lire la source originale ↗
27 janv. 2025npj Digital MedicineÉTUDE

L’évaluation des LLM médicaux doit couvrir des tâches cliniques plus variées

ÉvaluationWorkflow clinique

Résultat publié

MedS-Bench évalue les LLM médicaux sur 11 tâches cliniques de niveau supérieur plutôt que sur une logique étroite de questions-réponses.

Implication de conception pour CelestyxAI

L’évaluation doit refléter la taxonomie exacte des tâches d’admission : extraction, normalisation, synthèse, soutien à l’escalade et génération structurée doivent être mesurés séparément.

Lire la source originale ↗
05 févr. 2025The BMJGUIDE

FUTURE-AI transforme l’IA de confiance en exigences couvrant tout le cycle de vie

GouvernanceSécuritéFacteurs humainsÉvaluation

Résultat publié

Un consortium international de 117 experts provenant de 50 pays a défini six principes — équité, universalité, traçabilité, utilisabilité, robustesse et explicabilité — ainsi que 30 bonnes pratiques du design au monitoring.

Implication de conception pour CelestyxAI

Traçabilité, utilisabilité et surveillance post-déploiement doivent être des exigences produit de premier ordre, et non une documentation de conformité ajoutée après la construction technique.

Lire la source originale ↗
06 mars 2025npj Digital MedicineANALYSE

Implémenter des LLM en santé est un problème de contrôle, d’infrastructure et de dépendance fournisseur — pas seulement de modèle

GouvernanceSécuritéWorkflow clinique

Résultat publié

Les auteurs structurent le déploiement des LLM autour des arbitrages entre contrôle institutionnel, collaboration, coûts, sécurité des données, ouverture et dépendance aux fournisseurs externes.

Implication de conception pour CelestyxAI

La couche d’orchestration de CelestyxAI doit rester indépendante du modèle, versionnée et remplaçable afin que les contrôles institutionnels ne dépendent pas d’un fournisseur ou de son cycle de versions.

Lire la source originale ↗
07 mars 2025npj Digital MedicineÉTUDE

Le red teaming clinique révèle des modes d’échec invisibles aux évaluations standards

SécuritéÉvaluationFacteurs humains

Résultat publié

Des tests adversariaux menés par des cliniciens ont classé 20,1 % de 1 504 réponses comme inappropriées, notamment pour la sécurité, la confidentialité, les hallucinations/l’exactitude et les biais.

Implication de conception pour CelestyxAI

La validation pré-pilote doit inclure des scénarios d’admission volontairement adversariaux, ambigus et rares, avec revue clinique et classification explicite des échecs.

Lire la source originale ↗
17 mars 2025npj Digital MedicineÉTUDE

Des outils déterministes spécifiques aux tâches peuvent réduire fortement les erreurs des LLM dans les calculs cliniques

SécuritéÉvaluationWorkflow clinique

Résultat publié

Sur 10 000 essais, l’accès des agents LLM à des outils de calcul clinique spécifiques aux tâches a produit les plus fortes réductions de réponses incorrectes par rapport aux modèles non assistés.

Implication de conception pour CelestyxAI

Lorsqu’une tâche peut être représentée de manière déterministe, CelestyxAI doit la router vers un outil ou une règle explicite plutôt que demander au LLM de reproduire probabilistiquement la logique.

Lire la source originale ↗
19 mars 2025Applied SciencesÉTUDE

Les LLM peuvent transformer du texte clinique en FHIR, mais le prompting, la correction et la validation modifient fortement la qualité

InteropérabilitéÉvaluation

Résultat publié

L’étude compare plusieurs approches LLM de conversion de rapports cliniques en bundles FHIR et montre que les exemples et les corrections itératives influencent les performances.

Implication de conception pour CelestyxAI

La génération orientée FHIR doit se terminer par une validation déterministe de schéma, des contrôles terminologiques et des sorties rejetables, plutôt que de traiter du JSON plausible comme une donnée clinique interopérable.

Lire la source originale ↗
09 mai 2025npj Digital MedicineÉTUDE

Les workflows LLM montrent un potentiel pour le triage et l’orientation, mais le jugement clinique reste déterminant dans l’évaluation

Workflow cliniqueÉvaluationFacteurs humains

Résultat publié

Une évaluation sur 2 000 cas MIMIC-IV a testé des workflows LLM et RAG pour le triage, l’orientation vers une spécialité et le diagnostic, tandis que la notation clinique a montré une variation inter-évaluateurs importante.

Implication de conception pour CelestyxAI

CelestyxAI ne doit pas réduire les désaccords professionnels à une vérité terrain artificiellement unique; les protocoles doivent prévoir adjudication et mesure transparente de l’accord inter-évaluateurs.

Lire la source originale ↗
12 mai 2025OpenAIBENCHMARK

HealthBench rapproche l’évaluation de l’IA santé de scénarios réalistes notés par des experts

ÉvaluationFacteurs humains

Résultat publié

HealthBench introduit des conversations de santé réalistes, des rubriques propres à chaque cas élaborées par des médecins et une notation experte plutôt qu’une simple exactitude à choix multiples.

Implication de conception pour CelestyxAI

Des rubriques propres au cas et la gravité des erreurs doivent compléter les tests déterministes; il s’agit d’un modèle d’évaluation utile, pas d’une preuve de performance de CelestyxAI.

Lire la source originale ↗
13 juin 2025npj Digital MedicineÉTUDE

L’évaluation de l’IA clinique est plus robuste lorsqu’elle combine revue humaine, métriques automatisées et simulation

ÉvaluationFacteurs humainsWorkflow clinique

Résultat publié

Le cadre SCRIBE pour la documentation clinique ambiante combine simulation, métriques computationnelles, revue humaine et évaluation intelligente, incluant des simulations adversariales et d’équité.

Implication de conception pour CelestyxAI

Le protocole pré-pilote de CelestyxAI doit combiner tests de régression déterministes, simulation de scénarios, revue experte et mesures opérationnelles, plutôt que dépendre d’une seule famille de métriques.

Lire la source originale ↗
07 juill. 2025npj Digital MedicineÉTUDE

L’audit des biais doit être calibré à une population clinique et à une tolérance au risque spécifiques

ÉvaluationGouvernanceFacteurs humains

Résultat publié

Un cadre en cinq étapes relie engagement des parties prenantes, calibration à la population locale et scénarios cliniquement pertinents pour auditer exactitude et biais des LLM.

Implication de conception pour CelestyxAI

L’évaluation de l’équité doit être locale et spécifique au workflow. CelestyxAI doit définir les analyses par sous-groupes avec les institutions partenaires avant d’interpréter une performance agrégée.

Lire la source originale ↗
07 oct. 2025npj Digital MedicineANALYSE

L’« illusion d’évaluation » avertit que les benchmarks médicaux peuvent surestimer l’utilité réelle

ÉvaluationWorkflow cliniqueFacteurs humains

Résultat publié

Les auteurs décrivent les écarts entre données de benchmark, tâches, métriques automatisées et impact translationnel réel, et appellent à des évaluations contextualisées et transparentes.

Implication de conception pour CelestyxAI

Le plan de preuve de CelestyxAI doit mesurer des résultats extrinsèques du workflow — corrections, complétude, temps, gestion des escalades et utilisabilité — en plus de la qualité des sorties.

Lire la source originale ↗
05 nov. 2025npj Digital MedicineÉTUDE

Les LLM-juges peuvent accélérer l’évaluation des synthèses cliniques, à condition d’être ancrés à des instruments humains validés

ÉvaluationFacteurs humains

Résultat publié

Un modèle de raisonnement a montré un fort accord avec des évaluateurs humains sur un instrument validé de synthèse clinique et a réduit le temps d’évaluation, la revue experte restant la référence.

Implication de conception pour CelestyxAI

Des évaluateurs automatisés peuvent aider à industrialiser les tests de régression, mais CelestyxAI doit les calibrer sur des rubriques notées par des cliniciens avant d’en faire des barrières qualité.

Lire la source originale ↗
26 déc. 2025npj Digital MedicineÉTUDE

Sécurité et efficacité peuvent diverger — surtout dans les scénarios cliniques à haut risque

SécuritéÉvaluationWorkflow clinique

Résultat publié

CSEDB utilise 30 métriques de sécurité/efficacité sur 2 069 cas rédigés par des experts et observe une baisse de performance de 13,3 % dans les scénarios à haut risque pour les modèles testés.

Implication de conception pour CelestyxAI

Les moyennes ne peuvent pas être le critère principal d’acceptation. CelestyxAI doit pondérer signaux d’alarme, reconnaissance des situations critiques et échecs d’escalade selon la gravité des conséquences.

Lire la source originale ↗
06 juin 2026BMC Health Services ResearchREVUE

Aucune stratégie unique de réduction des hallucinations n’est suffisante en santé

SécuritéÉvaluationGouvernance

Résultat publié

Une revue systématique de 44 études identifie sept familles majeures de mitigation, dont RAG, graphes de connaissances, human-in-the-loop, évaluations spécialisées et red teaming.

Implication de conception pour CelestyxAI

CelestyxAI doit utiliser des contrôles en couches : règles autoritaires, connaissances curées, génération bornée, validation de schéma, revue humaine et tests adversariaux plutôt que miser la sécurité sur le prompting seul.

Lire la source originale ↗
25 juin 2026Cell Reports MedicineÉTUDE

S.C.O.R.E. formalise l’évaluation experte multidimensionnelle des sorties ouvertes de LLM en santé

ÉvaluationSécuritéFacteurs humains

Résultat publié

S.C.O.R.E. évalue Safety, Consensus & Context, Objectivity, Reproducibility et Explainability et montre que des métriques génériques de similarité textuelle peuvent mal classer des réponses cliniquement appropriées.

Implication de conception pour CelestyxAI

La grille de revue experte de CelestyxAI doit séparer explicitement sécurité, alignement aux preuves, équité/objectivité, reproductibilité et explicabilité au lieu de les fusionner en un score unique.

Lire la source originale ↗
23 juill. 2026PLOS Digital HealthÉTUDE

Le mapping de données de santé vers FHIR par LLM est faisable, mais des erreurs systématiques persistent

InteropérabilitéÉvaluationGouvernance

Résultat publié

Le mapping de quatre modèles de données de santé vers FHIR obtient des scores F1 prometteurs mais révèle confusion sémantique, mauvais alignement structurel, ambiguïtés terminologiques et variations de nommage; les auteurs recommandent validation humaine et gouvernance.

Implication de conception pour CelestyxAI

CelestyxAI doit traiter l’interopérabilité comme un pipeline de transformation gouverné avec terminologies, validation de schéma, provenance et voies de rejet/revue — pas comme une génération directe LLM-vers-DSE.

Lire la source originale ↗
19 août 2026NatureREVUE

La sécurité des LLM en santé doit être conçue sur l’ensemble du cycle de vie du système

SécuritéGouvernanceFacteurs humainsWorkflow clinique

Résultat publié

Une large revue cartographie les risques des LLM de santé à travers le design, les données, le modèle, l’inférence et l’environnement de déploiement, avec des mitigations en couches autour des interactions humaines et systèmes.

Implication de conception pour CelestyxAI

La sécurité clinique est une propriété du système de bout en bout. Le choix du modèle n’est qu’une couche parmi gouvernance des politiques, intégrité des données, contrôles d’accès, monitoring, workflow humain et gestion des incidents.

Lire la source originale ↗
20 août 2026Online Journal of Public Health InformaticsREVUE

Les études sur les LLM en santé sous-évaluent encore confidentialité, sécurité, robustesse, explicabilité et vérifiabilité

ÉvaluationSécuritéGouvernance

Résultat publié

Une revue systématique de 247 études guidée par des critères d’IA de confiance montre que l’évaluation se concentre sur l’exactitude et l’équité, alors que la protection de la vie privée n’apparaît que dans 0,8 % des études et l’assurance de sécurité dans aucune.

Implication de conception pour CelestyxAI

La matrice de preuve de CelestyxAI doit rendre confidentialité, sécurité, robustesse, explicabilité et vérifiabilité obligatoires, plutôt que de les reléguer à des annexes techniques.

Lire la source originale ↗
Synthèses scientifiques CelestyxAI

Transformer les preuves en direction scientifique propre au projet.

Ces textes sont des synthèses originales CelestyxAI fondées sur la littérature citée et sur les décisions accumulées du projet. Ils sont clairement séparés des publications externes et ne sont pas présentés comme des articles scientifiques évalués par les pairs.

CEL-SYN/01Synthèse de preuves

Pourquoi la couche de politiques déterministes doit rester autoritaire

Une synthèse CelestyxAI sur la séparation entre contraintes cliniques critiques et comportement probabiliste des modèles de langage.

Fondée sur 4 sources primaires / autoritatives
Ouvrir la synthèse →
CEL-SYN/02Synthèse de preuves

Du score du modèle à la preuve de workflow : ce que CelestyxAI doit démontrer avant un pilote

Un plan de validation reliant les travaux modernes sur l’évaluation des LLM médicaux aux principes d’évaluation clinique précoce de l’IA.

Fondée sur 5 sources primaires / autoritatives
Ouvrir la synthèse →
CEL-SYN/03Synthèse de preuves

Le human-in-the-loop est une architecture de contrôle, pas un avertissement

Comment intégrer revue professionnelle, override, calibration et audit dans l’assistance à l’admission clinique.

Fondée sur 4 sources primaires / autoritatives
Ouvrir la synthèse →
CEL-SYN/04Synthèse de preuves

FHIR est un contrat d’interface, pas un raccourci de confiance

Une note CelestyxAI sur la structuration clinique assistée par LLM, la validation de schéma et l’échange gouverné.

Fondée sur 3 sources primaires / autoritatives
Ouvrir la synthèse →
CEL-SYN/05Synthèse de preuves

Un dossier de sécurité pré-pilote pour l’IA d’admission clinique destinée aux professionnels

Une structure de preuve proposée pour tester les échecs rares à forte conséquence avant une validation institutionnelle contrôlée.

Fondée sur 5 sources primaires / autoritatives
Ouvrir la synthèse →
CEL-SYN/06Synthèse de preuves

Direction scientifique CelestyxAI 2025–2026 : du concept de triage IA à une infrastructure d’admission gouvernée

Une synthèse de projet reliant l’évolution de CelestyxAI aux preuves externes qui structurent désormais son architecture et son plan de validation.

Fondée sur 5 sources primaires / autoritatives
Ouvrir la synthèse →
Direction scientifique actuelle

Le modèle n’est pas la frontière du produit.

Les preuves émergentes convergent avec la direction prise par CelestyxAI : enfermer l’IA probabiliste dans un système clinique gouverné dont politiques, validation, audit, interopérabilité et contrôle humain restent indépendamment testables.

01Risque formalisable → contrôle déterministe
02Tâche générative → orchestration bornée
03Sortie → schéma + validation clinique
04Workflow → autorité professionnelle
05Intégration → contrat FHIR gouverné
06Déploiement → preuve continue
Collaboration de recherche

Vous travaillez sur la sécurité, l’évaluation, les facteurs humains ou l’interopérabilité de l’IA clinique?

Échanger avec nous