INSPECT-SR : 21 vérifications pour juger la fiabilité des essais cliniques

En bref

  • Publiée le 24 septembre 2026 dans The BMJ, INSPECT-SR aide à vérifier si les données et résultats d’un essai clinique randomisé sont suffisamment fiables pour entrer dans une revue systématique.
  • La grille comporte 21 vérifications réparties en 4 domaines : avis post-publication, déroulement et transparence de l’étude, textes et figures, résultats.
  • Elle complète l’évaluation classique du risque de biais. Un essai peut décrire une méthode correcte tout en présentant des données incohérentes ou peu plausibles.
  • Lors d’un test préparatoire sur 95 essais, 32 % ont soulevé des préoccupations sur leur authenticité. Ce chiffre ne mesure pas la fréquence des essais non fiables dans la littérature.
  • Cochrane a endossé INSPECT-SR pour ses revues. La grille structure un jugement humain et ne permet pas de conclure à une fraude.

Une revue systématique rassemble les études qui répondent à une même question pour en tirer une conclusion d’ensemble.

Mais que se passe-t-il si l’une des études incluses repose sur des données erronées, incohérentes ou inventées ?

Même une méta-analyse réalisée correctement peut alors intégrer ces données et voir son résultat modifié.

Le 24 septembre 2026, The BMJ a publié INSPECT-SR, une grille conçue pour repérer les essais cliniques dont la fiabilité pose problème avant leur inclusion dans une revue systématique. Cochrane l’a déjà endossée pour l’utilisation dans ses revues.

Peut-on vérifier de façon structurée qu’un essai publié mérite d’être intégré à une synthèse ?

Pourquoi le risque de biais ne suffit pas toujours

Un essai contrôlé randomisé (ECR) compare des groupes de participants constitués par tirage au sort. Il s’agit de la conception de référence pour évaluer l’efficacité d’une intervention lorsque ce type d’étude est possible.

Une revue systématique cherche ensuite à identifier les études répondant à une question définie à l’avance. Lorsqu’elle combine statistiquement leurs résultats, on parle de méta-analyse.

Avant cette synthèse, les auteurs évaluent notamment le risque de biais : le risque que la conception, la conduite, l’analyse ou la présentation de l’essai aient faussé son résultat. Pour les essais randomisés, RoB 2 est l’un des outils de référence. GRADE peut ensuite servir à juger le niveau de confiance dans l’ensemble des preuves.

Ces évaluations supposent toutefois en grande partie que les données rapportées sont authentiques et qu’aucune erreur majeure n’a compromis leur production.

Or un essai peut décrire une randomisation correcte et un protocole apparemment solide tout en contenant des données impossibles, des incohérences majeures ou des résultats fabriqués.

C’est ce problème qu’INSPECT-SR cherche à repérer.

Un exemple concret : l’ivermectine

Pendant la pandémie de Covid-19, certaines méta-analyses ont rapporté un effet favorable de l’ivermectine.

Des problèmes sérieux ont ensuite été identifiés dans plusieurs essais inclus. L’une des études les plus influentes a été retirée en raison de données frauduleuses. L’examen de données individuelles a aussi révélé des anomalies, notamment des blocs de dossiers de patients dupliqués.

Une méta-analyse qui incluait cet essai a ensuite été rétractée puis réanalysée. Les analyses corrigées et les grands essais menés par la suite n’ont pas apporté de preuve convaincante d’un bénéfice clinique de l’ivermectine contre la Covid-19.

Le problème dépasse largement cet exemple.

Quand une seule étude modifie une synthèse

L’étude VITALITY, publiée dans The BMJ en 2025, a identifié 1 330 essais rétractés et 847 revues systématiques qui en avaient intégré au moins un dans leurs méta-analyses.

Les chercheurs ont pu reproduire 3 902 de ces méta-analyses.

Après retrait des essais rétractés :

  • l’ampleur de l’effet variait de plus de 50 % dans 15,7 %.
  • le sens de l’effet changeait dans 8,4 % des méta-analyses ;
  • la significativité statistique changeait dans 16 % ;

Attendre qu’un article soit rétracté ne règle pas tout.
Une rétractation peut intervenir des années après sa publication, et certains problèmes ne conduisent jamais à une rétractation.

Comment fonctionne INSPECT-SR

Une question différente du risque de biais

Prenons un essai qui annonce un tirage au sort informatisé et un double aveugle.

Ces informations peuvent conduire à une évaluation rassurante sur certains domaines du risque de biais.

Mais si ses tableaux contiennent des moyennes mathématiquement impossibles ou des effectifs qui se contredisent d’une page à l’autre, une autre question se pose : peut-on faire confiance aux données rapportées ?

INSPECT-SR cible ce niveau.

21 vérifications en quatre domaines

La grille comporte 21 vérifications :

  • Avis post-publication, 3 vérifications : l’essai a-t-il été rétracté ? Existe-t-il un avertissement éditorial ? D’autres travaux de l’équipe ont-ils soulevé des problèmes ?
  • Déroulement, gouvernance et transparence, 5 vérifications : approbation éthique, enregistrement de l’essai, écarts avec le registre, plausibilité du recrutement et des moyens annoncés.
  • Textes et figures, 2 vérifications : contenus dupliqués ou incompatibles avec l’étude, images manipulées ou réutilisées.
  • Résultats, 11 vérifications : cohérence des effectifs, plausibilité des données initiales et des résultats, erreurs statistiques, contradictions entre tableaux, texte et autres publications du même essai.

Certaines vérifications sont très concrètes.

Si 20 patients évaluent leur douleur avec un nombre entier de 0 à 10 et que les 20 valeurs sont disponibles, la moyenne doit être un multiple de 0,05. Une moyenne annoncée à 6,43 ne peut donc pas correspondre à ces données.

Autre signal : après un véritable tirage au sort, les deux groupes se ressemblent en moyenne, mais des différences aléatoires persistent. Des groupes presque parfaitement identiques sur de très nombreuses variables peuvent donc justifier une vérification plus poussée.

Un signal isolé ne prouve rien. Il sert à déclencher l’examen.

Du signal au jugement

Pour chaque vérification, l’évaluateur répond oui, non, incertain ou non applicable. Un « oui » correspond à un problème potentiel.

À la fin de chaque domaine, il attribue l’un des trois niveaux suivants :

  • aucune inquiétude ;
  • quelques inquiétudes ;
  • inquiétudes sérieuses.

Aucun score automatique ne transforme les réponses en verdict.

Un seul signal peut parfois suffire à justifier des inquiétudes sérieuses, par exemple une rétractation directement liée à la fiabilité de l’étude. Dans la plupart des situations, l’évaluateur doit interpréter l’ensemble des éléments et expliquer son raisonnement.

Les auteurs recommandent d’appliquer INSPECT-SR avant l’évaluation du risque de biais.

Un essai jugé à « inquiétudes sérieuses » ne devrait pas être inclus dans la revue. Pour un essai avec « quelques inquiétudes », une analyse de sensibilité est recommandée : le calcul est réalisé avec puis sans l’étude pour voir si elle modifie la conclusion.

Deux évaluateurs indépendants sont recommandés, avec les compétences cliniques et statistiques nécessaires. En cas de doute, les auteurs de l’essai peuvent être contactés.

LIRE AUSSI : L’IA tient-elle vraiment ses promesses dans la découverte de médicaments ?

Ce que montrent les travaux de développement

INSPECT-SR est issu de plusieurs étapes de développement.

  1. Une première liste de vérifications a été construite à partir de la littérature et d’une enquête auprès d’experts.
  2. 72 vérifications candidates ont été appliquées à 95 ECR provenant de 50 revues Cochrane.
  3. Une consultation Delphi a ensuite demandé à des experts de noter leur utilité. 148 personnes ont participé au premier tour et 134 au second. Vingt-neuf vérifications ont atteint le seuil de consensus prévu.
  4. Des réunions de consensus ont ramené la grille à 21 vérifications.
  5. Une version provisoire a enfin été testée par 40 utilisateurs.

Les résultats

Lors du test des 72 vérifications candidates, les évaluateurs ont exprimé des préoccupations sur l’authenticité de 32 % des 95 essais examinés.

Si tous ces essais avaient été retirés, 22 % des méta-analyses étudiées se seraient retrouvées sans aucun essai.

Lors du test de la grille, les utilisateurs ont consacré une médiane de 45 minutes par essai, avec de fortes variations.

Parmi les 40 testeurs :

  • 70 % déclaraient qu’ils utiliseraient l’outil à nouveau ;
  • 93 % jugeaient raisonnables les conclusions obtenues.

Comment interpréter le chiffre de 32 % ?

Avec prudence.

Ces 95 essais provenaient de revues Cochrane contenant au maximum cinq essais et ont été évalués avec une liste de 72 vérifications, bien plus longue que la grille finale.

Certaines vérifications se sont révélées difficiles à appliquer ou faciles à mal interpréter.

Le chiffre de 32 % ne signifie donc pas qu’un essai clinique sur trois publié dans la littérature est non fiable.

Il décrit ce qui s’est passé dans cet échantillon et pendant cette phase de développement.

LIRE AUSSI : Fausses citations scientifiques : 4 046 cas détectés

Ce que ces données ne permettent pas de conclure

  • INSPECT-SR ne prouve pas une fraude. Un problème peut venir d’une fraude, d’une erreur de bonne foi ou d’un problème de conduite de l’étude. La grille évalue la confiance que l’on peut accorder aux données, pas l’intention des chercheurs.
  • Sa sensibilité et sa spécificité ne sont pas établies. On ne sait pas quelle proportion de véritables essais problématiques elle détecte ni combien d’essais fiables pourraient être signalés à tort.
  • Le consensus d’experts ne remplace pas une validation empirique. La construction de l’outil est structurée, mais ses performances en conditions réelles doivent encore être étudiées.
  • Le test utilisateur reste limité. Il concernait 40 volontaires qui découvraient la grille.
  • La concordance entre évaluateurs devra être documentée dans les utilisations futures.
  • Son effet sur les conclusions des revues reste à observer en pratique.
  • La grille ne remplace pas RoB 2, GRADE ou l’analyse des conflits d’intérêts. Elle répond à une autre question.
  • INSPECT-SR s’applique aux ECR sans nécessiter l’accès aux données individuelles des participants. Une extension appelée INSPECT-IPD est en développement pour aller plus loin lorsque ces données sont disponibles.

Implications pratiques

  • Si vous réalisez une revue systématique : la fiabilité de l’essai peut être vérifiée avant d’investir du temps dans l’évaluation du risque de biais et l’extraction détaillée des données.
  • Si vous utilisez une revue systématique : regardez si les auteurs expliquent comment ils ont traité les problèmes d’intégrité ou de fiabilité des études incluses. Une méta-analyse reposant sur très peu d’essais peut être particulièrement sensible à une seule étude problématique.
  • Si vous lisez un essai isolé : son statut éditorial, son enregistrement préalable et la cohérence entre protocole, effectifs et résultats donnent déjà des informations utiles.
  • Si vous repérez une anomalie : elle justifie une vérification, pas une accusation de fraude.

Conclusion

INSPECT-SR formalise une question qui restait souvent implicite dans les revues systématiques :

peut-on faire confiance aux données de cet essai ?

Ses 21 vérifications donnent aux évaluateurs une façon commune de documenter leurs doutes avant de synthétiser les résultats.

L’outil est désormais endossé par Cochrane et disponible librement. Sa performance en conditions réelles, sa reproductibilité entre évaluateurs et son effet sur les conclusions des revues devront encore être documentés.


Questions fréquentes

Qu’est-ce qu’un essai clinique « problématique » ?
Cochrane utilise ce terme pour une étude publiée ou non publiée dont les données ou les résultats soulèvent de sérieuses questions de fiabilité, qu’elle ait été rétractée ou non. Une fraude peut en être la cause, mais aussi une erreur majeure dans la conduite, l’analyse ou le traitement des données.

Quelle différence entre INSPECT-SR et RoB 2 ?
RoB 2 évalue le risque que la conception, la conduite, l’analyse ou la présentation d’un essai biaisent son résultat. INSPECT-SR cherche à déterminer si les données et résultats rapportés sont suffisamment fiables pour entrer dans une synthèse. Les deux évaluations sont complémentaires.

INSPECT-SR permet-il de prouver une fraude scientifique ?
Non. La grille aide à décider si l’on peut faire suffisamment confiance à un essai pour l’intégrer à une revue. Elle ne détermine pas si une anomalie est volontaire. Une enquête sur une éventuelle fraude relève notamment des institutions et des éditeurs.

Combien de temps faut-il pour évaluer un essai ?
Lors du test utilisateur, le temps médian était de 45 minutes par essai, avec une forte dispersion. L’évaluation peut s’arrêter plus tôt si un problème suffit déjà à justifier des inquiétudes sérieuses.

Où trouver INSPECT-SR ?
La grille et son guide d’utilisation sont disponibles librement sur inspect-sr.com, avec des exemples et un modèle modifiable pour consigner l’évaluation.


Évaluer un article suppose de pouvoir revenir au texte original et vérifier les éléments qui soutiennent ses conclusions.

Avec docmeup, vous déposez le PDF d’une publication. Il est lu en entier, traduit et synthétisé en français. Les passages importants sont surlignés directement dans l’article et plusieurs critères de fiabilité sont restitués, notamment la méthode, la population, les statistiques, la transparence et l’éthique.

Le texte d’origine reste accessible pour que chaque information puisse être vérifiée.


Références :

Wilkinson J, Bero L, Heal C, et al. INSPECT-SR tool for assessing trustworthiness of randomised controlled trials. BMJ. 2026;394. doi:10.1136/bmj-2026-100611. Source principale : grille finale, 21 vérifications, consultation Delphi, test utilisateur et recommandations d’utilisation.

Wilkinson J, Heal C, Antoniou GA, et al. Protocol for the development of a tool (INSPECT-SR) to identify problematic randomised controlled trials in systematic reviews of health interventions. BMJ Open. 2024;14(3). doi:10.1136/bmjopen-2024-084164. PMID: 38471680.

Wilkinson J, Heal C, Antoniou GA, et al. Assessing the feasibility and impact of clinical trial trustworthiness checks via an application to Cochrane Reviews: Stage 2 of the INSPECT-SR project. J Clin Epidemiol. 2025;184:111824. doi:10.1016/j.jclinepi.2025.111824. PMID: 40349737.

Xu C, Fan S, Tian Y, et al. Investigating the impact of trial retractions on the healthcare evidence ecosystem (VITALITY Study I): retrospective cohort study. BMJ. 2025;389. doi:10.1136/bmj-2024-082068. PMID: 40268307.

Lawrence JM, Meyerowitz-Katz G, Heathers JAJ, et al. The lesson of ivermectin: meta-analyses based on summary data alone are inherently unreliable. Nat Med. 2021;27(11):1853-1854. doi:10.1038/s41591-021-01535-y.

Hill A, Mirchandani M, Pilkington V. Ivermectin for COVID-19: addressing potential bias and medical fraud. Open Forum Infect Dis. 2022;9(2). doi:10.1093/ofid/ofab645.

Reis G, Silva EASM, Silva DCM, et al. Effect of early treatment with ivermectin among patients with Covid-19. N Engl J Med. 2022;386:1721-1731. doi:10.1056/NEJMoa2115869.

Naggie S, Boulware DR, Lindsell CJ, et al. Effect of ivermectin vs placebo on time to sustained recovery in outpatients with mild to moderate COVID-19. JAMA. 2022;328(16):1595-1603. doi:10.1001/jama.2022.18590.

Cochrane. New tool helps researchers spot problematic trials before they distort evidence. 24 septembre 2026.

INSPECT-SR Guidance. Guide d’utilisation et modèle disponibles sur inspect-sr.com.

Articles récents :