Retour
PubMedPrédiction pathogénicitéBenchmarkNouvel outil

Interpretable distillation reveals that deep learning splicing models suffer from pervasive confounders and blind spots.

Liu S, Zhang W, Regev OGenome Biol 2026 · août 2026
Score de pertinence
7/10
Pathologie / domaine
Non spécifique d'une pathologie (interprétation des variants d'épissage)
Source
PubMed
PMID 42625183

Outil / méthode

Reconnaissance des exons par combinaisons additives de motifs de séquence, avec exploitation de facteurs de confusion génomiques sans rapport avec l'épissage et prise en compte insuffisante de la structure de l'ARN.

Résumé

Prédire l'épissage à partir de la séquence génomique est déterminant pour interpréter la variation génétique, et les modèles d'apprentissage profond récents y atteignent les meilleures performances, mais leur logique de prédiction reste mal comprise. Les auteurs développent un cadre d'explication des prédictions par distillation interprétable et l'appliquent aux modèles d'épissage existants. Ils montrent que ces modèles reconnaissent les exons par des combinaisons additives étonnamment simples de motifs de séquence, incluant des éléments régulateurs connus de l'épissage. L'analyse révèle surtout que ces modèles exploitent des facteurs de confusion génomiques sans rapport avec l'épissage et rendent mal compte des effets de la structure de l'ARN, ce qui produit des erreurs de prédiction systématiques et de mauvaises performances sur les séquences qui s'écartent de la référence. Les auteurs en déduisent des limites fondamentales de l'entraînement sur séquences génomiques et proposent des pistes pour les dépasser.

Synthèse rédigée par Geno'X. Pour l'abstract original complet, consulter la publication source.

Analyse

Cela touche directement l'interprétation des variants : un score d'épissage prédit pèse lourd dans le classement d'un variant candidat, et l'article montre que ces modèles se dégradent précisément sur les séquences non référence, c'est-à-dire sur la séquence porteuse du variant que l'on cherche à évaluer. La conclusion raisonnable n'est pas d'écarter ces prédicteurs, mais de traiter un score isolé comme un argument faible tant qu'il n'est pas confirmé par une preuve fonctionnelle sur l'ARN du patient ou par minigène, en particulier pour les variants non canoniques. Il manque une quantification de l'erreur sur une série de variants cliniques réels : sans cela, on sait que le défaut existe mais pas dans quelles situations le score reste utilisable.

Analyse par Dr Thibaut Benquey

Pourquoi ce score ?

Impact 2/3Évidence 2/3Nouveauté 2/2Effectif 0/1Publication 1/1

Impact clinique : 2/3 · Solidité de l'évidence : 2/3 · Nouveauté : 2/2 · Effectif : 0/1 · Statut de publication : 1/1 → Total : 7/10

Mots-clés

prédiction de l'épissageapprentissage profondinterprétabilitéfacteurs de confusioninterprétation des variants
Rapport hebdo dans votre boîte mail

Chaque mercredi · Sélection commentée · Gratuit · Désabonnement en 1 clic