full-RNA ANR


Fouille non biaisée dans les banques de données RNA-seq massives – full-RNA

Résumé

Le séquençage d’ARN à haut débit (RNA-seq) est un outil unique pour la découverte de biomarqueurs médicaux et de cibles pharmaceutiques. Cependant, alors que près d’un million de banques RNA-seq humaines sont publiquement disponibles, ce trésor d’information médicale ne peut réaliser son plein potentiel car il est impossible d’interroger directement cette ressource pour mesurer l’expression d’un ARN d’intérêt. Pusieurs projets bioinformatiques ont abordé cette question, mais ils reposent sur des ARN de référence normaux qui ne capturent pas toute la diversité des transcrits pathologiques. De nouvelles structures de données sans référence utilisant des k-mers permettent d’interroger de grandes bases de séquneces, mais elles n’autorisent pas les requêtes quantitatives.

Notre objectif ici est de développer de nouvelles structures d’indexation capables de gérer des requêtes quantitatives sans référence dans des dizaines de milliers de banques RNA-seq tout en optimisant la consommation disque et mémoire. A cette fin, nous nous appuierons sur notre système d’indexation Reindeer. Nous apporterons des innovations importante permettant de réduire l’empreinte disque et mémoire de l’outil, et nous l’étendrons aux séquences de type “long-read”. De plus, nous implémenterons dans la nouvelle version de Reindeer des outils statistiques permettant de cribler les index pour y découvrir des ARN significativement associés à des caractères qualitatifs ou quantitatifs liés au phénotype des échantillons. Ceci nous permettra de découvrir des ARN associés à des caractéristiques cliniques ou cellulaires, et in fine produire de nouveaux modèles de diagnostic/pronostic.

Nous créerons deux premiers index d’environ 10.000 échantillons à partir des bases de données “Short Read Archive” et GTEX. A l’aide de ces index, nous proposons une série d’applications visant à mieux comprendre les déterminants du vieillissement et de la senescence cellulaire, deux processus liés et impliqués dans un grand nombre de pathologies. Nous générerons les premièrs modèles modèles prédictifs de vieillissement et senescence utilisant des ARN non répertoriés tels que les rétrotransposons, les lncRNA et les variants d’épissage. L’architecture distribuée de notre système, combinée à des serveurs web permettant des interrogations publiques permettra une large communauté d’évaluer d’évaluer nos outils, ouvrant la voie à une large gamme d’applications. Notre consortium est composé de bioinformaticiens de quatre institutions, dotés d’une solide expérience en informatique, structure de données de texte, analyse de séquences ARN à haut débit et transcriptomique en santé.

Participants

  • Daniel GAUTHERET - Coordinateur - I2BC Gif/Yvette
  • Rayan Chikhi - Institut Pasteur
  • Thérèse Commes - IRMB Montpellier
  • Mikael Salson - Bonsaï Lille

Signatures transcriptionnelles pour une analyse RNA-seq globale – Transipedia

Outils

Rapport

Analyser le transcriptome sans référence à grande échelle

L’expression des gènes produit une diversité infinie de transcrits. Rechercher et quantifier ces transcrits dans les immenses entrepots de séquences qui s’accumulent dans le monde est actuellement une tache impossible. Nous proposons ici pour la première fois une solution à ce problème, via une nouvelle structure d’indexation des séquences massives. Cet outil ouvre des perspectives uniques en biologie et santé. Retrouver des transcrits dans des peta-octets de données brutes

Le séquençage à haut débit bouleverse notre vision de l’expression génique par sa capacité à capturer la grande diversité de transcrits produits par chaque cellule. Toutefois, l’analyse bioinformatique de ces données, qui utilise le plus souvent une comparaison à des séquences de référence, échoue à identifier un très grand nombre d’ARN porteurs de variations essentielles biologiquement. Nous proposons ici un nouveau concept d’analyse transcriptomique utilisant des k-mers sélectionnés pour représenter chaque variation dans un transcrit, et un système d’indexation permettant de rechercher efficacement un nombre sans précédent de variants transcriptomiques. Ce système permettra de réanalyser de très grands jeux de données publiques, ouvrant la voie à une vaste gamme d’applications tels que le diagnostic par RNA-seq ou l’analyse des réseaux de régulation par les ARN.

Une approche unique fondée sur un index de k-mers

Nous proposons ici un système d’analyse des variants de transcription par RNA-seq fondé sur un concept de signature de k-mers. Ce concept utilise une information de séquence minimale pour capturer chaque événement, qu’il soit transcriptionnel, post-transcriptionnel ou génétique, indépendamment d’un transcriptome de référence. Nous développerons une nouvelle structure de données pour stocker des signatures dans une «encyclopédie» efficace qui associera les signatures à une variété d’événements biologiques tels que variants d’épissage, SNV, indels, ARN circulaires, transcrits de fusion, etc. Pour permettre l’interrogation de grands jeux de données RNA-seq avec des signatures k-mer, nous développerons une nouvelle structure d’index pouvant lier efficacement un k-mer à toutes ses occurrences dans les reads d’une banque RNA-seq.

Résultats

Le partenaire 1 est parvenu à extraire les signatures de tous les transcrits de Gencode (livrable 1.B). Avec les outils des livrables 3.x, ceci nous permet de quantifier efficacement tout transcrit humain de référence dans un dataset de RNA-seq. La reflexion sur les aspects de la structure de la base (1A) et de l’ontologie (1C) sont en cours mais non encore finalisées. Ce point n’étant pas bloquant pour l’avancée des autres livrables, nous préférons poursuivre cette réflexion et repousser les dates de livraison. Pour le livrable 2B les partenaires 1 et 2 ont analysé plusieurs centaines de banques RNA-seq de leucémies, cancers du poumon et cancers de la prostate afin d’extraire des signatures des transcrits spécifiques de ces différentes pathologies. Pour le livrable 2.A, de nouvelles statistiques ont été intégrées à DEkupl permettant de traiter des centaines de banques, et un nouvel outil (KamRat) a été développé en C++ pour rechercher très rapidement des k-mers « signature » avec d’autres statistiques que celles de DEkupl, notamment la régression logistique, la classification naïve bayesienne et l’Anova pour les problème avec des conditions multiples. Ces travaux font aussi l’objet de publications en cours de rédaction. Enfin le partenaire 1 a publié un article d’opinion au sujet des approches sans référence telles que celles que nous défendons dans cette ANR. Le partenaire 3 a atteint un milestone majeur du projet avec le développement et la publication du logiciel REINDEER en collaboration avec le partenaire 1. Ce logiciel permet d’indexer plusieurs milliers de banques RNA-seq et de rechercher efficacement des signatures de k-mers dans ces banques (Livrable 4B). En s’appuyant sur REINDEER le partenaire 3 a produit le site covid19seqsearch (voir faits marquants) qui est une première version du livrable 4A, c’est à dire un workflow complet comprenant input d’une séquence d’intérêt, extraction des k-mers et quantification dans plus de 1850 fichiers fastq.

Perspectives

Les principales retombées du projet comprennent (1) la capacité de réanalyser les projets RNA-seq dans tout type d’organisme, permettant l’identification d’une diversité d’évènements transcriptionnels sans précédent; (2) la découverte de biomarqueurs ARN de valeur diagnostique et pronostique; (3) une nouvelle façon pour les groupes gérant de grands jeux de données publics d’offrir l’accès à leurs données; (4) à plus long terme, l’émergence d’un écosystème pour la curation d’un index d’événements transcriptomiques à base de signatures k-mer avec des applications dans le domaine de la santé et de la recherche; et (5) une plate-forme puissante pour les services commerciaux que les partenaires industriels peuvent associer à la curation manuelle et à l’apprentissage automatique pour développer des applications biologiques ou médicales ciblées.

Publications

- Marchet C, Iqbal Z, Gautheret D, Salson M, Chikhi R. (2020) REINDEER: efficient indexing of k-mer presence and abundance in sequencing datasets. Bioinformatics. In press.
- Morillon A, Gautheret D. (2019). Bridging the gap between reference and real transcriptomes. Genome Biol. 20:112.
Actes publiés
- Marchet C, Iqbal Z, Gautheret D, Salson M, Chikhi R. (2020) REINDEER: efficient indexing of k-mer presence and abundance in sequencing datasets. ISMB (actes publiés)
Conférences
- Marchet C. et al. 2019 Indexing De Bruijn graphs with minimizers, BiATA, St Petersburg (Russia)
- Marchet C. et al. 2019 Survey of k-mer set of sets data structures for querying large collections of sequencing datasets, DSB, Dortmund (Germany)
- Marchet C. et al. 2019 Survey of k-mer set of sets data structures for querying large collections of sequencing datasets, Helsinki Bioinformatics Day (Finland)
- Marchet C, Iqbal Z, Gautheret D, Salson M, Chikhi R. REINDEER: efficient indexing of k-mer presence and abundance in sequencing datasets bioRxiv 2020.03.29.014159; doi: doi.org/10.1101/2020.03.29.014159
- Riquier S, Mathieu M, Boureux A, Ruffle F, Lemaitre JM, Djouad F, Gilbert N, Commes T. Detailed analysis of public RNAseq data and long non-coding RNA: a proposed enhancement to mesenchymal stem cell characterisation. BioRXiv. doi: doi.org/10.1101/2020.03.09.976001
- Marchet C, Kerbiriou M, Limasset A. BLight: Efficient exact associative structure for k-mers, bioRxiv 2020.04.28.546309; doi: doi.org/10.1101/546309
- Marchet C, Boucher C, Puglisi S, Medvedev P, Salson M, Chikhi R. Data structures based on k-mers for querying large collections of sequencing datasets, bioRxiv 2019.12.06.866756 doi: doi.org/10.1101/54630

Participants

  • Daniel GAUTHERET - Coordinateur - I2BC Gif/Yvette
  • Rayan Chikhi - Institut Pasteur
  • Thérèse Commes - IRMB Montpellier
  • Mikael Salson - Bonsaï Lille