Fiche de révision : Introduction à la génomique et analyses

Plan du Cours

  1. Génomes et dogme moléculaire
  2. Séquençage et assemblage des génomes
  3. Enjeux de la génomique fonctionnelle
  4. Banques de données biologiques
  5. Interrogation et récupération des séquences
  6. Similarités et alignements de séquences
  7. Structure des gènes et polymorphismes
  8. Données de séquençage et qualité
  9. Analyse des variants avec Galaxy
  10. Formats SAM et BAM
  11. Visualisation et couverture des alignements
  12. Détection et format des variants
  13. Effets des variants sur les protéines
  14. Workflow Gewurztraminer et gènes candidats

1. Génomes et dogme moléculaire

Notions clés & Définitions

  • Génomique : La génomique est une discipline interdisciplinaire de la biologie moléculaire qui étudie la structure, la fonction, l’évolution, la cartographie et l’édition des génomes.
  • Génome : Un génome est l’ensemble de l’information génétique d’un organisme ou d’une cellule, constitué de séquences de nucléotides d’ADN ou, chez les virus à ARN, d’ARN.

★ À maîtriser

  • L’ADN porte l’information génétique, et les gènes sont directement liés aux protéines qui déterminent le phénotype.

  • Le dogme central de la biologie moléculaire décrit la réplication de l’ADN, la transcription de l’ADN en ARN et la traduction de l’ARN en protéine. - Francis Crick, Central dogma of molecular biology, 1958

  • L’ARN messager transfère l’information génétique entre l’ADN et la production des protéines.

Compléments

  • Le génome nucléaire comprend des gènes codants et non codants, des régions fonctionnelles comme les séquences régulatrices et souvent une fraction importante d’ADN sans fonction évidente.

Astuce mémo

ADN → ARN → protéine

2. Séquençage et assemblage des génomes

Notions clés & Définitions

  • Séquençage : Le séquençage structural consiste à déterminer l’ordre des nucléotides d’une séquence d’ADN.

★ À maîtriser

  • Le séquençage Sanger produit des lectures pouvant atteindre 1 000 pb, de très haute qualité, et reste utilisé notamment pour séquencer des plasmides.

  • Le séquençage de deuxième génération, notamment Illumina, utilise de petits fragments et offre un très haut débit.

  • Le séquençage de troisième génération permet de lire de très longs fragments, mais il est sujet aux erreurs.

Compléments

  • Le séquençage de première génération, ou séquençage Sanger, utilise des terminateurs de chaîne radioactifs puis fluorescents et a reçu le prix Nobel en 1980.

  • L’assemblage génomique reconstitue un génome à partir des séquences obtenues par séquençage.

Astuce mémo

Sanger : qualité et fragments courts ; troisième génération : longues lectures mais erreurs

3. Enjeux de la génomique fonctionnelle

Notions clés & Définitions

  • Métagénomique : La métagénomique consiste à étudier les séquences génétiques provenant d’échantillons contenant des communautés d’organismes, comme ceux de l’expédition TARA Oceans.

★ À maîtriser

  • Les génomes végétaux peuvent être très grands, et les longues lectures peuvent aider à les assembler.
  • La génomique fonctionnelle et la bioinformatique permettent d’exploiter les séquences et les génomes pour étudier les fonctions biologiques.

Compléments

  • Le nombre et la qualité des génomes séquencés augmentent tandis que les coûts du séquençage diminuent.

  • Le cours souligne que le nombre de gènes et leurs fonctions restent incertains, et que les études génomiques peuvent être affectées par des biais.

📌 Une approche centrée sur les gènes est remise en question par l’idée que les formes présentes chez les individus sont des allèles. - Eisenstein, 2023

4. Banques de données biologiques

★ À maîtriser

  • Les bases de données biologiques stockent les grandes quantités de données produites par les approches omiques, notamment les séquences, les structures, les données d’expression et les marqueurs moléculaires.

📌 Les bases de données biologiques peuvent être généralistes ou spécialisées selon leur périmètre.

  • L’INSDC regroupe GenBank, hébergée par le NCBI, EMBL et DDBJ, dont les membres synchronisent leurs données malgré leur fonctionnement indépendant et utilisent un langage commun de caractéristiques.

  • UniProt combine depuis 2002 PIR, Swiss-Prot, qui est organisée par curation manuelle, et TrEMBL, qui provient de la traduction automatique de séquences nucléotidiques.

Compléments

  • Les bases spécialisées peuvent cibler un organisme comme TAIR pour Arabidopsis ou Ensembl pour les vertébrés, une catégorie biologique, ou la réduction des ambiguïtés avec RefSeq et Unigene.

5. Interrogation et récupération des séquences

★ À maîtriser

  • Entrez permet d’interroger plusieurs bases de données du NCBI et d’affiner les recherches à l’aide des opérateurs booléens AND, OR et NOT.

Compléments

  • La requête « Arabidopsis thaliana[Organism] AND calcium binding protein AND complete CDS NOT BTB » combine un filtre d’organisme, des termes de recherche et l’exclusion d’un terme.

  • Une fiche RefSeq donne accès à des séquences vérifiées et annotées, aux informations chromosomiques d’un gène, à ses variants d’ARNm, aux protéines correspondantes et à des informations fonctionnelles.

  • Un fichier FASTA permet d’enregistrer ou de récupérer des séquences pour les utiliser dans d’autres logiciels.

  • JBrowse permet de visualiser un génome et ses annotations, de se déplacer dans la région affichée, de zoomer et de sélectionner les pistes de données à afficher.

6. Similarités et alignements de séquences

Notions clés & Définitions

  • Alignement de séquences : Un alignement compare une séquence à une ou plusieurs autres afin d’identifier des régions similaires.
  • Indel : Un indel est une insertion ou une délétion de nucléotides ou d’acides aminés dans un alignement.

★ À maîtriser

  • Une similarité de séquence peut indiquer une fonction biologique, une structure tridimensionnelle ou une origine évolutive commune, et servir à assembler des fragments ou à repérer des différences de séquençage.

  • L’évaluation d’un alignement utilise une matrice de substitution, et le résultat dépend de la matrice choisie ainsi que du coût d’ouverture et d’extension des gaps.

  • Les principaux programmes BLAST se distinguent par les types de séquences comparés :

    • BLASTN compare une séquence nucléotidique à une base nucléotidique
    • BLASTP compare une protéine à une base protéique
    • BLASTX compare une séquence nucléotidique traduite dans six cadres à une base protéique
    • TBLASTN compare une protéine à une base nucléotidique traduite dans six cadres
    • TBLASTX compare des séquences nucléotidiques traduites dans six cadres entre elles

Compléments

  • Dans l’exemple de coûts présenté, ouvrir un gap vaut -10 et l’étendre vaut -1.

7. Structure des gènes et polymorphismes

Notions clés & Définitions

  • Polymorphisme : Un polymorphisme est une variation génomique entre individus qui, lorsqu’elle se trouve dans un gène, conduit à des allèles différents.

★ À maîtriser

  • Les principales catégories de polymorphismes sont :
    • SNP
    • insertions ou délétions
    • répétitions
    • variations du nombre de copies (CNV)

Compléments

  • Dans l’exercice, l’intervalle étudié couvre 200 kb et comprend 19 gènes, et les génomes de Riesling et de Gewürztraminer ne sont pas assemblés.

  • Un SNP correspond à un nucléotide et le cours indique qu’il y en a plus de 10^7 par génome humain, à raison d’environ un tous les 300 pb.

  • Les indels peuvent atteindre 10 nucléotides et le génome humain en compte environ 500 000 selon le cours.

  • Les CNV concernent de grands segments génomiques allant de quelques kilobases à plusieurs mégabases.

8. Données de séquençage et qualité

Notions clés & Définitions

  • Format GFF : Le format GFF est un fichier texte tabulé décrivant les annotations génomiques, notamment le chromosome, l’outil d’annotation, le type de caractéristique, ses coordonnées, son score, son brin, son cadre de lecture et ses attributs.
  • Format FASTQ : Le format FASTQ associe à chaque lecture sa séquence nucléotidique et une qualité encodée en ASCII par un caractère par base.

★ À maîtriser

  • Le séquençage Illumina paired-end décrit dans le cours produit deux lectures de 150 nucléotides à partir de fragments de 500 à 600 pb, après fragmentation mécanique.

📐 Formule - Le score Phred est calculé selon Qphred=−10log⁡10(P)Q_{\mathrm{phred}}=-10\log_{10}(P), où P est la probabilité que l’appel de base soit incorrect.

Compléments

  • Le génome de référence de Vitis vinifera PN40024 est issu du génotype Helfensteiner, est diploïde avec 2n = 38 chromosomes, mesure 475 Mb, compte environ 30 000 gènes et contient environ 40 % de séquences répétées. - Jaillon et al., 2007

  • Le séquençage décrit produit entre 116 et 138 millions de fragments par génome, soit environ 40 Go par fichier.

9. Analyse des variants avec Galaxy

Notions clés & Définitions

  • Format VCF : Le format VCF est un fichier texte tabulé dédié aux données de variation génétique, tandis que BCF en est la version binaire compressée.

★ À maîtriser

  • 🔄 Le protocole de détection des SNP et indels suit ces étapes :
    1. Contrôler la qualité et nettoyer les lectures
    2. Aligner les lectures sur le génome de référence
    3. Filtrer l’alignement
    4. Détecter les SNP et indels
    5. Filtrer les variants obtenus

📌 Le format SAM stocke les alignements dans un fichier texte tabulé, tandis que le format BAM en est la version binaire compressée, de taille deux à quatre fois plus petite.

Compléments

  • Galaxy est une plateforme libre et open source d’analyse de données, utilisable sans programmation, qui prend en charge la gestion de workflows et le partage des ressources informatiques, avec une capacité de stockage limitée à 100 Go par utilisateur.

  • Bowtie2 indexe le génome de référence, compare à celui-ci des fragments de lecture de 16 nucléotides répartis tous les 10 nucléotides en orientations directe et inverse, puis étend les meilleurs alignements en autorisant des gaps.

  • La détection des variants par mpileup rassemble les lectures, utilise la profondeur par base, les scores Phred des bases et les alignements, puis combine ces données pour estimer la vraisemblance des variants.

Astuce mémo

Contrôler, aligner, filtrer, appeler les variants

10. Formats SAM et BAM

★ À maîtriser

📌 Le format SAM est un fichier texte de séquences alignées, tandis que le format BAM est sa version binaire compressée, dont la taille est 2 à 4 fois plus petite.

Compléments

  • L’en-tête d’un fichier SAM ou BAM contient des informations sur le logiciel d’alignement et sur la séquence de référence, notamment son nom et sa longueur.

  • Les champs d’un enregistrement SAM/BAM comprennent le nom du read, les informations d’alignement, le chromosome de référence, la coordonnée de début, le score de qualité de l’alignement, les différences avec la référence, la localisation et la coordonnée du second read, la longueur totale de l’alignement, la séquence du read, son score Phred et des informations additionnelles.

Astuce mémo

SAM est lisible, BAM est binaire et compact

11. Visualisation et couverture des alignements

Notions clés & Définitions

  • Couverture : Pourcentage de la région génomique couvert par des reads.
  • Profondeur : Nombre de reads alignés sur une région génomique.

★ À maîtriser

  • Dans IGV, l’examen de la région portant le gène DXS consiste à superposer les annotations et les alignements, puis à repérer les polymorphismes potentiels.

Compléments

  • IGV est un logiciel de visualisation de données génomiques qui permet d’afficher simultanément les annotations de gènes, les polymorphismes et les séquences protéiques.

12. Détection et format des variants

★ À maîtriser

  • La détection par mpileup rassemble les reads, utilise la profondeur par base, les scores Phred des bases et l’alignement des reads, puis combine ces données pour estimer la probabilité des variants.

📌 Le VCF est un fichier texte délimité par des tabulations contenant des données de variation, tandis que le BCF est sa version binaire compressée.

  • Les colonnes principales du VCF sont CHROM pour le chromosome, POS pour la position, ID pour l’identifiant en base de données, REF pour le nucléotide de référence, ALT pour le nucléotide alternatif, QUAL pour la qualité, FILTER pour le filtre appliqué et INFO pour les informations supplémentaires.

  • Le protocole de détection des variants filtre d’abord l’alignement BAM pour conserver les reads alignés par paires, appelle les variants avec mpileup, puis formate et filtre le VCF avec VarScan avant sa visualisation dans IGV.

Compléments

  • L’en-tête d’un fichier VCF contient des informations sur les logiciels utilisés et explique les différentes colonnes.

Astuce mémo

Pileup → VCF : agréger les lectures, puis appeler les variants

13. Effets des variants sur les protéines

★ À maîtriser

📌 Un SNP synonyme ne modifie pas l’acide aminé codé, tandis qu’un SNP non synonyme entraîne un changement d’acide aminé.

📌 Un INDEL de 1 ou 2 nucléotides provoque un décalage du cadre de lecture et une modification importante de la protéine, tandis qu’un INDEL multiple de 3 nucléotides ajoute ou supprime un acide aminé et a souvent des conséquences moins drastiques.

  • SnpEff build construit une base de données à partir des annotations des séquences codantes, puis SnpEff eff annote les effets des variants à partir de cette base et du fichier VCF.

Compléments

  • Le code génétique comporte 64 codons pour coder 20 acides aminés et un codon STOP.

  • Une délétion d’un ou de deux nucléotides peut entraîner un codon STOP prématuré, tandis qu’une délétion de trois nucléotides supprime un acide aminé sans décaler le cadre de lecture.

Astuce mémo

Synonyme : même acide aminé ; non synonyme : acide aminé modifié

14. Workflow Gewurztraminer et gènes candidats

★ À maîtriser

  • Le workflow appliqué au Gewurztraminer reprend l’analyse des données de séquençage du Riesling : les fichiers d’entrée sont associés aux étapes du workflow, puis les résultats sont renommés et visualisés au fur et à mesure.

  • La recherche de gènes candidats pour le caractère aromatique compare dans IGV les alignements BAM et les variants VCF annotés du Gewurztraminer et du Riesling.

📌 Pour identifier des candidats du caractère aromatique, le Gewurztraminer est considéré comme très aromatique et hétérozygote pour le gène concerné, tandis que le Riesling est peu aromatique et ne possède pas l’allèle du Gewurztraminer.

Compléments

  • Deux gènes candidats indiqués pour le Gewurztraminer sont VIT_05s0020g02030 et VIT_05s0020g02130.

Teste tes connaissances

Teste tes connaissances sur Introduction à la génomique et analyses avec 10 questions à choix multiples et corrections détaillées.

1. Quelles étapes décrit le dogme central de la biologie moléculaire ?

2. Que cherche-t-on à déterminer lors d’un séquençage structural ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Introduction à la génomique et analyses avec 10 flashcards interactives.

Quels aspects des génomes la génomique étudie-t-elle ?

Leur structure, leur fonction, leur évolution, leur cartographie et leur édition.

Comment le dogme central décrit-il le flux d’information moléculaire ?

L’ADN se réplique, est transcrit en ARN, puis l’ARN est traduit en protéine.

Que détermine le séquençage structural de l’ADN ?

L’ordre des nucléotides d’une séquence d’ADN.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches