★ À maîtriser
L’ADN porte l’information génétique, et les gènes sont directement liés aux protéines qui déterminent le phénotype.
Le dogme central de la biologie moléculaire décrit la réplication de l’ADN, la transcription de l’ADN en ARN et la traduction de l’ARN en protéine. - Francis Crick, Central dogma of molecular biology, 1958
L’ARN messager transfère l’information génétique entre l’ADN et la production des protéines.
Compléments
ADN → ARN → protéine
★ À maîtriser
Le séquençage Sanger produit des lectures pouvant atteindre 1 000 pb, de très haute qualité, et reste utilisé notamment pour séquencer des plasmides.
Le séquençage de deuxième génération, notamment Illumina, utilise de petits fragments et offre un très haut débit.
Le séquençage de troisième génération permet de lire de très longs fragments, mais il est sujet aux erreurs.
Compléments
Le séquençage de première génération, ou séquençage Sanger, utilise des terminateurs de chaîne radioactifs puis fluorescents et a reçu le prix Nobel en 1980.
L’assemblage génomique reconstitue un génome à partir des séquences obtenues par séquençage.
Sanger : qualité et fragments courts ; troisième génération : longues lectures mais erreurs
★ À maîtriser
Compléments
Le nombre et la qualité des génomes séquencés augmentent tandis que les coûts du séquençage diminuent.
Le cours souligne que le nombre de gènes et leurs fonctions restent incertains, et que les études génomiques peuvent être affectées par des biais.
📌 Une approche centrée sur les gènes est remise en question par l’idée que les formes présentes chez les individus sont des allèles. - Eisenstein, 2023
★ À maîtriser
📌 Les bases de données biologiques peuvent être généralistes ou spécialisées selon leur périmètre.
L’INSDC regroupe GenBank, hébergée par le NCBI, EMBL et DDBJ, dont les membres synchronisent leurs données malgré leur fonctionnement indépendant et utilisent un langage commun de caractéristiques.
UniProt combine depuis 2002 PIR, Swiss-Prot, qui est organisée par curation manuelle, et TrEMBL, qui provient de la traduction automatique de séquences nucléotidiques.
Compléments
★ À maîtriser
Compléments
La requête « Arabidopsis thaliana[Organism] AND calcium binding protein AND complete CDS NOT BTB » combine un filtre d’organisme, des termes de recherche et l’exclusion d’un terme.
Une fiche RefSeq donne accès à des séquences vérifiées et annotées, aux informations chromosomiques d’un gène, à ses variants d’ARNm, aux protéines correspondantes et à des informations fonctionnelles.
Un fichier FASTA permet d’enregistrer ou de récupérer des séquences pour les utiliser dans d’autres logiciels.
JBrowse permet de visualiser un génome et ses annotations, de se déplacer dans la région affichée, de zoomer et de sélectionner les pistes de données à afficher.
★ À maîtriser
Une similarité de séquence peut indiquer une fonction biologique, une structure tridimensionnelle ou une origine évolutive commune, et servir à assembler des fragments ou à repérer des différences de séquençage.
L’évaluation d’un alignement utilise une matrice de substitution, et le résultat dépend de la matrice choisie ainsi que du coût d’ouverture et d’extension des gaps.
Les principaux programmes BLAST se distinguent par les types de séquences comparés :
Compléments
★ À maîtriser
Compléments
Dans l’exercice, l’intervalle étudié couvre 200 kb et comprend 19 gènes, et les génomes de Riesling et de Gewürztraminer ne sont pas assemblés.
Un SNP correspond à un nucléotide et le cours indique qu’il y en a plus de 10^7 par génome humain, à raison d’environ un tous les 300 pb.
Les indels peuvent atteindre 10 nucléotides et le génome humain en compte environ 500 000 selon le cours.
Les CNV concernent de grands segments génomiques allant de quelques kilobases à plusieurs mégabases.
★ À maîtriser
📐 Formule - Le score Phred est calculé selon , où P est la probabilité que l’appel de base soit incorrect.
Compléments
Le génome de référence de Vitis vinifera PN40024 est issu du génotype Helfensteiner, est diploïde avec 2n = 38 chromosomes, mesure 475 Mb, compte environ 30 000 gènes et contient environ 40 % de séquences répétées. - Jaillon et al., 2007
Le séquençage décrit produit entre 116 et 138 millions de fragments par génome, soit environ 40 Go par fichier.
★ À maîtriser
📌 Le format SAM stocke les alignements dans un fichier texte tabulé, tandis que le format BAM en est la version binaire compressée, de taille deux à quatre fois plus petite.
Compléments
Galaxy est une plateforme libre et open source d’analyse de données, utilisable sans programmation, qui prend en charge la gestion de workflows et le partage des ressources informatiques, avec une capacité de stockage limitée à 100 Go par utilisateur.
Bowtie2 indexe le génome de référence, compare à celui-ci des fragments de lecture de 16 nucléotides répartis tous les 10 nucléotides en orientations directe et inverse, puis étend les meilleurs alignements en autorisant des gaps.
La détection des variants par mpileup rassemble les lectures, utilise la profondeur par base, les scores Phred des bases et les alignements, puis combine ces données pour estimer la vraisemblance des variants.
Contrôler, aligner, filtrer, appeler les variants
★ À maîtriser
📌 Le format SAM est un fichier texte de séquences alignées, tandis que le format BAM est sa version binaire compressée, dont la taille est 2 à 4 fois plus petite.
Compléments
L’en-tête d’un fichier SAM ou BAM contient des informations sur le logiciel d’alignement et sur la séquence de référence, notamment son nom et sa longueur.
Les champs d’un enregistrement SAM/BAM comprennent le nom du read, les informations d’alignement, le chromosome de référence, la coordonnée de début, le score de qualité de l’alignement, les différences avec la référence, la localisation et la coordonnée du second read, la longueur totale de l’alignement, la séquence du read, son score Phred et des informations additionnelles.
SAM est lisible, BAM est binaire et compact
★ À maîtriser
Compléments
★ À maîtriser
📌 Le VCF est un fichier texte délimité par des tabulations contenant des données de variation, tandis que le BCF est sa version binaire compressée.
Les colonnes principales du VCF sont CHROM pour le chromosome, POS pour la position, ID pour l’identifiant en base de données, REF pour le nucléotide de référence, ALT pour le nucléotide alternatif, QUAL pour la qualité, FILTER pour le filtre appliqué et INFO pour les informations supplémentaires.
Le protocole de détection des variants filtre d’abord l’alignement BAM pour conserver les reads alignés par paires, appelle les variants avec mpileup, puis formate et filtre le VCF avec VarScan avant sa visualisation dans IGV.
Compléments
Pileup → VCF : agréger les lectures, puis appeler les variants
★ À maîtriser
📌 Un SNP synonyme ne modifie pas l’acide aminé codé, tandis qu’un SNP non synonyme entraîne un changement d’acide aminé.
📌 Un INDEL de 1 ou 2 nucléotides provoque un décalage du cadre de lecture et une modification importante de la protéine, tandis qu’un INDEL multiple de 3 nucléotides ajoute ou supprime un acide aminé et a souvent des conséquences moins drastiques.
Compléments
Le code génétique comporte 64 codons pour coder 20 acides aminés et un codon STOP.
Une délétion d’un ou de deux nucléotides peut entraîner un codon STOP prématuré, tandis qu’une délétion de trois nucléotides supprime un acide aminé sans décaler le cadre de lecture.
Synonyme : même acide aminé ; non synonyme : acide aminé modifié
★ À maîtriser
Le workflow appliqué au Gewurztraminer reprend l’analyse des données de séquençage du Riesling : les fichiers d’entrée sont associés aux étapes du workflow, puis les résultats sont renommés et visualisés au fur et à mesure.
La recherche de gènes candidats pour le caractère aromatique compare dans IGV les alignements BAM et les variants VCF annotés du Gewurztraminer et du Riesling.
📌 Pour identifier des candidats du caractère aromatique, le Gewurztraminer est considéré comme très aromatique et hétérozygote pour le gène concerné, tandis que le Riesling est peu aromatique et ne possède pas l’allèle du Gewurztraminer.
Compléments
Teste tes connaissances sur Introduction à la génomique et analyses avec 10 questions à choix multiples et corrections détaillées.
1. Quelles étapes décrit le dogme central de la biologie moléculaire ?
2. Que cherche-t-on à déterminer lors d’un séquençage structural ?
Mémorisez les concepts clés de Introduction à la génomique et analyses avec 10 flashcards interactives.
Quels aspects des génomes la génomique étudie-t-elle ?
Leur structure, leur fonction, leur évolution, leur cartographie et leur édition.
Comment le dogme central décrit-il le flux d’information moléculaire ?
L’ADN se réplique, est transcrit en ARN, puis l’ARN est traduit en protéine.
Que détermine le séquençage structural de l’ADN ?
L’ordre des nucléotides d’une séquence d’ADN.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches