Fiche de révision : Annotation et génomique fonctionnelle

Plan du Cours

  1. Objectifs de la génomique
  2. Identifier les gènes procaryotes
  3. Prédiction automatique des gènes
  4. Limites de l’annotation automatique
  5. Validation par tiling arrays
  6. Validation par RNA-seq
  7. Réannotation et complexité génomique
  8. Annotation fonctionnelle par homologie
  9. Gènes orphelins et génomique fonctionnelle
  10. Transcriptome, protéome et ARN non codants
  11. Épissage et expression différentielle
  12. Complexes protéiques et ARN régulateurs

1. Objectifs de la génomique

Notions clés & Définitions

  • Annotation structurale : Consiste à identifier les gènes codant des ARN ou des protéines et à déterminer leur organisation dans le génome.

Points essentiels

  • L’analyse d’un génome séquencé comprend d’abord l’identification de tous les gènes, puis l’identification de la nature et de la fonction de leurs produits.

Astuce mémo

Séquence → gènes → produits → fonctions

2. Identifier les gènes procaryotes

Notions clés & Définitions

  • Cadre ouvert de lecture : Un cadre ouvert de lecture est une séquence comprise entre deux codons stop, tandis qu’une CDS est une séquence comprise entre un codon start et un codon stop.

Points essentiels

  • Un gène procaryote codant une protéine comprend notamment:
    • un promoteur
    • un site de fixation du ribosome
    • une CDS
    • un site de terminaison de la transcription

Astuce mémo

Start→Stop = CDS ; Stop→Stop = ORF

3. Prédiction automatique des gènes

★ À maîtriser

  • Les programmes de prédiction utilisent des modèles de Markov cachés entraînés sur un organisme pour différencier les régions géniques des régions intergéniques.

Compléments

  • Les programmes adaptés aux eucaryotes riches en introns sont utilisés avec des algorithmes neuronaux qui déterminent le départ de transcription et les sites d’épissage.

Astuce mémo

Apprentissage des séquences → distinction régions géniques/intergéniques

4. Limites de l’annotation automatique

Points essentiels

  • L’efficacité de la prédiction automatique atteint 98 à 99 % chez les procaryotes, mais elle est très mauvaise chez les eucaryotes complexes.

  • Chez les eucaryotes complexes, les gènes sont souvent très grands, contiennent beaucoup d’introns et possèdent de petits exons.

Astuce mémo

Procaryotes précis ; eucaryotes complexes incertains

5. Validation par tiling arrays

Points essentiels

  • La méthode des tiling arrays consiste à extraire les ARN, les convertir en cDNA avec un nucléotide marqué, puis à les hybrider sur une puce d’oligonucléotides chevauchants.
  • Les tiling arrays ont montré que la partie transcrite des génomes est beaucoup plus importante que prévu, notamment dans des régions initialement considérées comme intergéniques.

Astuce mémo

Marquage → hybridation → transcrits cartographiés

6. Validation par RNA-seq

Points essentiels

  • 🔄 Le RNA-seq suit les étapes suivantes:
    1. produire des cDNA fragmentés
    2. ajouter des adaptateurs
    3. séquencer les extrémités
    4. aligner les séquences sur le génome

📌 La région intergénique ne correspond pas nécessairement à toute la séquence située entre deux CDS, car elle exclut les régions transcrites comme les UTR, les ARN antisens et les ARN non codants.

Astuce mémo

ARN → cDNA fragmentés → séquençage → alignement

7. Réannotation et complexité génomique

★ À maîtriser

  • La réannotation manuelle de la drosophile a modifié la structure de 85 % des gènes et de 45 % des protéines.

  • L’expression alternative chez la drosophile est passée de 861 à 4 743 transcrits prédits, principalement à cause de l’épissage alternatif.

  • Le génome humain publié en janvier 2001 comportait 27 462 gènes alors que les estimations initiales prévoyaient au moins 100 000 gènes.

Compléments

  • Chez la drosophile, le nombre de gènes est passé de 13 601 à 13 676 après réannotation, avec 727 anciens gènes supprimés et 802 nouveaux gènes ajoutés.

Astuce mémo

Réannotation manuelle → fusions, morcellements et épissages révélés

8. Annotation fonctionnelle par homologie

Notions clés & Définitions

  • Homologie : Deux protéines sont homologues si elles dérivent d’un ancêtre commun, mais l’homologie reste une hypothèse lorsqu’elle est déduite d’une comparaison de séquences.

Points essentiels

📌 Les recherches d’homologie comparent la séquence en acides aminés d’un cadre ouvert de lecture aux séquences d’une banque de protéines grâce à des outils heuristiques comme BLAST ou FASTA.

  • Une identité supérieure à 27 % est habituellement considérée comme une homologie évidente, une identité comprise entre 20 et 27 % comme douteuse, et une identité inférieure à 20 % comme l’absence d’homologie.

📌 Une protéine inconnue est annotée par déduction fonctionnelle lorsqu’elle présente une identité suffisamment élevée avec une protéine connue dont la fonction est identifiée.

Astuce mémo

Identité de séquence ≠ preuve directe de fonction

9. Gènes orphelins et génomique fonctionnelle

Points essentiels

  • Les génomes séquencés contiennent généralement entre 20 et 30 % de gènes inconnus ne ressemblant à aucune séquence connue, appelés gènes orphelins.

  • La génomique fonctionnelle étudie les gènes inconnus par inactivation systématique et par analyse globale de l’expression des gènes ou des protéines.

Astuce mémo

Inactivation → phénotype ; transcriptome → protéome

10. Transcriptome, protéome et ARN non codants

★ À maîtriser

  • Une puce transcriptomique compare les ARN d’une culture témoin et d’une culture expérimentale après marquage réciproque par Cy3 et Cy5, hybridation sur la puce et révélation des fluorophores.

  • Les couleurs de la puce indiquent:

    • vert : sous-expression
    • rouge : surexpression
    • jaune : absence de variation
    • absence de couleur : absence d’expression dans les deux conditions

Compléments

  • Dans l’étude de Jelinsky et Samson publiée dans PNAS en 1999, environ 325 transcrits de Saccharomyces cerevisiae étaient augmentés et environ 76 diminués après exposition à un agent alkylant. — Scott A. Jelinsky and Leona D. Samson, Global Response of Saccharomyces cerevisiae to an Alkylating Agent

Astuce mémo

Variation cellulaire → expression différentielle → réseaux fonctionnels

11. Épissage et expression différentielle

★ À maîtriser

  • Le RNA-seq différentiel compare, entre deux conditions, le nombre de séquences correspondant à chaque gène après séquençage haut débit des cDNA.

  • Chez l’homme, l’épissage alternatif concerne plus de la moitié des ARNm.

Compléments

  • Dans l’exemple du gène CD45, un pré-ARNm produit cinq ARNm matures et cinq protéines différentes par épissage alternatif.

12. Complexes protéiques et ARN régulateurs

Notions clés & Définitions

  • ARN non codant : ARN qui ne sert pas directement de matrice pour produire une protéine et peut exercer une fonction régulatrice.

★ À maîtriser

  • La purification TAP utilise deux tags en tandem pour purifier successivement un complexe protéique sur deux colonnes d’affinité séparées par un clivage du premier tag, avant analyse par spectrométrie de masse.

Compléments

  • L’étude du protéome de Saccharomyces cerevisiae par purification TAP et spectrométrie de masse a caractérisé 589 assemblages protéiques et défini 232 complexes multiprotéiques distincts.
  • Les TSSa-RNA sont de petits ARN non codants de moins de 50 nucléotides localisés à proximité des sites de démarrage de la transcription.

Astuce mémo

Un réseau de complexes reliés par des protéines partagées

Tableaux de synthèse

Comparaison des méthodes d’annotation

MéthodePrincipeRésultat
Tiling arraysHybridation de cDNA sur des oligonucléotides chevauchantsCartographie des régions transcrites
RNA-seqSéquençage et alignement de fragments de cDNADétection fine des transcrits et des CDS
Puce transcriptomiqueComparaison de signaux fluorescents entre deux conditionsMesure des variations d’expression

Teste tes connaissances

Teste tes connaissances sur Annotation et génomique fonctionnelle avec 27 questions à choix multiples et corrections détaillées.

1. Que vise principalement l’annotation structurale d’un génome ?

2. Dans quelle séquence l’analyse d’un génome nouvellement séquencé est-elle généralement organisée ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Annotation et génomique fonctionnelle avec 60 flashcards interactives.

Qu'est-ce que l'annotation structurale en génomique ?

C'est l'identification des gènes codant des ARN ou protéines et leur organisation.

Quelle est la première étape de l'analyse d'un génome séquencé ?

L'identification de tous les gènes.

Que détermine-t-on après avoir identifié les gènes dans un génome ?

La nature et la fonction de leurs produits.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches