Fiche de révision : Bioinformatique et bases biologiques

Plan du Cours

  1. Fondements de la bioinformatique
  2. Nature des séquences biologiques
  3. Origine et technologies de séquençage
  4. Séquences recombinantes et tags
  5. Gènes, ARN et maturation
  6. Variations et effets protéiques
  7. Outils d’analyse des séquences
  8. Organisation des bases biologiques
  9. Bases de données nucléiques
  10. Bases de données protéiques
  11. Domaines, ontologies et enzymes
  12. Structures et interprétation biologique
  13. Navigateurs de génomes

Repères chronologiques

  1. 1859La théorie de l’évolution a été énoncée par Darwin puis complétée par la théorie neutraliste de Kimura en 1983.
  2. 1953La structure en double hélice de l’ADN a été découverte par Watson et Crick.
  3. années 1980L’augmentation des séquences publiées et le développement des réseaux ont conduit à créer des centres de référence.

1. Fondements de la bioinformatique

Notions clés & Définitions

  • Bioinformatique : Champ multidisciplinaire utilisant notamment l’informatique et les mathématiques pour répondre à des questions biologiques.

★ À maîtriser

  • La bioinformatique couvre notamment: le stockage et la recherche d’informations, l’analyse de séquences, les analyses omiques, la modélisation des interactions géniques, les modélisations moléculaires et physiologiques, l’analyse d’images médicales et microscopiques

📌 La biologie est variable, dynamique et parfois peu reproductible, tandis que les mathématiques et l’informatique reposent sur des concepts et des théories précises.

Compléments

  • L’informatique apporte le stockage et l’organisation des données, l’automatisation des tâches manuelles et les algorithmes, tandis que les mathématiques apportent les statistiques et la modélisation.

Astuce mémo

Biologie variable ↔ informatique et mathématiques exactes

2. Nature des séquences biologiques

Notions clés & Définitions

  • Séquence biologique : Chaîne de caractères fondée sur un alphabet simple et fixe, manipulable par des algorithmes.
  • Épissage : Étape de maturation des ARN messagers eucaryotes qui élimine généralement les introns et relie les exons.

Points essentiels

  • Les principales formes de séquences biologiques sont:
    • ADN
    • ARN
    • protéine
    • génome complet
    • fragment génomique
    • ADNc
    • EST
    • ADN recombinant
    • fragment protéique

📌 Le brin sens est le brin codant, tandis que le brin matrice est le brin antisens non codant utilisé lors de la transcription.

  • Dans un gène eucaryote, la région codante commence au codon ATG et se termine par un codon STOP TGA, TAA ou TAG, mais l’ATG n’est pas forcément situé dans le premier exon.

Astuce mémo

Une séquence comme une chaîne de lettres manipulable

3. Origine et technologies de séquençage

★ À maîtriser

  • Le séquençage Sanger lit une séquence, tandis que le séquençage de nouvelle génération produit des millions de lectures ensuite assemblées pour former des séquences de génomes ou de transcriptomes.

Compléments

  • Les EST sont des Expressed Sequence Tags historiques qui mesuraient l’expression génique.

  • Les centres de séquençage ont évolué du séquençage Sanger et Gilbert vers le Southern blot, les puces à ADN, le séquençage par électrophorèse capillaire, puis les technologies NGS.

Astuce mémo

Sanger → microarray → NGS short reads et long reads

4. Séquences recombinantes et tags

Notions clés & Définitions

  • Protéine de fusion : Résulte de l’expression conjointe d’une séquence codante d’intérêt et d’une séquence codant un tag, reliées éventuellement par un linker.

★ À maîtriser

  • Les tags utilisés comprennent GST, GFP, (his)*6 et FLAG, et peuvent être placés en position N-terminale ou C-terminale de la protéine d’intérêt.

Compléments

  • Une séquence d’ADN recombinant peut contenir des séquences plasmidiques, des mutations et des transcrits issus de gènes fusionnés avec un tag.

Astuce mémo

Un plasmide portant promoteur, gène, linker et tag

5. Gènes, ARN et maturation

Points essentiels

  • Tous les ARN ne codent pas des protéines : les ARN peuvent être codants, ribosomiques, de transfert ou de petits ARN et longs ARN non codants.

  • Les gènes eucaryotes comprennent généralement un promoteur, une région 5’UTR, des exons, des introns, une région codante et une région 3’UTR.

📌 Le ribosome s’arrête au premier codon STOP rencontré dans la phase de lecture, ce qui empêche la traduction des ORF suivantes dans cette phase.

Astuce mémo

Brin codant ≠ brin matrice ; exon ≠ intron

6. Variations et effets protéiques

★ À maîtriser

  • Une mutation faux-sens remplace un acide aminé, une mutation synonyme conserve le même acide aminé et une mutation non-sens introduit un codon STOP.

  • Une insertion ou une délétion d’un ou deux nucléotides dans une région codante provoque généralement un décalage de phase et peut introduire un codon STOP prématuré.

  • Une insertion ou une délétion d’un nombre de nucléotides multiple de trois dans une région codante ne provoque pas de décalage de phase.

Compléments

  • Une mutation située dans une région régulatrice peut modifier l’abondance du produit, tandis qu’un défaut d’épissage peut produire une isoforme protéique.

Astuce mémo

Indel multiple de trois : pas de frameshift ; sinon décalage

7. Outils d’analyse des séquences

Notions clés & Définitions

  • Cadre ouvert de lecture : Séquence située entre un codon ATG le plus en amont possible et un codon STOP dans la même phase, sans codon STOP intermédiaire.

★ À maîtriser

  • La traduction dans les six phases de lecture examine les phases +1, +2, +3 et les phases inverses −1, −2, −3.

  • Le format FASTA représente couramment une séquence par une ligne de description commençant par « > », suivie de la séquence.

Compléments

  • Les outils associés aux analyses sont:
    • RevSeq
    • Transeq
    • PlotORF
    • ShowORF
    • Needle
    • Water

Astuce mémo

Recherche → traduction → ORF → alignement → annotation

8. Organisation des bases biologiques

★ À maîtriser

  • Les bases biologiques organisent les données à l’aide d’identifiants uniques, de fichiers texte, de bases relationnelles et de requêtes SQL.

Compléments

  • Les références croisées relient une entrée à d’autres ressources, notamment PubMed par son identifiant PMID.

Astuce mémo

Explosion des séquences → centres de référence → bases interconnectées

9. Bases de données nucléiques

★ À maîtriser

  • Les principales bases nucléiques sont:

    • GenBank
    • EMBL-ENA
    • DDBJ
  • GenBank, EMBL-ENA et DDBJ sont des bases de soumission contenant des redondances, tandis que RefSeq regroupe des séquences similaires de transcrits pour limiter cette redondance.

  • Une fiche nucléotidique contient une séquence et des annotations, mais la séquence peut comporter des erreurs de séquençage ou de manipulation et les annotations peuvent être corrigées avec les nouvelles connaissances.

  • Dans les formats EMBL et GenBank, 136..1317 désigne les positions 136 à 1317, tandis que <1..30 et 540..>621 signalent respectivement une extrémité incomplète au début et à la fin.

Compléments

  • Une séquence soumise à l’EMBL peut se retrouver dans les trois banques nucléiques après échange des nouvelles soumissions toutes les 24 heures et reformatage propre à chaque banque.

Astuce mémo

GenBank–ENA–DDBJ échangent les nouvelles soumissions

10. Bases de données protéiques

★ À maîtriser

📌 UniProtKB/Swiss-Prot est non redondante et annotée manuellement, tandis qu’UniProtKB/TrEMBL est redondante et annotée automatiquement par traduction des CDS d’EMBL.

  • Les annotations UniProtKB comprennent notamment:
    • le nom de la protéine et du gène
    • la fonction
    • l’activité enzymatique
    • les domaines
    • la localisation cellulaire
    • la spécificité d’expression
    • les pathologies
    • les effets des mutations
    • les interactions moléculaires

Compléments

  • Les références croisées citées comprennent:

    • EMBL
    • SMART
    • Gene Ontology
    • PDB
    • OMIM
  • Dans UniProtKB, un numéro TaxID identifie l’organisme et le TaxID 9606 correspond à l’être humain.

Astuce mémo

Swiss-Prot revue manuelle ↔ TrEMBL traduction automatique

11. Domaines, ontologies et enzymes

Notions clés & Définitions

  • Domaine protéique : Unité structurale ou fonctionnelle répertoriée dans les protéines et considérée comme une pièce de l’évolution.
  • Ontologie : Ensemble structuré de termes et de concepts représentant un domaine de connaissances et les relations entre ces concepts.

★ À maîtriser

  • Gene Ontology utilise un vocabulaire contrôlé organisé en graphe acyclique dirigé, avec notamment les relations is_a et part_of.

  • Les trois composantes de Gene Ontology sont:

    • Cellular Component
    • Biological Process
    • Molecular Function

Compléments

  • La classification Enzyme Commission attribue des numéros EC aux enzymes et distingue six classes principales d’enzymes.

Astuce mémo

GO : CC, BP, MF

12. Structures et interprétation biologique

Notions clés & Définitions

  • Protein Data Bank : Collection mondiale de structures tridimensionnelles de macromolécules biologiques, principalement des protéines.
  • AlphaFold : AlphaFold — Système d’intelligence artificielle développé par DeepMind qui prédit la structure tridimensionnelle d’une protéine à partir de sa séquence primaire en acides aminés.

★ À maîtriser

  • Les structures déposées dans la PDB sont principalement déterminées par cristallographie aux rayons X ou par spectroscopie RMN.

Compléments

  • En septembre 2025, la PDB comptait 241 386 entrées structurales.

Astuce mémo

PDB expérimental ↔ AlphaFold prédictif

13. Navigateurs de génomes

★ À maîtriser

  • Les navigateurs de génomes cités sont UCSC et Ensembl, qui permettent notamment d’examiner des gènes, des transcrits, des régions comparées, la synténie, les orthologues et des références externes.

📌 L’interprétation biologique reste indispensable car les bases de données peuvent contenir des erreurs manuelles ou automatiques malgré leurs références croisées.

Compléments

  • Les pistes UCSC citées comprennent:

    • les gènes
    • RefSeq
    • dbSNP
    • OMIM
    • GTEx
    • les îlots CpG
    • les marques ChIP-seq
  • Les informations accessibles dans Ensembl comprennent:

    • la séquence du transcrit
    • les exons
    • l’ADNc
    • la protéine
    • les domaines et caractéristiques
    • les arbres de gènes
    • les orthologues

Tableaux de synthèse

Bases de données biologiques

DomaineBases principalesParticularité
NucléiqueGenBank, EMBL-ENA, DDBJSoumission et redondance
ProtéiqueUniProtKB/Swiss-Prot, UniProtKB/TrEMBLAnnotation manuelle ou automatique
Domaines et motifsInterPro, SMART, PrositeDomaines, familles et motifs
OntologieGene Ontology, ECConcepts biologiques ou classes enzymatiques
StructurePDB, AlphaFoldStructures expérimentales ou prédites

Outils d’analyse de séquences

ObjectifOutils citésRésultat
TraductionTranseq, PlotORF, ShowORFProtéines et cadres de lecture
Alignement globalNeedleAlignement de deux séquences sur toute leur longueur
Alignement localWaterRégions similaires locales
Recherche de similitudeBLASTSéquences homologues ou similaires
PCR et amorcesPrimer-BLAST, In silico PCRConception ou simulation de PCR

Teste tes connaissances

Teste tes connaissances sur Bioinformatique et bases biologiques avec 10 questions à choix multiples et corrections détaillées.

1. Concernant les fondements de la bioinformatique :

2. Qu'est-ce que la bioinformatique en tant que champ multidisciplinaire ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Bioinformatique et bases biologiques avec 11 flashcards interactives.

Qu'est-ce que la bioinformatique ?

Un champ multidisciplinaire utilisant informatique et mathématiques pour questions biologiques.

Définition bioinformatique

Champ utilisant informatique pour questions biologiques.

En quelle année Darwin a-t-il énoncé la théorie de l'évolution ?

En 1859.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches