Fiche de révision : Formules R pour l’analyse statistique

Plan du Cours

  1. Démarrer avec R
  2. Décrire les données
  3. Extraire et filtrer
  4. Statistiques descriptives
  5. Statistiques par groupe
  6. Graphiques univariés
  7. Personnaliser les graphiques
  8. Deux variables quantitatives
  9. Résoudre les erreurs

1. Démarrer avec R

★ À maîtriser

  • 🔄 Pour commencer une analyse avec les jeux de données de MASS, il faut suivre ces étapes:
    1. Lancer library(MASS)
    2. Consulter l'aide avec ?nom
    3. Définir le répertoire avec setwd("chemin")
    4. Importer le fichier avec read.table("f.csv", header=TRUE, sep=";", dec=",", row.names=1)

📌 Dans read.table, header=TRUE indique que la première ligne contient les noms, sep définit le séparateur de colonnes, dec le séparateur décimal et row.names=1 utilise la première colonne comme noms de lignes.

Compléments

  • L'affectation d <- Aids2 stocke le jeu de données Aids2 sous le nom d, tandis que stringsAsFactors=TRUE transforme les chaînes de caractères en variables qualitatives et que # texte introduit un commentaire non exécuté.

Astuce mémo

Charger, documenter, configurer, importer

2. Décrire les données

★ À maîtriser

  • 🔄 Les principales commandes de description sont: dim(d) donne les dimensions, nrow(d) et ncol(d) donnent séparément le nombre de lignes et de colonnes, str(d) affiche le type des variables, names(d) et rownames(d) affichent les noms

📌 Une variable qualitative contient des catégories, une variable quantitative discrète contient un nombre limité d'entiers et une variable quantitative continue contient des mesures telles que le poids, la taille ou des dates.

Compléments

  • head(d) affiche les 6 premières lignes, levels(d$x) affiche les modalités d'une variable qualitative et factor(d$x) transforme une variable codée 0/1 en variable qualitative.

Astuce mémo

Qualitative = catégories ; quantitative = mesures ou dénombrements

3. Extraire et filtrer

★ À maîtriser

  • L'extraction dans un tableau utilise d[i, ] pour une ligne, d[, j] pour une colonne, d[i, j] pour une valeur, d$x pour une variable nommée et d["France", ] pour une ligne nommée.

  • subset(d, x > 10 & sex == "F") extrait les individus répondant à plusieurs conditions, tandis que which(d$x > 10) donne leurs numéros et sum(d$x > 10) compte ces individus.

📌 Les opérateurs >, >=, <, <=, == et != comparent des valeurs, tandis que &, | et ! combinent respectivement les conditions par ET, OU et NON.

Compléments

📌 attach(d) permet d'écrire x au lieu de d$x, et detach(d) annule ensuite cette recherche simplifiée des variables.

4. Statistiques descriptives

★ À maîtriser

  • table(x) calcule les effectifs des modalités, prop.table(table(x)) calcule leurs fréquences, et names(which.max(table(x))) donne la modalité la plus fréquente.

  • summary(x) fournit le minimum, le premier quartile, la médiane, la moyenne, le troisième quartile, le maximum et le nombre de valeurs manquantes éventuelles.

  • L'étendue d'une variable se calcule par max⁡(x)−min⁡(x)\max(x)-\min(x) ou par diff(range(x)), tandis que l'écart interquartile vaut Q3−Q1Q3-Q1.

Compléments

  • var(x) calcule la variance, sd(x) calcule l'écart-type qui est la racine de la variance, et round(x, 2) arrondit une valeur à 2 décimales.

5. Statistiques par groupe

★ À maîtriser

  • mean(d$$y[d$$g == "A"]) calcule une statistique pour un seul groupe, tandis que tapply(d$$y, d$$g, mean) applique la moyenne à chaque groupe et peut être remplacé par summary, var ou sd.

Compléments

  • sapply(d[, 1:4], var) applique la variance à chaque colonne et sapply(d[, 1:4], function(x) diff(range(x))) calcule l'étendue de chaque colonne.

  • by(d[, 1:4], d$g, cor) applique une fonction à un tableau groupe par groupe, tandis que colMeans(d[, 1:4]) calcule la moyenne de chaque colonne.

6. Graphiques univariés

★ À maîtriser

  • boxplot(y ~ g, data=d) produit des boîtes à moustaches côte à côte de y pour chaque groupe g, tandis que boxplot(d[, 1:4]) produit une boîte par colonne.

📌 Une variable qualitative ou quantitative discrète se représente par un diagramme en bâtons, tandis qu'une variable quantitative continue se représente par un histogramme ou une boîte à moustaches.

  • barplot(table(x)) produit un diagramme en bâtons, pie(table(x)) un camembert, hist(x) un histogramme et boxplot(x) une boîte à moustaches affichant notamment la médiane, les quartiles et les valeurs atypiques.

Compléments

  • boxplot.stats(x)$out extrait les valeurs atypiques d'un boxplot et length(v) compte le nombre d'éléments, notamment le nombre de valeurs atypiques.

Astuce mémo

Qualitative ou discrète = bâtons ; continue = histogramme ou boîte

7. Personnaliser les graphiques

★ À maîtriser

  • Les options main, xlab et ylab ajoutent respectivement un titre, un nom à l'axe des abscisses et un nom à l'axe des ordonnées, tandis que col définit la couleur et names les étiquettes.

Compléments

  • par(mfrow=c(1, 2)) affiche plusieurs graphiques dans une fenêtre de 1 ligne et 2 colonnes, puis par(mfrow=c(1, 1)) rétablit un seul graphique par fenêtre.

  • pch=20 définit la forme des points, xlim=c(a,b) et ylim=c(a,b) fixent les bornes des axes, et col=d$g attribue une couleur selon le groupe.

8. Deux variables quantitatives

Points essentiels

📌 Une corrélation de Pearson proche de celle de Spearman suggère une liaison linéaire, tandis qu'une corrélation de Spearman nettement supérieure suggère une liaison non linéaire ; le nuage de points doit toujours être vérifié.

  • plot(x, y) et plot(y ~ x, data=d) produisent un nuage de points de y en fonction de x, avec x en abscisse, tandis que pairs(d[, 1:4]) affiche tous les nuages de points deux à deux.

📌 cor(x, y) calcule la corrélation de Pearson, qui mesure une liaison linéaire, tandis que cor(x, y, method="spearman") calcule la corrélation de Spearman, qui mesure une liaison monotone.

  • Dans une corrélation, un signe positif indique une liaison croissante et un signe négatif une liaison décroissante ; une valeur absolue supérieure à 0,7 indique une liaison forte, comprise entre 0,3 et 0,7 une liaison modérée, et inférieure à 0,3 une liaison faible.

Astuce mémo

Pearson mesure le linéaire ; Spearman mesure le monotone

9. Résoudre les erreurs

★ À maîtriser

📌 Un objet introuvable peut provenir d'un oubli de library(MASS) ou d'une faute de frappe, et R distingue les majuscules des minuscules.

📌 Un résultat NA dû à des valeurs manquantes se traite avec na.rm=TRUE dans les statistiques ou use="complete.obs" dans cor.

Compléments

📌 Un résultat vide peut venir d'un nom de modalité mal écrit, qu'il faut vérifier avec levels() ou table(), tandis qu'un fichier introuvable nécessite de vérifier le répertoire avec getwd() et list.files().

Astuce mémo

Oubli, données manquantes ou mauvais nom → objet introuvable, NA ou résultat vide

Tableaux de synthèse

Choisir un graphique selon la variable

Type de variableGraphiqueCommande
Qualitative ou discrèteDiagramme en bâtonsbarplot(table(x))
QualitativeCamembertpie(table(x))
Quantitative continueHistogrammehist(x)
QuantitativeBoîte à moustachesboxplot(x)
Quantitative par groupeBoîtes côte à côteboxplot(y ~ g, data=d)

Teste tes connaissances

Teste tes connaissances sur Formules R pour l’analyse statistique avec 23 questions à choix multiples et corrections détaillées.

1. Quelle séquence permet de préparer une analyse d’un fichier CSV avec les jeux de données de MASS dans R ?

2. Dans read.table, que signifie l’argument row.names=1 ?

Faire le QCM →

Révisez avec les flashcards

Mémorisez les concepts clés de Formules R pour l’analyse statistique avec 60 flashcards interactives.

Quelle commande lance la bibliothèque MASS en R ?

library(MASS) lance la bibliothèque MASS.

Que fait l'argument header=TRUE dans read.table ?

Il indique que la première ligne contient les noms.

Que fait l'affectation d <- Aids2 en R ?

Elle stocke le jeu de données Aids2 sous le nom d.

Voir les flashcards →

Cours similaires

Crée tes propres fiches de révision

Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.

Générateur de fiches