★ À maîtriser
library(MASS)?nomsetwd("chemin")read.table("f.csv", header=TRUE, sep=";", dec=",", row.names=1)📌 Dans
read.table,header=TRUEindique que la première ligne contient les noms,sepdéfinit le séparateur de colonnes,decle séparateur décimal etrow.names=1utilise la première colonne comme noms de lignes.
Compléments
d <- Aids2 stocke le jeu de données Aids2 sous le nom d, tandis que stringsAsFactors=TRUE transforme les chaînes de caractères en variables qualitatives et que # texte introduit un commentaire non exécuté.Charger, documenter, configurer, importer
★ À maîtriser
dim(d) donne les dimensions, nrow(d) et ncol(d) donnent séparément le nombre de lignes et de colonnes, str(d) affiche le type des variables, names(d) et rownames(d) affichent les noms📌 Une variable qualitative contient des catégories, une variable quantitative discrète contient un nombre limité d'entiers et une variable quantitative continue contient des mesures telles que le poids, la taille ou des dates.
Compléments
head(d) affiche les 6 premières lignes, levels(d$x) affiche les modalités d'une variable qualitative et factor(d$x) transforme une variable codée 0/1 en variable qualitative.Qualitative = catégories ; quantitative = mesures ou dénombrements
★ À maîtriser
L'extraction dans un tableau utilise d[i, ] pour une ligne, d[, j] pour une colonne, d[i, j] pour une valeur, d$x pour une variable nommée et d["France", ] pour une ligne nommée.
subset(d, x > 10 & sex == "F") extrait les individus répondant à plusieurs conditions, tandis que which(d$x > 10) donne leurs numéros et sum(d$x > 10) compte ces individus.
📌 Les opérateurs
>,>=,<,<=,==et!=comparent des valeurs, tandis que&,|et!combinent respectivement les conditions par ET, OU et NON.
Compléments
📌
attach(d)permet d'écrirexau lieu ded$x, etdetach(d)annule ensuite cette recherche simplifiée des variables.
★ À maîtriser
table(x) calcule les effectifs des modalités, prop.table(table(x)) calcule leurs fréquences, et names(which.max(table(x))) donne la modalité la plus fréquente.
summary(x) fournit le minimum, le premier quartile, la médiane, la moyenne, le troisième quartile, le maximum et le nombre de valeurs manquantes éventuelles.
L'étendue d'une variable se calcule par ou par diff(range(x)), tandis que l'écart interquartile vaut .
Compléments
var(x) calcule la variance, sd(x) calcule l'écart-type qui est la racine de la variance, et round(x, 2) arrondit une valeur à 2 décimales.★ À maîtriser
mean(d$$y[d$$g == "A"]) calcule une statistique pour un seul groupe, tandis que tapply(d$$y, d$$g, mean) applique la moyenne à chaque groupe et peut être remplacé par summary, var ou sd.Compléments
sapply(d[, 1:4], var) applique la variance à chaque colonne et sapply(d[, 1:4], function(x) diff(range(x))) calcule l'étendue de chaque colonne.
by(d[, 1:4], d$g, cor) applique une fonction à un tableau groupe par groupe, tandis que colMeans(d[, 1:4]) calcule la moyenne de chaque colonne.
★ À maîtriser
boxplot(y ~ g, data=d) produit des boîtes à moustaches côte à côte de y pour chaque groupe g, tandis que boxplot(d[, 1:4]) produit une boîte par colonne.📌 Une variable qualitative ou quantitative discrète se représente par un diagramme en bâtons, tandis qu'une variable quantitative continue se représente par un histogramme ou une boîte à moustaches.
barplot(table(x)) produit un diagramme en bâtons, pie(table(x)) un camembert, hist(x) un histogramme et boxplot(x) une boîte à moustaches affichant notamment la médiane, les quartiles et les valeurs atypiques.Compléments
boxplot.stats(x)$out extrait les valeurs atypiques d'un boxplot et length(v) compte le nombre d'éléments, notamment le nombre de valeurs atypiques.Qualitative ou discrète = bâtons ; continue = histogramme ou boîte
★ À maîtriser
main, xlab et ylab ajoutent respectivement un titre, un nom à l'axe des abscisses et un nom à l'axe des ordonnées, tandis que col définit la couleur et names les étiquettes.Compléments
par(mfrow=c(1, 2)) affiche plusieurs graphiques dans une fenêtre de 1 ligne et 2 colonnes, puis par(mfrow=c(1, 1)) rétablit un seul graphique par fenêtre.
pch=20 définit la forme des points, xlim=c(a,b) et ylim=c(a,b) fixent les bornes des axes, et col=d$g attribue une couleur selon le groupe.
📌 Une corrélation de Pearson proche de celle de Spearman suggère une liaison linéaire, tandis qu'une corrélation de Spearman nettement supérieure suggère une liaison non linéaire ; le nuage de points doit toujours être vérifié.
plot(x, y) et plot(y ~ x, data=d) produisent un nuage de points de y en fonction de x, avec x en abscisse, tandis que pairs(d[, 1:4]) affiche tous les nuages de points deux à deux.📌
cor(x, y)calcule la corrélation de Pearson, qui mesure une liaison linéaire, tandis quecor(x, y, method="spearman")calcule la corrélation de Spearman, qui mesure une liaison monotone.
Pearson mesure le linéaire ; Spearman mesure le monotone
★ À maîtriser
📌 Un objet introuvable peut provenir d'un oubli de
library(MASS)ou d'une faute de frappe, et R distingue les majuscules des minuscules.
📌 Un résultat
NAdû à des valeurs manquantes se traite avecna.rm=TRUEdans les statistiques ouuse="complete.obs"danscor.
Compléments
📌 Un résultat vide peut venir d'un nom de modalité mal écrit, qu'il faut vérifier avec
levels()outable(), tandis qu'un fichier introuvable nécessite de vérifier le répertoire avecgetwd()etlist.files().
Oubli, données manquantes ou mauvais nom → objet introuvable, NA ou résultat vide
Choisir un graphique selon la variable
| Type de variable | Graphique | Commande |
|---|---|---|
| Qualitative ou discrète | Diagramme en bâtons | barplot(table(x)) |
| Qualitative | Camembert | pie(table(x)) |
| Quantitative continue | Histogramme | hist(x) |
| Quantitative | Boîte à moustaches | boxplot(x) |
| Quantitative par groupe | Boîtes côte à côte | boxplot(y ~ g, data=d) |
Teste tes connaissances sur Formules R pour l’analyse statistique avec 23 questions à choix multiples et corrections détaillées.
1. Quelle séquence permet de préparer une analyse d’un fichier CSV avec les jeux de données de MASS dans R ?
2. Dans read.table, que signifie l’argument row.names=1 ?
Mémorisez les concepts clés de Formules R pour l’analyse statistique avec 60 flashcards interactives.
Quelle commande lance la bibliothèque MASS en R ?
library(MASS) lance la bibliothèque MASS.
Que fait l'argument header=TRUE dans read.table ?
Il indique que la première ligne contient les noms.
Que fait l'affectation d <- Aids2 en R ?
Elle stocke le jeu de données Aids2 sous le nom d.
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches