5V de Big Data : V O Vélocité Variété Véracité Valeur (V=Volume, V=Vélocité, V=Variété, V=Véracité, V=Valeur).
5V = Volume Vélocité Variété Véracité Valeur : Volume+Vélocité arrivent vite, variété change, véracité manque parfois, valeur justifie le projet.
Lazy = j’écris la recette ; Action = je cuisine et je ramène le résultat au Driver.
Broadcast = dictionnaire distribué une fois ; Accumulateur = compteur global fiable en distribué.
Native en JVM > Pandas UDF en blocs (Arrow) > UDF Python boîte noire (pas d’optimisation Catalyst).
Append=ajoute, Complete=réécrit tout, Update=met à jour seulement les lignes changées.
Watermark (1 minute) = “retard accepté” avant de fermer les fenêtres.
Indexer → OneHot → Assembler : Catégories → indices → vecteur features.
Continue→Régression linéaire, Beaucoup d’arbres→Random Forest, Groupes→K-means, Probabilité→Logistic(sigmoïde, seuil 0.5).
Broadcast = “je l’envoie une fois” : le modèle (ou ses poids) part du driver vers tous les workers, puis chaque worker prédit son lot avec une pandas_udf.
| Date | Événement |
|---|---|
| 2026-03-01 | Date de vente dans le fichier ventes_v2.csv du TP 5 |
| 2026-03-02 | Date de vente dans le fichier ventes_v2.csv du TP 5 |
| 2026-03-03 | Date de vente dans le fichier ventes_v2.csv du TP 5 |
| 2026-03-04 | Date de vente dans le fichier ventes_v2.csv du TP 5 |
| 2026-03-05 | Date de vente dans le fichier ventes_v2.csv du TP 5 |
| Mode | Écriture | Cas typique |
|---|---|---|
| Append | Uniquement les nouvelles lignes apparues depuis le dernier déclenchement | Flux sans besoin de réécrire tout le résultat |
| Complete | Réécrit toute la table de résultat à chaque micro-batch | Nécessaire pour les agrégations |
| Update | Écrit uniquement les lignes dont la valeur a changé depuis le dernier déclenchement | Idéal pour mettre à jour les totaux en temps réel |
| Terme | Rôle | Méthode clé |
|---|---|---|
| Transformer | Transforme un DataFrame en un autre DataFrame | .transform() |
| Estimator | Apprend en ajustant sur les données puis fournit un Model | .fit() |
| Pipeline | Enchaîne plusieurs étapes (pour éviter la divergence entre train/test) | pipeline.fit(train_df) |
Teste tes connaissances sur Introduction à Spark et Big Data avec 20 questions à choix multiples et corrections détaillées.
1. Quel est le rôle principal du Driver Program dans l’architecture distribuée de Spark ?
2. Quel composant convertit une colonne catégorielle en indices numériques appris lors du fit ?
Mémorisez les concepts clés de Introduction à Spark et Big Data avec 20 flashcards interactives.
Big Data — caractéristiques principales ?
Volume, Vélocité, Variété, Véracité, Valeur
Écosystème Spark — composantes clés ?
Spark SQL, Spark Streaming, MLlib, GraphX
Architecture Spark — modèle ?
Master/Slave avec Driver, Cluster Manager, Executors
Importe ton cours et l'IA génère fiches, QCM et flashcards en 30 secondes.
Générateur de fiches