Big Data — caractéristiques principales ?
Volume, Vélocité, Variété, Véracité, Valeur
Écosystème Spark — composantes clés ?
Spark SQL, Spark Streaming, MLlib, GraphX
Architecture Spark — modèle ?
Master/Slave avec Driver, Cluster Manager, Executors
Lazy Evaluation — mécanisme ?
Transformations enregistrées, actions déclenchent l’exécution
RDD — définition ?
Resilient Distributed Dataset, immuable et distribué
Transformations — rôle ?
Créer un nouveau RDD sans exécution immédiate
Actions — rôle ?
Lancer le calcul et renvoyer un résultat
DataFrame — structure ?
Table distribuée avec schéma, colonnes et lignes
Spark SQL — utilité ?
Manipuler données structurées avec requêtes SQL
Spark Streaming — principe ?
Traiter flux de données en temps réel
Fenêtrage — objectif ?
Regrouper événements par fenêtres temporelles
Watermark — fonction ?
Tolère événements tardifs avant fermeture de fenêtre
Checkpointing — but ?
Sauvegarder l’état pour reprise après crash
MLlib — étape préparatoire ?
Feature Engineering, encodage, assemblage de features
Feature Engineering — opérations clés ?
StringIndexer, OneHotEncoder, VectorAssembler
Algorithmes ML — exemples ?
Régression, Random Forest, KMeans, Logistic Regression
Pipeline ML — rôle ?
Chaîner étapes de préparation et entraînement
Model deployment — étape ?
Charger PipelineModel, transformer flux, écrire résultats
Deep Learning Spark — principe ?
Diffusion du modèle via broadcast, pandas_udf
Modes de sortie streaming — principaux ?
Append, Complete, Update
Teste tes connaissances avec un QCM de 20 questions sur Introduction à Spark et Big Data.
1. Quel est le rôle principal du Driver Program dans l’architecture distribuée de Spark ?
2. Quel composant convertit une colonne catégorielle en indices numériques appris lors du fit ?
Révisez le cours complet dans la fiche de révision de Introduction à Spark et Big Data.
Voir la fiche →Importe ton cours et l'IA génère des flashcards en 30 secondes.
Générateur de flashcards