Configuration des services HDFS/YARN et validation du cluster
Cluster Hadoop — HDFS et YARN en environnement de test
Mise en place d'un cluster Hadoop avec stockage distribué HDFS et ordonnancement YARN, validé en labo.
- HDFS
- stockage distribué OK
- YARN
- ressources / jobs OK
- lab
- environnement de test
Contexte
Environnement d'apprentissage / test pour comprendre le stockage distribué et la gestion de ressources d'un cluster de traitement de données — hors contexte de production.
Le problème
Faire cohabiter NameNode/DataNode (HDFS) et le gestionnaire de ressources YARN de façon cohérente : chemins, ports, rôles de nœuds, et preuve que le cluster accepte stockage et soumission de tâches.
L'approche
- Configuration des nœuds HDFS (NameNode / DataNode selon le setup retenu).
- Configuration YARN pour l'allocation de ressources et l'ordonnancement.
- Contrôles de santé (daemon up, rapports DataNode, ResourceManager) et tests de lecture/écriture HDFS.
- Validation qu'une charge / job de test peut être ordonnancé via YARN.
Pourquoi ce choix
HDFS + YARN forment le socle classique d'un cluster Hadoop : séparer persistance distribuée et scheduling évite de confondre « fichiers répliqués » et « CPU alloué ».
Résultat mesuré
- Cluster fonctionnel : HDFS opérationnel + YARN capable d'ordonnancer
- Setup de laboratoire — pas un datacenter ni une charge de production