Configuration des services HDFS/YARN et validation du cluster

Cluster Hadoop — HDFS et YARN en environnement de test

Mise en place d'un cluster Hadoop avec stockage distribué HDFS et ordonnancement YARN, validé en labo.

HDFS
stockage distribué OK
YARN
ressources / jobs OK
lab
environnement de test

Contexte

Environnement d'apprentissage / test pour comprendre le stockage distribué et la gestion de ressources d'un cluster de traitement de données — hors contexte de production.

Le problème

Faire cohabiter NameNode/DataNode (HDFS) et le gestionnaire de ressources YARN de façon cohérente : chemins, ports, rôles de nœuds, et preuve que le cluster accepte stockage et soumission de tâches.

L'approche

  • Configuration des nœuds HDFS (NameNode / DataNode selon le setup retenu).
  • Configuration YARN pour l'allocation de ressources et l'ordonnancement.
  • Contrôles de santé (daemon up, rapports DataNode, ResourceManager) et tests de lecture/écriture HDFS.
  • Validation qu'une charge / job de test peut être ordonnancé via YARN.

Pourquoi ce choix

HDFS + YARN forment le socle classique d'un cluster Hadoop : séparer persistance distribuée et scheduling évite de confondre « fichiers répliqués » et « CPU alloué ».

Résultat mesuré

  • Cluster fonctionnel : HDFS opérationnel + YARN capable d'ordonnancer
  • Setup de laboratoire — pas un datacenter ni une charge de production