Weiter zum Inhalt

Cloudera Hadoop Tutorial

Lerne das Hadoop-Ökosystem kennen, die Architekturen und wie du mit Cloudera startest.
Aktualisiert 18. Sept. 2026  · 15 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity
\n

Was ist Apache Hadoop?

\n

Hadoop ist ein Open-Source-Java-Framework für verteilte Anwendungen und datenintensives Management. Es ermöglicht Anwendungen, mit Tausenden Knoten und Petabytes an Daten zu arbeiten. Hadoop wurde von Googles Veröffentlichungen zu MapReduce, GoogleFS und Bigtable inspiriert.

\n

Dank des MapReduce-Frameworks lassen sich riesige Datenmengen verarbeiten. Statt Daten zur Verarbeitung über das Netzwerk zu bewegen, bringt MapReduce die Verarbeitung direkt zu den Daten.

\n

Hadoop ist kein Produkt im engeren Sinn, sondern ein Regelwerk für die Speicherung und Verarbeitung verteilter Daten. Verschiedene Softwareanbieter haben darauf aufbauend kommerzielle Big-Data-Produkte entwickelt.

\n

Hadoop-Datensysteme sind in ihrer Skalierung nicht begrenzt. Es können zusätzliche Hardware und Cluster hinzugefügt werden, um höhere Lasten zu bewältigen – ohne Neukonfiguration oder teure Softwarelizenzen.

\n\n

Cloudera wurde 2008 vom Mathematiker Jeff Hammerbacher mitgegründet, ehemals bei Bear Stearns und Facebook. Er leitete dort die Datenanalyse und entwickelte Programme für besseres Werbe-Targeting. Weitere Mitgründer sind Christophe Bisciglia (ehemals Google), Amr Awadallah (ehemals Yahoo, ebenfalls an Hadoop beteiligt) und Mike Olson, CEO von Cloudera. Chefarchitekt ist Doug Cutting, der Kopf hinter der Lucene-Suchmaschine und dem verteilten Hadoop-Framework.

\n

2018 fusionierte Cloudera mit dem Hauptkonkurrenten Hortonworks. Anschließend leitete das Unternehmen eine Neuausrichtung ein, um sich für die Cloud zu öffnen. Im Jahr 2021 wurde Cloudera von den Private-Equity-Fonds KKR und Clayton Dubilier & Rice für 5,3 Milliarden US-Dollar übernommen – eine solide Basis für weiteres Wachstum.

\n

Hadoop begann 2002 mit Doug Cutting und Mike Cafarella im Apache-Nutch-Projekt. Ziel war eine Suchmaschine, die eine Milliarde Seiten indexieren kann. Nach viel Forschung kamen sie zum Schluss, dass ein solches System rund eine halbe Million Dollar an Hardware und monatlich etwa 30.000 Dollar Betriebskosten erfordern würde – zu teuer. Die Architektur würde nicht mit Milliarden von Webseiten skalieren. Es musste eine Lösung her, die Implementierungskosten sowie Speicherung und Verarbeitung großer Datenmengen verbessert.

\n

2003 stießen sie auf Googles Paper zum verteilten Dateisystem GFS (Google File System) für die Speicherung sehr großer Datenvolumina. Es adressierte das Speicherproblem der riesigen Dateien aus Crawling und Indexierung – aber nur zur Hälfte.

\n

2004 veröffentlichte Google das Paper zur MapReduce-Technik – die zweite Hälfte der Lösung für große Datensätze. Diese Techniken (GFS und MapReduce) existierten bei Google nur als White Paper; es gab keine offene Implementierung. Doug Cutting wusste aus Apache-Lucene-Erfahrung, dass Open Source die beste Verbreitung ermöglicht. Zusammen mit Mike Cafarella begann er, GFS und MapReduce im Rahmen von Apache Nutch als Open Source umzusetzen.

\n

2005 stellte Cutting fest, dass Nutch auf 20–40 Knoten begrenzt war. Er erkannte zwei Probleme: (a) Nutch würde sein Potenzial erst auf sehr großen Clustern entfalten, (b) mit zwei Personen war das Vorhaben unrealistisch. Also suchte er ein Unternehmen, das investieren wollte. Yahoo! verfügte über ein starkes Engineering-Team mit großem Interesse.

\n

2006 wechselte Doug Cutting mit Nutch zu Yahoo. Ziel war ein verlässliches, skalierbares Open-Source-Rechenframework. Bei Yahoo trennte Cutting die verteilten Komponenten von Nutch ab und startete das neue Projekt Hadoop. Benannt nach dem gelben Stoffelefanten seines Sohnes – ein einzigartiges, leicht auszusprechendes Wort. Er entwickelte Hadoop so, dass es auf Tausenden Knoten gut funktioniert, auf Basis von GFS und MapReduce.

\n

2007 testete Yahoo Hadoop erfolgreich auf einem 1000-Knoten-Cluster und setzte es produktiv ein.

\n

Im Januar 2008 gab Yahoo Hadoop als Open-Source-Projekt an die Apache Software Foundation (ASF). Im Juli 2008 testete die ASF Hadoop erfolgreich auf 4000 Knoten.

\n

2009 gelang Hadoop das Sortieren eines Petabytes in weniger als 17 Stunden – für Milliarden Suchanfragen und das Indexieren von Millionen Webseiten. Doug Cutting verließ Yahoo und wechselte zu Cloudera, um Hadoop in weitere Branchen zu tragen.

Werde Dateningenieur

Werde ein Dateningenieur durch fortgeschrittenes Python-Lernen
Kostenloses Lernen Beginnen

Das Ökosystem von Apache Hadoop

\n

Hadoop wurde zum De-facto-Standard für die Datenverarbeitung – ähnlich wie Excel sich schrittweise als Standardsoftware für Datenanalyse etabliert hat. Anders als Excel wurde Hadoop jedoch von Entwicklerinnen und Entwicklern konzipiert und nicht von \"Business Analysts\". Dennoch hängen breite Akzeptanz und Erfolg eher von Business-Analysten ab als von Entwicklerteams. Deshalb wurden die Herausforderungen von Big Data funktional segmentiert und für jedes Segment auf Hadoop basierende Technologien entwickelt. All diese Werkzeuge bilden zusammen das sogenannte Hadoop-Ökosystem.

\n

Das Hadoop-Ökosystem erweitert Hadoop und macht es fähig, eine große Bandbreite geschäftlicher Probleme zu lösen. Heute umfasst es Hunderte Technologien, die wir gemäß ihrer Anwendungssegmente in 14 Kategorien bündeln: Abstraktionssprachen, SQL on Hadoop (Hive und Pig), Rechenmodelle (MapReduce und Tez), Werkzeuge für Echtzeitverarbeitung (Storm und Spark Streaming), Datenbanken (HBase und Cassandra), Streaming-Ingestion-Tools (Kafka und Flume), Datenintegrations-Tools (Sqoop und Talend), Workflow-Koordinatoren (Oozie und Control-M für Hadoop), Tools zur verteilten Dienstekoordination (ZooKeeper), Cluster-Administrations-Tools (Ranger und Sentry), Benutzeroberflächen (Hue und Jupyter), Inhaltsindizierung (Elasticsearch und Splunk), verteilte Dateisysteme (HDFS) und Ressourcenmanager (YARN und Mesos). In diesem Abschnitt schauen wir uns die Funktionen der wichtigsten Tools dieses Big-Data-Ökosystems an. Wenn du tiefer einsteigen willst, lies anschließend unsere Guides zu den einzelnen Hadoop-Ökosystem-Bausteinen, die auf diesen Artikel folgen. Die folgende Mindmap zeigt das Hadoop-Ökosystem im Überblick.

\n

Heuristische Karte des Hadoop-Ökosystems

\n
\"Heuristische
\n

Die Grundkonfiguration des Hadoop-Ökosystems enthält unter anderem folgende Technologien: Spark, Hive, Pig, HBase, Sqoop, Storm, ZooKeeper, Oozie und Kafka.

\n

Spark

\n

Bevor wir Spark erklären, erinnern wir uns: Damit ein Algorithmus auf einem Multi-Node-Cluster unter Hadoop laufen kann, muss er parallelisierbar sein. Ein Algorithmus gilt als \"skalierbar\", wenn er parallelisierbar ist und damit die Skalierung eines Clusters ausnutzen kann. Hadoop implementiert das Rechenmodell MapReduce. Dessen Problem: Es basiert auf einem gerichteten azyklischen Graphen. Anders gesagt, die MapReduce-Abfolge läuft strikt sequentiell in drei Phasen ohne Schleifen (Map -> Shuffle -> Reduce); keine Phase ist iterativ.

\n
\"Spark\"
\n

Dieses azyklische Modell passt nicht für bestimmte Anwendungen, vor allem wenn Daten über mehrere Operationen hinweg wiederverwendet werden – etwa bei vielen statistischen Lernverfahren, die iterativ ablaufen, oder bei interaktiven Analyseabfragen. Spark adressiert diese Einschränkungen: Es ist eine In-Memory-Compute-Engine für verteilte Verarbeitung im Cluster. Mit anderen Worten: eine verteilte In-Memory-Rechenengine. Im Vergleich zu MapReduce, das im Batch-Modus arbeitet, ermöglicht Spark interaktive Verarbeitung, lädt Daten vorab in den Speicher und ist dadurch sehr gut für Machine-Learning-Workloads geeignet.

\n

Hive

\n

Hive ist eine Data-Warehouse-ähnliche Recheninfrastruktur, die Abfrage- und Aggregationsdienste für sehr große Datenmengen auf verteilten Dateisystemen wie HDFS bereitstellt. Hive bietet eine SQL-basierte Abfragesprache (ANSI-92) namens HiveQL (Hive Query Language), mit der Daten auf HDFS adressiert werden. Fortgeschrittene Nutzer und Entwickler können Map- und Reduce-Funktionen direkt in ihre Abfragen integrieren, um ein breiteres Spektrum an Datenmanagement-Aufgaben abzudecken. Wenn du eine Abfrage in HiveQL schreibst, wird sie von Hive in einen MapReduce-Job transformiert und an den JobTracker zur Ausführung übergeben.

\n
\"Hive\"
\n

Pig

\n

Pig ist eine interaktive Datenfluss-Umgebung unter Hadoop. Sie besteht aus zwei Elementen: einer Datenfluss-Ausdruckssprache namens Pig Latin und einer interaktiven Ausführungsumgebung für Datenflüsse.

\n

Pig Latin ähnelt grob Skriptsprachen wie Perl, Python oder Ruby, ist aber spezifischer und lässt sich am besten als \"Data-Flow-Sprache\" beschreiben. Du formulierst damit sequentielle Datenflüsse von Quelldaten zu Zieldaten unter Hadoop – ähnlich einem ETL. Diese Flüsse werden in MapReduce-Funktionen übersetzt und schließlich an den JobTracker zur Ausführung übergeben. Kurz gesagt: Pig ist das ETL von Hadoop. In Pig Latin beschreibst du in voneinander unabhängigen, aber verschachtelten Streams, wie Daten geladen, transformiert und aggregiert werden – mit speziellen Pig-Anweisungen, den sogenannten Operatoren. Diese zu beherrschen ist der Schlüssel zu Pig Latin, zumal es davon weniger gibt als in Hive.

\n
\"Pig\"
\n

HBase

\n

Bevor wir zu HBase kommen, ein kurzer Rückblick: Klassische relationale Datenbanksysteme (RDBMS), die lange Zeit für das Datenmanagement genutzt wurden, stoßen bei großem Datenvolumen und hoher Datenvielfalt schnell an Grenzen. RDBMS sind für streng strukturierte Daten (Tabellen mit Zeilen/Spalten) entworfen; zudem erhöht wachsendes Volumen die Latenz von Abfragen. Diese Latenz ist für viele Anwendungsfälle mit nahezu Echtzeitanforderungen problematisch. Neue Datenbanksysteme, die sogenannten \"NoSQL\"-Datenbanken, wurden entwickelt, um diese Limitierungen zu adressieren. Sie erzwingen keine feste Struktur, verteilen Speicherung und Verwaltung über mehrere Knoten und sind skalierbar. Skalierbarkeit bedeutet, dass die Systemleistung bei steigender Last stabil bleibt. HBase gehört in diese Kategorie.

\n

HBase ist ein verteiltes, spaltenorientiertes Datenbanksystem, das Lese- und Schreibzugriffe in Echtzeit auf in HDFS gespeicherte Daten bereitstellt. HDFS ermöglicht sequentiellen Batchzugriff und ist für sehr schnelle Zugriffe wie beim Streaming ungeeignet; HBase schließt diese Lücke und liefert schnellen Zugriff auf HDFS-Daten.

\n

HBase basiert auf Googles \"Bigtable\" und kann extrem große Datenmengen speichern (Milliarden Zeilen/Spalten). Es hängt von ZooKeeper ab, einem verteilten Koordinationsdienst für Anwendungsentwicklung.

\n
\"HBase\"
\n

Sqoop

\n

Sqoop, kurz für SQL-to-Hadoop, ist ein Tool zum Transfer von Daten zwischen relationalen Datenbanken und dem HDFS von Hadoop – in beide Richtungen. Es ist in das Hadoop-Ökosystem integriert und fungiert als Planer für die Datenaufnahme in Hadoop. Du kannst mit Sqoop Daten aus RDBMS wie MySQL, Oracle oder SQL Server nach HDFS importieren, sie in Hadoop per MapReduce oder einem anderen Rechenmodell transformieren und zurück in das RDBMS exportieren. Wir sprechen von einem Aufnahme-Planer, weil Sqoop – ähnlich wie Oozie – diesen Import/Export-Prozess automatisiert und zeitlich terminiert. Alles, was du tun musst, ist die SQL-Abfragen für Import und Export zu schreiben. Sqoop nutzt MapReduce für Import und Export – effizient und fehlertolerant.

\n
\"Sqoop\"
\n

Storm

\n

Um Storm zu verstehen, hilft ein Blick auf das Konzept von Lambda-Architekturen (λ) und warum sie wichtig sind. Verbundene Geräte, das Internet of Things (IoT), erweitern das Internet in unseren Alltag. Dabei entstehen kontinuierliche Datenströme, die in vielen Fällen in Echtzeit verarbeitet werden müssen. Batch-Modelle sind für diese Echtzeitanforderungen ungeeignet; selbst interaktive Modelle sind nicht darauf ausgelegt, kontinuierlich und sofort zu verarbeiten. Anders als operative Daten aus Unternehmenssystemen wie Finanzen oder Marketing, die auch bei Streaming-Erzeugung historisiert und später verarbeitet werden können, verlieren viele IoT-Daten bereits kurz nach ihrer Entstehung ihren Wert und müssen unmittelbar verarbeitet werden. Neben IoT gibt es Use Cases wie Betrugsprävention, Social-Media-Analyse oder Geolokalisierung mit Antwortzeiten unter einer Sekunde. Für solche Big-Data-Probleme wurden Lambda-Architekturen entwickelt. Sie ergänzen MapReduce um zwei zusätzliche Schichten, um Latenzen zu reduzieren. Storm ist eine Software-Implementierung dieser Lambda-Architektur. Damit lassen sich unter Hadoop Daten in Echtzeit (oder nahezu Echtzeit) verarbeiten.

\n
\"Storm\"
\n

ZooKeeper

\n

Die Synchronisation bzw. Koordination der Kommunikation zwischen Knoten bei der Ausführung paralleler Aufgaben ist eine der schwierigsten Herausforderungen in verteilten Anwendungen. Um dieses Problem zu lösen, hat Hadoop Koordinationsdienste in sein Ökosystem aufgenommen – konkret ZooKeeper. ZooKeeper übernimmt die komplexe Synchronisation verteilter Jobs im Cluster, sodass andere Hadoop-Tools sich nicht selbst darum kümmern müssen. Es ermöglicht zudem, verteilte Anwendungen zu entwickeln, ohne Expertin oder Experte für verteilte Programmierung zu sein. Ohne in Details zur Datenkoordination in Hadoop-Clustern zu gehen: ZooKeeper stellt einen verteilten Konfigurationsdienst, einen Verteilungsdienst und ein Namensregister für verteilte Anwendungen bereit. Mit ZooKeeper koordiniert Hadoop seine verteilten Jobs.

\n
\"ZooKeeper\"
\n

Oozie

\n

Standardmäßig führt Hadoop Jobs in der Reihenfolge ihrer Einreichung aus, ohne ihre Abhängigkeiten zu berücksichtigen. In der Praxis erfordern viele Anwendungsfälle jedoch mehrere miteinander verknüpfte, komplexe Jobs. Werden zwei abhängige Jobs an den JobTracker (oder YARN) übergeben, führt dieser sie aus, ohne auf den Zusammenhang zu achten – Fehler und Abbrüche sind die Folge. Wie lässt sich die Ausführung mehrerer zusammenhängender Jobs steuern? Die derzeit einfachste Lösung ist ein Job-Scheduler – Oozie.

\n

Oozie ist ein als Service im Hadoop-Cluster laufender Job-Scheduler. Er plant Hadoop-Jobs und generell die Ausführung aller auf dem Cluster lauffähigen Jobs, etwa Hive-Skripte, MapReduce-, Hama- oder Storm-Jobs. Oozie ist dafür gemacht, die sofortige oder zeitverzögerte Ausführung Tausender abhängiger Jobs automatisch zu steuern. Für die Nutzung brauchst du zwei XML-Dateien: eine Oozie-Engine-Konfiguration und eine Workflow-Definition.

\n
\"Oozie\"
\n

Einführung in Cloudera

\n

Cloudera ist ein US-Unternehmen aus Kalifornien, das historisch eine auf dem verteilten Hadoop-Framework basierende Big-Data-Lösung entwickelt hat und sich inzwischen stark in Richtung Cloud orientiert. Seit über einem Jahr erweitert Cloudera seine Lösung auf den Public Clouds AWS, Azure und GCP.

\n

Einführung in CDP

\n

Die Cloudera Data Platform (CDP) ist eine Plattform, mit der Unternehmen Daten in hybriden Multi-Cloud-Umgebungen per Self-Service-Analytics auswerten können. Sie ermöglicht es Organisationen, mehr Wert aus allen Daten zu ziehen, indem in wenigen Stunden Datenlakes in der Cloud entstehen.

\n

CDP bietet integrierte, multifunktionale Self-Service-Tools zur Analyse und Zentralisierung von Daten. Außerdem stellt sie unternehmensweite Sicherheit und Governance bereit und kann in Public, Private und Multi-Cloud-Umgebungen betrieben werden. CDP ist die Nachfolge-Distribution der beiden früheren Hadoop-Distributionen von Cloudera: Cloudera Distribution of Hadoop (CDH) und Hortonworks Data Platform (HDP).

\n

Self-Service-Zugriff auf Unternehmensdaten steht im Mittelpunkt. Die neu hinzugefügten, in die Plattform integrierten Cloud-Services bieten Analysten, Data Scientists, IT-Teams und Entwicklern ebenfalls Self-Service-Zugriff auf Daten und Analysen. Die drei Cloud-nativen CDP-Merkmale, mit denen Cloudera sich vom Wettbewerb abhebt, sind: Self-Service, Multi-Cloud und Security.

\n

CDP bietet einen einzigartigen Public-Private-Ansatz, Echtzeitanalysen, skalierbare Bereitstellung on-premises, in der Cloud und hybrid sowie eine Privacy-First-Architektur.

\n

CDP Public Cloud

\n

CDP Public Cloud ist eine Platform-as-a-Service (PaaS), die mit Cloud-Infrastrukturen kompatibel ist und sich leicht zwischen verschiedenen Cloud-Anbietern portieren lässt – inklusive privater Lösungen wie OpenShift. CDP wurde vollständig hybrid und multi-cloud-fähig entwickelt, sodass eine einzige Plattform alle Use Cases über den gesamten Datenlebenszyklus managen kann. Die Plattform arbeitet mit Daten in unterschiedlichsten Setups, darunter AWS, Azure und GCP. Zudem kann sie Workloads und Ressourcen automatisch hoch- und herunterskalieren, um Performance zu verbessern und Kosten zu senken.

\n

CDP Public Cloud Services

\n

Die wichtigsten Komponenten der CDP Public Cloud sind:

\n
    \n
  1. \n

    CDP Data Engineering ist ein All-in-One-Setup auf Basis von Apache Spark. Es vereinfacht ETL-Prozesse für unternehmensweite Analyseteams, ermöglicht Orchestrierung und Automatisierung mit Apache Airflow und bietet ausgereiftes Pipeline-Monitoring, visuelles Debugging und Management-Tools. Außerdem stellt es isolierte Arbeitsumgebungen bereit und ist containerisiert, skalierbar und portabel.

    \n
  2. \n
  3. \n

    CDP Data Hub ist ein Service für hochwertige Analysen vom Edge bis zur KI. Der Cloudera Data Hub ist ein Cloud-nativer Service für Datenmanagement und Analytics. Er ermöglicht IT und Business-Developer-Teams, schneller Anwendungen für jeden Use Case zu bauen – von Streaming bis ETL. Datenmarts, Datenbanken und Machine Learning sind nur einige der abgedeckten Services im breiten Spektrum analytischer Workloads.

    \n
  4. \n
  5. \n

    CDP Data Warehouse ist ein Service, mit dem IT ein Cloud-natives Self-Service-Analytics-Erlebnis für BI-Analysten bereitstellt. Streaming, Data Engineering und Analytics sind vollständig integriert. Zudem gibt es ein einheitliches Framework, um alle Daten und Metadaten über Private, mehrere Public oder hybride Clouds hinweg zu sichern und zu steuern. Der Cloudera Data Warehouse Service erleichtert die Bereitstellung von Self-Service-Datenwarehouses für Analysten. Er basiert auf robusten, enterprise-erprobten SQL-Engines. Hunderte Nutzer können mit einem Klick auf Daten zugreifen – on-premises und in der Cloud. Ressourcen lassen sich bedarfsgerecht skalieren, und das Workload-Management erfolgt per Self-Service mit intuitiven Tools.

    \n
  6. \n
  7. \n

    CDP Machine Learning vereinfacht die Bereitstellung kollaborativer ML-Workspaces, damit Data Scientists Unternehmensdaten optimal nutzen können. Es optimiert ML-Workflows mit nativen, umfassenden Tools zum Deployen, Skalieren und Überwachen von Modellen. Organisationen können mit wenigen Klicks neue ML-Workspaces bereitstellen und so Self-Service-Zugriff auf Tools und Daten für ML-Workflows ermöglichen. Replikation on-premises oder in der Cloud gelingt schnell, ohne bei Security und Governance Abstriche zu machen. Data Scientists wählen ihre bevorzugten Tools und profitieren von elastischen Ressourcen nach Bedarf. Training, Data Engineering, Deployment und Modellmanagement erfolgen zügig in einer All-in-One-Oberfläche – ohne Plattformwechsel.

    \n
  8. \n
  9. \n

    Cloudera Data Visualization ermöglicht das Modellieren von Daten im virtuellen Data Warehouse, ohne zugrunde liegende Strukturen oder Tabellen zu verändern, und das Abfragen großer Datenmengen ohne ständiges Laden – das spart Zeit und Kosten.

    \n
  10. \n
  11. \n

    Cloudera Operational Database ist eine verwaltete Lösung, die die zugrunde liegende Cluster-Instanz zu einer Datenbank abstrahiert. Sie skaliert automatisch anhand der Cluster-Auslastung, steigert die Performance bei gleicher Infrastruktur und löst Betriebsprobleme automatisch.

    \n
  12. \n
\n

CDP Private Cloud

\n

CDP Private Cloud ist ideal für hybride Deployments. On-Premises-Umgebungen lassen sich mit Public Clouds verbinden – bei konsistenter, integrierter Sicherheit und Governance. In CDP Private Cloud sind Compute und Storage entkoppelt, sodass beide Cluster unabhängig skalieren. Auf einem CDP-Private-Cloud-Base-Cluster liefert die Cloudera Shared Data Experience (SDX) vereinheitlichte Sicherheit, Governance und Metadatenverwaltung. Nutzerinnen und Nutzer können Cloudera Data Warehousing und Cloudera Machine Learning schnell bereitstellen und bei Bedarf über die Management Console skalieren.

\n

CDP Private Cloud Services

\n

Einige Komponenten der CDP Public Cloud – etwa Machine Learning und Data Warehouse – sind auch in CDP Private Cloud verfügbar. Für traditionelle Workloads kommen mehrere Analyse-Engines zum Einsatz, die Streaming, Data Engineering, Datenmarts, operative Datenbanken und Data Science abdecken.

\n

Grundlagen von HDFS und MapReduce

\n

HDFS ist das verteilte Dateisystem von Hadoop und das zentrale Element von Hadoop. Es ermöglicht die Speicherung und Replikation von Daten auf mehreren Servern. In Kombination mit YARN erweitert es die Datenmanagement-Fähigkeiten des HDFS-Clusters und ermöglicht effiziente Big-Data-Verarbeitung.

\n

HDFS kann auf Standard-Hardware betrieben werden und ist dadurch sehr fehlertolerant. Jeder Datenblock wird mehrfach gespeichert und kann unter allen Umständen wiederhergestellt werden. Die Replikation schützt zudem vor potenzieller Datenkorruption.

\n

HDFS setzt auf einen NameNode und mehrere DataNodes. Ein DataNode ist ein Standardserver, auf dem Daten gespeichert sind. Der NameNode enthält die Metadaten (welche Daten auf welchen Knoten liegen). Anwendungen interagieren ausschließlich mit dem NameNode, der bei Bedarf mit den DataNodes kommuniziert.

\n

HDFS vermeidet außerdem Netzwerklast, indem es Rechenoperationen zu den Daten bringt statt Daten zu verschieben. Anwendungen greifen also dort auf Daten zu, wo sie gespeichert sind. Eine weitere Stärke ist die Portabilität: HDFS läuft auf unterschiedlichster Hardware ohne Kompatibilitätsprobleme.

\n

Was ist MapReduce und wie funktioniert es?

\n

MapReduce ist die Verarbeitungsschicht von Apache Hadoop, direkt abgeleitet von Googles MapReduce. Anwendungen werden im Wesentlichen in Java geschrieben. Durch eine Map- und eine Reduce-Phase lassen sich riesige Datenmengen effizient verarbeiten. In der Map-Phase wird ein Datensatz in einen anderen transformiert, indem Elemente in Schlüssel/Wert-Paare (Tupel) zerlegt werden. In der anschließenden Reduce-Phase werden die aus der Map-Phase stammenden Tupel zu kleineren, aggregierten Tupelmengen zusammengeführt.

\n
\"MapReduce\"
\n

MapReduce ist ein hochparalleles Framework, das sich auf massenhaft Standard-Hardware skalieren lässt, um den wachsenden Bedarf an Verarbeitung großer Datenmengen zu decken. Wenn Map- und Reduce-Aufgaben stabil laufen, reicht eine Konfigurationsänderung, um auf größeren Datensätzen zu arbeiten. Diese extreme Skalierbarkeit – von einem einzelnen Knoten bis zu Hunderten oder Tausenden – macht MapReduce weltweit beliebt bei Big-Data-Profis.

\n

MapReduce ermöglicht unter anderem:

\n
    \n
  • Parallele Verarbeitung für Big-Data-Aufgaben.
  • \n
  • Einsatz in einer großen Bandbreite kommerzieller Datenverarbeitungsanwendungen.
  • \n
  • Kosteneffektive, zentralisierte Verarbeitungsframeworks.
  • \n
  • Integration mit SQL zur Vereinfachung paralleler Verarbeitung.
  • \n
\n

Clouderas Distribution Including Apache Hadoop

\n

Cloudera ist einer der historischen Pure Player rund um Hadoop – neben Hortonworks und MapR. Das von Intel unterstützte Unternehmen entwickelt CDH, eine Hadoop-Distribution, die weitere Open-Source-Projekte wie Impala und Search einschließt. Zudem werden Sicherheits- und Integrationsfunktionen geboten.

\n

Impala ist eine interaktive SQL-Abfrage-Engine für direkte Abfragen auf in HDFS, Apache HBase oder AWS S3 gespeicherten Daten. Die Engine nutzt Technologien und Komponenten aus Hive, etwa die SQL-Syntax (HiveSQL), den ODBC-Treiber und die Query-UI.

\n

Die Search-Komponente basiert auf Apache Solr, einer auf Lucene aufbauenden Engine für Datenindizierung und -suche. Durch die Integration in CDH stehen etwa nahezu Echtzeit-Indizierung und der Zugriff auf Daten in Hadoop- oder HBase-Clustern zur Verfügung. Mit Solr sind komplexe Volltextsuchen möglich, ohne tiefgehende SQL-Kenntnisse. Daten in Hadoop lassen sich abfragen, ohne sie zuerst verschieben zu müssen.

\n

Cloudera bietet mehrere CDH-Editionen mit unterschiedlichen Funktionen für Service- und Cluster-Management sowie verschiedenem Supportumfang:

\n
    \n
  • Cloudera Express ist die kostenlose CDH-Version. Sie enthält die CDH-Komponenten und Kernfunktionen des Cloudera Managers. Zudem gibt es Zugriff auf eine 30-tägige Testversion der Enterprise-Edition.
  • \n
  • Cloudera Manager ist der Control Tower von CDH. Das Tool bietet eine webbasierte Admin-Konsole, um CDH-Deployments bereitzustellen, zu verwalten, zu überwachen und ihre Gesundheit zu prüfen. Außerdem gibt es eine API zur Konfiguration und zum Abruf von Metriken und Betriebsinformationen eines CDH-Clusters.
  • \n
  • Cloudera Enterprise ist die lizenzpflichtige Edition mit erweiterten Funktionen, darunter fortgeschrittene Tools aus Cloudera Manager und Navigator.
  • \n
  • Cloudera Manager Advanced Features ergänzt Cloudera Express um zentrale Funktionen: Betriebsberichte, Quotenmanagement, Konfigurationslogs, Rolling Updates, Service-Neustarts, Kerberos-Integration, LDAP-Integration, SNMP-Unterstützung und automatische Desaster Recovery.
  • \n
  • Cloudera Navigator (nur in den Editionen Flex und Data Hub) ermöglicht Sicherheits- und Governance-Management innerhalb einer CDH-Plattform. Das Tool unterstützt Compliance-Anforderungen. Datenverantwortliche, Analysten und Administratoren können große Datenmengen in Hadoop explorieren und Verschlüsselungsschlüssel für die Datensicherung im CDH-Cluster einfacher verwalten.
  • \n
\n

Für eine Proof-of-Concept-Umgebung lädst du zunächst den Cloudera Manager Server Installer herunter und führst ihn aus.

\n
    \n
      \n
    1. Öffne zuerst Cloudera Manager Downloads im Browser. Klicke im Kasten Cloudera Manager auf Download Now. Du kannst auch den Installer für deine Cloudera-Manager-Version laden, zum Beispiel für Cloudera Manager 6.3.3:
    2. \n
    \n
\n
\"Cloudera
\n
    \n
      \n
    1. Führe anschließend den Cloudera Manager Installer aus.
    2. \n
    \n
\n

Setze zuerst Ausführungsrechte für Cloudera-manager-installer.bin: chmod u+x Cloudera-manager-installer.bin

\n

Starte den Installer mit: sudo ./cloudera-manager-installer.bin --username=username --password=password

\n
    \n
  1. Lies die Lizenzbedingungen und akzeptiere sie.
  2. \n
\n

Der Installer führt dann Folgendes aus:

\n
    \n
  1. Installation der Cloudera-Manager-Repository-Dateien.
  2. \n
  3. Installation des Oracle JDK.
  4. \n
  5. Installation des Cloudera Manager Servers und der eingebetteten PostgreSQL-Pakete.
  6. \n
\n

Nach Abschluss wird die vollständige URL für die Cloudera Manager Admin Console inklusive Port (standardmäßig 7180) angezeigt. Notiere dir diese URL. Drücke dann Enter, um OK zu wählen, den Installer zu beenden und die erfolgreiche Installation zu bestätigen.

\n

Als Nächstes installierst du CDH mit dem Wizard.

\n
    \n
  • Gehe zur Cloudera Manager Admin Console, indem du dich anmeldest unter: HTTP://:7180, wobei die FQDN oder IP des Hosts ist, auf dem der Cloudera Manager Server läuft.
  • \n
  • Melde dich an der Cloudera Manager Admin Console an. Die Standardzugangsdaten sind:\n
      **Username**: admin\n  **Password**: admin\n
    \n
  • \n
\n
\"Cloudera
\n

Lies die Nutzungsbedingungen und akzeptiere sie. Klicke auf Continue, um den Installationsassistenten zu starten.

\n
\"Nutzungsbedingungen
\n

Der Installationsassistent von Cloudera Manager führt dich durch folgende Schritte: Select Edition Wähle die zu installierende Edition. Optional kannst du eine Lizenz einspielen.

\n
\"Edition
\n

Specify Hosts Wähle die Hosts, auf denen CDH und andere Services laufen. Select Repository Hier gilt:

\n
    \n
  • Wähle zunächst den Repository-Typ für die Installation. Für diesen Proof-of-Concept-Cluster wird \"Use Parcels\" empfohlen.
  • \n
  • Wähle dann die CDH-Version und zusätzliche Parcels aus, die du installieren möchtest.
  • \n
  • Wähle die Release-Version des Cloudera Manager Agent aus.
  • \n
  • Klicke auf Continue.
  • \n
\n
\"Repository
\n

Accept JDK License Mit der Installation der JDK-Software stimmst du der Oracle Binary Code License Agreement zu. Lies die Bedingungen, setze die Häkchen und klicke auf Continue.

\n

Enter Login Credentials Definiere Root-Account, Benutzername, Authentifizierungsmethode, SSH-Port und die Anzahl der Hosts.

\n

Install Agents Die Seite zeigt den Installationsfortschritt. Du kannst Details je Host aufklappen und die Logs einsehen.

\n

Install Parcels Die Seite zeigt den Fortschritt der zuvor gewählten Parcels. Ein Klick auf eine Fortschrittsleiste zeigt Details für den jeweiligen Host.

\n
\"Parcels
\n

Inspect Hosts Der Host Inspector sucht nach häufigen Konfigurationsproblemen. Prüfe die Ergebnisse, behebe etwaige Punkte und klicke anschließend auf Run Again, um die Resultate zu aktualisieren.

\n
\"Hosts
\n

Nach Abschluss dieser Schritte startet der Cluster-Setup-Assistent automatisch.

\n

Fazit

\n

Die Vorteile von Hadoop für Unternehmen sind enorm. Dank des verteilten Rechnens lassen sich große Datenmengen schnell speichern und verarbeiten. Daten und Anwendungen sind gegen Hardwareausfälle geschützt. Fällt ein Knoten aus, werden Jobs automatisch auf andere Knoten umgeleitet, sodass die verteilte Verarbeitung weiterläuft. Mehrere Kopien aller Daten werden automatisch gespeichert. Erfolgsbeispiele findest du hier. Aktuelle Themen aus der Data-Science-Welt gibt es in unserem Blog.

Lass dich für deine Traumrolle als Data Engineer zertifizieren

Unsere Zertifizierungsprogramme helfen dir, dich von anderen abzuheben und potenziellen Arbeitgebern zu beweisen, dass deine Fähigkeiten für den Job geeignet sind.

Hol Dir Deine Zertifizierung
Timeline mobile.png
Themen
Big Data
Datenwissenschaft
Datenkompetenz