Ein Data Lake bezeichnet einen zentralen Ort, an dem große Datenmengen in einem rohen, unstrukturierten Format zusammen mit Informationen über die Daten und eindeutigen Identifikatoren gespeichert werden. Dort werden Daten gespeichert, die später verarbeitet werden können, um wertvolle geschäftliche Erkenntnisse zu gewinnen und Ihr Unternehmen voranzubringen.
Diese flexible Organisation ermöglicht die Speicherung sowohl strukturierter als auch semistrukturierter Daten, ohne dass die Gefahr besteht, an proprietäre Systeme wie Data Warehouses gebunden zu sein. Das ist letztlich langlebiger und kostengünstiger, allerdings erfordern Data Lakes für die effektive Verwaltung und Verarbeitung der Daten fachkundige Betreuung.
So erstellen Sie einen Data Lake
Wenn Sie einen Data Lake für Ihr Unternehmen einrichten möchten, sollten Sie die folgenden Schritte berücksichtigen:
1. Wählen Sie eine flexible Cloud-Speicherlösung: Sie können Data Lakes auf Plattformen wie Amazon Web Services und Microsoft Azure einrichten. Durch die Nutzung eines dieser Dienste vermeiden Sie hohe Anfangskosten, da es sich um Cloud-Dienste handelt, bei denen nur die tatsächliche Nutzung abgerechnet wird.
2. Ermitteln Sie, woher Ihre Daten stammen: Es ist hilfreich, die Datenquellen und die Häufigkeit zu bestimmen, mit der neue Daten hinzugefügt werden. Sie können die Daten unverändert hinzufügen oder sie gemäß den Anforderungen Ihrer Organisation bereinigen.
3. Richten Sie Prozesse ein: Die Daten stammen aus verschiedenen Quellen. Sie können sich mit unterschiedlichen Abteilungen abstimmen, um die besten Verfahren, Workflows und Zeitpläne für die Veröffentlichung der Daten festzulegen.
4. Testen Sie den Data Lake: Es ist wichtig, Ihren Data Lake regelmäßig zu testen, um sicherzustellen, dass Sie Daten erfolgreich aus ihm abrufen und nutzen können. Dies ist besonders wichtig, um die Kontinuität zu gewährleisten, wenn sich die Anforderungen Ihres Unternehmens weiterentwickeln und verändern.
5. Nutzen Sie Ihre Daten: Nachdem Sie die oben genannten Schritte durchlaufen haben, verfügen Sie über ein System, mit dem Sie Ihre Daten effektiv erfassen können. Anschließend müssen Sie verschiedene Extrahieren-, Transformieren- und Laden-(ETL)-Prozesse nutzen, um aus Ihren Daten einen Mehrwert zu gewinnen. Dafür können Sie Data Warehouses und Visualisierungstools verwenden. Lösungen wie Microsoft Power BI und Tableau eignen sich, um die Zahlen auszuwerten und aus Ihren Rohdaten Erkenntnisse abzuleiten.
Data Warehouse vs. Data Lake
Obwohl Data Warehouses und Data Lakes denselben Zweck erfüllen, nämlich als Speicherorte für Daten zu dienen, gibt es einige wesentliche Unterschiede.
Erstens verfügt ein Data Warehouse über ein festgelegtes Datenlayout, bevor die Daten gelesen werden. Ein Data Lake hingegen kann Daten in jedem beliebigen Format aufnehmen. Bei einem Data Lake werden die Daten erst organisiert, nachdem sie gelesen wurden.
Data Lakes erfordern außerdem Nutzer mit Fachkenntnissen über verschiedene Datentypen, da die Daten unorganisiert und in unterschiedlichen Formaten vorliegen. Data Warehouses sind für ein breiteres Publikum zugänglicher, da ihre Struktur von vornherein klar definiert ist.
Die strukturierte Natur von Data Warehouses bedeutet jedoch, dass die Einrichtung mehr Zeit für Konfiguration und Anpassungen benötigt. Data Lakes lassen sich dagegen schneller und einfacher anpassen.
Vorteile von Data Lakes
Die Nutzung eines Data Lakes bietet zahlreiche Vorteile:
- Tiefere Einblicke in Geschäftstrends und -chancen
- Geringere Implementierungskosten durch Open-Source-Technologien wie Hadoop und Spark
- Keine notwendige Datenorganisation vor der Verarbeitung
- Flexiblere Analysemethoden
Herausforderungen von Data Lakes
Data Lakes bieten zwar zahlreiche Vorteile, dennoch sollten Sie sich auch der folgenden Herausforderungen bewusst sein:
- Risiko, zu einer Ablagestelle für Daten zu werden, die wertvolle Analysen verhindert
- Erfordert erfahrenere und sachkundigere Nutzer
- Die Kosten können ausufern, wenn die Data-Lake-Umgebung nicht kontrolliert wird
Data Lake in der Cloud vs. On-Premises
On-Premises
On-Premises-Data-Lakes bieten in der Regel eine hohe Leistung. Das bedeutet außerdem, dass vertrauliche Daten unter Ihrer Kontrolle bleiben und beim Zugriff auf die Daten weniger Latenzprobleme auftreten.
Eine On-Premises-Einrichtung bringt jedoch folgende Herausforderungen mit sich:
- Physische Server können viel physischen Platz beanspruchen
- Die Einrichtung kann kostspielig und zeitaufwendig sein
- Das Hinzufügen weiterer physischer Server kann schwierig sein, was die Skalierbarkeit einschränkt
Cloud
Data Lakes in der Cloud sind dagegen kostengünstiger, da Sie zu jedem Zeitpunkt nur für die tatsächlich genutzten Ressourcen bezahlen. Außerdem müssen Sie keine physischen Server einrichten. Dadurch lassen sich Cloud-Data-Lakes leichter skalieren, da keine zusätzliche Kapazität physischer Server hinzugefügt werden muss.
Allerdings sollten Sie sich auch der Herausforderungen cloudbasierter Data Lakes bewusst sein:
- Geringere Sicherheit für sensible Daten
- Weniger Kontrolle über Data Governance und Zugriffsrechte
Mehr auf eWeek: Warum Unternehmen mit Cloud-Data-Lakes kämpfen
Beispiele für Data Lakes
Um ein Gefühl für die praktischen Einsatzmöglichkeiten zu bekommen, ist es hilfreich, erfolgreiche Implementierungen von Data Lakes zu betrachten.
Sisense
Sisense nutzt das AWS-Ökosystem für seinen Data Lake. Das Unternehmen verfügt über mehr als 70 Milliarden Datensätze und nutzt seine Data-Lake-Architektur, um diese Daten effektiv zu verwalten. Mithilfe verschiedener Visualisierungstools, darunter der eigenen Visualisierungssoftware von Sisense, kann das Unternehmen aus den Daten einen Mehrwert gewinnen.
Depop
Depop ist eine in London ansässige Social-Shopping-App. Tausende Kunden, die die App für Nachrichten und Einkäufe nutzen, erzeugen einen kontinuierlichen Strom von Ereignissen und Daten. Das Unternehmen nutzt wiederum Amazon S3, um diesen riesigen Datenstrom zu verarbeiten und für seine Geschäftsentscheidungen zu verwenden.
ironSource
ironSource ist eine Plattform für die Monetarisierung innerhalb von Apps und Videowerbung. Sie verarbeitet Streamingdaten von Millionen von Endgeräten und benötigte daher eine Lösung für diesen massiven Datenzufluss. Das Unternehmen entschied sich für Upsolver, das Datenströme mit bis zu 500.000 Ereignissen pro Sekunde verarbeiten kann.
Peer39
Peer39 ist führend in der Werbe- und Digitalmarketingbranche. Das Unternehmen analysiert mehr als 450 Millionen Webseiten, um die tatsächliche Bedeutung der darin enthaltenen Texte zu erfassen. Dadurch erhalten Werbetreibende genauere Informationen und können ihr Werbebudget optimal einsetzen. Peer39 nutzt Upsolver, um diese riesige Datenmenge zu verarbeiten.
SimilarWeb
SimilarWeb ist ein Unternehmen für Marketing Intelligence, das Einblicke in die digitale Welt liefert. Dies erreicht es durch die Erfassung riesiger Datenmengen aus verschiedenen Quellen. SimilarWeb muss Tausende Terabyte an Daten analysieren und nutzt dafür eine Kombination aus Amazon S3, Amazon Athena und Upsolver.