Was ist ein Data Lakehouse?

Written By
Sam Ingalls
Sam Ingalls
May 24, 2022
4 minute read
ServerWatch content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More
A picture of a man looking at his screen with joy because this article is about data lakehouses which offer the best of both data warehouses and data lakes which address managing structured and unstructured data to produce business insights and analytics.

Ein Data Lakehouse ist ein Paradigma des Datenmanagements, das die Funktionen von Data Warehouse und Data Lake auf einer einheitlichen Plattform kombiniert, um die Speicherung strukturierter und unstrukturierter Daten zu optimieren.

Während Data Warehouses lange Zeit die Lösung für die Speicherung strukturierter Daten waren, führte die Datenexplosion der vergangenen Jahrzehnte dazu, dass Data Lakes riesige Mengen einzigartiger und unstrukturierter Datentypen speicherten.

Erst kürzlich begannen führende Anbieter von Datenbanksoftware und Speicherverwaltungslösungen, die neueste hybride Lösung für die Verwaltung des gesamten Datenbestands einer Organisation zu entwickeln und zu vermarkten.

Die Entwicklung der Datenpipeline: von Warehouses zu Lakes

Die Entwicklung von Data Lakehouses ist das Ergebnis einer Weiterentwicklung der Art und Weise, wie Unternehmen und Rechenzentren wachsende Mengen und unterschiedliche Datentypen verwalten.

Bevor sich Organisationen mit Data Lakehouses befassen, müssen sie zunächst deren Vorgänger kennen: Data Warehouses und Data Lakes.

Was ist ein Data Warehouse?

Seit den 1980er-Jahren sind Data Warehouses zweckgebundene Speicher für strukturierte Daten, die für Reporting und Business Intelligence (BI) verwendet werden. Standard-Data-Warehouses empfangen externe und operative Daten, die durch Extrahieren, Transformieren und Laden (ETL) gefiltert werden. Diese Software transformiert die strukturierten Daten effizient und speichert sie in einem Repository mit demselben Datenformat.

Was ist ein Data Lake?

Vor fast einem Jahrzehnt prägte James Dixon, CTO von Pentaho, den Begriff „Data Lake“, um ein Repository zu beschreiben, in dem Daten in ihrem Rohformat gespeichert werden. Anders als Data Warehouses, die strukturierte Daten speichern, enthalten Data Lakes das gesamte Spektrum strukturierter, semistrukturierter und unstrukturierter Daten und Datentypen. 

Advertisement

Obwohl Data Lakes für viele Anwendungsfälle in Unternehmen immer beliebter werden, eignen sie sich optimal für die Validierung von Data-Science-Anwendungen. Andere Inhalte eines Data Lakes durchlaufen dagegen eine ETL-Lösung zur Verwendung in einem Data Warehouse oder einer Echtzeit-Datenbank.

Vergleichen Sie die besten Data-Warehousing-Lösungen mit Druid vs. Dremio auf TechRepublic.

Probleme mit Data Warehouses und Data Lakes

Probleme von Data Warehouses: starr und proprietär

Da Data Warehouses strikten proprietären Formaten folgen, unterstützen sie nicht die Mischung neuer und unterschiedlicher Datentypen – darunter Video, Audio, Streaming und Deep-Learning-Modelle wie künstliche Intelligenz (KI) und maschinelles Lernen (ML).

Diese Unfähigkeit, unstrukturierte Daten zu verwalten, veranlasste Unternehmen, überschüssige Daten zu extrahieren und zu speichern, aus denen später Data Lakes entstehen sollten.

Probleme von Data Lakes: unkontrolliert und unzuverlässig

Obwohl sie Speicher für unstrukturierte Daten bieten, sind Data Lakes für unzuverlässige Datensümpfe bekannt. Im Vergleich zur Effizienz, die von Data Warehouses erwartet wird, performen Data Lakes meist schlecht und haben Schwierigkeiten, BI-Anwendungen zu unterstützen.

Data Warehouses und Data Lakes gemeinsam nutzen: Duplizierung

Seit dem Aufkommen von Data Lakes versuchen Organisationen, die Funktionen von Warehouse und Lake über zwei unterschiedliche Systeme und Teams zu nutzen. Traditionelle IT-Fachleute und Datenbankadministratoren verwalten das Warehouse, während Data Scientists sich darauf konzentrieren, das Potenzial des Lakes auszuschöpfen.

Dieses Nebeneinander von Data Warehouses und Lakes führt in Organisationen häufig zu Datenduplizierung, replizierten Prozessen und höheren Kosten. Das neueste Paradigma für Datenadministratoren, um diese Probleme zu lösen, ist das Data Lakehouse.

Erfahren Sie, wie Databricks Partnern den Zugriff auf seine Lakehouse-Plattform für Daten- und KI-Services ermöglicht auf Channel Insider.

Was ist ein Data Lakehouse?

Ein Data Lakehouse vereint Komponenten aus Data Warehouses und Data Lakes und stellt Administratoren einen zentralen Datenspeicher für BI, Data Science, Deep Learning und Streaming-Analysen bereit. Mit Data Lakehouses können Administratoren das gesamte Spektrum an Rohdaten über eine Oberfläche und mit einer Data Governance verwalten, die der herkömmlichen Verwaltung von Data Warehouses ähnelt.

Zu den allgemein anerkannten Funktionen von Data Lakehouses gehören:

  • Alle Daten (strukturiert, semistrukturiert und unstrukturiert) werden in einem einzigen Repository gespeichert
  • End-to-End-Streaming für Echtzeiteinblicke aus dem Daten-Repository
  • Direkter Zugriff für Administratoren auf Lese- und Schreibvorgänge für Daten
  • Entkopplung von Rechenleistung und Speicher für Skalierbarkeit und Mehrfachnutzung
  • Schemaunterstützung zur Etablierung von Data Governance
  • Indizierung und Datenkomprimierung zur Erhöhung der Abfragegeschwindigkeit
  • Unterstützung von Transaktionen mit Atomizität, Konsistenz, Isolation und Dauerhaftigkeit (ACID)
Advertisement

Durch die Konsolidierung mehrerer Systeme – Data Warehouse(s) und Data Lake(s) – in einem Data Lakehouse können Organisationen die Verwaltung von Schema und Data Governance vereinfachen und Redundanz, replizierte Prozesse und Betriebskosten reduzieren. Wie Data Lakes im Cloud-Zeitalter bieten Data Lakehouses kostengünstigen Speicher und umfassende Skalierbarkeit.

An infographic from Databricks showing the differences between data warehouses, lakes, and lakehouses.
An infographic from Databricks showing the differences between data warehouses, lakes, and lakehouses.

Die wichtigsten Anbieter von Data Lakehouses

ClouderaCouchbase
DatabricksDataStax
DremioIBM
Neo4jRedis
SnowflakeTigerGraph

Sehen Sie, warum IBM ServerWatchs Top Data Fabric Solutions bietet.

Data Lakehouses: das Beste aus beiden Welten

Data Lakehouses schaffen eine Brücke für die Zusammenarbeit zwischen den Stakeholdern des Datenmanagements einer Organisation. Obwohl es sich um ein neueres Konzept handelt, ist die Hoffnung auf eine einheitliche Lösung für die Verwaltung strukturierter und unstrukturierter Daten lebendig. Auf dem aufstrebenden Markt bauen mehrere namhafte Anbieter ihre Data-Lakehouse-Funktionen aus.

Behalten Sie im Blick, was die nächste Generation von Datenmanagementlösungen bringen wird.

Vervollständigen Sie diesen Überblick über Data Lakehouses mit den fünf Dingen, die Sie laut TechRepublic wissen müssen:

Zusätzliche Berichterstattung

Sam Ingalls

Sam Ingalls

Content Writer

Sam Ingalls is an award-winning writer and researcher covering enterprise technology, cybersecurity, data centers, and IT trends, for eSecurity Planet, Tech Republic, ServerWatch, Webopedia, and Channel Insider.

ServerWatch Logo

ServerWatch is a top resource on servers. Explore the latest news, reviews and guides for server administrators now.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.