Strukturierte und unstrukturierte Daten sind die beiden Hauptkategorien von Daten. Da wir im Informationszeitalter leben, sind Daten der wichtigste Bestandteil unseres täglichen Lebens, und jede Entscheidung, die wir treffen, basiert auf die eine oder andere Weise auf Daten.
In diesem Artikel geht es um strukturierte Daten, unstrukturierte Daten und die Unterschiede zwischen ihnen.
Mehr lesen: Die besten Data-Fabric-Softwarelösungen 2021
Was sind strukturierte Daten?
Strukturierte Daten sind Daten, die nach einem vordefinierten Modell strukturiert oder auf vordefinierte Weise organisiert sind. Laut Google sind „strukturierte Daten ein standardisiertes Format zur Bereitstellung von Informationen über eine Seite und zur Klassifizierung des Seiteninhalts“. Structured Query Language (SQL) wird zur Verwaltung strukturierter Daten in relationalen Datenbanken verwendet. Die zunächst SEQUEL genannte Sprache wurde Anfang der 1970er-Jahre bei IBM von Donald D. Chamberlin und Raymond F. Boyce entwickelt.
Benutzer können strukturierte Daten bereits mit grundlegenden Kenntnissen des Themas problemlos aufrufen und interpretieren.
Über SQL können Benutzer strukturierte Daten bereits mit grundlegenden Kenntnissen des Themas problemlos aufrufen und interpretieren. Die spezifische Architektur strukturierter Daten erleichtert beispielsweise die Bearbeitung und Abfrage von Algorithmen des maschinellen Lernens (ML). Bei der Suchmaschinenoptimierung (SEO) sind strukturierte Daten das Markup, das Suchmaschinen hilft, die Interpretation und Darstellung der Inhalte zu verstehen.
Strukturierte Daten werden in der Regel in einem relationalen Datenbankmanagementsystem (RDBMS) gespeichert. Zu den häufigen Anwendungen einer relationalen Datenbank mit strukturierten Daten zählen Geldautomatenaktivitäten, Flugreservierungssysteme und Verkaufstransaktionen. Darüber hinaus sind Möglichkeiten zum Schutz strukturierter Daten leicht verfügbar und verständlich. Datenbanken bieten Zugriffskontrolltools und -techniken, die die Sicherheit strukturierter Daten verbessern.
Mehr lesen: Best Practices für die SQL-Performanceoptimierung
Was sind unstrukturierte Daten?
Unstrukturierte Daten sind Daten, die entweder nicht nach einem vordefinierten Datenmodell strukturiert oder nicht auf vordefinierte Weise organisiert sind. Dieser Datentyp kann von Menschen oder Maschinen erzeugt werden und eine interne Struktur besitzen. Zu unstrukturierten Daten können unter anderem Dokumente, Bücher, Metadaten, Gesundheitsdaten, Bilder, Audio- und Videodateien, Dateien, E-Mail-Nachrichten und Webseiten gehören.
Unstrukturierte Daten können auf verschiedene Weise gespeichert werden, etwa in Data Lakes, NoSQL-Datenbanken und Data Warehouses.
Ende der 2000er-Jahre führte das Aufkommen von Big Data zu einem verstärkten Interesse an den Einsatzmöglichkeiten unstrukturierter Daten in Bereichen wie Ursachenanalyse und Predictive Analytics. Laut einem vorausschauenden Bericht von Computerworld aus dem Jahr 2011 könnten bis 2021 mehr als 90 % aller Daten in Unternehmen unstrukturiert sein. Tatsächlich prognostizierten IDC und Seagate für 2025 ein Wachstum der globalen Data Sphere auf 175,8 Zettabyte – gegenüber einer Wachstumsrate von etwa 26 % seit 2015; der Großteil dieser Daten wird unstrukturiert sein.
Laut einem Bericht für die IEEE-Konferenz 2013 zu Systemen, Prozessen und Regelung gibt es verschiedene Möglichkeiten, unstrukturierte Daten zu speichern, etwa in Data Lakes, NoSQL-Datenbanken (nicht relational) und Data Warehouses. Mit dem Wachstum in diesem Bereich wurden zahlreiche Tools und Plattformen speziell für die Nutzung, Verwaltung, Speicherung und Absicherung unstrukturierter Daten entwickelt, darunter Amazon DynamoDB, MonkeyLearn und MongoDB Atlas.
Strukturierte Daten vs. unstrukturierte Daten
Sowohl strukturierte als auch unstrukturierte Daten können von Menschen oder Maschinen erzeugt werden, doch es gibt einige offensichtliche Unterschiede zwischen ihnen. Insbesondere machen die Unregelmäßigkeiten und das mehrdeutige Verhalten unstrukturierter Daten deren Verständnis mit herkömmlichen Programmen schwierig.
| Strukturierte Daten | Unstrukturierte Daten | |
|---|---|---|
| Merkmale | Vordefiniertes Datenmodell Klar definiert Quantitative Daten Einfacher Zugriff Einfache Analyse | Kein vordefiniertes Datenmodell Nicht klar definiert Qualitative Daten Schwieriger Zugriff Schwierige Analyse |
| Gespeichert in | Relationale Datenbank Data Warehouse Tabellenkalkulationen | NoSQL-Datenbank Data Lake Data Warehouse |
| Analysemethoden | Regression Klassifizierung Clustering | Data Mining Verarbeitung natürlicher Sprache Vektorsuche |
| Anwendungsfälle | Online-Buchungen Geldautomaten Bestandskontrollsysteme | Spracherkennung Bilderkennung Textanalyse |
| Beispiele | Namen Daten Adressen Telefonnummern Kreditkartennummern | E-Mail-Nachrichten Gesundheitsdaten Bilder Audio Video |
Durch die Entwicklung und Erfindung moderner Technologien ist es einfacher geworden, unstrukturierte Daten zu analysieren und neue Erkenntnisse daraus zu gewinnen. Die Umwandlung von unstrukturierten in strukturierte Daten kann deren Nutzung, Verwaltung, Speicherung und Absicherung einfacher und effizienter machen.
Als Nächstes lesen: Die besten Data-Warehouse-Tools und -Lösungen 2021