Un lac de données désigne un emplacement central où de grandes quantités de données sont stockées dans un format brut et non structuré, avec des informations sur les données et des identifiants uniques. Il stocke des données qui pourront être traitées ultérieurement afin d’en extraire des informations précieuses pour l’entreprise et de la faire progresser.
Ce type d’organisation flexible permet de stocker des données structurées et semi-structurées sans craindre de se retrouver prisonnier de systèmes propriétaires tels que les entrepôts de données. Cette approche est finalement plus durable et plus économique, même si les lacs de données nécessitent l’œil d’un expert pour gérer et traiter efficacement les données.
Comment créer un lac de données
Voici les étapes à prendre en compte si vous souhaitez mettre en place un lac de données pour votre entreprise :
1. Choisissez une solution de stockage cloud : Vous pouvez configurer des lacs de données sur des plateformes telles qu’Amazon Web Services et Microsoft Azure. L’utilisation de l’un de ces services vous évite d’engager des coûts initiaux considérables, puisqu’il s’agit de services cloud qui ne vous factureront qu’en fonction de votre utilisation de chaque service.
2. Déterminez d’où proviennent vos données : Il est utile d’identifier les sources de données et la fréquence à laquelle de nouvelles données sont ajoutées. Vous pouvez choisir d’ajouter les données telles quelles ou de les nettoyer en fonction des exigences de votre organisation.
3. Mettez en place des processus : Les données proviendront de différentes sources. Vous pouvez échanger avec les différents services afin de déterminer les procédures, les flux de travail et les calendriers les plus adaptés à la publication des données.
4. Testez le lac de données : Il est important de tester régulièrement votre lac de données afin de vous assurer que vous pouvez bien récupérer et utiliser les données qu’il contient. Cela est particulièrement important pour garantir la continuité à mesure que les besoins de votre entreprise évoluent et changent.
5. Utilisez vos données : Après avoir suivi les étapes ci-dessus, vous disposerez d’un système permettant de collecter efficacement vos données. Vous devrez ensuite utiliser différents processus d’extraction, de transformation et de chargement (ETL) pour tirer parti de vos données. Vous pouvez utiliser des entrepôts de données et des outils de visualisation pour y parvenir. Des solutions telles que Microsoft Power BI et Tableau sont utiles pour analyser les chiffres et donner du sens à vos données brutes.
Entrepôt de données ou lac de données
Si les entrepôts de données et les lacs de données ont le même objectif, à savoir stocker des données, ils présentent certaines différences importantes.
Tout d’abord, un entrepôt de données repose sur une structure de données définie avant la lecture des données. Un lac de données, en revanche, peut accepter les données dans n’importe quel format. Dans le cas d’un lac de données, les données sont organisées après leur lecture.
Les lacs de données nécessitent également des utilisateurs possédant une connaissance approfondie des différents types de données, puisque celles-ci sont désorganisées et présentées dans différents formats. Les entrepôts de données sont accessibles à un public plus large, car leur structure est intrinsèquement bien définie.
Cependant, la nature structurée des entrepôts de données signifie que leur mise en place demande davantage de temps pour être configurée et ajustée. À l’inverse, les lacs de données peuvent être adaptés plus rapidement et plus facilement.
Avantages des lacs de données
L’utilisation d’un lac de données présente de nombreux avantages :
- Une meilleure compréhension des tendances et des opportunités commerciales
- Un coût de mise en œuvre réduit grâce à des technologies open source telles que Hadoop et Spark
- Aucune nécessité d’organiser les données avant leur traitement
- Des méthodes d’analyse plus flexibles
Défis des lacs de données
Malgré les nombreux avantages des lacs de données, il est également important de connaître les défis suivants :
- Le risque de transformer le lac en simple dépôt de données, ce qui entrave les analyses utiles
- La nécessité de disposer d’utilisateurs plus expérimentés et compétents
- Les coûts peuvent s’envoler si l’environnement du lac de données n’est pas maîtrisé
Lac de données cloud ou sur site
Sur site
Les lacs de données sur site offrent généralement de bonnes performances. Cela signifie également que les données confidentielles restent sous votre contrôle et que les problèmes de latence sont moins nombreux lors de l’accès aux données.
Cependant, une configuration sur site présente les défis suivants :
- Les serveurs physiques peuvent occuper beaucoup d’espace physique
- La mise en place peut être coûteuse et chronophage
- Il peut être difficile d’ajouter des serveurs physiques, ce qui limite la capacité de mise à l’échelle
Cloud
À l’inverse, les lacs de données cloud sont plus économiques, puisque vous ne payez que ce que vous utilisez à un moment donné. Ils ne nécessitent pas non plus l’installation de serveurs physiques, ce qui facilite leur mise à l’échelle : vous n’avez pas besoin d’ajouter de capacité de serveur physique.
Cependant, il est également important de connaître les défis des lacs de données cloud :
- Une sécurité moindre pour les données sensibles
- Un contrôle moindre sur la gouvernance et l’accessibilité des données
Pour en savoir plus sur eWeek : Pourquoi les entreprises peinent avec les lacs de données cloud
Exemples de lacs de données
Il est utile d’examiner des mises en œuvre réussies de lacs de données pour se faire une idée de leurs cas d’usage concrets.
Sisense
Sisense exploite l’écosystème AWS pour son lac de données. L’entreprise possède plus de 70 milliards d’enregistrements et utilise l’architecture de son lac de données pour gérer efficacement ces données. Elle est en mesure d’en extraire de la valeur grâce à différents outils de visualisation, notamment le logiciel de visualisation de Sisense.
Depop
Depop est une application de shopping social basée à Londres. Les milliers de clients qui utilisent l’application pour envoyer des messages et effectuer des achats génèrent un flux constant d’événements et de données. L’entreprise utilise à son tour Amazon S3 pour gérer ce flux massif de données et orienter ses décisions commerciales.
ironSource
ironSource est une plateforme de monétisation intégrée aux applications et de publicité vidéo. Elle traite les données en continu provenant de millions d’appareils finaux et avait donc besoin d’une solution pour gérer cet afflux massif de données. L’entreprise a choisi Upsolver, qui peut gérer des flux allant jusqu’à 500 000 événements par seconde.
Peer39
Peer39 est un leader du secteur de la publicité et du marketing numérique. L’entreprise analyse plus de 450 millions de pages web afin d’en dégager le véritable sens du texte qu’elles contiennent. Cela fournit aux annonceurs des informations plus précises, afin qu’ils puissent optimiser leurs dépenses publicitaires. Peer39 utilise Upsolver pour gérer cette quantité massive de données.
SimilarWeb
SimilarWeb est une entreprise de veille marketing qui fournit des informations sur l’univers numérique. Elle y parvient en collectant de grandes quantités de données provenant de différentes sources. SimilarWeb doit analyser des milliers de téraoctets de données et utilise donc une combinaison d’Amazon S3, d’Amazon Athena et d’Upsolver pour y parvenir.