データレイクとは、大量のデータを生の非構造化形式で保存する中央の場所を指します。そこには、データに関する情報や一意の識別子も含まれます。データレイクには、後から処理して価値あるビジネス上の洞察を引き出し、ビジネスを前進させられるデータが保存されます。
このような柔軟な構成であれば、データウェアハウスのような独自システムに囲い込まれる心配なく、構造化データと半構造化データの両方を保存できます。最終的には、より堅牢で費用対効果にも優れていますが、データレイクでデータを効果的に管理・処理するには専門家の知見が必要です。
データレイクの構築方法
ビジネス向けのデータレイクを構築する場合に検討すべき手順は、次のとおりです。
1. 柔軟なクラウドストレージソリューションを選ぶ: データレイクは、Amazon Web ServicesやMicrosoft Azureなどのプラットフォーム上に構築できます。これらは使用量に応じてのみ課金されるクラウドサービスであるため、いずれかを利用すれば初期に巨額の費用を負担せずに済みます。
2. データの発生源を把握する:データの発生源と、新しいデータが追加される頻度を特定しておくと便利です。データをそのまま追加することも、組織の要件に応じてクリーンアップしてから追加することもできます。
3. プロセスを整備する:データはさまざまなソースから集まります。各部門と連携し、データを公開するための最適な手順、ワークフロー、スケジュールを決定できます。
4. データレイクをテストする:データレイクからデータを正常に取得して利用できるよう、頻繁にテストすることが重要です。ビジネスのニーズが拡大・変化した際にも継続性を確保するうえで、特に重要となります。
5. データを活用する:上記の手順を終えると、データを効率的に収集するためのシステムが整います。次に、データから価値を引き出すため、さまざまな抽出、変換、ロード(ETL)プロセスを利用する必要があります。これには、データウェアハウスや可視化ツールを利用できます。Microsoft Power BIやTableauなどのソリューションは、数値を分析し、生データから意味を導き出すのに役立ちます。
データウェアハウスとデータレイクの比較
データウェアハウスとデータレイクは、どちらもデータの保存場所という点で目的は同じですが、いくつか重要な違いがあります。
まず、データウェアハウスでは、データを読み込む前に想定するデータレイアウトが決められています。一方、データレイクではどのような形式のデータでも受け入れられます。データレイクでは、読み込んだ後にデータを整理します。
データレイクではデータが整理されておらず、形式もさまざまであるため、異なるデータ型に関する専門知識を持つユーザーも必要です。データウェアハウスは構造が本質的に明確に定義されているため、より幅広いユーザーが利用できます。
ただし、データウェアハウスは構造化されているため、セットアップには構成や調整により多くの時間がかかります。対照的に、データレイクはより迅速かつ簡単に適応させられます。
データレイクのメリット
データレイクの利用には、多くのメリットがあります。
- ビジネスのトレンドや機会に関する洞察が深まる
- HadoopやSparkなどのオープンソース技術により、導入コストを削減できる
- 処理前にデータを整理する必要がない
- より柔軟な分析手法を利用できる
データレイクの課題
データレイクには多くのメリットがある一方で、次のような課題にも注意が必要です。
- 価値ある分析を妨げるデータのごみ捨て場になるリスクがある
- より経験豊富で知識のあるユーザーが必要になる
- データレイク環境を管理できなければ、コストが膨れ上がる可能性がある
クラウドとオンプレミスのデータレイク
オンプレミス
オンプレミスのデータレイクは通常、高いパフォーマンスを発揮します。機密データを自社の管理下に置けるほか、データアクセス時の遅延問題も少なくなります。
ただし、オンプレミス環境には次のような課題があります。
- 物理サーバーが広い物理スペースを占有する可能性がある
- セットアップに多額の費用と時間がかかる可能性がある
- 物理サーバーを追加するのが難しく、拡張性が制限される
クラウド
一方、クラウドのデータレイクは、その時点で利用した分だけ支払えばよいため、より費用対効果に優れています。また、物理サーバーをセットアップする必要もないため、物理サーバーの容量を追加せずに済み、クラウドのデータレイクはより簡単に拡張できます。
ただし、クラウドベースのデータレイクにも次のような課題があることに注意が必要です。
- 機密データに対するセキュリティが低い
- データガバナンスとアクセス性に対する管理が及びにくい
eWeekでさらに読む:企業がクラウドデータレイクに苦戦する理由
データレイクの事例
データレイクの実際のユースケースを知るには、導入に成功した事例を見るとよいでしょう。
Sisense
Sisenseは、データレイクにAWSエコシステムを活用しています。同社は700億件を超えるレコードを保有しており、データレイクアーキテクチャを使ってこのデータを効果的に管理しています。また、Sisense独自の可視化ソフトウェアを含むさまざまな可視化ツールによって、データから価値を引き出しています。
Depop
Depopは、ロンドンを拠点とするソーシャルショッピングアプリです。メッセージの送受信や購入にアプリを利用する何千人もの顧客が、イベントとデータの絶え間ないストリームを生み出します。同社はその結果、Amazon S3を利用してこの膨大なデータストリームを処理し、ビジネス上の意思決定に役立てています。
ironSource
ironSourceは、アプリ内収益化と動画広告のプラットフォームです。数百万台のエンドデバイスからストリーミングデータを処理するため、この大量のデータ流入に対応するソリューションが必要でした。同社は、毎秒最大50万件のイベントを処理できるUpsolverを選択しました。
Peer39
Peer39は、広告およびデジタルマーケティング業界のリーダーです。同社は4億5000万を超えるウェブページを分析し、そこに含まれるテキストの真の意味を読み取っています。これにより、広告主はより正確な情報を得て、広告費を最大限に活用できます。Peer39は、この膨大なデータ量の処理にUpsolverを利用しています。
SimilarWeb
SimilarWebは、デジタル世界に関する洞察を提供するマーケティングインテリジェンス企業です。さまざまなソースから膨大な量のデータを収集することで、これを実現しています。SimilarWebは数千テラバイトのデータを分析する必要があるため、Amazon S3、Amazon Athena、Upsolverを組み合わせて利用しています。