データの複雑さと量が増すなか、企業にはデータを管理するためのより優れた方法が求められています。そこで登場するのが、データメッシュとデータファブリックです。これらは、次世代のデータ管理における最も注目されている2つの概念です。どちらにも長所と短所がありますが、相互に補完し合う関係でもあります。
本稿では、この2つの概念を詳しく解説し、これらのソリューションを活用して企業データからより良い意思決定につなげる方法を検討します。
データメッシュとは?
Zhamak Dehghaniは、データ管理の概念としてデータメッシュという用語を2019年に初めて定義し、次の4つの基本原則を示しました:
- ドメイン所有権
- プロダクトとしてのデータ
- セルフサービス型データプラットフォーム
- 連合型コンピュテーショナルガバナンス
従来のデータ管理モデルが情報の中央リポジトリに重点を置くのに対し、データメッシュの概念は、より分散型のアプローチを取ります。このモデルでは、各チームや部門が自らのデータを管理し、全員が利用できる連合型システムを構築する責任を負います。
このアプローチにはいくつかの利点があります。第一に、各チームが自らの記録を維持する責任を負うため、データの正確性と最新性を確保しやすくなります。また、チーム同士が組織内で他のチームがデータをどのように利用しているかを確認できるため、透明性とコラボレーションも促進されます。さらに、データメッシュは中央集権的なITインフラの必要性をなくし、組織にとってより柔軟で拡張性の高いデータ管理を可能にします。
データメッシュの概念の価値は、組織のデータにおける信頼できる唯一の情報源を構築しながら、個々の事業部門により大きな管理権限を与えられる点にもあります。これにより、データサイロを防ぎ、組織全体のデータ資産を統制・管理しやすくなります。
さらに、セルフサービス型データプラットフォームの原則により、ビジネスユーザーは必要なときに必要なデータへ、より簡単にアクセスできるようになります。これは意思決定の改善と業務効率の向上に役立ちます。
最終的に、データメッシュの概念は、増え続けるデータ資産をより適切に管理したい組織に大きなメリットをもたらします。
データファブリックとは?
データファブリックとは、データとそれをつなぐプロセスを統合したレイヤー(ファブリック)として機能する設計概念です。Gartnerがこの用語を初めて生み出し、現在ではデータ管理を考えるうえで広く使われる概念となっています。
データファブリックは、既知のメタデータ、識別されたメタデータ、推測されたメタデータのリソースに対する継続的な分析を活用します。これにより、複数のプラットフォーム、データ種別、場所にまたがるデータの共有と再利用が可能になります。
データファブリックは、人間と自動化された機能を活用して既存データへのアクセスを実現し、必要に応じてデータの統合も支援します。さまざまなソースからデータを特定して接続することで、異なるアプリケーションのデータポイント間にある、ビジネス上関連性の高い独自のつながりを見つけ出します。この洞察により、従来のデータ管理手法では実現できなかった、迅速なアクセスと理解を通じてより大きな価値を生み出す、意思決定の再設計が可能になります。
一般的な構成では、データファブリックはまずデータパイプラインを受動的に監視します。時間の経過とともに、人工知能(AI)や機械学習(ML)の機能を使って、より効率的なデータ処理方法を提案するようになります。
データファブリックは、データウェアハウスやデータレイクではありません。これらの概念を基盤として構築される、データ管理における次の論理的なステップです。
データメッシュ対データファブリック
データメッシュとデータファブリックはいずれも、ガバナンス、データの発見、再利用を重視したデータ管理のアプローチです。ただし、この2つにはいくつかの重要な違いがあります。
データメッシュはデータプロダクトのネットワークであり、それぞれに明確な所有者がいて、API(アプリケーション・プログラミング・インターフェース)経由でアクセスできます。一方、データファブリックは、データプロダクトの作成を可能にし、利用者に単一のアクセスポイントを提供する集中型プラットフォームです。
ただし、冒頭で述べたように、この2つの概念は相互に補完し合い、共存することができます。例えば、データファブリックを使ってアセットをカタログ化し、データプロダクトに変換したうえで、連合型ガバナンスポリシーを適用できます。これによりデータ利用者は、データプロダクトをカタログに公開したり、検索したり、API経由でデータプロダクトの情報を照会・可視化したりするなど、さまざまな方法でデータプロダクトを利用できるようになります。
データファブリックのメタデータは、データプロダクトの作成プロセスや、データプロダクトの監視中にパターンを発見し、こうした活動を自動化するためにも利用できます。
なぜ拡張データが重要なのか?
組織が増え続けるデータ量に対応しようとするなか、拡張データ管理の重要性はますます高まっています。
拡張データ管理は、組織によるデータ資産の管理を改善し、データ品質を高めるとともに、手作業による介入の必要性を減らします。さらに、組織のデータを統合的に把握できるビューや、メタデータ管理の自動化、マスターデータモデルの生成も実現できます。
データがかつてない速さで増加する時代において、拡張データ管理は、増大する需要に対応するために必要とされるソリューションを提供します。
こうしたデータ管理の概念を活用することで、意思決定の改善、業務効率の向上、データサイロの防止が可能になります。これらはいずれも今日のビジネス環境において重要な要素であり、組織が競争優位性を獲得する助けとなります。