今日、データは大規模に生成されており、機械学習(ML)の取り組みに大きな機会をもたらしている。しかし、そのデータのかなりの部分は、データサイエンティストやML実務者が利用できない状態にある。厳格なプライバシー規制、高額なコスト、長い処理時間がデータ処理の妨げとなっている。
その結果、GartnerはAIプロジェクトの85%が失敗すると推定している。ここで合成データが 有用となる。
合成データとは、詳細なアルゴリズムとシミュレーションを用いてシステムが生成する人工データである。完全に匿名化されたデータであり、組織が必要な規模の学習データをオンデマンドで作成できるため、実データの優れた代替となる。
合成データとは?
AIアルゴリズムは合成データを人工的に生成するが、実データセットで学習され、 元データと同じ特性を備えている。 合成データは実データと一対一の相関を 持たないため、再識別される可能性が低い。
その結果、 データサイエンティストは テストやモデリングのためにデータを安心して複製・利用でき、 個人を特定できる情報(PII)をさらしたり規制当局の逆鱗に触れたりするリスクなしに。
関連記事:構造化データと非構造化データ:違いと例
合成データはどのように生成されるのか?
合成データを生成する方法はいくつかある。簡単な方法としては、モンテカルロシミュレーションや分布セットから数値を抽出する方法があるが、データセットが複雑な場合は通常、生成モデルが好まれる。
生成モデルは、実世界のデータに見られるパターンを自動的に学習し、それに正確に一致する情報を生成するニューラルネットワークを基盤としている。Generative Adversarial Networks(GAN)とVariational Autoencoder(VAE)が、一般的な2つの生成モデルアーキテクチャである。
GANモデルでは、2つのニューラルネットワークモデル(生成器と識別器と呼ばれる)が、一方のネットワークの利益がもう一方の損失となるゼロサムゲームで競い合う。一方、VAEはエンコーダー・デコーダーの概念に基づいて動作する教師なしモデルである。
合成データの生成に役立つツールとは?
以下に、合成データの作成に利用できるツールの例を挙げる。
- Datagenは、次の分野で利用されるフォトリアルなデータセットを提供する合成データセットソリューションである:モノのインターネット(IoT)、ロボティクス、および拡張現実(AR)。
- Matplotlib、NumPy、SciPyを基盤とする, Scikit-learnはオープンソースのPythonライブラリで、 合成データセットを生成するツールを提供する。
- Pydgbenは、名前、職業、クレジットカード番号、メールアドレスなどの一般的な項目を作成するPythonライブラリである。
- Parallel Domainは、高品質なセンサーデータを生成し、MLモデルやコンピュータービジョンのワークフローを改善する合成データプラットフォームである。
合成データを利用するメリット
機械学習モデルの構築において、合成データは他の種類のデータよりもスケーラブルで、扱いやすく、費用対効果に優れている。
スケーラビリティ
MLモデルは 膨大な量のデータを消費する。 しかし、そのような大量の関連データを 学習やテストのために入手することは 不可能である。合成データツールを使えば、データサイエンティストは高品質なAI/MLモデルの構築に必要なだけデータのコピーを作成できる。
使いやすさ
実世界のデータを扱う場合、個人情報を保護し、 不正確な情報を除去し、 さまざまな形式のデータを効率的に処理することが重要となる。 合成データは、個人情報をマスキングし、エラーを排除し、ラベル付けを容易にするために形式を標準化するため、はるかに扱いやすい。
費用対効果
実際の学習データを入手するには、企業は多額の費用を負担する可能性がある。さらに、データを手作業でラベル付けするには時間がかかる。 合成データ生成ツールを使えば、プロセスが簡素化され、より費用対効果が高く、短時間で済む。
Enterprise Networking Planetで続きを読む:合成データはAIを改善できるか?
合成データを利用する際の課題
合成データにはいくつかのメリットがある 一方で、一定の制約もある。例えば、大きな欠点の1つ は、合成データを効果的に利用するには、高度なデータ生成ツールの扱いに精通した熟練アナリストが必要であることだ。これは、適格なAI人材の不足が労働市場で生じているため、しばしば困難となる。
さらに、合成データの品質は元データ次第であり、実データにはしばしば バイアスが大量に含まれている。そのため、ニューラルネットワークを偏った過去のデータで学習させると、同じバイアスが反映される。これにより、機械学習モデルの出力に不正確さが生じることがある。
合成データのユースケース
合成データの最も代表的なユースケースは、自動運転車とヘルスケアの2つである。
自動運転車
自動運転車は、合成データのユースケースとして圧倒的に優れた例である。 自動車メーカーは、安全な車両を開発するために、数百万ものシナリオを検討し、それに応じてデータを収集しなければならない。
現実にこれを行うのは不可能だが、合成データを使えば、組織は想定可能なあらゆる運転シナリオについて数百万、あるいは数十億通りの組み合わせを生成し、安全な運転ソリューションを導き出せる。
ヘルスケア
ヘルスケアは、患者データの利用を規定する厳格な法律がある、高度に規制された業界である。合成データは完全に匿名で、再識別のリスクもないため、医療機関はヘルスケア分野の科学研究、臨床試験、MLモデルのトレーニングに容易に利用できる。
合成データの未来
合成データの生成は、 費用対効果が高く、極めてスケーラブルなデータを作成する革新的な方法である。合成データとそのさまざまなメリットに対する認知が高まるにつれ、より多くの企業がその可能性を活用し、恩恵を得るようになるだろう。
さらに、プライバシー法が厳格化する中、組織は合成データに頼らざるを得なくなる。そのため、完全に一般化するまで、合成データの人気は高まり続けるだろう。