2025年03月30日
Amazon DataZoneではじめるデータマネジメント(1)
前回の記事で、データマネジメント、その中核となるデータガバナンスの必要性をお伝えしましたが、今回はその実践例を紹介します。
皆さんは業務で欲しいデータがある場合、どのように手に入れますか?組織にもよると思いますが、「詳しそうな人に聞いてみる」、「システム担当者に問い合わせる」など人を介している方々も多いのではないでしょうか。そして、その手間や待ち時間に煩わしさを感じているかもしれません。これでは部署をまたいだ全社的なデータ活用はなかなか進みません。
今回は、これらの問題を軽減するAWSのAmazon DataZone (以下DataZone)を用いた、データ発見性を向上させる方法について紹介します。
Amazon DataZoneとは?
Amazon DataZoneは、AWSが提供するデータ管理とガバナンスのためのサービスです。利用することで組織全体でのデータの発見、共有、管理が容易になり、データドリブンな意思決定をサポートします。
主な特徴として、以下の点が挙げられます:
- データカタログ: メタデータが一元管理されることでデータの検索と発見が容易になります。
- データ共有: 部門間でデータとツールを共有し、ビジネスインサイトを促進します。
- データガバナンス: 組織の境界を越えてデータのアクセスを管理できます。
- AIの活用: 生成AIと機械学習によりデータ発見とカタログ化を支援します。
- 可視性: データの来歴を可視化し、透明性を高めます。
DataZoneを活用することで、組織はデータ資産を最大限に活用し、コンプライアンスを維持しながら、イノベーションを加速させることができます。
当初は独立したサービスとして発表されましたが、現在はデータ、分析、AIの統合基盤であるAmazon SageMakerのデータとAIのガバナンスを担うサービスとして提供されています
データの探索から利用までのステップ
文章での説明ではイメージがわきづらいかもしれませんので、DataZoneを実際にどのように使うかを見ていきましょう。
ここでは、自身が所属していないプロジェクトのデータについて知りたい場合の利用方法を説明します。
①まず、データ分析のためのプロジェクトを作成します。
②検索窓にキーワードを入力すると関連するテーブル名(データアセット名)が表示されるので選択します。
③テーブルのメタデータが表示されます。データ所管部署が事前に整備した概要などの情報を確認し、必要なデータかどうかを判断します。
④スキーマのタブを開いてカラムの情報をチェックします。これらの情報も含めて必要なデータかどうかを判断します。
⑤必要なデータであれば実際のデータにアクセスするために「サブスクライブ」ボタンを押し、データ所管部署に閲覧申請をします。
⑥データ所管部署が閲覧許可を出すと、テーブルに含まれるデータを閲覧できるようになります。
⑦Amazon Athenaなどのツールを用いてテーブルのデータにアクセスします。
DataZoneを利用したメタデータ整備
前節の利用例では「配送」というキーワードでデータを検索しました。
しかし、元のデータには「配送」というワードが含まれていないため検索には引っかかりません。
DataZoneを使ってデータの概要説明やわかりやすい列名などを付与することで検索したときのデータの発見性やデータ利用者の理解が著しく高まります。
付与された説明等はメタデータと呼ばれます。
このような説明を1つ1つ作成していくのは労力のかかる作業です。
DataZoneにはテーブルに含まれるデータの概要や考えうるユースケースなどについて生成AIを使って文案を作成してくれる機能があります。現時点では英語での生成にはなりますが、別途翻訳をかけることで効率的にメタデータを作成することができます。
まとめ
今回はAmazon DataZoneの利用イメージと、メタデータ整備の方法について紹介しました。
必要なデータを探し当てるまでのリードタイムが縮まり、またデータの意味が分かりやすくなることで皆様のデータ活用がさらに進むことと思います。
次回も、引き続きDataZoneを用いたデータマネジメントについて紹介する予定です。