データカタログとは?AI時代に必須な理由と主要ツール比較【2026年版】

データマネジメント
読了時間 約13分
データカタログとは?AI時代に必須な理由と主要ツール比較【2026年版】

社内の情シス担当者から「AIエージェントに社内データを触らせたいのだが、そもそもどのテーブルを渡せばよいか分からない」というご相談が、この半年で急に増えました。BigQueryやSnowflakeに数千テーブルが積み上がり、誰がいつ作ったか、どのカラムが今も生きているのか、追い切れなくなっているという状況です。

社内ChatGPT・RAG・MCP経由のAIエージェントなど、AIに社内データを使わせる仕組みは急速に広がっています。ところが受け皿となる「どこに何があるか」の目録が整っていないと、AIは推測で存在しないカラム名や誤った結合を返し、結果として意思決定を誤らせます。

この「AIに使わせる前に、まず人間がデータを見つけられる状態を作る」ための基盤が、データカタログです。用語自体は10年以上前からありますが、生成AIの普及で意味合いが変わりました。ガートナーは2025年1月にデータ&アナリティクス・ガバナンスのMagic Quadrant(データ管理製品の評価レポート)を新カテゴリで発行し、2026年1月の第2版でも静的な目録機能より「アクティブメタデータ」と「AIレディネス」を評価軸の中心に据えています。

国内外の2025〜2026年の動向と、導入現場でつまずくポイントを、AIエージェント時代の基盤として整理していきます。


なぜ今、データカタログが必要になったのか

なぜ今、データカタログが必要になったのか

「AIに社内データを使わせる」という要件が、この2年で企業側の温度感を変えました。背景には次の3つの流れがあります。

ダークデータが企業データの半分以上を占めている

Splunkの2024年更新の「State of Dark Data」調査では、**回答者の60%が「自社データの半分以上はダーク(所在不明・使われていない状態)」**と答え、うち3分の1は「75%以上」と回答しています。IDCの予測でも、非構造化データは全ストレージの約78%を占め、2024年の5.5ZBから2028年に10.5ZBへ倍増する見込みです。

つまり、多くの企業では社内データの半分以上が「あるはずだが誰も使い方を知らない」状態で放置されています。この状態のままAIエージェントに「先月の売上を分析して」と頼めば、AIはたまたま最初に見つけたテーブルを使い、それが古いスナップショットや廃止予定のマートだったとしても気づきません。

生成AIが「意味の推測」を加速させた

自然言語からSQLを組み立てて数値を返す仕組みは、この2年で急速に一般化しました。BigQueryのGemini in BigQuery、Snowflake Cortex、Databricks Genie、Microsoft Fabric Copilotなど、主要DWHはすべてチャット窓口を備えています。

そこで露呈したのが、テーブル定義やビジネス用語の意味が整理されていないと、AIが存在しない列名や誤った結合を平気で生成する問題です。学術研究でもText-to-SQLの実行失敗の多くが「スキーマ関連のハルシネーション」に分類されており、対策として指標定義と目録の両方を整える必要があることが明らかになっています。

姉妹記事のセマンティックレイヤーとは?AI時代のデータ活用の要では「指標定義の食い違い」を中心に扱いましたが、その手前にある「そもそもどのテーブルが正か」を答えられる基盤がデータカタログです。

ガートナーの評価軸が「アクティブメタデータ」に寄った

ガートナーは2025年1月、データ&アナリティクス・ガバナンス・プラットフォームのMagic Quadrantを新設し、2026年1月に第2版を発行しました。旧来のメタデータ管理製品カテゴリを再編したもので、アクティブメタデータ(メタデータを継続的に解析し、品質監視・ポリシー適用・データセット推薦を自動で行う方式)とAIレディネス、マルチクラウド/ハイブリッド対応が評価軸の中心に置かれています。第2版では評価範囲が非構造化データ・分析モデル・データプロダクトまで広がり、AIエージェント対応やML活用の自動化が明確な評価項目に加わりました。

かつて評価対象だった「静的な目録機能」の比重は下がり、データカタログは「一覧を出すためのツール」から、AIエージェントに正しいメタデータを継続的に供給する基盤へと再定義されつつあります。


データカタログとは何か

データカタログとは何か

概念だけ聞くと抽象的なので、位置と役割から入ります。

「データの図書館目録」というイメージ

データカタログは、社内に散らばるデータ資産(テーブル・ビュー・ファイル・ダッシュボード・MLモデルなど)を検索できる形でまとめた目録です。各データについて「名前・所有者・説明・タグ・データ品質・リネージ(系譜)」まで含めて管理します。

DATA SOURCES
BigQuery
Snowflake
S3 / データレイク
BI(Looker / Tableau)
DATA CATALOG
メタデータ層
目録・検索・リネージ
名前・所有者・品質・PII分類
USERS
アナリスト
業務ユーザー
AIエージェント
データエンジニア
データカタログの位置:データ源からメタデータだけを集め、利用者に横断検索を提供する目録層

図のように、データカタログ自体はデータを保管する場所ではありません。BigQueryやSnowflakeといったDWH、S3などのデータレイク、Tableau・Looker StudioといったBIツール、社内アプリのRDBなどからメタデータだけを収集し、利用者が横断的に検索できる状態を作ります。

利用者は「先月の売上を集計しているテーブルはどれ?」「顧客IDというカラムを含む表を全部見せて」といった問いを、ツールを跨いで1箇所から投げられるようになります。

データディクショナリ・メタデータ管理との違い

似た用語との違いを整理しておきます。

用語スコープ主な形式例
データディクショナリ1つのデータベースに閉じたテーブル・カラム定義書Excel、Wiki、DBMS付属機能Oracle DataDictionary、社内Wiki
メタデータ管理メタデータを収集・標準化・活用する裏側のプロセス全体ETLやスクリプト、ルール定義データオーナー命名規則、PII分類
データカタログ複数DWH/BIを横断した検索・発見のUI層Web UI、API、AI検索OpenMetadata、Alation、Dataplex

メタデータ管理はバックエンド、データカタログはそのフロントエンド、と整理すると分かりやすいです。データディクショナリはさらに古い、1DBに閉じた資料の集まりで、今はデータカタログに取り込まれる形が主流です。

AI時代の3層モデル

2025〜2026年に定着しつつある企業データ基盤のAI対応モデルは、おおまかに次の3層で捉えられます。

  • データカタログ:どこに何があるかを見つける(メタデータ層)
  • セマンティックレイヤー:指標や次元の意味を1つに揃える(意味定義層)
  • MCP:AIエージェントに標準プロトコルで届ける(配信層)

3層は独立しつつ補完し合います。カタログで「使ってよいテーブル」を絞り、セマンティックレイヤーで「用語の定義」を固め、MCPでAIエージェントに配信する。3層のどれかが欠けると、AIは古いテーブルか誤った定義のどちらかを平気で使います。


データカタログの主要機能

データカタログの主要機能

具体的にデータカタログが何をしてくれるのか、代表的な6つの機能で見ていきます。

検索・ディスカバリ
キーワード+AI検索で、テーブル・カラム・ダッシュボードを横断検索
メタデータ自動収集
DWH・BIから定期スキャン。スキーマ・利用頻度を人手なしで最新化
データリネージ
「どの生データが、どのETLを通ってこの数字になったか」を追跡
ビジネスグロッサリ
「MAU・LTV」など業務用語を1つの定義に統一し、カラムに紐付け
データ品質シグナル
Null率・更新頻度・重複件数を自動計測し、しきい値超過でアラート
アクセス統制・PII管理
個人情報カラムを自動タグ付け、マスキング・閲覧権限を一元管理
データカタログの主要機能(どのツールにも共通する6つの観点)

図の6機能はどのツールにも共通し、ツール選定時の比較観点にもなります。

検索・ディスカバリ

「顧客ID」「先月の売上」といった自然言語や部分一致で、テーブル・カラム・ダッシュボードを横断検索できます。Google検索のようなキーワード検索に加え、2025年以降は各ツールともAI検索(意味検索)を搭載し、「解約率を計算しているダッシュボードは?」といった曖昧な問いにも答えられるようになりました。

メタデータの自動収集

BigQueryやSnowflakeといったDWH、Tableau・Looker Studioなどに定期的に接続し、テーブル一覧・スキーマ・クエリ実行履歴・使われている頻度などを自動で集めます。人手でExcelを更新する運用と比べ、実態と乖離しにくいのが強みです。

データリネージ(系譜)

「このダッシュボードの数字は、どのETLジョブが、どの生データを加工して作ったのか」を辿れる機能です。障害時の影響範囲調査や、カラムの廃止判断で威力を発揮します。dbtやAirflowから吐き出されるメタデータを取り込むと、テーブル間だけでなくカラム単位の系譜まで表示されるツールが増えています。

ビジネスグロッサリ(用語集)

「MAU」「LTV」「アクティブユーザー」といった業務用語を、社内で1つの定義に統一します。定義した用語はテーブルのカラムやダッシュボードに紐づけられ、「このMAUはこの定義に沿っている」と一目で分かる状態を作れます。セマンティックレイヤーが「機械的に強制する定義」なのに対し、こちらは「人間向けの合意された定義」を扱います。

データ品質・オブザーバビリティ

各テーブルのNull率・重複件数・更新頻度といった品質指標を自動計測し、しきい値を超えたらアラートを出す機能です。Great Expectations や dbt tests と連携し、「壊れているテーブルは検索結果に出ない/注意マークが付く」といった使い方ができます。

アクセス統制・PII管理

個人情報(PII)を含むカラムを自動検出してタグ付けし、「マスキングした列だけを見せる」「特定ロールしか閲覧できない」といったポリシーを一元管理できます。個人情報保護法・GDPR対応で必須の機能です。


主要ツールの比較

主要ツールの比較

2026年時点で選択肢に上がる主要ツールを、提供形態別に整理します。料金は各社の公表情報や業界の実勢を基にした目安で、規模・ユーザー数・追加コネクタで変動します。

OSS:まず自社で試したい場合

ツール提供形態料金主な特徴
OpenMetadataセルフホスト/マネージド無料+運用工数統一メタデータモデル、データ品質・リネージを標準搭載
DataHubセルフホスト/マネージド無料+運用工数Kafka前提のストリーミング設計、GraphQL API
Amundsenセルフホスト無料+運用工数検索・発見に特化した軽量構成、Lyftが2019年に公開したOSS

OSSを選ぶ最大の理由はライセンス費用ではなく、メタデータを自社の資産として持てる点です。ただし年間0.25〜1人分のプラットフォームエンジニアの工数が必要で、専任リソースを割けない企業には運用負荷が重くなります。

商用SaaS:部門横断で本格運用する場合

ツール料金レンジ(年間・目安)主な特徴
Atlan中堅で数百万〜数千万円規模モダンなUI、アクティブメタデータ設計、Slack/Teams連携が標準
Alation数千万円規模ガバナンスと用語集の機能が厚く、Snowflakeとの統合実績が長い
Collibra数千万円規模ガバナンス・コンプライアンス機能が網羅的、金融・公共での導入が多い
Select Star見積(中堅向け価格帯)自動リネージと利用状況分析が標準搭載、導入工数が軽い

商用SaaSはメタデータ管理を専任チームに任せず、業務側に定着させる仕掛け(ワークフロー、承認フロー、Slack連携など)が揃っています。本体ライセンスとは別に、実装SI費用が本体と同等かそれ以上になるケースも見込んでおく必要があります。

クラウド組込:既に単一クラウドで動いている場合

ツール料金主な特徴
Google Cloud Dataplex Universal Catalog(旧Data Catalog)従量課金GCS・BigQuery・Looker横断のメタデータ統合
AWS Glue Data Catalog100万オブジェクト/月まで無料、超過分は少額の従量課金AWSネイティブ、Athena・EMR・Redshiftと直結
Microsoft Purview2025年1月から従量課金モデルに移行(資産数と処理量に応じた課金)M365・Azure・ハイブリッド対応、コンプラ機能が厚い

マルチクラウドの企業がクラウド組込型を選ぶと、結局それぞれのカタログが分断されて何も解決しない、という失敗が最も多いパターンです。単一クラウドに寄せている企業以外は、OSSか商用SaaSを検討したほうが安全です。

国内:日本語UI・伴走型で入れたい場合

  • COMETA(primeNumber):日本語UIとメタデータ管理を軸にしたSaaS。2025年6月に「AIデータプラットフォーム」へ刷新し、ベータ提供していた対話型AIアシストを正式版化。メタデータ一括生成・個人情報検出も提供しています。NTTコミュニケーションズとの販売連携も発表されています。

英語UIに抵抗のある業務ユーザーが多い、あるいは実装支援まで含めて日本語で対応してほしい、といった場合は国内SaaSが現実的な選択肢になります。

選定フロー

Q1. データ基盤は単一クラウドか?
YES(単一)
Q2. どのクラウドを使っているか?
AWS → AWS Glue Data Catalog
GCP → Google Cloud Dataplex
Azure / M365 → Microsoft Purview
NO(マルチクラウド/複数DWH)
Q3. 専任のプラットフォームエンジニアがいるか?
YES → OpenMetadata / DataHub(OSS自社運用)
NO → Atlan / Alation / Collibra(商用SaaS)
日本語UI・伴走型が必須 → COMETA
ツール選定の分岐(自社に合う3〜4問で選択肢が絞れる)

図の分岐は「単一クラウドか」「専任エンジニアがいるか」「日本語UI必須か」の3問で選択肢を絞る、Evastの支援現場での意思決定パターンをまとめたものです。次の章のスモールスタートの考え方と併せて判断してください。


データカタログ導入のスモールスタート

データカタログ導入のスモールスタート

データカタログの失敗事例で最も多いのは「全社一斉展開」です。成功している企業は、次の3ステップを踏んでいます。

ステップ1:1ドメイン・1ユースケースに絞る

最初から全社データを対象にすると、オーナー不在・命名規則の合意形成に3か月かかり、経営が興味を失って頓挫します。まずは具体的なペインを1つ選びます。

  • 「営業KPIダッシュボードの元データ整備」
  • 「マーケの広告レポートで参照しているテーブルの棚卸し」
  • 「解約分析に使うテーブルを1箇所にまとめる」

1ドメイン30〜100テーブル、期間1〜2か月が現実的な範囲です。

ステップ2:オーナーシップを先に定義する

導入プロジェクトが止まる最大の要因は、Go-Live前にデータオーナーが決まっていないことです。テーブル/ドメイン単位で「誰が定義を維持するか」を書面化してから、収集を始めます。

オーナーは兼任で構いませんが、「回答責任者は誰か」だけは明確にしておきます。オーナーが決まっていないデータは、カタログに載せても誰も更新せず、すぐに実態と乖離します。

ステップ3:メタデータ標準と最小限のグロッサリを固める

技術的な導入の前に、次の3点を合意します。

  1. 命名規則:テーブル名・カラム名の付け方(fact_sales_dailyなど)
  2. 必須タグ:ドメイン・オーナー・機密度の3つは全テーブルに必須
  3. PII分類:個人情報を含むカラムの識別ルール

ここまで固まった段階で、はじめてツール選定に入ります。ツールを先に決めてから運用ルールを後付けすると、ツール依存の運用になり、乗り換え時に一からやり直しになります。

「AIエージェント/社内ChatGPTに渡すデータの整備順序」については、社内AI・社内ChatGPTを業務で使うためのデータ準備で導入前提の全体像を扱っています。データカタログは、その全体像の一部を占める「見つけられる状態を作る」パートに相当します。


導入でつまずくポイント

導入でつまずくポイント

現場でよく見る失敗パターンを5つ挙げておきます。ツール選定と同じくらい、避け方の理解が大事です。

1. 「導入して終わり」で棚卸しが止まる

カタログは継続的に育てる仕組みです。半年に1度の棚卸し・スチュワードシップ会議(データオーナーが集まり定義や責任範囲を見直す会)・オーナー変更フローを最初から設計しないと、Go-Live後3か月で情報が古くなり、誰も見なくなります。

2. スコープを絞らず全社一斉展開する

前章でも触れましたが、これが失敗の筆頭です。まず1ドメインで成功事例を作り、その事例を持って次のドメインに広げる方が、結果として全社浸透までの時間が短くなります。

3. ユーザー教育を後回しにする

高機能なカタログを入れても、業務ユーザーが検索の使い方や用語集の意味を知らなければ、採用率は10%に届きません。データチームが部門ごとに30分ハンズオンを回すという地道な取り組みが、結局は定着の速さを決めます。

4. ツール選定を「機能比較表」だけで決める

比較表上の機能差は、実務での定着率をあまり左右しません。むしろ業務ユーザーが自分で更新できるUIか、既存のSlack/Teamsに通知を流せるかといった「使い続けられるか」の観点で判断が分かれます。PoCの段階で、必ず業務ユーザー自身に触ってもらってから決めるほうが安全です。

5. データ品質・リネージなしで「検索だけ」入れる

検索できるだけのカタログは、Excelの一覧より少し便利な程度で終わります。リネージとデータ品質のシグナル(「このテーブルは3日更新されていない」「上流のETLが失敗している」など)が出て初めて、業務ユーザーが「安心して使える/使ってはいけない」を判断できます。導入時からリネージ収集を組み込んでおくことをおすすめします。


まとめ:データカタログはAI時代の「下地」

データカタログは10年前から存在する概念ですが、生成AI・RAG・MCPが普及した2025〜2026年に、その意味合いが「あると便利な検索ツール」から「AIに社内データを使わせるための必須基盤」へと格上げされました。

大事な観点を最後に整理します。

  • 企業データの半分以上はダーク(所在不明)で、そのままAIに渡すと誤答が量産される
  • データカタログは「どこに何があるか」の目録層。セマンティックレイヤー(意味定義層)、MCP(配信層)と3層で補完する
  • ツールはOSS(OpenMetadata・DataHub)/商用SaaS(Atlan・Alation・Collibra)/クラウド組込(Dataplex・Glue・Purview)/国内(COMETA)から、単一クラウドかマルチクラウドか、専任チームの有無で選ぶ
  • 導入は1ドメイン1〜2か月のスモールスタートで、オーナーシップと命名規則を先に固める

Evastでは、データマネジメント・データガバナンスの設計から、データカタログの選定・PoC・伴走運用までを支援しています。「AIに社内データを使わせたいが、まず何から手を付けるべきか分からない」という段階からのご相談も歓迎です。

詳しくはデータマネジメント支援サービスのページをご覧ください。


参考文献

  • Gartner, “Magic Quadrant for Data and Analytics Governance Platforms” (初版2025年1月/第2版2026年1月)
  • Splunk, “The State of Dark Data” (2024年更新版)
  • IDC, “Global DataSphere and StorageSphere Forecast” (2024)
  • Atlan, “Data Catalog for AI: Capabilities, Uses & Tooling in 2026” (2026)
  • Atlan, “Active Metadata: The Complete 2026 Guide” (2026)
  • Microsoft Learn, “Microsoft Purview Data Governance Pricing Announcement” (2025年1月)
  • AWS, “AWS Glue Pricing” (2025)
  • primeNumber, “COMETAをAIデータプラットフォームへ刷新” (2025年6月)
  • Secoda, “Mistakes To Avoid When Creating a Data Catalog” (2024年更新版)

よくある質問

データカタログとは何ですか?
社内に散らばるテーブル・ビュー・ファイル・ダッシュボード・機械学習モデルなどを、検索できる形でまとめた「データの図書館目録」です。名前・所有者・説明・タグ・データ品質・リネージ(どのデータから作られたか)といったビジネスの文脈まで一緒に管理する点が、単なる一覧表と違います。データ利用者が「使いたい数字がどこにあるか」を自力で探せる状態を作るための基盤です。
データディクショナリやメタデータ管理と何が違うのですか?
データディクショナリは1つのデータベースに閉じたテーブル・カラム定義書で、多くの場合Excelやドキュメントで管理されます。メタデータ管理はメタデータを集め・整え・活用する裏側のプロセス全体を指します。データカタログはその上に立つ「検索・発見のUI層」で、複数DWHやBIツールを横断して探せる点が最大の違いです。
なぜAI時代にデータカタログが急に必要になったのですか?
生成AIやAIエージェントに社内データを使わせるには、AIが「どのテーブルが正しいか」「どのカラムが何を意味するか」を判断できる状態が前提になるためです。ガートナーは2025年1月にデータ&アナリティクス・ガバナンスのMagic Quadrantを新設し、2026年1月の第2版では「アクティブメタデータ」「AIレディネス」「AIエージェント対応」を評価軸の中心に据えています。整備されていないダークデータをAIに渡すと、意味を推測した誤った回答を大規模に量産するリスクが顕在化します。
どのツールを選べばよいですか?
選定軸は主に3つです。(1)クラウドが1つだけならAWS Glue・Google Cloud Dataplex・Microsoft Purviewといったクラウド組込型が最短。(2)マルチクラウドや複数DWHを横断するならOpenMetadata・DataHubなどのOSSかAtlan・Alationといった商用SaaS。(3)日本語UIやAI連携機能を重視し伴走型で入れたいならCOMETAが選択肢に入ります。まず「1つのドメイン」で試して、あとから広げるのが定石です。
導入にはどのくらいの期間・費用がかかりますか?
1ドメイン・数十テーブル規模のPoC(概念実証)なら1〜2か月、部門横断で100テーブル超を整えるなら3〜6か月が目安です。費用はOSSを自社運用なら年間ライセンス無料+プラットフォームエンジニア0.25〜1人分の工数、商用SaaSは中堅で年間1,500万〜7,000万円が実勢レンジです。AWS GlueやDataplexなどクラウド組込型は月数万〜数十万円から始められます。
Share:
Back to Blog
データガバナンスのスモールスタート|中小企業が最低限やる4項目と費用【2026年版】 データマネジメント
約9分

データガバナンスのスモールスタート|中小企業が最低限やる4項目と費用【2026年版】

データガバナンスは大企業のフル装備で捉えると中小企業では回りません。用語定義・権限・品質・変更履歴の最低限4項目を、月額ツール数万円+0.1〜0.2人月で始める構成と3ヶ月ロードマップ、稟議で問われる費用感と、ルール先行で失敗する典型パターンを整理した2026年版です。

医療・介護のデータ活用とデータ基盤の作り方|2026年版 データマネジメント
約13分

医療・介護のデータ活用とデータ基盤の作り方|2026年版

医療・介護のデータ活用が進まない本質は「電子カルテのベンダー分断」「3省2ガイドライン」「要配慮個人情報の同意設計」の3つの壁。法務と情シスで足が止まる領域を、院内経営ダッシュボードから4〜8週間で立ち上げる現実解と、初期50万〜1,500万円のアプローチ別費用相場で、稟議に持ち込める粒度で整理しました。

データオブザーバビリティとは?データ品質監視の5つの柱と始め方 データマネジメント
約13分

データオブザーバビリティとは?データ品質監視の5つの柱と始め方

データオブザーバビリティ(データ基盤の健康状態を継続的に把握する仕組み)の定義、データ品質の監視で見る5つの柱、dbtのテストとの違い、ツールの選択肢と費用感、スモールスタートの3ステップ、よくある失敗までを整理します。「ダッシュボードの数字がおかしいと現場から指摘される」状態を抜け出したい、データ基盤の運用担当者・情報システム部門のマネージャー向けにまとめました。