Databricks データを操作する
Databricks データをプラットフォームにインポートすると、Databricks のコストと使用状況の分析とモニタリングを開始できます。Databricks データは 1 時間単位で追跡およびレポートされます。
Databricks システムテーブル
コンソールは、次の Databricks システムテーブルと連携します。
| System Table | 説明 |
|---|---|
system.billing.usage | アカウント全体の課金対象となるすべての使用状況レコードを含みます。 |
system.billing.list_prices | SKU 料金の履歴ログです。SKU 料金に変更があるたびにレコードが追加されます。 |
system.compute.node_timeline | all-purpose および jobs コンピュートリソースの利用状況メトリクスを取得します。 |
system.access.workspaces_latest | アカウント内のすべての workspace のメタデータを含みます。 |
system.compute.clusters | 任意のクラスタのコンピュート構成の履歴全体を保持します。 |
system.compute.warehouses | 任意の SQL warehouse の構成履歴全体を保持します。 |
DoiT コネクタ用のサービスプリンシパルを作成すると、必要な権限が付与されます。
Cloud Analytics における Databricks データ
ディメンションおよびメトリクスを通じて Databricks データを取得できます。以下に、DoiT と Databricks の用語の対応関係を示します。
基本メトリクス
DoiT term | Databricks term | 説明 |
|---|---|---|
cost | cost | コンピュートワークロード(クラスタ、SQL warehouses など)で消費された Databricks Units (DBUs) の合計コストと、基盤となるインフラストラクチャに対して選択したクラウドプロバイダーから別途請求される料金の合計です。 |
usage | usage | Databricks コンピュートリソース (DBUs) およびワークロードやユーザーが使用した特定機能の消費量です。 |
標準ディメンション
| DoiT term | 説明 |
|---|---|
| Billing Account | 特定の Databricks アカウントの一意の識別子です。billing usage table schema の account_id にマッピングされます。 |
| Project ID | Databricks warehouse の一意の識別子です。billing usage table schema の workspace_id にマッピングされます。 |
| Project/Account name | Databricks workspace の名前です。workspaces system table schema の workspace_name にマッピングされます。 |
| Usage start time | 記録された使用状況が発生した時間または課金間隔の開始時刻です。billing usage table schema の usage_start_time にマッピングされます。 |
| Usage end time | 記録された使用状況が発生した課金間隔の終了時刻です。billing usage table schema の usage_end_time にマッピング されます。 |
| Service ID/description | 課金対象の使用状況の最終的な原因となった特定の Databricks プロダクトまたは機能です。billing usage table schema の billing_origin_product にマッピングされます。例: SQL、ALL_PURPOSE、INTERACTIVE。 |
| SKU ID/Description | 特定の使用レコードにおいて消費され、コストが発生した特定の Stock Keeping Unit (SKU) です。billing usage table schema の usage_sku_name にマッピングされます。例: STANDARD_ALL_PURPOSE_COMPUTE、SQL_CLASSIC_COMPUTE、ENTERPRISE_ALL_PURPOSE_COMPUTE_(PHOTON)。 |
| Report cost | 特定の単位使用量に対するドル(または設定した通貨)での推定コストです。billing usage table schema の usage_quantity および pricing table schema の pricing にマッピングされます。 |
| Report usage | 記録された時間間隔中に、特定の Databricks プロダクト、機能、またはリソースが消費した単位数です。usage_quantity は usage_unit に依存します。例えば、usage_unit が STORAGE_SPACE の場合、usage_quantity は TB-hours または GB-hours になります。billing usage table schema の usage_quantity にマッピングされます。 |
| Usage unit | usage_quantity の測定単位です。billing usage table schema の usage_unit にマッピングされます。例: DBU、STORAGE_SPACE、NETWORK_BYTE、API_OPERATION。 |
| Cost type | 使用レコードが元のエントリか、Databricks によって行われた修正に関連するかを示します。billing usage table schema の record_type にマッピングされます。例: ORIGINAL、RETRACTION、RESTATEMENT。 |
| Resource ID | コンピュート、ストレージ、またはデータを消費または管理する Databricks 内のさまざまなオブジェクトやエンティティに割り当てられる一意の識別子です。 |
| Operation | プラットフォーム上で実行され、コンピュートリソースを消費し、DBUs で測定される料金が発生する Databricks のアクションまたはタスクです。 |
| Row ID | テーブル内のそれぞれの使用レコード(行)の一意の識別子です。billing usage table schema の record_id にマッピングされます。 |
システムラベル
以下は、プラットフォームで使用できる Databricks のシステムラベルです。
-
databricks/account_id: 特定の Databricks アカウントの一意の識別子です。
-
databricks/cloud: Databricks warehouse が使用しているクラウドプロバイダーです。例:
AWS、AZURE、GCP。 -
databricks/cluster_name: Databricks クラスタ名です。
-
databricks/usage_type: DBUs を消費しているワークロードタイプまたは特定機能です。例:
STORAGE_SPACE。 -
databricks/warehouse_name: Databricks warehouse 名です。
Identity metadata
identity_metadata は、使用状況に関与するアイデンティティに関する詳細情報を提供します。
-
databricks/identity_metadata/run_as: ワークロ ードを実行したユーザーを記録します。これらの値は、Identity metadata reference に記載されている特定のワークロードタイプに対してのみ設定されます。
-
databricks/identity_metadata/owned_by: これは SQL warehouse の使用状況にのみ適用され、その使用状況の原因となった SQL warehouse を所有するユーザーまたはサービスプリンシパルを記録します。
-
databricks/identity_metadata/created_by: これは Databricks Apps に適用され、そのアプリを作成したユーザーのメールアドレスを記録します。
使用メタデータ
usage_metadata の値は、使用レコードに関係するワークスペースオブジェクトおよびリソースに関連する文字列です。詳細は、Usage metadata reference を参照してください。
-
databricks/usage_metadata/cluster_id: コンピュートクラスタインスタンスの一意の識別子。
-
databricks/usage_metadata/destination_region: データの転送先、またはリソースのレプリケート先である AWS または Azure のリージョン。
-
databricks/usage_metadata/notebook_id: Databricks の使用に関連付けられたノートブックの一意の識別子。
-
databricks/usage_metadata/dlt_pipeline_id: 使用レコードに関連付けられた宣言型パイプラインの一意の識別子。
-
databricks/usage_metadata/dlt_update_id: 使用レコードに関連付けられたパイプライン更新の一意の識別子。
-
databricks/usage_metadata/dlt_maintenance_id: 使用レコードに関連付けられたパイプラインメンテナンスタスクの一意の識別子。
-
databricks/usage_metadata/run_name: 使用レコードに関連付けられた Foundation Model Fine-tuning 実行の、ユーザー向けの一意の名前。
-
databricks/usage_metadata/notebook_path: 使用に関連付けられたノートブックのワークスペースストレージパス。
-
databricks/usage_metadata/central_clean_room_id: 使用レコードに関連付けられた central clean room の一意の識別子。
-
databricks/usage_metadata/app_id: 使用レコードに関連付けられたアプリの一意の識別子。
-
databricks/usage_metadata/budget_policy_id: ワークロードに適用されているサーバーレス予算ポリシーの一意の識別子。
-
databricks/usage_metadata/endpoint_id: API エンドポイントの一意の識別子。
-
databricks/usage_metadata/endpoint_name: Model Serving endpoint など、エンドポイントに付けられた名前。
-
databricks/usage_metadata/job_id: Databricks ジョブに割り当てられた一意の識別子。
-
databricks/usage_metadata/job_name: Databricks ジョブに対してユーザーが指定した、人間が読みやすい名前。
-
databricks/usage_metadata/job_run_id: 特定の Databricks ジョ ブ実行に割り当てられた一意の識別子。
-
databricks/usage_metadata/metastore_id: Unity Catalog メタストアの一意の識別子。
-
databricks/usage_metadata/node_type: Databricks のクラスタノードに使用される、特定の仮想マシン (VM) インスタンスタイプ。
-
databricks/usage_metadata/source_region: データの送信元、またはリソースが元々配置されている AWS または Azure のリージョン。
-
databricks/usage_metadata/warehouse_id: Databricks SQL warehouse の一意の識別子。
製品機能リファレンス
product_features は、使用された特定の製品機能に関する情報を含むオブジェクトで、次のキーと値のペアを含みます。
-
databricks/product_features/jobs_tier: 値には
LIGHT、CLASSIC、またはnullが含まれます。 -
databricks/product_features/sql_tier: 値には
LIGHT、CLASSIC、またはnullが含まれます。 -
databricks/product_features/dlt_tier: 値には
CORE、PRO、ADVANCED、またはnullが含まれます。 -
databricks/product_features/is_serverless: 値には
true、false、またはnullが含まれます。 -
databricks/product_features/is_photon: 値には
true、false、またはnullが含まれます。 -
databricks/product_features/serving_type: 値には
MODEL、GPU_MODEL、FOUNDATION_MODEL、FEATURE、またはnullが含まれます。 -
databricks/product_features/offering_type: 値には
BATCH_INFERENCE、またはnullが含まれます。 -
databricks/product_features/networking_connectivity_type: 値には
PUBLIC_IPとPRIVATE_IPが含まれます。
拡張メトリック
DoiT は Databricks の Cluster CPU utilization と Cluster memory utilization メトリクスをサポートしています。これらは Extended metrics に表示されます。

これらのメトリクスは、DBU コストを具体的なインサイトに変換するために必要な運用上のコンテキストを提供します。例えば、あるクラスタで常に高い CPU 使用率またはメモリ使用率が見られる場合、ボトルネックが発生しており、そのワークロードに対してクラスタのプロビジョニングが不足している可能性を示します。ノードを追加するか、コードを最適化する必要があるかもしれません。
Cluster CPU utilization
Cluster CPU utilization は、クラスタの CPU がタスクを積極的に処理している時間のパーセンテージを測定します。これはユーザーモード (ワークロード)、システムモード (カーネルのオペレーション)、アイドル時間に分解されます。
Cluster memory utilization
Cluster memory utilization は、クラスタのノードで使用されている RAM のパーセンテージを測定します。Spark executor に割り当てられたメモリ、キャッシュされたデータ、およびシステムプロセスに割り当てられたメモリを追跡し、使用中メモリ、未使用のバッファ、キャッシュメモリを区別します。