EDB Postgres Lakehouse Clusters on Hybrid Manager#
EDB Postgres Lakehouseクラスターは、オブジェクトストレージでオープンレイクハウステーブルフォーマットApache Iceberg®、Delta Lakeを照会するための高速分析コンピューティングを提供します。
ハブクイックリンク Analytics Hub — コアコンセプト — 関連するハウツー
Hybrid ManagerHMを使用すると、コンソールとAPIを介してレイクハウスクラスターをプロビジョニングおよび管理し、既存のPGDクラスターおよびより広範な分析エコシステムと統合できます。
EDB Postgres Lakehouseアーキテクチャの基本的な概念については、 EDB Postgres Lakehouse Clusters on Hybrid Manager を参照してください。
ハイブリッドマネージャーでLakehouseクラスターを使用する理由#
マネージド分析コンピューティング HMでレイクハウスクラスターをプロビジョニングして、オブジェクトストレージで高速クエリーを実行します。
コンピューティングとストレージの分離 データをオブジェクトストレージに保持し、必要に応じて分析コンピューティングをスケーリングします。
PGDとの統合 PGD階層テーブルおよびオフロードデータでレイクハウスクラスターを使用します。
相互運用性 Lakehouseクラスターは、他の分析エンジンと共有しているIcebergおよびDelta Lakeテーブルを照会できます。
使いやすいPostgresインターフェイス EDB Postgres Lakehouseクラスターで標準のSQLクライアントとツールを使用します。
重要な用語とアーキテクチャの概要#
ハイブリッドマネージャーPGFS、PGAA、レイクハウスクラスター、アナリティクスオフロードなどで使用されるコア分析用語の定義については、 Analytics concepts (hub) を参照してください。
ハイブリッドマネージャーでレイクハウスクラスターを使用する必要がある場合#
次の場合にハイブリッドマネージャーでレイクハウスクラスターを使用します。
オブジェクトストレージに保存されている大規模なデータセットで 高速でスケーラブルな分析 を実行します。
PGD階層テーブル またはオフロードされたPGDトランザクションデータからのクエリデータ。
Postgresを外部データレイクと統合します IcebergまたはDelta Lakeに構築されています。
データレイクコンテンツへのPostgres SQLアクセスで、 サポートBIツールとアドホックユーザー 。
分析コンピューティングをトランザクションデータベースとは別に管理 - 必要な場合にのみスケーリング。
ハイブリッドマネージャーのレイクハウスクラスターの主要な機能#
オブジェクトストレージでの高速クエリの実行#
内容 オブジェクトストレージに保存されているApache Iceberg®およびDelta Lakeテーブルで分析クエリを実行します。
理由 大規模なデータセットをPostgresストレージに移動せずに、高速でスケーラブルな分析を有効にします。
方法 HMでレイクハウスクラスターをプロビジョニングし、ベクトル化されたクエリ実行でPGAAを使用してデータをクエリします。
ここで PGFSを介して接続されたS3互換オブジェクトストレージバケット。
PGD階層化テーブルとオフロードのサポート#
内容 PGDオフロードおよび階層化データのクエリターゲットとしてレイクハウスクラスターを使用します。
理由 履歴データの照会可能な状態を維持しながら、PGD運用ストレージを最適化します。
方法 Iceberg形式のオブジェクトストレージへの分析レプリケーション用にPGDノードグループを構成します。
ここで レイクハウスクラスターを介して照会された、IcebergのオフロードPGDデータ。
ハイブリッドマネージャーの階層化テーブル の概念を学習する
外部データレイクのクエリ#
内容 他のツールSpark、Trino、Flinkで作成されたIcebergまたはDelta Lakeテーブルを照会します。
理由 Postgresから外部データレイクを照会することにより、データの重複とETLを回避します。
方法 Lakehouseクラスターを外部のIcebergカタログに、またはDelta Lakeストレージに直接接続します。
ここで オプションのカタログ統合を備えたS3互換オブジェクトストレージ。
分析コンピューティングの集中管理#
内容 PGDクラスターと並行してHMで分析クラスターをプロビジョニング、監視、および管理します。
理由 分析コンピューティングとトランザクションコンピューティングを1つのコントロールプレーンで管理します。
方法 HMコンソールまたはAPIを使用して、Lakehouseクラスターを作成および構成します。
ここで Lakehouseクラスターは、HMが管理するクラウド環境で実行されます。
ハイブリッドマネージャーでのレイクハウスクラスターの入門#
ハイブリッドマネージャーでLakehouseクラスターの使用を開始するには
オブジェクトストレージを指す Configure PGFS storage locations 。
PGDと統合する場合、 ハイブリッドマネージャーの階層化テーブル を学習します。
Iceberg/DeltaデータのLakehouseテーブルまたは外部リーダーを作成します。
Postgresクライアントを使用してデータを照会します。