Apache Iceberg® in Hybrid Manager#
Apache Iceberg®は、オブジェクトストレージに保存される大規模な分析データセット用のオープンテーブル形式です。
ハブクイックリンク Analytics Hub — Core Concepts — Related How-Tos
Hybrid ManagerHMは、Iceberg機能をEDB Postgres展開に統合し、次のことを可能にします。
Lakehouseクラスターを介したオブジェクトストレージの効率的なクエリー
PGDクラスターからIceberg形式への構造化データのオフロード
Icebergテーブルの集中カタログ管理
外部分析エンジンSpark、Trino、Flinkなどとの相互運用性
Icebergの一般的な概要については、 Apache Iceberg® in Hybrid Manager を参照してください。
ハイブリッドマネージャーでIcebergを使用する理由#
Apache Iceberg®は、大規模なデータセットの分析のためのオープンで信頼性の高いパフォーマンスの基盤を提供します。ハイブリッドマネージャーを介して使用すると、次のことができます。
ベクトル化された実行を使用して、LakehouseクラスターからIcebergテーブルを高いパフォーマンスで照会します。
トランザクションPGDデータをIceberg形式にオフロードして、費用効率の高い階層ストレージと長期分析を実現します。
HMを介してIcebergカタログを一元管理するか、外部カタログに接続します。
Iceberg形式を使用して、Postgresと他のツールSpark、Trino、Flink間でデータをシームレスに共有します。
重要な用語とアーキテクチャの概要#
ハイブリッドマネージャーPGFS、PGAA、レイクハウス、カタログ、AutoPartition、Analytics Offloadなどで使用される分析用語の定義については、 Analytics concepts (hub) を参照してください。
ハイブリッドマネージャーでIcebergを使用する必要があるのはどのような場合ですか?#
次の場合にIcebergをハイブリッドマネージャーで使用します。
**費用対効果の高い方法でPGDデータをアーカイブし、Postgresまたはその他のツールでクエリします。
データレイクハウスアーキテクチャ をHM管理または外部のIcebergカタログと統合します。
ETLを使用しないラージオブジェクトストレージデータセットで アドホック分析を有効にします 。
階層テーブルを実装 して、PGDで大規模な時系列データセットとストレージライフサイクルを管理します。
Iceberg形式を使用して Postgresと外部データ処理 ツールを統合します。
ハイブリッドマネージャーのIcebergの主要機能#
既存のIcebergテーブルのクエリー#
内容 オブジェクトストレージに既に保存されているIcebergテーブルでSQLクエリーを実行します。
理由 ETLまたは重複なしで他のツールSpark、Trino、Flink、PGDオフロードで作成されたデータを再利用できます。
方法 Lakehouseクラスターを使用して、Icebergデータを指すPGAA外部テーブルを定義します。
ここで ファイルベースまたはカタログ管理のS3互換オブジェクトストレージのIcebergテーブル。
Icebergカタログの統合#
内容 LakehouseおよびPGDノードをIcebergカタログHM管理または外部に接続します。
理由 Icebergテーブルのメタデータを一元管理し、一貫したセマンティクスでクエリを実行します。
方法 PGAAファンクションpgaa.add_catalog
、pgaa.attach_catalog
を使用して、カタログを接続およびインポートします。
ここで HM管理のLakekeeperカタログ、またはサードパーティのカタログGlue、Nessie、Polaris。
ハウツー Configure an Iceberg catalog connection
注 階層テーブル または PGDオフロード を使用する場合、相互運用性とライフサイクル管理のためにカタログ管理のIcebergテーブルを使用することを強くお勧めします。
PGDデータのIcebergへのオフロード#
内容 PGDトランザクションデータを分析ストレージ用にIceberg形式にオフロードします。
理由 データのクエリー可能を維持しながら、ストレージコストを最適化し、PGD操作負荷を削減します。
方法 PGFSの場所および/またはIcebergカタログを構成し、PGDテーブルで分析レプリケーションを有効にします。
ここで オブジェクトストレージにオフロードされたIcebergテーブル、Lakehouseまたは他のツールでクエリ可能。
Tiered Tables in Hybrid Manager の概念を学習する
ハイブリッドマネージャーでのIcebergのユースケース#
クエリアクセスを維持しながらPGDデータをIceberg形式でアーカイブする
HM管理カタログを使用した一元化データレイクハウスアーキテクチャ
Lakehouseクラスターを介した大規模なデータのアドホック分析
PGDデータセットの階層化ストレージとライフサイクル管理の実装
Iceberg形式を使用してPGDオフロードデータをSpark、Trino、Flinkパイプラインに公開する
ハイブリッドマネージャーでのIcebergのスタートガイド#
ハイブリッドマネージャーでIcebergの使用を開始するには
Configure an Iceberg catalog connection HM管理または外部。
PGDと統合する場合、 Tiered Tables in Hybrid Manager を学習します。
標準のPostgresクライアントを使用して分析クエリを実行します。