Apache Iceberg® in Hybrid Manager#

Apache Iceberg®は、オブジェクトストレージに保存される大規模な分析データセット用のオープンテーブル形式です。

ハブクイックリンク Analytics Hub — Core Concepts — Related How-Tos

Hybrid ManagerHMは、Iceberg機能をEDB Postgres展開に統合し、次のことを可能にします。

  • Lakehouseクラスターを介したオブジェクトストレージの効率的なクエリー

  • PGDクラスターからIceberg形式への構造化データのオフロード

  • Icebergテーブルの集中カタログ管理

  • 外部分析エンジンSpark、Trino、Flinkなどとの相互運用性

Icebergの一般的な概要については、 Apache Iceberg® in Hybrid Manager を参照してください。

ハイブリッドマネージャーでIcebergを使用する理由#

Apache Iceberg®は、大規模なデータセットの分析のためのオープンで信頼性の高いパフォーマンスの基盤を提供します。ハイブリッドマネージャーを介して使用すると、次のことができます。

  • ベクトル化された実行を使用して、LakehouseクラスターからIcebergテーブルを高いパフォーマンスで照会します。

  • トランザクションPGDデータをIceberg形式にオフロードして、費用効率の高い階層ストレージと長期分析を実現します。

  • HMを介してIcebergカタログを一元管理するか、外部カタログに接続します。

  • Iceberg形式を使用して、Postgresと他のツールSpark、Trino、Flink間でデータをシームレスに共有します。

重要な用語とアーキテクチャの概要#

ハイブリッドマネージャーPGFS、PGAA、レイクハウス、カタログ、AutoPartition、Analytics Offloadなどで使用される分析用語の定義については、 Analytics concepts (hub) を参照してください。

ハイブリッドマネージャーでIcebergを使用する必要があるのはどのような場合ですか?#

次の場合にIcebergをハイブリッドマネージャーで使用します。

  • **費用対効果の高い方法でPGDデータをアーカイブし、Postgresまたはその他のツールでクエリします。

  • データレイクハウスアーキテクチャ をHM管理または外部のIcebergカタログと統合します。

  • ETLを使用しないラージオブジェクトストレージデータセットで アドホック分析を有効にします 。

  • 階層テーブルを実装 して、PGDで大規模な時系列データセットとストレージライフサイクルを管理します。

  • Iceberg形式を使用して Postgresと外部データ処理 ツールを統合します。

ハイブリッドマネージャーのIcebergの主要機能#

既存のIcebergテーブルのクエリー#

内容 オブジェクトストレージに既に保存されているIcebergテーブルでSQLクエリーを実行します。

理由 ETLまたは重複なしで他のツールSpark、Trino、Flink、PGDオフロードで作成されたデータを再利用できます。

方法 Lakehouseクラスターを使用して、Icebergデータを指すPGAA外部テーブルを定義します。

ここで ファイルベースまたはカタログ管理のS3互換オブジェクトストレージのIcebergテーブル。

ハウツー Read Iceberg/Delta with or without a catalog

Icebergカタログの統合#

内容 LakehouseおよびPGDノードをIcebergカタログHM管理または外部に接続します。

理由 Icebergテーブルのメタデータを一元管理し、一貫したセマンティクスでクエリを実行します。

方法 PGAAファンクションpgaa.add_catalog 、pgaa.attach_catalog を使用して、カタログを接続およびインポートします。

ここで HM管理のLakekeeperカタログ、またはサードパーティのカタログGlue、Nessie、Polaris。

ハウツー Configure an Iceberg catalog connection

注 階層テーブル または PGDオフロード を使用する場合、相互運用性とライフサイクル管理のためにカタログ管理のIcebergテーブルを使用することを強くお勧めします。

PGDデータのIcebergへのオフロード#

内容 PGDトランザクションデータを分析ストレージ用にIceberg形式にオフロードします。

理由 データのクエリー可能を維持しながら、ストレージコストを最適化し、PGD操作負荷を削減します。

方法 PGFSの場所および/またはIcebergカタログを構成し、PGDテーブルで分析レプリケーションを有効にします。

ここで オブジェクトストレージにオフロードされたIcebergテーブル、Lakehouseまたは他のツールでクエリ可能。

Tiered Tables in Hybrid Manager の概念を学習する

ハイブリッドマネージャーでのIcebergのユースケース#

  • クエリアクセスを維持しながらPGDデータをIceberg形式でアーカイブする

  • HM管理カタログを使用した一元化データレイクハウスアーキテクチャ

  • Lakehouseクラスターを介した大規模なデータのアドホック分析

  • PGDデータセットの階層化ストレージとライフサイクル管理の実装

  • Iceberg形式を使用してPGDオフロードデータをSpark、Trino、Flinkパイプラインに公開する

関連 Analytics concepts (hub)

ハイブリッドマネージャーでのIcebergのスタートガイド#

ハイブリッドマネージャーでIcebergの使用を開始するには

  1. Provision a Lakehouse cluster 。

  2. Configure an Iceberg catalog connection HM管理または外部。

  3. PGDと統合する場合、 Tiered Tables in Hybrid Manager を学習します。

  4. Read Iceberg/Delta with or without a catalog 。

  5. 標準のPostgresクライアントを使用して分析クエリを実行します。

関連するハウツー#

次のトピック#

Delta Lake in Hybrid Manager