Analytics Terminology#

このページでは、Analytics Accelerator および Hybrid Manager (HM) の分析機能で使用される主要な用語を定義します。

概念、ハウツー、機能ガイドを調べるときに、クイックリファレンスとして使用します。


アパッチアイスバーグ#

オブジェクトストレージに保存される大規模な分析データセット向けのオープンテーブル形式。スキーマ進化、タイムトラベル、そして多くの分析エンジン(Spark、Trino、Flink、Postgres)との相互運用性を提供します。

Apache Iceberg


デルタ湖#

データレイクにACIDトランザクションと信頼性を追加するオープンテーブル形式とストレージレイヤー。_delta_logトランザクションログを備えたParquetファイル上に構築されています。

Delta Lake


データレイクハウス#

データ レイクとデータ ウェアハウスの要素を組み合わせた最新のアーキテクチャ:

  • オブジェクトストレージにデータを保存する

  • オープンテーブル形式(Iceberg、Delta Lake)をサポート

  • ベクトル化されたクエリエンジンを使用して高速なSQL分析を提供します

  • ストレージをコンピューティングから分離

関連概念: データレイクハウス


EDB Postgres Lakehouse クラスター#

オブジェクト ストレージに保存されているデータに対して高速SQLクエリを実行するために、Hybrid Manager によってプロビジョニングされた管理された分析コンピューティング クラスター。

  • IcebergおよびDelta Lake形式をサポート

  • ベクトル化されたクエリエンジン(Apache DataFusion)を使用します

  • スケーラビリティとコスト効率のためにストレージとコンピューティングを分離します

EDB Postgres Lakehouse


EDB Postgres分散 (PGD)#

Postgres の高度な分散バージョン:

  • 高可用性とマルチマスターレプリケーションを提供

  • 高度なデータ階層化パターン(階層化テーブル)を有効にします

  • スケーラブルな分析のためにLakehouseクラスターとシームレスに連携

Learn more


階層型テーブル#

PGD AutoPartition を使用して大規模な時間ベースのデータセットを管理する機能:

  • ホットデータ はPGDトランザクションクラスタ内に残ります

  • コールドデータ はApache Icebergテーブルとしてオブジェクトストレージにオフロードされます

  • クエリはホットデータとコールドデータの両方に透過的にアクセスできます

EDB Postgres分散 (PGD) と階層化テーブル


PGAA (Postgres 汎用分析アダプタ)#

Postgres で次のことが可能になる拡張機能:

  • オープンテーブル形式(Iceberg、Delta Lake)のクエリ

  • オブジェクトストレージにマップする 外部テーブル を定義する

  • Power Lakehouse クラスタークエリ

  • PGD階層化テーブルのオフロードとクエリを有効にする

Example in use


PGFS (Postgres ファイルシステム)#

Postgres がオブジェクト ストレージにアクセスするために使用できる ストレージの場所 を定義する拡張機能。

  • PGAAとPGDが氷山とデルタ湖へのアクセスに使用

  • AWS S3、Google Cloud Storage、および互換性のあるサービスをサポート

  • オブジェクトストレージをクエリする必要がある各LakehouseまたはPGDクラスターで構成する必要があります

Example in use


自動パーティション#

PGD​​ BDR (双方向レプリケーション) の機能:

  • PGDテーブルの時間ベースのパーティションを自動的に作成します

  • analytics_offload_period が設定されている場合、古いパーティションをオブジェクト ストレージに自動的にオフロードします。

Example in use


BDR分析テーブル#

内部PGDコンセプト:

  • analytics_table ビューは、どの PGD テーブルが Tiered Table オフロードの対象としてマークされているかを追跡します。

  • 各テーブルの状態とオフロードの進行状況を追跡します

階層型テーブルの動作を監視および検証するのに役立ちます。

Example in use


氷山カタログ#

Iceberg テーブルのスキーマ、場所、バージョンを追跡するメタデータ サービス:

  • 複数のエンジン(Spark、Trino、Postgres)間での完全な相互運用性のために必要

  • HM 管理 (Lakekeeper) または外部 (AWS Glue、Nessie、Polaris など) が可能

  • PGAAとPGDはどちらもIceberg RESTカタログへの接続をサポートしています

Example in use


レイクキーパー#

HM が管理する Iceberg カタログ サービス:

  • アイスバーグテーブルの中央カタログを提供します

  • カタログ統合によるPGD階層化テーブルオフロードをサポート

  • カタログベースのテーブル検出を通じてLakehouseクラスタークエリをサポート

  • Iceberg RESTカタログAPIを使用

Example in use


オープンテーブル形式#

分析に使用される標準化されたファイルレイアウトとメタデータ形式:

  • Apache Iceberg

  • デルタ湖

同じデータへのマルチエンジン アクセスを有効にします (Spark、Trino、Postgres Lakehouse など)。

オープンテーブル形式


ベクトル化されたクエリエンジン#

データを 列バッチ で(行ごとではなく)処理する分析エンジン:

  • 分析クエリを高速化

  • 最新のCPU機能(SIMD)を活用

  • Lakehouse クラスターのクエリパフォーマンスを強化

EDB Lakehouse クラスターには、このために Apache DataFusion が埋め込まれています。


データ階層化#

ホット 、 ウォーム 、 コールド データを異なるストレージ層に保存する方法:

  • ホット → 高速トランザクションPGDノード

  • コールド → オブジェクト ストレージ (アイスバーグ テーブル)

  • 階層型テーブルはPostgres + HMでこのパターンを自動化します

関連概念: データ階層化


ストレージとコンピューティングの分離#

Lakehouse アーキテクチャで使用されるパターン:

  • オブジェクト ストレージ にデータを保存する (独立してスケーリング可能)

  • ストレージとは独立して分析コンピューティング(Lakehouse クラスター)を拡張

コスト効率が高く、弾力性のある分析アーキテクチャを実現します。

関連概念: ストレージとコンピューティングの分離


次のステップ#

重要な用語を理解したら、