Analytics Terminology#
このページでは、Analytics Accelerator および Hybrid Manager (HM) の分析機能で使用される主要な用語を定義します。
概念、ハウツー、機能ガイドを調べるときに、クイックリファレンスとして使用します。
アパッチアイスバーグ#
オブジェクトストレージに保存される大規模な分析データセット向けのオープンテーブル形式。スキーマ進化、タイムトラベル、そして多くの分析エンジン(Spark、Trino、Flink、Postgres)との相互運用性を提供します。
デルタ湖#
データレイクにACIDトランザクションと信頼性を追加するオープンテーブル形式とストレージレイヤー。_delta_logトランザクションログを備えたParquetファイル上に構築されています。
データレイクハウス#
データ レイクとデータ ウェアハウスの要素を組み合わせた最新のアーキテクチャ:
オブジェクトストレージにデータを保存する
オープンテーブル形式(Iceberg、Delta Lake)をサポート
ベクトル化されたクエリエンジンを使用して高速なSQL分析を提供します
ストレージをコンピューティングから分離
関連概念: データレイクハウス
EDB Postgres Lakehouse クラスター#
オブジェクト ストレージに保存されているデータに対して高速SQLクエリを実行するために、Hybrid Manager によってプロビジョニングされた管理された分析コンピューティング クラスター。
IcebergおよびDelta Lake形式をサポート
ベクトル化されたクエリエンジン(Apache DataFusion)を使用します
スケーラビリティとコスト効率のためにストレージとコンピューティングを分離します
EDB Postgres分散 (PGD)#
Postgres の高度な分散バージョン:
高可用性とマルチマスターレプリケーションを提供
高度なデータ階層化パターン(階層化テーブル)を有効にします
スケーラブルな分析のためにLakehouseクラスターとシームレスに連携
階層型テーブル#
PGD AutoPartition を使用して大規模な時間ベースのデータセットを管理する機能:
ホットデータ はPGDトランザクションクラスタ内に残ります
コールドデータ はApache Icebergテーブルとしてオブジェクトストレージにオフロードされます
クエリはホットデータとコールドデータの両方に透過的にアクセスできます
PGAA (Postgres 汎用分析アダプタ)#
Postgres で次のことが可能になる拡張機能:
オープンテーブル形式(Iceberg、Delta Lake)のクエリ
オブジェクトストレージにマップする 外部テーブル を定義する
Power Lakehouse クラスタークエリ
PGD階層化テーブルのオフロードとクエリを有効にする
PGFS (Postgres ファイルシステム)#
Postgres がオブジェクト ストレージにアクセスするために使用できる ストレージの場所 を定義する拡張機能。
PGAAとPGDが氷山とデルタ湖へのアクセスに使用
AWS S3、Google Cloud Storage、および互換性のあるサービスをサポート
オブジェクトストレージをクエリする必要がある各LakehouseまたはPGDクラスターで構成する必要があります
自動パーティション#
PGD BDR (双方向レプリケーション) の機能:
PGDテーブルの時間ベースのパーティションを自動的に作成します
analytics_offload_periodが設定されている場合、古いパーティションをオブジェクト ストレージに自動的にオフロードします。
BDR分析テーブル#
内部PGDコンセプト:
analytics_table ビューは、どの PGD テーブルが Tiered Table オフロードの対象としてマークされているかを追跡します。
各テーブルの状態とオフロードの進行状況を追跡します
階層型テーブルの動作を監視および検証するのに役立ちます。
氷山カタログ#
Iceberg テーブルのスキーマ、場所、バージョンを追跡するメタデータ サービス:
複数のエンジン(Spark、Trino、Postgres)間での完全な相互運用性のために必要
HM 管理 (Lakekeeper) または外部 (AWS Glue、Nessie、Polaris など) が可能
PGAAとPGDはどちらもIceberg RESTカタログへの接続をサポートしています
レイクキーパー#
HM が管理する Iceberg カタログ サービス:
アイスバーグテーブルの中央カタログを提供します
カタログ統合によるPGD階層化テーブルオフロードをサポート
カタログベースのテーブル検出を通じてLakehouseクラスタークエリをサポート
Iceberg RESTカタログAPIを使用
オープンテーブル形式#
分析に使用される標準化されたファイルレイアウトとメタデータ形式:
Apache Iceberg
デルタ湖
同じデータへのマルチエンジン アクセスを有効にします (Spark、Trino、Postgres Lakehouse など)。
ベクトル化されたクエリエンジン#
データを 列バッチ で(行ごとではなく)処理する分析エンジン:
分析クエリを高速化
最新のCPU機能(SIMD)を活用
Lakehouse クラスターのクエリパフォーマンスを強化
EDB Lakehouse クラスターには、このために Apache DataFusion が埋め込まれています。
データ階層化#
ホット 、 ウォーム 、 コールド データを異なるストレージ層に保存する方法:
ホット → 高速トランザクションPGDノード
コールド → オブジェクト ストレージ (アイスバーグ テーブル)
階層型テーブルはPostgres + HMでこのパターンを自動化します
関連概念: データ階層化
ストレージとコンピューティングの分離#
Lakehouse アーキテクチャで使用されるパターン:
オブジェクト ストレージ にデータを保存する (独立してスケーリング可能)
ストレージとは独立して分析コンピューティング(Lakehouse クラスター)を拡張
コスト効率が高く、弾力性のある分析アーキテクチャを実現します。
関連概念: ストレージとコンピューティングの分離
次のステップ#
重要な用語を理解したら、