Analytics Terminology#
このページでは、アナリティクスアクセラレーターPGAAおよびハイブリッドマネージャーHM分析機能で使用される重要な用語を定義します。
概念、ハウツー、機能ガイドを探索する際のクイックリファレンスとして使用します。
Apache Iceberg#
オブジェクトストレージに保存される大規模な分析データセットのオープンテーブル形式。スキーマの進化、タイムトラベル、および多くの分析エンジンSpark、Trino、Flink、Postgresとの相互運用性を提供します。
デルタレイク#
ACIDトランザクションと信頼性をデータレイクに追加するオープンテーブル形式とストレージレイヤー_delta_logトランザクションログを使用してParquetファイルに構築されています。
データレイクハウス#
データレイクとデータウェアハウスの要素を組み合わせた最新のアーキテクチャ。
オブジェクトストレージにデータを保存する
オープンテーブルフォーマットのサポートIceberg、Delta Lake
ベクトル化されたクエリエンジンを使用して、高速SQL分析を提供します
ストレージをコンピューティングから分離する
関連概念 Data lakehouse
EDB Postgres Lakehouseクラスター#
オブジェクトストレージに保存されているデータに高速SQLクエリを実行するためにハイブリッドマネージャーによってプロビジョニングされた管理対象分析コンピューティングクラスター。
IcebergおよびDelta Lakeフォーマットをサポート
ベクトル化されたクエリエンジンApache DataFusionを使用します
スケーラビリティとコスト効率のためにストレージとコンピューティングを分離
EDB Postgres Distributed PGD#
Postgresの高度な分散バージョン
高可用性とマルチマスターリプリケーションを提供します
高度なデータ階層化パターン階層化テーブルを有効にします
Lakehouseクラスターとシームレスに動作して、スケーラブルな分析を実現
Learn more
階層化テーブル#
PGD AutoPartition を使用して大規模な時間ベースのデータセットを管理する機能。
ホットデータ はPGDトランザクションクラスターに残ります
コールドデータ はApache Icebergテーブルとしてオブジェクトストレージにオフロードされます
クエリーはホットデータとコールドデータの両方に透過的にアクセスできます
PGAAアナリティクスアクセラレーター#
Postgresで次のことを可能にするEDB機能。
クエリオープンテーブルフォーマットIceberg、Delta Lake
オブジェクトストレージにマップする 外部テーブル を定義する
Power Lakehouseクラスタークエリー
PGD階層テーブルのオフロードとクエリーを有効にする
See how-tos
PGFS Postgresファイルシステム#
Postgresがオブジェクトストレージへのアクセスに使用できる ストレージの場所 を定義する拡張機能。
IcebergとDelta LakeへのアクセスにPGAAおよびPGDによって使用
AWS S3、Google Cloud Storage、および互換性のあるサービスをサポート
オブジェクトストレージを照会する必要がある各レイクハウスまたはPGDクラスターで構成する必要があります
See how-tos
AutoPartition#
PGD双方向レプリケーションの機能
PGDテーブルの時間ベースのパーティションを自動的に作成します
analytics_offload_periodで構成されている場合、古いパーティションをオブジェクトストレージに自動的にオフロード
See how-tos
BDR分析テーブル#
内部PGDコンセプト
analytics_table ビューは、階層テーブルオフロード用にマークされたPGDテーブルを追跡します
各テーブルの状態とオフロードの進行状況を追跡します
階層テーブルの動作の監視と検証に役立ちます。
See how-tos
氷山カタログ#
Icebergテーブルのスキーマ、場所、バージョンを追跡するメタデータサービス
複数のエンジンSpark、Trino、Postgres間の完全な相互運用性に必要
HM管理Lakekeeperまたは外部AWS Glue、Nessie、Polarisなどで管理できます
PGAAとPGDは両方とも、Iceberg RESTカタログへの接続をサポート
See how-tos
Lakekeeper#
HM管理のIcebergカタログサービス
Icebergテーブルの集中カタログを提供します
カタログ統合によるPGD階層テーブルのオフロードをサポート
カタログベースのテーブル検出を介してLakehouseクラスタークエリをサポート
Iceberg RESTカタログAPIを使用
See how-tos
オープンテーブルフォーマット#
分析に使用される標準化されたファイルレイアウトとメタデータ形式
Apache Iceberg
デルタレイク
同じデータSpark、Trino、Postgres Lakehouseなどへのマルチエンジンアクセスを有効にします。
ベクトル化されたクエリエンジン#
行ごとではなく 列バッチ でデータを処理する分析エンジン
分析クエリを高速化します
最新のCPU機能SIMDを利用
Lakehouseクラスタークエリパフォーマンスを強化
EDB Lakehouseクラスターは、このために Apache DataFusion を埋め込みます。
データ階層化#
ホット 、 ウォーム 、および コールド データをさまざまなストレージ階層に保存する方法
ホット→高速トランザクションPGDノード
コールド→オブジェクトストレージIcebergテーブル
階層テーブルは、Postgres + HMでこのパターンを自動化します
関連概念 Data tiering
ストレージとコンピューティングの分離#
Lakehouseアーキテクチャで使用されるパターン
オブジェクトストレージ にデータを保存する 独立してスケーリング
ストレージとは無関係に分析コンピューティングレイクハウスクラスターをスケールする
費用効率の高い、柔軟な分析アーキテクチャを有効にします。
関連概念 Separation of storage and compute
次のステップ#
重要な用語を理解したところで、