Analytics Terminology#

このページでは、アナリティクスアクセラレーターPGAAおよびハイブリッドマネージャーHM分析機能で使用される重要な用語を定義します。

概念、ハウツー、機能ガイドを探索する際のクイックリファレンスとして使用します。

Apache Iceberg#

オブジェクトストレージに保存される大規模な分析データセットのオープンテーブル形式。スキーマの進化、タイムトラベル、および多くの分析エンジンSpark、Trino、Flink、Postgresとの相互運用性を提供します。

Apache Iceberg Integration With Analytics Accelerator


デルタレイク#

ACIDトランザクションと信頼性をデータレイクに追加するオープンテーブル形式とストレージレイヤー_delta_logトランザクションログを使用してParquetファイルに構築されています。

Delta Lake Integration with Analytics Accelerator


データレイクハウス#

データレイクとデータウェアハウスの要素を組み合わせた最新のアーキテクチャ。

  • オブジェクトストレージにデータを保存する

  • オープンテーブルフォーマットのサポートIceberg、Delta Lake

  • ベクトル化されたクエリエンジンを使用して、高速SQL分析を提供します

  • ストレージをコンピューティングから分離する

関連概念 Data lakehouse


EDB Postgres Lakehouseクラスター#

オブジェクトストレージに保存されているデータに高速SQLクエリを実行するためにハイブリッドマネージャーによってプロビジョニングされた管理対象分析コンピューティングクラスター。

  • IcebergおよびDelta Lakeフォーマットをサポート

  • ベクトル化されたクエリエンジンApache DataFusionを使用します

  • スケーラビリティとコスト効率のためにストレージとコンピューティングを分離

EDB Postgres Lakehouse Architecture


EDB Postgres Distributed PGD#

Postgresの高度な分散バージョン

  • 高可用性とマルチマスターリプリケーションを提供します

  • 高度なデータ階層化パターン階層化テーブルを有効にします

  • Lakehouseクラスターとシームレスに動作して、スケーラブルな分析を実現

Learn more


階層化テーブル#

PGD AutoPartition を使用して大規模な時間ベースのデータセットを管理する機能。

  • ホットデータ はPGDトランザクションクラスターに残ります

  • コールドデータ はApache Icebergテーブルとしてオブジェクトストレージにオフロードされます

  • クエリーはホットデータとコールドデータの両方に透過的にアクセスできます

Tiered Tables With Analytics Accelerator


PGAAアナリティクスアクセラレーター#

Postgresで次のことを可能にするEDB機能。

  • クエリオープンテーブルフォーマットIceberg、Delta Lake

  • オブジェクトストレージにマップする 外部テーブル を定義する

  • Power Lakehouseクラスタークエリー

  • PGD階層テーブルのオフロードとクエリーを有効にする

See how-tos


PGFS Postgresファイルシステム#

Postgresがオブジェクトストレージへのアクセスに使用できる ストレージの場所 を定義する拡張機能。

  • IcebergとDelta LakeへのアクセスにPGAAおよびPGDによって使用

  • AWS S3、Google Cloud Storage、および互換性のあるサービスをサポート

  • オブジェクトストレージを照会する必要がある各レイクハウスまたはPGDクラスターで構成する必要があります

See how-tos


AutoPartition#

PGD双方向レプリケーションの機能

  • PGDテーブルの時間ベースのパーティションを自動的に作成します

  • analytics_offload_period で構成されている場合、古いパーティションをオブジェクトストレージに自動的にオフロード

See how-tos


BDR分析テーブル#

内部PGDコンセプト

  • analytics_table ビューは、階層テーブルオフロード用にマークされたPGDテーブルを追跡します

  • 各テーブルの状態とオフロードの進行状況を追跡します

階層テーブルの動作の監視と検証に役立ちます。

See how-tos


氷山カタログ#

Icebergテーブルのスキーマ、場所、バージョンを追跡するメタデータサービス

  • 複数のエンジンSpark、Trino、Postgres間の完全な相互運用性に必要

  • HM管理Lakekeeperまたは外部AWS Glue、Nessie、Polarisなどで管理できます

  • PGAAとPGDは両方とも、Iceberg RESTカタログへの接続をサポート

See how-tos


Lakekeeper#

HM管理のIcebergカタログサービス

  • Icebergテーブルの集中カタログを提供します

  • カタログ統合によるPGD階層テーブルのオフロードをサポート

  • カタログベースのテーブル検出を介してLakehouseクラスタークエリをサポート

  • Iceberg RESTカタログAPIを使用

See how-tos


オープンテーブルフォーマット#

分析に使用される標準化されたファイルレイアウトとメタデータ形式

  • Apache Iceberg

  • デルタレイク

同じデータSpark、Trino、Postgres Lakehouseなどへのマルチエンジンアクセスを有効にします。

Learn more


ベクトル化されたクエリエンジン#

行ごとではなく 列バッチ でデータを処理する分析エンジン

  • 分析クエリを高速化します

  • 最新のCPU機能SIMDを利用

  • Lakehouseクラスタークエリパフォーマンスを強化

EDB Lakehouseクラスターは、このために Apache DataFusion を埋め込みます。


データ階層化#

ホット 、 ウォーム 、および コールド データをさまざまなストレージ階層に保存する方法

  • ホット→高速トランザクションPGDノード

  • コールド→オブジェクトストレージIcebergテーブル

  • 階層テーブルは、Postgres + HMでこのパターンを自動化します

関連概念 Data tiering


ストレージとコンピューティングの分離#

Lakehouseアーキテクチャで使用されるパターン

  • オブジェクトストレージ にデータを保存する 独立してスケーリング

  • ストレージとは無関係に分析コンピューティングレイクハウスクラスターをスケールする

費用効率の高い、柔軟な分析アーキテクチャを有効にします。

関連概念 Separation of storage and compute


次のステップ#

重要な用語を理解したところで、