Delta Lake#
Delta Lake は、ACID 保証、スキーマの適用、タイム トラベル、スケーラブルなパフォーマンスを備えた最新のデータ レイクを強化するオープン ソースのテーブル形式とトランザクション レイヤーです。
EDB は、Analytics Accelerator の一部として Delta Lake テーブルをクエリするためのファーストクラスのサポートを可能にし、大規模なレイクハウス データで Postgres SQL を操作できるようにします。
Hybrid Manager (HM) 内で Delta Lake が使用および管理される方法の詳細については、 Delta Lake を参照してください。
Delta Lakeとは#
Delta Lake は、S3、GCS、Azure Data Lake Storage などのオブジェクト ストレージ システムにデータベースのような信頼性と一貫性を追加します。
主な特徴:
強力なデータ一貫性を備えたACIDトランザクション
スキーマの強制とスキーマの進化のサポート
データの履歴バージョンを照会するためのタイムトラベル
バッチおよびストリーミングのサポート
Apache Parquet 上にトランザクション ログ (
_delta_log) を備えたオープン フォーマット
関連概念: オープンテーブル形式
Delta LakeがEDB分析にとって重要な理由#
Delta Lake のサポートにより、Analytics Accelerator は次のことが可能になります。
Postgres SQLを使用して既存の Delta Lake テーブルをクエリする
Postgres、Spark、Trino、Presto など、相互運用可能なデータ アーキテクチャをサポートします。
システム間の不要なデータの重複や移動を排除
Lakehouse クラスター内の分析クエリに、管理されたバージョン管理されたデータを提供する
関連概念: EDB Postgres Lakehouse
EDBがDelta Lakeを活用する方法#
EDB Postgres Lakehouse クラスターは、PGAA 拡張機能を通じて Delta Lake データへのアクセスを提供します。
CREATE TABLE ... USING PGAA WITH (pgaa.format = 'delta', ...)を使用して Delta Lake 外部テーブルを定義するApache DataFusion を使用したベクトル化実行により、Parquet ベースの Delta Lake テーブルを効率的にクエリします。
スキーマの進化やタイムトラベルなどの Delta Lake 機能のメリットを享受
現在の主なサポート: 既存の Delta Lake テーブルのクエリ。PGD オフロードは現在 Iceberg を対象としています。Delta 読み取りサポートにより、既存の Delta ベースのデータ レイクとの統合が可能になります。
一般的な使用例#
Use case |
Delta Lake + Analytics Accelerator |
|---|---|
Business intelligence reporting |
Query Delta Lake tables using Postgres SQL and BI tools |
Data science and machine learning |
Access Delta tables for model training and feature engineering |
Data lake governance |
Utilize Delta’s ACID guarantees with Lakehouse SQL access |
Cross-platform interoperability |
Query Delta Lake data alongside Spark, Trino, and Postgres Lakehouse |
役割ベースのガイダンス#
学習パス#
関連概念#
次のステップ#
ハイブリッド マネージャー ユーザー向け
ハウツーガイド
Analytics Accelerator learning guide でさらに詳しく調べてください。