Analytics Accelerator Quick Start#

このクイックスタートでは、次のことを行います。

  1. Lakehouseノードを作成します。

  2. 優先するPostgresクライアントを使用してノードに接続します。

  3. オブジェクトストレージ内のサンプルデータTPC-H、TPC-DS、Clickbench、または1BRCを照会します。

詳細および高度なユースケースについては、 PGAA functions reference を参照してください。

はじめに#

Postgres Lakehouseは、EDB Postgres® AIプラットフォームでプロビジョニングできる新しいタイプのPostgresクラスター実際には1つのノードです。これには、オブジェクトストレージの列指向レイクハウステーブルを高速照会するためのApache DataFusion に基づくベクトル化クエリエンジンが含まれています Delta Lake protocol を使用します。

知っておくべきこと#

詳細については、 Analytics Accelerator Concepts および PGAA functions reference を参照してください。ただし、これらが知っておくべき主なポイントです。

  • Postgres Lakehouseノードは一時的なものです。

  • Postgres Lakehouseノードは、オブジェクトストレージのベンチマークデータセットを照会するように事前構成されています。

  • Postgres Lakehouseは通常読み取り専用ですが、それ以外の場合は、すべての有効なPostgresクエリーをサポートします。

  • システムテーブルは書き込み可能なため、ユーザーとロールを作成できます。これらのテーブルは、接続されたブロックストレージに保存されるため、インスタンスが再起動されるまで持続し、バックアップ/復元操作の一部として保存されます。それ以外の場合、Lakehouseテーブルは最終的にオブジェクトストレージに保存されるため、バックアップの一部ではありません。

基本アーキテクチャ#

この図は、Lakehouseノードのボックスの内容を示しています。

Level 300 Architecture

Level 300 Architecture#

はじめに#

HCPポータルにログインしてプロジェクトを作成したら、クラスターを作成できます。

Lakehouseノードを作成する#

プロジェクトページで、 Create New > Lakehouse Analytics を選択します。

Create Lakehouse Node Dropdown

Create Lakehouse Node Dropdown#

Create Analytical Cluster ページが開きます。ここで、テンプレートビルドまたはカスタムビルドを選択できます。

Create Lakehouse Node Wizard Step 1

Create Lakehouse Node Wizard Step 1#

Custom Build を選択し、 Start from Scratch を選択します。 Create Analytical Cluster ページが開き、クラスターのサイズと構成を選択できます。

Create Lakehouse Node Wizard Step 2

Create Lakehouse Node Wizard Step 2#

次に、 Clusters ページに戻ります。ここで、クラスターの作成時に、クラスターのステータスを確認できます。クラスターのプロビジョニングには10〜15分かかる場合があります。

いくつかの注意事項

  • 独自のパスワードを入力する必要があります。安全なパスワードを作成し、パスワードマネージャーに保存します。 HCPはパスワードを保存しません。

  • EDB Postgres Advanced ServerまたはEDB Postgres Extended Serverを選択できます。

  • NVMeドライブ上のすべてのデータは、クラスターがシャットダウンすると失われます。

  • システムテーブルの永続データユーザー、ロールなどは、接続されたブロックストレージデバイスに保存され、再起動またはバックアップ/復元サイクル後も存続します。

  • Postgres 16のみがサポートされています。

Lakehouseノードの動作#

ノードに接続します#

EDB Postgres AIプラットフォームから他のクラスターに接続するのと同じ方法で、Postgresクライアントを使用してLakehouseノードに接続できます。クラスターの詳細ページに移動し、その接続文字列をコピーします。

たとえば、 .pgpass blobを~/.pgpass にコピーします。$YOUR_PASSWORD を、クラスター起動時に指定したパスワードに置き換えてください。次に、接続文字列をコピーし、 psqlまたはpgcliの引数として使用できます。

通常、任意のPostgresクライアントを使用してデータベースに接続できます。私たちはすべてのイントロスペクションクエリーが機能することを期待しています。そうでないクエリーが見つかった場合、それはバグです。

コンストレインを理解する#

  • すべてのクラスターはEDB Postgres Advanced ServerまたはEDB Postgres Extended Serverを使用します。したがって、接続したときにインストール内のこれらのフレーバーからボイラープレートテーブルが表示されることが予想されます。

  • クエリ可能データベンチマークデータセットのようなは、デルタテーブルとしてオブジェクトストレージに保存されます。すべてのクラスターは、1〜1000のスケールファクターでTPC-H、TPC-DS、クリックベンチ内のベンチマークデータを含むストレージバケットをポイントするようにプリロードされています。

  • 現在AWSのみがサポートされています。 Bring your own account BYOAはサポートされていません。

  • EDB Postgres AIアカウントでアクティブ化されている任意のリージョンにクラスターを展開できます。各リージョンには、ベンチマークデータのコピーを含むバケットがあります。したがって、クラスターを起動すると、クラスターに最も近い場所のベンチマークデータが使用されます。

  • クラスターは一時的なものです。ロール、ユーザー、付与などのシステムテーブルのデータを除き、データはハードドライブに保存されません。クラスターを再起動するか、クラスターをバックアップして復元すると、これらのシステムテーブルが復元されます。ただし、オブジェクトストレージのデータは変更されないままです。

  • クラスターは、オブジェクトストレージ内のデータの読み取り専用クエリーをサポートしていますが、ユーザーなどを作成するためにシステムテーブルへの書き込みクエリーをサポートしています。オブジェクトストレージに直接書き込むことはできません。テーブルを作成することはできません。

  • 独自のデータをオブジェクトストレージにロードする場合は、 Reference - Bring your own data を参照してください。

ベンチマークデータセットを検査する#

ベンチマークデータセットを検査します。すべてのクラスターには、すぐに使用できるベンチマークデータがあります。 pgcliを使用している場合、 \dn を実行して、使用可能なテーブルを表示できます。

使用可能なベンチマークデータセットは次のとおりです。

  • TPC-H、スケールファクター1、10、100、および1000

  • TPC-DS、スケールファクター1、10、100、および1000

  • ClickBench、1億行

  • 10億行チャレンジ

ベンチマークデータセットの詳細については、 Reference - Available benchmarking datasets を参照してください。

ベンチマークデータセットを照会する#

いくつかの基本的なクエリーを実行してみることができます。

edb_admin> select count(*) from clickbench.hits;
+----------+
| count    |
|----------|
| 99997497 |
+----------+
SELECT 1
Time: 0.945s

edb_admin> select count(*) from brc_1b.measurements;
+------------+
| count      |
|------------|
| 1000000000 |
+------------+
SELECT 1
Time: 0.651s

!!!note

構文/クエリーの互換性に関する注意事項と情報については、 PGAA functions reference を参照してください。 !!!