Analytics Accelerator Quick Start#
このクイックスタートでは、次のことを行います。
Lakehouseノードを作成します。
優先するPostgresクライアントを使用してノードに接続します。
オブジェクトストレージ内のサンプルデータTPC-H、TPC-DS、Clickbench、または1BRCを照会します。
詳細および高度なユースケースについては、 PGAA functions reference を参照してください。
はじめに#
Postgres Lakehouseは、EDB Postgres® AIプラットフォームでプロビジョニングできる新しいタイプのPostgresクラスター実際には1つのノードです。これには、オブジェクトストレージの列指向レイクハウステーブルを高速照会するためのApache DataFusion に基づくベクトル化クエリエンジンが含まれています Delta Lake protocol を使用します。
知っておくべきこと#
詳細については、 Analytics Accelerator Concepts および PGAA functions reference を参照してください。ただし、これらが知っておくべき主なポイントです。
Postgres Lakehouseノードは一時的なものです。
Postgres Lakehouseノードは、オブジェクトストレージのベンチマークデータセットを照会するように事前構成されています。
Postgres Lakehouseは通常読み取り専用ですが、それ以外の場合は、すべての有効なPostgresクエリーをサポートします。
システムテーブルは書き込み可能なため、ユーザーとロールを作成できます。これらのテーブルは、接続されたブロックストレージに保存されるため、インスタンスが再起動されるまで持続し、バックアップ/復元操作の一部として保存されます。それ以外の場合、Lakehouseテーブルは最終的にオブジェクトストレージに保存されるため、バックアップの一部ではありません。
基本アーキテクチャ#
この図は、Lakehouseノードのボックスの内容を示しています。
Level 300 Architecture#
はじめに#
HCPポータルにログインしてプロジェクトを作成したら、クラスターを作成できます。
Lakehouseノードを作成する#
プロジェクトページで、 Create New > Lakehouse Analytics を選択します。
Create Lakehouse Node Dropdown#
Create Analytical Cluster ページが開きます。ここで、テンプレートビルドまたはカスタムビルドを選択できます。
Create Lakehouse Node Wizard Step 1#
Custom Build を選択し、 Start from Scratch を選択します。 Create Analytical Cluster ページが開き、クラスターのサイズと構成を選択できます。
Create Lakehouse Node Wizard Step 2#
次に、 Clusters ページに戻ります。ここで、クラスターの作成時に、クラスターのステータスを確認できます。クラスターのプロビジョニングには10〜15分かかる場合があります。
いくつかの注意事項
独自のパスワードを入力する必要があります。安全なパスワードを作成し、パスワードマネージャーに保存します。 HCPはパスワードを保存しません。
EDB Postgres Advanced ServerまたはEDB Postgres Extended Serverを選択できます。
NVMeドライブ上のすべてのデータは、クラスターがシャットダウンすると失われます。
システムテーブルの永続データユーザー、ロールなどは、接続されたブロックストレージデバイスに保存され、再起動またはバックアップ/復元サイクル後も存続します。
Postgres 16のみがサポートされています。
Lakehouseノードの動作#
ノードに接続します#
EDB Postgres AIプラットフォームから他のクラスターに接続するのと同じ方法で、Postgresクライアントを使用してLakehouseノードに接続できます。クラスターの詳細ページに移動し、その接続文字列をコピーします。
たとえば、 .pgpass blobを~/.pgpass
にコピーします。$YOUR_PASSWORD
を、クラスター起動時に指定したパスワードに置き換えてください。次に、接続文字列をコピーし、
psqlまたはpgcliの引数として使用できます。
通常、任意のPostgresクライアントを使用してデータベースに接続できます。私たちはすべてのイントロスペクションクエリーが機能することを期待しています。そうでないクエリーが見つかった場合、それはバグです。
コンストレインを理解する#
すべてのクラスターはEDB Postgres Advanced ServerまたはEDB Postgres Extended Serverを使用します。したがって、接続したときにインストール内のこれらのフレーバーからボイラープレートテーブルが表示されることが予想されます。
クエリ可能データベンチマークデータセットのようなは、デルタテーブルとしてオブジェクトストレージに保存されます。すべてのクラスターは、1〜1000のスケールファクターでTPC-H、TPC-DS、クリックベンチ内のベンチマークデータを含むストレージバケットをポイントするようにプリロードされています。
現在AWSのみがサポートされています。 Bring your own account BYOAはサポートされていません。
EDB Postgres AIアカウントでアクティブ化されている任意のリージョンにクラスターを展開できます。各リージョンには、ベンチマークデータのコピーを含むバケットがあります。したがって、クラスターを起動すると、クラスターに最も近い場所のベンチマークデータが使用されます。
クラスターは一時的なものです。ロール、ユーザー、付与などのシステムテーブルのデータを除き、データはハードドライブに保存されません。クラスターを再起動するか、クラスターをバックアップして復元すると、これらのシステムテーブルが復元されます。ただし、オブジェクトストレージのデータは変更されないままです。
クラスターは、オブジェクトストレージ内のデータの読み取り専用クエリーをサポートしていますが、ユーザーなどを作成するためにシステムテーブルへの書き込みクエリーをサポートしています。オブジェクトストレージに直接書き込むことはできません。テーブルを作成することはできません。
独自のデータをオブジェクトストレージにロードする場合は、 Reference - Bring your own data を参照してください。
ベンチマークデータセットを検査する#
ベンチマークデータセットを検査します。すべてのクラスターには、すぐに使用できるベンチマークデータがあります。
pgcliを使用している場合、 \dn
を実行して、使用可能なテーブルを表示できます。
使用可能なベンチマークデータセットは次のとおりです。
TPC-H、スケールファクター1、10、100、および1000
TPC-DS、スケールファクター1、10、100、および1000
ClickBench、1億行
10億行チャレンジ
ベンチマークデータセットの詳細については、 Reference - Available benchmarking datasets を参照してください。
ベンチマークデータセットを照会する#
いくつかの基本的なクエリーを実行してみることができます。
edb_admin> select count(*) from clickbench.hits;
+----------+
| count |
|----------|
| 99997497 |
+----------+
SELECT 1
Time: 0.945s
edb_admin> select count(*) from brc_1b.measurements;
+------------+
| count |
|------------|
| 1000000000 |
+------------+
SELECT 1
Time: 0.651s
!!!note
構文/クエリーの互換性に関する注意事項と情報については、 PGAA functions reference を参照してください。 !!!