Deploy AI Factory with Hybrid Manager UI#

概要#

このガイドでは、ハイブリッドマネージャーHCP Webインターフェイスを介したAI Factoryコンポーネントの展開手順を提供します。この展開プロセスには、GPUインフラストラクチャのセットアップ、NVIDIA NIMモデルの展開、およびGen AIアプリケーションの構成が含まれます。

前提条件#

インフラストラクチャ要件#

AI Factoryコンポーネントを展開する前に

  • GPUノードが構成されたKubernetesクラスター

  • NVIDIA GPUオペレーターのインストール

  • NVIDIA NGCレジストリまたはプライベートレジストリへのアクセス

  • モデルプロファイルのオブジェクトストレージエアギャップ展開

GPUノード構成#

GPUノードがNVIDIA NIM要件を満たしていることを確認します。

Model Type

NIM Model

GPU Requirements

Container Image

Text Completion

llama-3.3-nemotron-super-49b-v1

4 x L40S

nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1:1.8.5

Text Embeddings

llama-3.2-nemoretriever-300m-embed-v1

1 x L40S

nvcr.io/nim/nvidia/llama-3.2-nemoretriever-300m-embed-v1:latest

Image Embeddings

nvclip

1 x L40S

nvcr.io/nim/nvidia/nvclip:latest

OCR

paddleocr

1 x L40S

nvcr.io/nim/baidu/paddleocr:latest

Text Reranking

llama-3.2-nv-rerankqa-1b-v2

1 x L40S

nvcr.io/nim/nvidia/llama-3.2-nv-rerankqa-1b-v2:latest

GPUノードに以下が含まれていることを確認します。

  • ラベル nvidia.com/gpu=true

  • テイント nvidia.com/gpu

ステップ1レジストリ認証を構成する#

インターネットに接続された展開#

インターネットアクセスのあるクラスターの場合、NVIDIA NGC認証を構成します。

  1. NVIDIA NGC Portal からNGC APIキーを取得します

  2. HCP UIを介して認証シークレットを作成します。

  • Project Settings → Secrets に移動します

  • NGC_API_KEYを使用してnvidia-nim-secrets を作成する

  • ngc-cred Dockerレジストリシークレットを作成します

または、kubectlを使用します。

NGC_API_KEY=<your-ngc-api-key>

#  Create runtime secret

kubectl -n default create secret generic nvidia-nim-secrets \
    --from-literal=NGC_API_KEY=${NGC_API_KEY}

kubectl -n default annotate secret nvidia-nim-secrets \
    replicator.v1.mittwald.de/replicate-to=m-.*

#  Create image pull secret

kubectl -n default create secret docker-registry ngc-cred \
    --docker-server=nvcr.io \
    --docker-username=$oauthtoken \
    --docker-password=${NGC_API_KEY}

kubectl -n default annotate secret ngc-cred \
    replicator.v1.mittwald.de/replicate-to=m-.*

エアギャップ展開#

インターネットアクセスのない環境の場合

  1. ミラーNIMイメージ skopeoを使用して、必要なイメージをプライベートレジストリにコピーします

  2. モデルURLの更新 プライベートレジストリの場所を参照するようにHCPを構成する

  3. キャッシュプロファイル モデルプロファイルをダウンロードしてオブジェクトストレージに保存します

  4. ストレージパスの構成 モデルの展開中にキャッシュされたプロファイルを参照する

詳細な手順については、 Air-Gapped Configuration を参照してください。

ステップ2モデルライブラリーにアクセスする#

Model ライブラリーインターフェイスに移動します。

  1. Hybrid Managerコンソールにログインします

  2. プロジェクトセレクターからプロジェクトを選択します

  3. AI Factory → Model ライブラリー に移動します

モデルライブラリーには、使用可能なNVIDIA NIMモデルが表示されます。

  • llama-3.3-nemotron-super-49b-v1 高度な推論とチャット機能128Kコンテキスト

  • llama-3.2-nemoretriever-300m-embed-v1 高品質のテキスト埋め込み

  • llama-3.2-nv-rerankqa-1b-v2 多言語クエリドキュメントのリランキング

  • paddleocr 超軽量OCRシステム

  • nvclip 画像とテキストのマルチモーダル埋め込み

ステップ3モデルサーバークラスターを展開する#

導入用モデルの選択#

  1. モデルライブラリーで Deploy Model をクリックします

  2. 利用可能なオプションからターゲットモデルを選択します

  3. モデル要件とドキュメントリンクを確認します

展開パラメーターの構成#

モデルサーバークラスター設定を構成します。

インスタンス構成

  • サーバーインスタンス デフォルト1高可用性のための増加

  • 最小インスタンス 1サポートされている場合はスケールからゼロの0

  • 最大インスタンス 負荷要件に基づきます

リソースの割り当て

  • メモリ モデル要件に基づいて構成します

  • テキスト補完モデル 64-128 GB

  • 組み込みモデル 32-64 GB

  • CPU 通常はデフォルト値で十分

  • GPU 文書化された要件と一致する

  • llama-3.3-nemotron 4 GPU

  • その他のモデル 1 GPU 通常

スケーリング構成

  • 同時要求のしきい値 自動スケーリングトリガーの構成

  • Scale to Zero サポートされている場合に有効にします初期リリースでは使用できない場合があります

デプロイモデル#

  1. 構成の概要を確認します

  2. Deploy をクリックして展開を開始します

  3. モデルサーバークラスタービューでの展開ステータスの監視

展開により作成されるもの

  • KServe InferenceServiceリソース

  • リソースが構成された予測子ポッド

  • モデルアクセスのサービスエンドポイント

ステップ4展開ステータスを監視する#

View Model Serverクラスター#

AI Factory → Model Server Clusters に移動して、以下を表示します。

  • クラスター表示名

  • ロードバランサーのイングレスURI

  • 展開ステータス アクティブ/正常、保留中、失敗

  • モデルの詳細とタグ

  • リソース使用率メトリック

アクセスクラスターの詳細#

表示するクラスター名をクリックします。

  • 詳細な構成パラメーター

  • リアルタイムの健康メトリック

  • Grafanaダッシュボードの統合

  • 推論レイテンシーチャート

  • システム状態インジケーター

ステップ5APIアクセスを構成する#

APIトークンを生成する#

デプロイされたモデルへの外部アクセスの場合

  1. AI Factory → API Token Management に移動します

  2. Create Token をクリックします

  3. トークン参照名を提供します

  4. 生成されたトークンを安全に保存する

APIトークンにより、次のことが可能になります。

  • RAGアプリケーション認証

  • 外部サービスの統合

  • プログラマティックモデルアクセス

アクセスエンドポイント#

モデルはOpenAI互換のエンドポイントを公開します。

内部アクセス クラスター内

http://<service-name>.<namespace>.svc.cluster.local/v1/chat/completions

外部アクセス イングレスを使用する場合

https://<ingress-url>/v1/chat/completions

ステップ6 Gen AIアプリケーションをビルドする#

ナレッジベースの作成#

  1. AI Factory → Gen AI Builder → Knowledge Bases に移動します

  2. データソースを構成します。

  • PostgreSQLデータベース

  • ドキュメントリポジトリ

  • API接続

  1. 展開されたサービスから埋め込みモデルを選択します

  2. コンテンツを処理して埋め込みを生成する

アシスタントの構成#

  1. AI Factory → Assistants に移動します

  2. 次を使用して新しいアシスタントを作成します。

  • 名前と指示子

  • モデルエンドポイントの選択

  • ナレッジベースの統合

  • ツール構成

  1. アシスタントアプリケーションの展開

詳細な手順については、 Create Assistant Guide を参照してください。

ステップ7モデルの更新と管理#

モデルサーバークラスターの編集#

実行中のクラスターを変更するには

  1. Model Server Clusters に移動します

  2. 編集するクラスターを選択します

  3. パラメーターを調整します。

  • インスタンス数

  • リソースの割り当て

  • スケーリングしきい値

  1. 変更を適用しますローリング更新をトリガーします

ローリングアップデート#

更新は、次のことを介して可用性を維持します。

  • 再起動前の接続ドレイン

  • インスタンス間の状態検証

  • 失敗時の自動ロールバック

障害対応#

一般的な展開の問題#

モデルの開始に失敗します

  • GPUの可用性が要件と一致することを確認します

  • レジストリ認証シークレットの確認

  • ポッドイベントとログを確認する

高い推論レイテンシー

  • バッチサイズパラメーターを調整する

  • GPU割り当てを増加します

  • 負荷分散のためのスケールレプリカ

APIトークンの問題

  • トークンの有効期限がまだ残っていることを確認します

  • ネットワークポリシーの確認

  • イングレス構成の確認

詳細な診断については、 Troubleshooting AI Factory on Hybrid Manager を参照してください。

追加リソース#

リファレンスドキュメント

NVIDIAモデルドキュメント