Deploy AI Factory with Hybrid Manager UI#
概要#
このガイドでは、ハイブリッドマネージャーHCP Webインターフェイスを介したAI Factoryコンポーネントの展開手順を提供します。この展開プロセスには、GPUインフラストラクチャのセットアップ、NVIDIA NIMモデルの展開、およびGen AIアプリケーションの構成が含まれます。
前提条件#
インフラストラクチャ要件#
AI Factoryコンポーネントを展開する前に
GPUノードが構成されたKubernetesクラスター
NVIDIA GPUオペレーターのインストール
NVIDIA NGCレジストリまたはプライベートレジストリへのアクセス
モデルプロファイルのオブジェクトストレージエアギャップ展開
GPUノード構成#
GPUノードがNVIDIA NIM要件を満たしていることを確認します。
Model Type |
NIM Model |
GPU Requirements |
Container Image |
|---|---|---|---|
Text Completion |
llama-3.3-nemotron-super-49b-v1 |
4 x L40S |
nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1:1.8.5 |
Text Embeddings |
llama-3.2-nemoretriever-300m-embed-v1 |
1 x L40S |
nvcr.io/nim/nvidia/llama-3.2-nemoretriever-300m-embed-v1:latest |
Image Embeddings |
nvclip |
1 x L40S |
nvcr.io/nim/nvidia/nvclip:latest |
OCR |
paddleocr |
1 x L40S |
nvcr.io/nim/baidu/paddleocr:latest |
Text Reranking |
llama-3.2-nv-rerankqa-1b-v2 |
1 x L40S |
nvcr.io/nim/nvidia/llama-3.2-nv-rerankqa-1b-v2:latest |
GPUノードに以下が含まれていることを確認します。
ラベル
nvidia.com/gpu=trueテイント
nvidia.com/gpu
ステップ1レジストリ認証を構成する#
インターネットに接続された展開#
インターネットアクセスのあるクラスターの場合、NVIDIA NGC認証を構成します。
NVIDIA NGC Portal からNGC APIキーを取得します
HCP UIを介して認証シークレットを作成します。
Project Settings → Secrets に移動します
NGC_API_KEYを使用して
nvidia-nim-secretsを作成するngc-credDockerレジストリシークレットを作成します
または、kubectlを使用します。
NGC_API_KEY=<your-ngc-api-key>
# Create runtime secret
kubectl -n default create secret generic nvidia-nim-secrets \
--from-literal=NGC_API_KEY=${NGC_API_KEY}
kubectl -n default annotate secret nvidia-nim-secrets \
replicator.v1.mittwald.de/replicate-to=m-.*
# Create image pull secret
kubectl -n default create secret docker-registry ngc-cred \
--docker-server=nvcr.io \
--docker-username=$oauthtoken \
--docker-password=${NGC_API_KEY}
kubectl -n default annotate secret ngc-cred \
replicator.v1.mittwald.de/replicate-to=m-.*
エアギャップ展開#
インターネットアクセスのない環境の場合
ミラーNIMイメージ skopeoを使用して、必要なイメージをプライベートレジストリにコピーします
モデルURLの更新 プライベートレジストリの場所を参照するようにHCPを構成する
キャッシュプロファイル モデルプロファイルをダウンロードしてオブジェクトストレージに保存します
ストレージパスの構成 モデルの展開中にキャッシュされたプロファイルを参照する
詳細な手順については、 Air-Gapped Configuration を参照してください。
ステップ2モデルライブラリーにアクセスする#
Model ライブラリーインターフェイスに移動します。
Hybrid Managerコンソールにログインします
プロジェクトセレクターからプロジェクトを選択します
AI Factory → Model ライブラリー に移動します
モデルライブラリーには、使用可能なNVIDIA NIMモデルが表示されます。
llama-3.3-nemotron-super-49b-v1 高度な推論とチャット機能128Kコンテキスト
llama-3.2-nemoretriever-300m-embed-v1 高品質のテキスト埋め込み
llama-3.2-nv-rerankqa-1b-v2 多言語クエリドキュメントのリランキング
paddleocr 超軽量OCRシステム
nvclip 画像とテキストのマルチモーダル埋め込み
ステップ3モデルサーバークラスターを展開する#
導入用モデルの選択#
モデルライブラリーで Deploy Model をクリックします
利用可能なオプションからターゲットモデルを選択します
モデル要件とドキュメントリンクを確認します
展開パラメーターの構成#
モデルサーバークラスター設定を構成します。
インスタンス構成
サーバーインスタンス デフォルト1高可用性のための増加
最小インスタンス 1サポートされている場合はスケールからゼロの0
最大インスタンス 負荷要件に基づきます
リソースの割り当て
メモリ モデル要件に基づいて構成します
テキスト補完モデル 64-128 GB
組み込みモデル 32-64 GB
CPU 通常はデフォルト値で十分
GPU 文書化された要件と一致する
llama-3.3-nemotron 4 GPU
その他のモデル 1 GPU 通常
スケーリング構成
同時要求のしきい値 自動スケーリングトリガーの構成
Scale to Zero サポートされている場合に有効にします初期リリースでは使用できない場合があります
デプロイモデル#
構成の概要を確認します
Deploy をクリックして展開を開始します
モデルサーバークラスタービューでの展開ステータスの監視
展開により作成されるもの
KServe InferenceServiceリソース
リソースが構成された予測子ポッド
モデルアクセスのサービスエンドポイント
ステップ4展開ステータスを監視する#
View Model Serverクラスター#
AI Factory → Model Server Clusters に移動して、以下を表示します。
クラスター表示名
ロードバランサーのイングレスURI
展開ステータス アクティブ/正常、保留中、失敗
モデルの詳細とタグ
リソース使用率メトリック
アクセスクラスターの詳細#
表示するクラスター名をクリックします。
詳細な構成パラメーター
リアルタイムの健康メトリック
Grafanaダッシュボードの統合
推論レイテンシーチャート
システム状態インジケーター
ステップ5APIアクセスを構成する#
APIトークンを生成する#
デプロイされたモデルへの外部アクセスの場合
AI Factory → API Token Management に移動します
Create Token をクリックします
トークン参照名を提供します
生成されたトークンを安全に保存する
APIトークンにより、次のことが可能になります。
RAGアプリケーション認証
外部サービスの統合
プログラマティックモデルアクセス
アクセスエンドポイント#
モデルはOpenAI互換のエンドポイントを公開します。
内部アクセス クラスター内
http://<service-name>.<namespace>.svc.cluster.local/v1/chat/completions
外部アクセス イングレスを使用する場合
https://<ingress-url>/v1/chat/completions
ステップ6 Gen AIアプリケーションをビルドする#
ナレッジベースの作成#
AI Factory → Gen AI Builder → Knowledge Bases に移動します
データソースを構成します。
PostgreSQLデータベース
ドキュメントリポジトリ
API接続
展開されたサービスから埋め込みモデルを選択します
コンテンツを処理して埋め込みを生成する
アシスタントの構成#
AI Factory → Assistants に移動します
次を使用して新しいアシスタントを作成します。
名前と指示子
モデルエンドポイントの選択
ナレッジベースの統合
ツール構成
アシスタントアプリケーションの展開
詳細な手順については、 Create Assistant Guide を参照してください。
ステップ7モデルの更新と管理#
モデルサーバークラスターの編集#
実行中のクラスターを変更するには
Model Server Clusters に移動します
編集するクラスターを選択します
パラメーターを調整します。
インスタンス数
リソースの割り当て
スケーリングしきい値
変更を適用しますローリング更新をトリガーします
ローリングアップデート#
更新は、次のことを介して可用性を維持します。
再起動前の接続ドレイン
インスタンス間の状態検証
失敗時の自動ロールバック
障害対応#
一般的な展開の問題#
モデルの開始に失敗します
GPUの可用性が要件と一致することを確認します
レジストリ認証シークレットの確認
ポッドイベントとログを確認する
高い推論レイテンシー
バッチサイズパラメーターを調整する
GPU割り当てを増加します
負荷分散のためのスケールレプリカ
APIトークンの問題
トークンの有効期限がまだ残っていることを確認します
ネットワークポリシーの確認
イングレス構成の確認
詳細な診断については、 Troubleshooting AI Factory on Hybrid Manager を参照してください。
追加リソース#
リファレンスドキュメント
NVIDIAモデルドキュメント