Prerequisites for AI Factory on Hybrid Manager#
インフラストラクチャ要件#
Kubernetes Cluster Foundation#
AI Factoryには、AIワークロード用の十分なリソースを備えた適切に構成されたHybrid Manager Kubernetesクラスターが必要です。クラスターはGPUスケジューリングをサポートし、さまざまなワークロードタイプに合わせて構成された適切なノードグループが必要です。
クラスター要件
GPUデバイスプラグインをサポートするKubernetes 1.27以降
GPUノード管理のためにインストールされたNVIDIA GPUオペレーター
オーケストレーションコンポーネントに十分なCPUとメモリ
サービスメッシュ通信をサポートするネットワークポリシー
GPUノード構成#
GPUリソースは、モデル提供操作に不可欠です。ノード構成は、モデル要件および予想されるワークロード特性と一致する必要があります。
GPUノードの要件
CUDA 12.1+をサポートするNVIDIA GPU
nvidia.com/gpu=trueでラベル付けされたGPUノード専用スケジューリング用のGPUテイント
nvidia.com/gpuターゲットモデルサイズに十分なGPUメモリ
モデルリソース要件
Model Type |
Example Model |
GPU Requirements |
Container Image |
|---|---|---|---|
Text Completion |
llama-3.3-nemotron-super-49b |
4 x L40S |
nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1:1.8.5 |
Text Embeddings |
llama-3.2-nemoretriever-300m |
1 x L40S |
nvcr.io/nim/nvidia/llama-3.2-nemoretriever-300m-embed-v1:latest |
Image Embeddings |
nvclip |
1 x L40S |
nvcr.io/nim/nvidia/nvclip:latest |
OCR |
paddleocr |
1 x L40S |
nvcr.io/nim/baidu/paddleocr:latest |
Text Reranking |
llama-3.2-nv-rerankqa-1b |
1 x L40S |
nvcr.io/nim/nvidia/llama-3.2-nv-rerankqa-1b-v2:latest |
モデルごとのリソース仕様の詳細については、 NVIDIA NIM documentation を参照してください。
レジストリ構成#
インターネットに接続された展開#
インターネットアクセスのあるクラスターの場合、NVIDIA NGCレジストリ認証を構成してモデルイメージのプルを有効にします。
NGC APIキー構成#
NVIDIA NGC documentation に従ってNGC APIキーを取得します。
必要なシークレットを作成します。
# Set your NGC API key
NGC_API_KEY=<your-ngc-api-key>
# Create model runtime secret
kubectl -n default create secret generic nvidia-nim-secrets \
--from-literal=NGC_API_KEY=${NGC_API_KEY}
# Enable secret replication across namespaces
kubectl -n default annotate secret nvidia-nim-secrets \
replicator.v1.mittwald.de/replicate-to=m-.*
イメージプルシークレット構成#
イメージプルのDockerレジストリ認証を構成します。
# Create image pull secret
kubectl -n default create secret docker-registry ngc-cred \
--docker-server=nvcr.io \
--docker-username=$oauthtoken \
--docker-password=${NGC_API_KEY}
# Enable secret replication
kubectl -n default annotate secret ngc-cred \
replicator.v1.mittwald.de/replicate-to=m-.*
エアギャップ展開#
インターネットアクセスのない環境の場合、ハブガイドを使用してイメージと展開アセットを事前に準備し、ハイブリッドマネージャーでプライベートレジストリアクセスを構成します。
モデルイメージの移行#
これらのハブ参照に従って、必要なモデルイメージを準備してプライベートレジストリにミラーリングします。
プライベートレジストリとイメージガバナンス Model Library Architecture
KServeマニフェストと展開フロー Using NVIDIA NIM in your environment
モデルレジストリの更新#
デフォルトのモデル参照を更新して、プライベートレジストリをポイントします。モデルライブラリー構成とHM API /コンソールパスを操作します。
プロファイルキャッシュNIM#
一部のNVIDIA NIMモデルは、オフライン操作のためにローカルで利用できる必要があるランタイムプロファイルを使用します。プロファイルの検出とキャッシュ戦略については、NVIDIAのドキュメントに従ってください。
NVIDIA NIMドキュメント https://docs.nvidia.com/nim/
ハブ使用パターン Using NVIDIA NIM in your environment
ネットワーク要件#
サービスコミュニケーション#
AI Factoryコンポーネントには、サービス間通信用の特定のネットワーク構成が必要です。
ネットワークポリシー
モデルサービングポッドとアプリケーション名前空間間のトラフィックを許可する
外部モデルエンドポイントアクセスのイングレスを有効にする
可観測性のためのサービスメッシュ通信のサポート
DNS解決
内部サービス検出のためのクラスターローカルDNS
必要に応じて、パブリックエンドポイントアクセス用の外部DNS
ストレージアクセス#
必要なストレージシステムへのネットワーク接続を確認します。
オブジェクトストレージ
モデルアーティファクトとプロファイル用のS3互換ストレージ
モデルのダウンロード操作に十分な帯域幅
ストレージアクセスのためのIAMロールまたは資格情報
セキュリティ前提条件#
RBAC構成#
AI Factory操作のロールベースのアクセス制御を構成します。
必要なロール
プロジェクトレベルの管理のための名前空間管理者
展開操作のモデルオペレーター
モニタリングと可観測性のための読み取り専用アクセス
証明書管理#
安全な通信のためにSSL証明書を準備します。
証明書の要件
モデルエンドポイントエクスポージャのTLS証明書
サービスメッシュ通信のための内部CA
コンプライアンスのための証明書のローテーション手順
次のステップ#
前提条件を満たしたら、次のことに進みます。
詳細なGPU構成の場合 GPU Setup Guide
レジストリ統合のための Model Library Configuration
Create First InferenceService 初期モデルを展開する
計画のサポートが必要な場合は、次の場所に相談してください。