Prerequisites for AI Factory on Hybrid Manager#

インフラストラクチャ要件#

Kubernetes Cluster Foundation#

AI Factoryには、AIワークロード用の十分なリソースを備えた適切に構成されたHybrid Manager Kubernetesクラスターが必要です。クラスターはGPUスケジューリングをサポートし、さまざまなワークロードタイプに合わせて構成された適切なノードグループが必要です。

クラスター要件

  • GPUデバイスプラグインをサポートするKubernetes 1.27以降

  • GPUノード管理のためにインストールされたNVIDIA GPUオペレーター

  • オーケストレーションコンポーネントに十分なCPUとメモリ

  • サービスメッシュ通信をサポートするネットワークポリシー

GPUノード構成#

GPUリソースは、モデル提供操作に不可欠です。ノード構成は、モデル要件および予想されるワークロード特性と一致する必要があります。

GPUノードの要件

  • CUDA 12.1+をサポートするNVIDIA GPU

  • nvidia.com/gpu=true でラベル付けされたGPUノード

  • 専用スケジューリング用のGPUテイントnvidia.com/gpu

  • ターゲットモデルサイズに十分なGPUメモリ

モデルリソース要件

Model Type

Example Model

GPU Requirements

Container Image

Text Completion

llama-3.3-nemotron-super-49b

4 x L40S

nvcr.io/nim/nvidia/llama-3.3-nemotron-super-49b-v1:1.8.5

Text Embeddings

llama-3.2-nemoretriever-300m

1 x L40S

nvcr.io/nim/nvidia/llama-3.2-nemoretriever-300m-embed-v1:latest

Image Embeddings

nvclip

1 x L40S

nvcr.io/nim/nvidia/nvclip:latest

OCR

paddleocr

1 x L40S

nvcr.io/nim/baidu/paddleocr:latest

Text Reranking

llama-3.2-nv-rerankqa-1b

1 x L40S

nvcr.io/nim/nvidia/llama-3.2-nv-rerankqa-1b-v2:latest

モデルごとのリソース仕様の詳細については、 NVIDIA NIM documentation を参照してください。

レジストリ構成#

インターネットに接続された展開#

インターネットアクセスのあるクラスターの場合、NVIDIA NGCレジストリ認証を構成してモデルイメージのプルを有効にします。

NGC APIキー構成#

NVIDIA NGC documentation に従ってNGC APIキーを取得します。

必要なシークレットを作成します。

#  Set your NGC API key

NGC_API_KEY=<your-ngc-api-key>

#  Create model runtime secret

kubectl -n default create secret generic nvidia-nim-secrets \
    --from-literal=NGC_API_KEY=${NGC_API_KEY}

#  Enable secret replication across namespaces

kubectl -n default annotate secret nvidia-nim-secrets \
    replicator.v1.mittwald.de/replicate-to=m-.*

イメージプルシークレット構成#

イメージプルのDockerレジストリ認証を構成します。

#  Create image pull secret

kubectl -n default create secret docker-registry ngc-cred \
    --docker-server=nvcr.io \
    --docker-username=$oauthtoken \
    --docker-password=${NGC_API_KEY}

#  Enable secret replication

kubectl -n default annotate secret ngc-cred \
    replicator.v1.mittwald.de/replicate-to=m-.*

エアギャップ展開#

インターネットアクセスのない環境の場合、ハブガイドを使用してイメージと展開アセットを事前に準備し、ハイブリッドマネージャーでプライベートレジストリアクセスを構成します。

モデルイメージの移行#

これらのハブ参照に従って、必要なモデルイメージを準備してプライベートレジストリにミラーリングします。

モデルレジストリの更新#

デフォルトのモデル参照を更新して、プライベートレジストリをポイントします。モデルライブラリー構成とHM API /コンソールパスを操作します。

プロファイルキャッシュNIM#

一部のNVIDIA NIMモデルは、オフライン操作のためにローカルで利用できる必要があるランタイムプロファイルを使用します。プロファイルの検出とキャッシュ戦略については、NVIDIAのドキュメントに従ってください。

ネットワーク要件#

サービスコミュニケーション#

AI Factoryコンポーネントには、サービス間通信用の特定のネットワーク構成が必要です。

ネットワークポリシー

  • モデルサービングポッドとアプリケーション名前空間間のトラフィックを許可する

  • 外部モデルエンドポイントアクセスのイングレスを有効にする

  • 可観測性のためのサービスメッシュ通信のサポート

DNS解決

  • 内部サービス検出のためのクラスターローカルDNS

  • 必要に応じて、パブリックエンドポイントアクセス用の外部DNS

ストレージアクセス#

必要なストレージシステムへのネットワーク接続を確認します。

オブジェクトストレージ

  • モデルアーティファクトとプロファイル用のS3互換ストレージ

  • モデルのダウンロード操作に十分な帯域幅

  • ストレージアクセスのためのIAMロールまたは資格情報

セキュリティ前提条件#

RBAC構成#

AI Factory操作のロールベースのアクセス制御を構成します。

必要なロール

  • プロジェクトレベルの管理のための名前空間管理者

  • 展開操作のモデルオペレーター

  • モニタリングと可観測性のための読み取り専用アクセス

証明書管理#

安全な通信のためにSSL証明書を準備します。

証明書の要件

  • モデルエンドポイントエクスポージャのTLS証明書

  • サービスメッシュ通信のための内部CA

  • コンプライアンスのための証明書のローテーション手順

次のステップ#

前提条件を満たしたら、次のことに進みます。

  1. 詳細なGPU構成の場合 GPU Setup Guide

  2. レジストリ統合のための Model Library Configuration

  3. Create First InferenceService 初期モデルを展開する

計画のサポートが必要な場合は、次の場所に相談してください。