Model Management on Hybrid Manager#
目的と利点#
ハイブリッドマネージャー内のモデル管理は、Kubernetesインフラストラクチャで実行されているAIモデルに一元的なガバナンスと展開機能を提供します。このシステムにより、組織はエンタープライズグレードの Model Serving インフラストラクチャを活用しながら、AI機能の完全な制御を維持できます。
この統合は、AIを大規模に展開する組織の重要な要件に対応します。承認されたレジストリを介したモデルガバナンス、GPUアクセラレーションを使用したスケーラブルな推論サービング、およびハイブリッドマネージャーのコントロールプレーンを介した統合管理。制御されたインフラストラクチャ内でモデルを実行することにより、最先端のAI機能にアクセスしながら、データ主権を維持します。
コアコンセプト#
モデルライブラリー#
Model Library Architecture は、AIモデルイメージの集中ガバナンスシステムとして機能します。 Hybrid Managerのアセットライブラリーストラクチャ内で動作し、運用展開の準備ができている検証済みモデルの厳選されたビューを提供します。
ライブラリは、多段階のガバナンスを実装します。
信頼できるコンテナレジストリからの自動同期
セキュリティスキャンと脆弱性評価
組織ポリシーに基づいた承認ワークフロー
バージョン管理とドキュメントのメタデータ管理
ライブラリ内のモデルは、 Gen AI Builder on Hybrid Manager アシスタント、 How do I create knowledge bases for RAG? パイプライン、カスタム推論アプリケーションを含むすべてのAI Factory機能を強化します。ライブラリのガバナンスフレームワークを通じて検証されたモデルのみが運用環境に到達できます。
モデルサービング#
Model Serving は、Kubernetesクラスター内のKServeを使用して、承認されたモデルをスケーラブルな推論エンドポイントに変換します。このインフラストラクチャは、自動スケーリング、状態管理、およびリソースの最適化を備えた実稼働グレードのモデルの展開を提供します。
主要なサービス提供機能には次のものが含まれます。
デプロイされたモデルエンドポイントを定義する **InferenceService** リソース
さまざまなモデルフレームワーク用に最適化された **ServingRuntime** 構成
高パフォーマンスの推論のためのGPUの割り当てとスケジューリング Setup GPU および Update GPU resources を参照してください。
認証を使用した内部および外部エンドポイントアクセス
管理インターフェイス#
Hybrid Managerは、Webコンソールを介して統合管理を提供し、完全な構成可能性を維持しながらKubernetesの複雑さを抽象化します。このインターフェイスにより、次のことが可能になります。
ライブラリからサービングまでモデル展開のビジュアルワークフロー
リソースの割り当てとスケーリング構成
推論メトリックとGPU使用率のモニタリングダッシュボード
アクセス制御とエンドポイント管理
実装ワークフロー#
モデル登録#
組織は、信頼できるモデルソースへのリポジトリ接続を構成することから始めます。モデルライブラリーは、定義されたルールに基づいて外部レジストリと同期し、新しいモデルバージョンを自動的に検出および検証します。
External Registry → Repository Rules → Security Scanning → Model Library
リポジトリルールは、環境に入るモデルを決定し、インジェスト時点で組織ポリシーを実装します。この自動化されたアプローチにより、ガバナンス標準を維持しながら、手動オーバーヘッドが削減されます。
モデルの展開#
検証されたモデルは、サービスインフラストラクチャを構成するガイド付きワークフローを介して展開されます。
モデル選択 バージョン、パフォーマンス特性、リソース要件を含むメタデータを使用してライブラリ内の使用可能なモデルを参照します。
実行時構成 モデルフレームワークvLLM、TensorRT-LLM、カスタム用に最適化された ServingRuntimes を選択または作成します
リソースの割り当て 予想されるワークロードに基づいて、GPU、メモリ、およびCPU要件を定義します
エンドポイント構成 認証を使用した内部クラスターアクセスまたは外部APIエンドポイントを設定します Access KServe endpoints を参照してください。
システムは、KServeが管理するInferenceServiceリソースを作成し、ポッドのスケジューリング、ヘルスモニタリング、トラフィックルーティングを自動的に処理します。
運用管理#
導入されたモデルは、要求に基づいた自動スケーリングを使用した継続的な監視の下で動作します。ハイブリッドマネージャーは、次のことを介して可視性を提供します。
レイテンシーやスループットを含むリアルタイムの推論メトリック
リソース最適化のためのGPU使用率追跡
プロアクティブなメンテナンスのエラー率と状態
リソース消費に基づいたコスト分析
GPUインフラストラクチャ#
リソースタイプ#
ハイブリッドマネージャーは、ワークロード要件に一致するさまざまなGPU構成をサポートします。
開発GPU リソース共有のタイムスライシングサポートを使用したテストと実験用の下位層GPUT4、RTXシリーズ 製品GPU レイテンシー用の専用割り当てを備えた高性能GPUA100、H100センシティブな推論ワークロード マルチインスタンスGPU パーティション化されたGPUにより、複数の小型モデルがハードウェアリソースを効率的に共有できます
アロケーション戦略#
GPUのスケジューリングは、使用可能なリソースをアドバタイズし、割り当てポリシーを適用するKubernetesデバイスプラグインを介して発生します。システムは以下をサポートしています。
実稼働ワークロードのための排他的なGPU割り当て
開発とテストのためのタイムスライス共有
効率的なマルチモデルサービングのためのMIGパーティション
ワークロード配置のノードアフィニティルール
プロジェクトレベルのリソースクォータは、チーム間の公平なアクセスを保証しながら、GPUの独占を防ぎます。自動スケーリングは、推論需要に基づいてGPUの割り当てを調整し、サービス要件を満たしながらコストを最適化します。
統合パターン#
Gen AI Builderアプリケーション#
Gen AI Builderは、アシスタントとエージェントのモデルエンドポイントを活用します。 Model Servingを介して展開されたLLMは、テキスト生成機能を提供し、埋め込みモデルはRAGパイプラインをサポートします。
アプリケーションは、クラスターローカルDNSを介してモデルにアクセスします。
http://model-name.namespace.svc.cluster.local/v1/chat/completions
ナレッジベースパイプライン#
ナレッジベースは、ドキュメントのベクトル化とセマンティック検索に埋め込みモデルを利用します。モデルライブラリーは、取り込みおよび取得操作全体で一貫したモデルバージョンを保証します。
パイプライン統合のメリットは次のとおりです。
既知のパフォーマンス特性を備えた検証済みの埋め込みモデル
ライブラリ同期を介した自動モデル更新
ナレッジベース操作全体で一貫したベクトルディメンション
カスタムアプリケーション#
組織は、ビジネス固有の要件に特化したモデルを展開します。サービングインフラストラクチャは、ビジョンモデル、リランキングモデル、カスタムの微調整されたバリアントを含むさまざまなモデルタイプをサポートしています。
外部アプリケーションは、APIキー認証を使用して安全なエンドポイントを介してモデルにアクセスし、セキュリティ境界を維持しながら既存のビジネスシステムとの統合を可能にします。
セキュリティとガバナンス#
アクセス制御#
ロールベースのアクセス制御は、マルチプルのレベルでモデル操作を制御します。
ライブラリーアクセス モデルを登録および承認できる人を制御します
展開権限 モデルをサービングに展開できる人を管理します
エンドポイントアクセス モデルエンドポイントを呼び出すことができる人を決定します
エンタープライズIDプロバイダーとの統合により、コンプライアンス要件の詳細な監査証跡を維持しながら、シングルサインオンが可能になります。
モデルガバナンス#
ガバナンスフレームワークにより、検証されたモデルのみが運用環境に到達します。
セキュリティスキャンは、展開前に脆弱性を特定します
デジタル署名は、モデルの信頼性と完全性を検証します
承認ワークフローは、マルチステークホルダーの検証を強制します
リテンションポリシーはモデルのライフサイクルと非推奨を管理します
データ保護#
すべてのモデル操作は、インフラストラクチャ内のデータ主権を維持します。
Kubernetesクラスターでのみ実行されるモデル
推論データが制御された環境を離れることはありません
ネットワークポリシーはトラフィックの分離を適用します
暗号化は、転送中および保存中のデータを保護します
モニタリングと最適化#
パフォーマンスメトリック#
包括的なモニタリングは、複数のディメンションにわたってモデルのパフォーマンスを追跡します。
推論レイテンシー エンドツーエンドの要求の処理時間
トークンスループット 言語モデルの生成レート
バッチ効率 バッチ機能の利用
キャッシュヒット率 応答キャッシュの効果
これらのメトリックは、バッチサイズの調整、リソース割り当ての調整、キャッシュ戦略の調整を含む最適化の決定を通知します。
リソース使用率#
GPUモニタリングは、ハードウェア効率の可視性を提供します。
最適化の機会を特定するメモリ使用パターン
スケーリング要件を示すコンピューティング使用率
コスト分析のための消費電力
ハードウェアの状態の温度モニタリング
コスト管理#
システムは、コスト帰属のリソース消費を追跡します。
モデルおよびプロジェクトごとのGPU時間
モデルアーティファクトのストレージコスト
推論トラフィックのネットワーク転送
リソースコストに影響を与えるスケーリングパターン
ベストプラクティス#
モデル選択#
明確な要件分析に基づいてモデルを選択します。
モデル機能をユースケース要件に合わせる
リソースの制約とコストへの影響を考慮する
テストによるパフォーマンス特性の検証
将来の参照用にモデル選択の根拠を文書化する
導入戦略#
体系的な展開アプローチを実装します。
控えめなリソース割り当てから開始します
最適化する前に実際の使用量をモニタする
モデルの更新にカナリア展開を使用する
問題のある展開のロールバック機能を維持する
オペレーショナルエクセレンス#
高い運用基準を維持します。
ベースラインパフォーマンスメトリックを確立する
運用前に包括的なモニタリングを実装する
文書構成の決定事項と手順
リソースの使用率とコストの定期的なレビュー
はじめに#
次の手順でモデル管理を開始します。
設定→機能から、ハイブリッドマネージャープロジェクトで モデル機能を有効にします
リポジトリルールを構成 して、信頼できるモデルソースを接続する
ガイド付き展開ワークフローを使用して 最初のモデルを展開
統合されたダッシュボードを介した モニタパフォーマンス
詳細な実装ガイダンスについては
Hybrid Manager内のモデル管理は、AIの展開を実験的なプロトタイプから実稼働グレードのサービスに変換し、エンタープライズ機能を提供しながら主権を維持します。