ローカルLLMの活用が広がる中、モデルを動かすだけでなく、複数のモデルを用途やリクエスト内容に応じて使い分ける仕組みが求められています。また、複数のユーザーやチームで利用する際には、認証や利用可能なモデルの制御、ユーザーごとの利用状況の可視化、利用上限の設定なども課題となります。
本セッションでは、ローカルLLMへのリクエストを適切にルーティングし、管理するための仕組みを段階的に紹介します。
(1)Envoy GatewayとKubernetes Gateway APIを用いて、複数のモデルへリクエストを振り分ける基本的な構成を取り上げます。
(2) LiteLLMをAI Gatewayとして導入し、複数モデルへのルーティングに加え、ユーザーごとのアクセス制御、利用可能なモデルの制限、利用量やコストの可視化・管理を実現する方法を紹介します。
(3) 最後に、NVIDIA NeMo Switchyardを用いて、リクエストの内容や難易度をAIが判定し、軽量モデルや高性能モデルなど、適切なモデルへ動的にルーティングする仕組みを紹介します。
デル・テクノロジーズ株式会社
Principal Engineer, Solutions Architect
Kubernetesを活用したAIプラットフォームの設計・構築や、Kubernetesの運用における技術支援に従事するなど、クラウドネイティブ技術を軸に、企業のIT基盤の設計・活用を支援している。共著に『Kubernetes Secret管理入門 ― HashiCorp Vaultで実現するセキュアな運用』がある。