AI/MLワークロードは推論だけでなく、前処理など複数の処理から構成されます。私たちは各処理に適切なアクセラレータを割り当て、効率的に活用する低消費電力な処理基盤(AI Computing Platform)の実現を目指しています。
本セッションでは、ストリーム処理基盤OSS NumaflowとKubernetesのDynamic Resource Allocation(DRA)を組み合わせ、Filter/ResizeとInferenceをそれぞれGPUで実行する映像推論PoCをデモを交えて紹介します。Numaflowで処理間のつながりをYAMLで宣言的に定義し、DRAで各処理にGPUを割り当てることで、複数のGPU処理をKubernetes上に構築・デプロイする方法をお伝えします。
対象は、Kubernetes上でGPUを利用したAI/ML処理基盤を構築したい方や、その基盤を利用するアプリケーション開発者です。
また、内製だけでは利用や開発を広げることが難しかった経験から、既存OSSやKubernetesコミュニティと協調する方針へ転換した背景も紹介します。
NTT株式会社
Research Engineer
学生時代は最適化コンパイラの研究に取り組み、入社後は分散システム・仮想化の研究開発に従事し,コンピューティング基盤技術を専門としている。
現在は、アクセラレータを効率的に活用するための技術検証やPoC開発に取り組んでいる。
NTT株式会社
研究主任
データストリーム処理システム、分散ブロックストレージ、永続性メモリのデータベース処理システムへの適用といったミドルウェアレイヤの研究開発を経て、現在はKubernetesクラスタでのアクセラレータ活用のための研究開発に従事している。