エントリー済み

“何を統制し、何を委ねるか”を線引きする - ML開発環境をEC2スタンドアロンから as a Serviceへ

中級者 Architecture Design

50人近いML研究者を抱える組織で開発環境はEC2スタンドアロンとして各自に払い出されていました。NVIDIAドライバがバラつきCUDAが動かない環境もあり、コスト・セキュリティ・運用トイル全てが限界に近づいていました。

基盤設計は私1人、パイロット研究者やチームの支援で構想から半年でK8s上でCoderを使いコンテナホストする「開発環境 as a Service」に作り直しました。軸は「何を統制し、何を委ねるか」という線引きです。好みに見えて生産性に寄与しない揺らぎは統一し、生産性を左右する領域だけ委ねる-AWS profileやNVIDIAドライバ、mise によるツールバージョンは統一し、システム領域は揮発、homeは永続化して委ねました。

この移行でインフラコストを40%削減し、オンボーディングを1日から1時間未満に短縮、セキュリティ更新も個別対応から一括対応に変えました。一方で運用面の泥臭さも残りワークロード起因のノード障害対応は今も向き合い続けている課題です。

本セッションでは、50人規模のML研究組織ゆえに向き合った線引きの判断基準と移行ストーリーを共有します。

Speaker

Shuntaro Ito

Sansan株式会社

ML Platform Engineer

学生時代にToB系SaaSスタートアップでの業務や自然言語処理を専門として100ノードを超える大規模分散学習を経験し、Sansan 株式会社に新卒入社。
現在は内製 OCR/VLM/LLM を本番推論および学習する基盤の設計・運用を担当。
Slurm や Kubernetes を使った Job スケジューリングや、GPU を使った本番推論や分散学習にまつわる o11y に興味があります。