エントリー済み

最小の運用コストで、守りながら回す Self-hosted Runner 基盤

中級者 CI / CD

タイミーの runner基盤 は、1時間あたり約6,000ジョブを処理します。これを EKS Auto Mode × Actions Runner Controller で支えています。

Auto Mode に振り切ることでノード管理からは解放されますが、クラスター自体のバージョンアップは残ります。そこでアップグレード可否の自動判定と検証用クラスターでの先行追従を自作し、人が介在するのは本番の実行日時を決めるところだけにしました。

一方で、手間を減らすことと見ないで済ませることは別です。ランナーの外部通信を後から追跡できるようにし、クラスターの設定が危険な状態に落ちていないかを継続的に評価しています。さらに、障害時に十分な調査ができるログ・アラート基盤を Grafana で構築し、可観測性とコストの折り合いをつけました。Pod 配置の断片化によるノードの無駄にも同じ観点で向き合っています。

Kubernetes の運用コストが不安で Self-hosted Runner の基盤化に踏み切れない方に、運用・セキュリティ・コストの3軸で判断材料を持ち帰っていただけます。

Speaker

Hiroshi Tokudomi

株式会社タイミー

プラットフォームエンジニアリングチーム

RailsやGoを中心にバックエンド開発に携わってきました。開発を進める中でインフラや運用改善にも関心を持ち、徐々にSRE領域へと領域を広げていき、現在は株式会社タイミーでSREとしてオブザーバビリティ、開発者体験やセキュリティの向上、インフラ整備、パフォーマンスチューニングなどに取り組んでいます。