エントリー済み

Managed Apache Flinkを用いたステートフルなデータ処理を安全に運用する

中級者 Operation / Monitoring / Logging

断続的に取り込まれる時系列データを特定タイミングで処理するため、Amazon Managed Service for Apache Flinkを採用していました。データを1分、10分、30分などの時間軸で集計する必要があり、集計タイミングの管理と状態管理、状態復旧をモチベーションにした技術選定です。

しかしあるデプロイで、集計データが破損する問題が発生しました。チェックポイントは成功しジョブも正常表示のままでした。長い時間軸ほど症状が悪く、データの欠損検知だけでは拾うことができず最終的な出力値だけが誤った形になっていました。
原因は独立した複数の欠陥が重なったものでした。状態の互換性、停止中データの読み直し、書き込みと状態保存の非同期、復旧時の負荷集中です。

本セッションでは、これらを本番公開前に潰しきるまでの過程を共有します。修正後の切替リハーサルでも別の層で取りこぼしが出ており、一度の修正とデプロイでは終わりませんでした。マネージドサービスの正常表示では及ばない範囲を、状態の互換性・起動直後の集計・書き込みの冪等性という3つの観点でどう埋めたかを持ち帰っていただけます。

Speaker

Kohei Nagase

株式会社スリーシェイク

マネージャー

パブリッククラウドサービスの開発・運用やIoTサービス開発を経て、2021年に株式会社スリーシェイクにジョイン。
エンジニアとしてインフラを主軸にしつつ幅広い領域での技術支援や、組織コンサルティングを行なっている。
社内では各種事業部運営活動やチームマネジメント業も兼ねる。