エントリー済み

より正しいp99へ - Prometheus Native Histogramsで手に入れる正確なパーセンタイル

中級者 Operation / Monitoring / Logging

そのp99を、より正しい値に近づける方法があります。Prometheus公式ドキュメントには、実際の95パーセンタイルが320ms付近でも、classic histogramのバケット境界の粗さで推定値が443msまでズレる例があります。バケット境界は計装時に決める設定値で、その粗さが誤差になります。

登壇者自身もこれまで同じ悩みを抱えてきました。SREとして運用していた頃、95パーセンタイルの正確さに自信が持てず監視ルールの閾値に使えませんでした。p99やp95を厳密な値として信じきれない方も少なくないのではないでしょうか。

これを解消するのが、Prometheus v3.8でstableとなったNative Histogramsです。相対誤差を最大5%に保証しカーディナリティを抑え時系列数を最大90%削減できる効果を見込み、Kubernetesもv1.37でベータ・デフォルトON化しています。本セッションでは、classic histogramの限界を数値で示し、解決策とPrometheusクライアント直接計装/OpenTelemetry計装それぞれで変えるべきことを伝えます。

Speaker

Mitsuhiro Tanda

Grafana Labs

Staff Developer Advocate

グラファナラボ日本合同会社スタッフデベロッパーアドボケイト。約10年来のGrafanaユーザーであり、初期バージョンからのコントリビューター。AWS移行を進める組織においてGrafanaとPrometheusの導入・全社展開を推進。PrometheusおよびCloudWatchとのインテグレーション強化にも取り組む。Grafana好きが高じて現職に至る。今後はLGTMスタックの普及やコミュニティ活動に取り組む予定。