#トラブルシューティング

4 件の記事

Kubernetes が遅くなる箇所 — API サーバー、etcd、スケジューラ
読了 6分

Kubernetes が遅くなる箇所 — API サーバー、etcd、スケジューラ

ワークロードは正常なのに kubectl が遅く、デプロイが遅れる、コントロールプレーンが遅くなる状況を診断します。API サーバーを叩く過剰な LIST・WATCH、etcd の fsync 遅延と DB の肥大化、スケジューラ遅延の見分け方と、それぞれの指標・対処を扱います。

requests と limits の値を決める基準 — 運用で通用するルール
読了 5分

requests と limits の値を決める基準 — 運用で通用するルール

Kubernetes の requests・limits の概念ではなく「いくつに設定するか」を扱います。実測ベースの requests 算定、CPU limit のスロットリング論争、memory limit を掛ける理由、QoS クラスと退避の順序、VPA 推奨モードの活用、過大予約と無制限メモリという両側の事故パターンまで整理します。

HPA が思いどおりに動かないとき — よくある設定ミス 6 つ
読了 5分

HPA が思いどおりに動かないとき — よくある設定ミス 6 つ

Kubernetes の HPA が増えない、増えるのが遅すぎる、上下に揺れ続ける原因を整理します。requests 未設定とターゲットパーセントの意味、スケールアップの反応速度と安定化ウィンドウ、フラッピング、GitOps の replicas 衝突、CPU だけを見るスケーリングの限界まで、確認方法とともに扱います。

Pod が Pending で止まるとき — 原因 7 つと確認の順序
読了 5分

Pod が Pending で止まるとき — 原因 7 つと確認の順序

Kubernetes の Pod が Pending 状態で止まる原因を実務の頻度順に整理します。describe の Events の読み方から、リソース不足、過大な requests、nodeSelector・affinity の不一致、taint、PVC のバインド待ち、ResourceQuota、Cluster Autoscaler が増えないケースまで、確認コマンドと対処を扱います。