インフラ

サーバーが遅い理由 #5 データベースが遅くなるとき — インデックス・ロック・コネクションプール
読了 7分

サーバーが遅い理由 #5 データベースが遅くなるとき — インデックス・ロック・コネクションプール

問題なく動いていたデータベースが遅くなる原因を追跡します。データの成長がしきい値を超えた瞬間に崩れるフルスキャン、インデックスがあるのに使われない条件、長いトランザクションが作るロック待ちのチェーン、プール枯渇と DB 飽和の見分け方、EXPLAIN と統計ビューによる診断手順を扱います。

EC2 の Graviton 移行 — 削減幅と移行チェックリスト
読了 6分

EC2 の Graviton 移行 — 削減幅と移行チェックリスト

x86 インスタンスを Graviton(arm64)へ移すときの実際の削減幅と移行手順を整理します。世代の現況(Graviton4 が主力、Graviton5 GA)、移行が簡単なワークロードと詰まる場所、マルチアーキテクチャイメージのビルド、カナリア切り替え、RDS・Lambda まで広げる順序を扱います。

サーバーが遅い理由 #4 帯域は足りているのに遅いとき — レイテンシ・RTT・再送
読了 6分

サーバーが遅い理由 #4 帯域は足りているのに遅いとき — レイテンシ・RTT・再送

回線の帯域は余っているのにネットワークが遅い状況の原因を追跡します。RTT と往復回数が体感速度を決める構造、TCP ハンドシェイクと TLS の往復コスト、BDP とウィンドウの限界、パケットロスと再送の確認方法、コネクション再利用まで扱います。

サーバーが遅い理由 #3 SSD なのに遅いとき — 書き込み増幅・fsync・キュー深度
読了 7分

サーバーが遅い理由 #3 SSD なのに遅いとき — 書き込み増幅・fsync・キュー深度

SSD を使っているのにディスクがボトルネックになる状況の原因を追跡します。スペックシートの IOPS の前提条件、fsync が生む耐久性書き込みのコスト、SLC キャッシュの枯渇と書き込み増幅、キュー深度 1 の物理的な限界、クラウドボリュームの IOPS 上限まで扱います。

お金が漏れやすい AWS のサービスと設定 — 常設の点検リスト
読了 5分

お金が漏れやすい AWS のサービスと設定 — 常設の点検リスト

急増ではなくベースラインを静かに押し上げる AWS の無駄を点検リストとして整理します。gp2 ボリュームの残存、パブリック IPv4、NAT Gateway の構造、無期限のログ保持、旧世代インスタンス、放置されたロードバランサー、S3 ストレージクラス、開発環境の常時稼働まで、確認方法とともに扱います。

AWS の請求が急に増えたとき — 最もよくある原因 10 個
読了 8分

AWS の請求が急に増えたとき — 最もよくある原因 10 個

先月より AWS の請求書が急に大きくなったときに犯人を探す手順と、実務で最も頻繁に当たる原因 10 個を整理します。NAT Gateway のデータ処理、CloudWatch Logs の取り込み、スナップショットの蓄積、データ転送、RI・Savings Plans の期限切れまで、それぞれの確認方法と対処を扱います。

サーバーが遅い理由 #2 メモリを増やしても速くならないとき — ページキャッシュ・スワップ・ワーキングセット
読了 6分

サーバーが遅い理由 #2 メモリを増やしても速くならないとき — ページキャッシュ・スワップ・ワーキングセット

メモリを増設したのに性能が変わらない状況の原因を追跡します。available の意味とページキャッシュ、余ったメモリがすでにキャッシュとして働いている構造、スワップは使用量ではなく出入りで判定すること、ワーキングセットの見極め、コンテナのメモリ上限とアプリケーションのヒープ設定まで扱います。

サーバーが遅い理由 #1 CPU 使用率は低いのに遅いとき — run queue・I/O wait・ロック競合
読了 7分

サーバーが遅い理由 #1 CPU 使用率は低いのに遅いとき — run queue・I/O wait・ロック競合

CPU 使用率が低いのにサーバーが遅い状況の原因を追跡します。run queue とスケジューリング遅延、iowait の落とし穴、ロック競合と off-CPU の待ち、クラウドのスチールタイムまで、使用率グラフが見落とす待ち時間を見つける診断手順を扱います。

GHCR (GitHub Container Registry) とは — Docker Hub との違い、使い方、料金
読了 7分

GHCR (GitHub Container Registry) とは — Docker Hub との違い、使い方、料金

ghcr.io の正体から整理します。GHCR とは何か、Docker Hub と何が違うのか (pull 制限、権限モデル、料金)、PAT の発行から push/pull までの使い方、そして GitHub Actions 連携と運用のコツまで一本でまとめます。

ハードウェア上級 #7 ファームウェア・BMC・ライフサイクル — サーバーの中のもう 1 台のコンピュータ
読了 9分

ハードウェア上級 #7 ファームウェア・BMC・ライフサイクル — サーバーの中のもう 1 台のコンピュータ

メイン CPU と独立して常に動き続ける管理用コンピュータ BMC を扱います。リモートコンソールと電源制御、IPMI と Redfish、ファームウェアスタックとアップデート運用、SMART と ECC カウンタによる故障予測、管理ネットワークのセキュリティ、そして保証満了からディスク廃棄までのライフサイクルを整理し、ハードウェア上級シリーズを締めくくります。

ハードウェア上級 #6 データセンターの冷却とラック — 電気は結局熱になる
読了 8分

ハードウェア上級 #6 データセンターの冷却とラック — 電気は結局熱になる

サーバーに入った電力はほぼすべて熱になって出ていきます。前面吸気・背面排気という気流の基本から出発し、ホットアイル・コールドアイルのコンテインメント、ラック密度と空冷の限界、D2C・液浸といった液体冷却、ASHRAE の温度基準と PUE の関係まで、データセンター冷却の全体像を整理します。

ハードウェア上級 #5 データセンターの電力 — サーバーをこれ以上挿せない本当の理由
読了 9分

ハードウェア上級 #5 データセンターの電力 — サーバーをこれ以上挿せない本当の理由

ラックに空きスロットが残っていてもサーバーを挿せない理由は電力バジェットです。PSU の冗長化と A/B 電源フィード、ラック単位の kW 契約、PDU と UPS、発電機と ATS、PUE、そして GPU サーバーが押し上げた電力密度まで、サーバーが生きる電力環境を運用者の視点で整理します。