#SRE

9 편의 글

SRE 실무 #5 포스트모템: 비난 없는 회고와 액션 아이템의 사후 관리
5 분 소요

SRE 실무 #5 포스트모템: 비난 없는 회고와 액션 아이템의 사후 관리

장애를 조직의 학습으로 바꾸는 포스트모템 운영을 다룹니다. 비난 없음(blameless)이 온정주의가 아니라 정보 획득 전략인 이유, 어떤 장애에 포스트모템을 쓸지 정하는 트리거 기준, 타임라인·영향·원인 분석·액션 아이템으로 이어지는 템플릿, 사람 실수에서 멈추지 않고 시스템 원인까지 내려가는 질문법, 그리고 액션 아이템이 방치되지 않게 하는 추적 규칙까지 다룹니다.

SRE 실무 #4 온콜 운영: 로테이션, 에스컬레이션, 부담 관리
5 분 소요

SRE 실무 #4 온콜 운영: 로테이션, 에스컬레이션, 부담 관리

지속 가능한 온콜 체계를 설계하는 법을 다룹니다. 로테이션이 성립하는 최소 인원과 근무 편성 방식, 1차 대응자가 막혔을 때를 위한 에스컬레이션 체인, 교대를 넘길 때의 핸드오프 루틴, 교대당 페이지 건수로 부담을 측정하고 상한을 두는 이유, 온콜 중 발견한 문제를 갚는 후속 작업 시간 확보, 그리고 보상과 문화까지, 온콜이 번아웃 제조기가 되지 않기 위한 조건들을 다룹니다.

SRE 실무 #3 경보 설계: 증상 기반 알림과 다중 창 번 레이트
4 분 소요

SRE 실무 #3 경보 설계: 증상 기반 알림과 다중 창 번 레이트

새벽에 사람을 깨울 가치가 있는 경보만 남기는 설계를 다룹니다. 원인 기반 경보(CPU 높음)가 아니라 증상 기반 경보(사용자 요청 실패)로 전환해야 하는 이유, 페이지와 티켓을 가르는 기준, 번 레이트 경보를 짧은 창과 긴 창의 조합으로 만들어 오탐과 미탐을 함께 줄이는 다중 창 구성, 경보 피로를 측정하고 줄이는 운영 루틴까지 다룹니다.

SRE 실무 #2 에러 버짓 운영: 정책 문서와 번 레이트
5 분 소요

SRE 실무 #2 에러 버짓 운영: 정책 문서와 번 레이트

에러 버짓을 개념에서 운영 도구로 바꾸는 방법을 다룹니다. 버짓이 소진됐을 때 무엇을 할지 장애가 나기 전에 합의해 두는 에러 버짓 정책 문서, 피처 동결이 실제로 작동하기 위한 경영진 합의, 버짓이 줄어드는 속도를 나타내는 번 레이트의 계산, 빠른 소진과 느린 소진을 구분해서 대응하는 법, 릴리스 판단에 버짓을 연결하는 실무 패턴까지 다룹니다.

SRE 실무 #1 SLI·SLO 설계: 무엇을 측정하고 몇 9를 약속할 것인가
6 분 소요

SRE 실무 #1 SLI·SLO 설계: 무엇을 측정하고 몇 9를 약속할 것인가

SRE 실무 시리즈의 첫 편으로 SLI와 SLO를 실제로 설계하는 과정을 다룹니다. 사용자 여정에서 측정 대상을 고르는 법, 좋은 SLI가 good/total 비율 형태인 이유, 로드밸런서·서버·클라이언트 중 어디서 측정할지의 트레이드오프, SLO 수치를 현재 성능에서 출발시켜야 하는 이유, 측정 창 선택, 그리고 SLO 명세 문서에 반드시 적어야 할 항목까지 다룹니다.

인시던트 핸들링의 핵심: 장애 대응에서 가장 중요한 것
5 분 소요

인시던트 핸들링의 핵심: 장애 대응에서 가장 중요한 것

장애 대응이 유능한 개인이 아니라 절차로 굴러가게 만드는 방법을 정리합니다. 복구가 원인 규명보다 먼저라는 원칙, 지휘·소통·조사의 역할 분리, 심각도 등급과 선포 기준, 비난 없는 포스트모템 작성법, 온콜을 지속 가능하게 만드는 조건까지 다룹니다.

Error Budget: 장애를 허용하는 예산의 개념과 계산
5 분 소요

Error Budget: 장애를 허용하는 예산의 개념과 계산

SLO에서 파생되는 Error Budget의 개념과 계산법을 정리합니다. 예산의 크기를 시간과 요청 수로 환산하는 법, 소진 속도(번 레이트) 기반 알림이 임계값 알림보다 나은 이유, 예산 소진 시의 정책, 배포 속도와 안정성의 갈등을 규칙으로 바꾸는 운영법까지 다룹니다.

SLI, SLO, SLA 구분: 지표에서 목표, 계약까지
5 분 소요

SLI, SLO, SLA 구분: 지표에서 목표, 계약까지

헷갈리기 쉬운 SLI, SLO, SLA 세 용어를 실무 순서로 정리합니다. 좋은 SLI를 고르는 기준(성공 요청 비율 방식), SLO 수치를 정하는 현실적인 방법, SLA가 SLO보다 느슨해야 하는 이유, 나인(9)의 감각과 흔한 실수까지 예시로 다룹니다.

SRE와 DevOps의 차이: 겹치는 곳과 갈리는 곳
4 분 소요

SRE와 DevOps의 차이: 겹치는 곳과 갈리는 곳

SRE와 DevOps가 각각 무엇이고 어디서 겹치고 어디서 갈리는지 정리합니다. 문화·철학으로서의 DevOps와 그 구현으로서의 SRE, 신뢰성을 숫자로 계약하는 SRE의 고유 도구(SLO·Error Budget), 조직에서 두 역할이 실제로 나뉘는 모양, 채용 공고 읽는 법까지 다룹니다.