Tag: monitoring
All the articles with the tag "monitoring".
-
할 일이 없으면 침묵하는 감시
처리 대상이 0건이면 지표를 하나도 내보내지 않는 계측을 리뷰하면서, 하트비트가 성립하는 두 성질과 감시 키를 어디서 얻어야 하는지 정리한다.
-
경보가 울리지 않는 실패
4년간 300회 넘게 반복된 실패가 화면에는 정상으로만 보였던 건을 계기로, 실패가 신호를 내지 않는 구조들과 감시 대상을 무엇으로 잡아야 하는지 정리한다.
-
오류의 시작 시각과 멈춘 시각
예외는 29시간 전부터 있었는데 처리가 멈춘 것은 다음 날 오후였던 건에서, 원인 시각과 장애 시각을 따로 재야 전환점이 보인다는 것을 정리한다.
-
Google Cloud OpenTelemetry 자동 활성화 — 영향과 대응
Google Cloud에서 OpenTelemetry 통합을 자동 활성화하겠다는 안내를 받았을 때, 영향 범위를 확인하고 대응하는 방법을 정리한다.
-
AWS RDS 디스크 풀 장애 대응 — 연속 ALARM에서 배운 것
AWS RDS에서 disk_running_out ALARM이 연속 5회 발생한 장애 상황의 원인 분석, 즉시 대응, 재발 방지 조치를 정리한다.
-
조용함과 깨짐 사이
대량 재전송을 검토하다 실제 파손 규모를 먼저 재서 0.34퍼센트임을 확인하고, 복구 대신 로그 수정이 진짜 산출물임을 정리한다.
-
인프라 탓이 아니었던 지연
배치가 느린 원인을 인프라에서 찾다가 계측 로그로 서버 시간을 분리해 구조적 특성임을 확인하고, 고칠 수 있지만 안 한다고 적은 과정이다.
-
하나로 보이는 두 문제를 갈라내기
메모리를 늘려도 절반만 나아진 것을 덜 고쳤다로 읽지 않고 두 번째 원인을 찾아, 종료 사유로 원인을 가르는 방법을 세운 과정이다.