모니터링

시스템의 상태를 24시간 내내 실시간으로 감시하고 기록하는 것

모니터링이 필요한 이유

만일 모니터링이 없다면 갑자기 서비스 장애 시 이유를 알 수 없어 해결까지의 시간도 오래걸리고 따라서 서비스의 품질도 나빠지게 된다.

따라서 모니터링을 구축하여 관리하면 서비스 장애가 생기기 전 미리 조짐을 알 수 있으며 빠른 원인 파악 및 해결이 가능해진다.

또한 시스템 자원을 필요한 양에 맞게 사용할 수 있어 최적화와 비용절감이 가능하다.

사용한 프로그램들

알람을 주는 서비스 과정

  1. 프로메테우스는 metric정보를 모으며 설정한 rule에 따라 감시를 하고 있다.( CPU 50% 이상 10초 유지 )

image.png

  1. CPU 사용량이 50%가 넘는것을 확인하면 Pending 상태로 바뀌며 알람을 보낼 준비를 시작한다.
  2. CPU 높은 사용량이 10초 초과 시 Firing 상태로 변경되고 Alertmanager는 Discord로 알람을 전송하여 모든 팀원이 서버의 장애 정보를 알 수 있게 된다.

image.png