장애 대응보다 중요한 장애 복구 설계 — RTO/RPO를 현실적으로 잡는 법
핵심 요약 항목 내용 RTO (Recovery Time Objective) 장애 발생 후 서비스가 복구되기까지 허용 가능한 최대 시간 RPO (Recovery Point Objective) 장애 발생 시 손실을 허용할 수 있는 최대 데이터 양 (시간 단위) 핵심 판단 기준 RTO/RPO가 낮을수록 비용과 복잡도가 높아짐 — 비즈니스 영향도에 따라 티어를 나눠야 함 핵심 메시지 Active/Active가 RPO 0을 보장하지 않고, … 장애 대응
외부 API 장애가 우리 서비스 장애로 이어졌다
장애 Alert의 원인을 스스로 찾다: SRE Observer 개발기
들어가며안녕하세요. LINE Plus에서 Home 서비스의 안정성을 책임지고 있는 Home SRE(Site Reliability Engineering) 팀입니다.SRE Observ...
SRE 업무에 AI 녹여내기 — 2편: Alert Adviser로 장애 원인 분석 자동화
SRE 업무에 AI 녹여내기 — 1편: Smart RI Calc로 인프라 비용 산정 자동화
[구축사례] kt cloud PLATFORM Observability Alert 플랫폼 구축하기
@keyframes kttblink { 50% { opacity:0; } } .ktt-cursor { animation:kttblink 1.05s step-end infinite; } @keyframes kttlive { 0% { box-shadow:0 0 0 0 rgba(63,185,80,0.55); } 70% { box-shadow:0 0 0 6px rgba(63,185,80,0); } 100% { box-shadow:0 0 0 0 rgba
Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기
들어가며: 관측성 데이터는 많아졌지만, 분석은 여전히 어렵습니다안녕하세요. LY Corporation에서 Home 서비스의 안정성을 책임지고 있는 Home SRE(Site Reli...
[트렌드 리포트] "DR은 필요하지만..." 진짜 고민은 따로 있었다
kt cloud마케팅커뮤니케이션팀 요약SUMMARY AI 시대 운영 안정성에 대한 기업들의 실제 고민은 무엇일까요?웨비나 참석자 200명의 설문을 통해 클라우드 운영 현황과 DR 준비 수준, 운영 과제를 분석했습니다. 안녕하세요. kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 발생 이후의 대응만으로는 충분하지 않습니다. 장애가 발생하더라도 서비스를 지속할 수 있도록 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스
[kt cloud 웨비나] 중단 없는 운영을 위한 클라우드
요약 이번 kt cloud 웨비나에서는 공공·엔터프라이즈 환경의 실제 사례를 기반으로,고가용성(HA) 및 DR 구성 전략, 그리고 Multi-AZ 기반의 안정적인 플랫폼 운영 체계를 공유합니다. 안녕하세요. kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 대응보다 ‘중단되지 않는 구조’를 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스템이 복잡해질수록 장애 대응에 대한 실무진의 부담은 커지고,서비스 중단에 대한 조
신뢰성 향상을 위한 SLO/SLI 도입 3편 - 서비스 적용 사례
시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...
Agent 로 최적화 하는 EKS 운영: AWS DevOps Agent + K8s Operator로 MTTR 줄이기
Amazon Elastic Kubernetes Service(Amazon EKS) 환경에서 워크로드를 운영하다 보면, Pod의 OOMKilled 종료나 IP 고갈로 인한 생성 실패 등 다양한 장애 상황에 직면하게 됩니다. 이러한 장애가 발생하면 엔지니어는 Pod 로그 수집부터 Kubernetes Events 추적, 노드 시스템 로그 확인까지 반복적이고 시간 소모적인 트러블슈팅 과정을 거쳐야 합니다. 특히 야간이나 주말에는 대응 시간이 길어지고,
SRE 팀의 반복 작업을 10분의 1로 줄인 SRE 봇 개발기
들어가며: 늘어나는 서비스, 새로운 인프라, 끝없는 문의여러분의 팀은 하루에 몇 번이나 같은 질문에 답하고, 같은 작업을 반복하고 계신가요?LINE Home DevOps 팀은 최근...
신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기
시작하며안녕하세요. SRE(Site Reliability Engineer)로 일하고 있는 어다희입니다. 저희 팀은 Media Platform SRE를 비롯해 글로벌 트래픽 관리 업...
운영 비용을 95% 절감한 서버리스 온콜 시스템 구축기
안녕하세요. 고기를 좋아하는 올리브영 SRE 태극기입니다! 올리브영은 기존에 사용하던 외부 솔루션 기반 온콜 시스템의 한계를 해결하기 위해, 2025년 7월 Amazon SES + Amazon Connect…
[WhaTap] RDS Failover/Reboot 관제 2 – RDS Failover
오늘은 BESPIN GLOBAL SRE실 지봉근님이 작성해주신 '[WhaTap] RDS Failover / Reboot 관제 2 - RDS Failover'에 대해 소개해드리도록 하겠습니다. The post [WhaTap] RDS Failover/Reboot 관제 2 – RDS Failover appeared first on BESPIN Tech Blog.
[WhaTap] RDS Failover / Reboot 관제 1 – Describe RDS
오늘은 BESPIN GLOBAL SRE실 지봉근님이 작성해주신 '[WhaTap] RDS Failover / Reboot 관제 1 - Describe RDS' 에 대해 소개해드리도록 하겠습니다. The post [WhaTap] RDS Failover / Reboot 관제 1 – Describe RDS appeared first on BESPIN Tech Blog.
AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법
오늘은 BESPIN GLOBAL SRE실 정민아님이 작성해주신 'AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법' 에 대해 소개해드리도록 하겠습니다. The post AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법 appeared first on BESPIN Tech Blog.
AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성
오늘은 BESPIN GLOBAL SRE실 정민아님이 작성해주신 'AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성' 대해 소개해드리도록 하겠습니다. The post AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성 appeared first on BESPIN Tech Blog.