devBlog
본문 바로가기
devBlog.kr
포스트주간 인기글최근 본 글즐겨찾기(로그인 필요)프로필(로그인 필요)새로운 소식요청하기
devBlog.kr
포스트주간 인기글최근 본 글즐겨찾기(로그인 필요)프로필(로그인 필요)새로운 소식요청하기
devBlog

푸터 메뉴

탐색
  • 포스트
  • 태그별 보기
  • 기업별 보기
  • 주간 인기글
정보
  • 이용약관
  • 개인정보 처리방침

© 2026 devBlog.kr. All rights reserved.

·

v3.0.1

태그/SRE

SRE 글 모음

기업 기술블로그의 SRE 관련 글 21개

KT 클라우드 로고

KT 클라우드

2026-08-20 · 1일 전

[구축사례] kt cloud PLATFORM Observability Alert 플랫폼 구축하기

@keyframes kttblink { 50% { opacity:0; } } .ktt-cursor { animation:kttblink 1.05s step-end infinite; } @keyframes kttlive { 0% { box-shadow:0 0 0 0 rgba(63,185,80,0.55); } 70% { box-shadow:0 0 0 6px rgba(63,185,80,0); } 100% { box-shadow:0 0 0 0 rgba

AWSDevOpsInfraMonitoringSRE
라인 로고

라인

2026-07-31 · 21일 전

Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

들어가며: 관측성 데이터는 많아졌지만, 분석은 여전히 어렵습니다안녕하세요. LY Corporation에서 Home 서비스의 안정성을 책임지고 있는 Home SRE(Site Reli...

LLMMonitoringSRE
KT 클라우드 로고

KT 클라우드

2026-07-29 · 23일 전

[트렌드 리포트] "DR은 필요하지만..." 진짜 고민은 따로 있었다

kt cloud마케팅커뮤니케이션팀 요약SUMMARY AI 시대 운영 안정성에 대한 기업들의 실제 고민은 무엇일까요?웨비나 참석자 200명의 설문을 통해 클라우드 운영 현황과 DR 준비 수준, 운영 과제를 분석했습니다. 안녕하세요. kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 발생 이후의 대응만으로는 충분하지 않습니다. 장애가 발생하더라도 서비스를 지속할 수 있도록 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스

AI/MLDevOpsInfraSRE
KT 클라우드 로고

KT 클라우드

2026-06-17 · 2개월 전

[kt cloud 웨비나] 중단 없는 운영을 위한 클라우드

요약 이번 kt cloud 웨비나에서는 공공·엔터프라이즈 환경의 실제 사례를 기반으로,고가용성(HA) 및 DR 구성 전략, 그리고 Multi-AZ 기반의 안정적인 플랫폼 운영 체계를 공유합니다. 안녕하세요. kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 대응보다 ‘중단되지 않는 구조’를 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스템이 복잡해질수록 장애 대응에 대한 실무진의 부담은 커지고,서비스 중단에 대한 조

AWSDevOpsInfraSRE
라인 로고

라인

2026-04-22 · 4개월 전

신뢰성 향상을 위한 SLO/SLI 도입 3편 - 서비스 적용 사례

시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...

MonitoringPerformanceSRE
AWS 로고

AWS

2026-03-25 · 5개월 전

Agent 로 최적화 하는 EKS 운영: AWS DevOps Agent + K8s Operator로 MTTR 줄이기

Amazon Elastic Kubernetes Service(Amazon EKS) 환경에서 워크로드를 운영하다 보면, Pod의 OOMKilled 종료나 IP 고갈로 인한 생성 실패 등 다양한 장애 상황에 직면하게 됩니다. 이러한 장애가 발생하면 엔지니어는 Pod 로그 수집부터 Kubernetes Events 추적, 노드 시스템 로그 확인까지 반복적이고 시간 소모적인 트러블슈팅 과정을 거쳐야 합니다. 특히 야간이나 주말에는 대응 시간이 길어지고,

AWSDevOpsKubernetesPerformanceSRE
라인 로고

라인

2026-03-24 · 5개월 전

SRE 팀의 반복 작업을 10분의 1로 줄인 SRE 봇 개발기

들어가며: 늘어나는 서비스, 새로운 인프라, 끝없는 문의여러분의 팀은 하루에 몇 번이나 같은 질문에 답하고, 같은 작업을 반복하고 계신가요?LINE Home DevOps 팀은 최근...

DevOpsInfraSRE
라인 로고

라인

2026-03-19 · 5개월 전

신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기

시작하며안녕하세요. SRE(Site Reliability Engineer)로 일하고 있는 어다희입니다. 저희 팀은 Media Platform SRE를 비롯해 글로벌 트래픽 관리 업...

DevOpsMonitoringSRE
올리브영 로고

올리브영

2025-12-24 · 8개월 전

운영 비용을 95% 절감한 서버리스 온콜 시스템 구축기

안녕하세요. 고기를 좋아하는 올리브영 SRE 태극기입니다! 올리브영은 기존에 사용하던 외부 솔루션 기반 온콜 시스템의 한계를 해결하기 위해, 2025년 7월 Amazon SES + Amazon Connect…

AWSDevOpsSRE
베스핀글로벌 로고

베스핀글로벌

2025-05-30 · 약 1년 전

[WhaTap] RDS Failover/Reboot 관제 2 – RDS Failover

오늘은 BESPIN GLOBAL SRE실 지봉근님이 작성해주신 '[WhaTap] RDS Failover / Reboot 관제 2 - RDS Failover'에 대해 소개해드리도록 하겠습니다. The post [WhaTap] RDS Failover/Reboot 관제 2 – RDS Failover appeared first on BESPIN Tech Blog.

AWSDatabaseInfraMonitoringSRE
베스핀글로벌 로고

베스핀글로벌

2025-05-29 · 약 1년 전

[WhaTap] RDS Failover / Reboot 관제 1 – Describe RDS

오늘은 BESPIN GLOBAL SRE실 지봉근님이 작성해주신 '[WhaTap] RDS Failover / Reboot 관제 1 - Describe RDS' 에 대해 소개해드리도록 하겠습니다. The post [WhaTap] RDS Failover / Reboot 관제 1 – Describe RDS appeared first on BESPIN Tech Blog.

AWSDatabaseMonitoringSRE
베스핀글로벌 로고

베스핀글로벌

2025-05-28 · 약 1년 전

AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법

오늘은 BESPIN GLOBAL SRE실 정민아님이 작성해주신 'AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법' 에 대해 소개해드리도록 하겠습니다. The post AWS Athena를 이용하여 ELB 액세스 로그 분석하는 방법 appeared first on BESPIN Tech Blog.

AWSData AnalysisSRE
베스핀글로벌 로고

베스핀글로벌

2025-05-26 · 약 1년 전

AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성

오늘은 BESPIN GLOBAL SRE실 정민아님이 작성해주신 'AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성' 대해 소개해드리도록 하겠습니다. The post AWS Console Login 시 Lambda를 이용하여 Slack 으로 알람 발생 구성 appeared first on BESPIN Tech Blog.

AWSDevOpsSRESecurity
라인 로고

라인

2025-05-23 · 약 1년 전

문의 대응을 효율화하기 위한 RAG 기반 봇 도입하기

시작하며안녕하세요. SR(Service Reliability) 팀에서 SRE(site reliability engineer, 사이트 안정성 엔지니어링) 업무를 맡고 있는 이채승(a...

AI AgentRAGSRE
하이퍼커넥트 로고

하이퍼커넥트

2025-05-15 · 1년 이상 전

Building Resilient, High Performance ScyllaDB Clusters with Super Disk

안녕하세요, SRE - Database Platform Unit(DBP)의 stewart입니다. Hyperconnect는 전사 NoSQL 데이터베이스로 ScyllaDB를 약 4년 동안 운영하며, ML feature store[2] 등 전사의 매우 다양한 서비스의 고성능 요구사항을 충족해왔습니다. 하지만 최근 장애 모의 훈련에서 cluster rolling update 시 node 복구 시간이 지나치게 길다는 문제를 발견했습니다. 본 글에서는 이

DatabasePerformanceSRE
데브시스터즈 로고

데브시스터즈

2025-04-03 · 1년 이상 전

데브시스터즈 엔지니어링 데이 - Infra/SRE 돌아보기

‘데브시스터즈 엔지니어링 데이’를 소개합니다.

InfraSRE
올리브영 로고

올리브영

2024-05-20 · 2년 이상 전

올리브영 QA의 AWS Lambda를 통한 On call 도입기

안녕하세요. 올리브영 QA Enginner 멜짱입니다. 올리브영은 인시던트를 어떻게 관리하고 있는가?…

AWSDevOpsSRE
올리브영 로고

올리브영

2024-01-24 · 2년 이상 전

올리브영은 인시던트를 어떻게 관리하고 있는가?

목차 인시던트란? 인시던트 정책을 수립하게 된 배경이 무엇인가요? 인시던트 정책을 수립하기 위해서 무엇을 하였나요? 인시던트 발생 시 어떻게 진행되나요? 인시던트 처리 후에는 어떻게 하고 있나요? 인시던트란? 인시던트(Incident…

DevOpsMonitoringSRE
12

페이지 1 / 2 (총 21개)