신뢰성 향상을 위한 SLO/SLI 도입 3편 - 서비스 적용 사례
시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...
기업 기술블로그의 Monitoring 관련 글 191개
시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...
개요 GS리테일은 전국 18,000여 개의 편의점 GS25와 슈퍼마켓 GS THE FRESH, O4O 플랫폼 우리동네GS, 홈쇼핑 GS SHOP 등 온·오프라인을 아우르는 대한민국 대표 유통기업입니다. 매일 수천만 명의 고객이 이용하는 이 서비스들이 끊김 없이 운영되는 데에는 GS리테일 클라우드인프라팀의 24/7 모니터링이 뒷받침되고 있습니다. GS리테일의 클라우드 인프라는 사업 부문별로 독립된 Datadog 환경과 다수의 모니터링 도구들을 통
GitLab Duo Agent Platform은 여러 AI 에이전트가 협업해 이슈 기획, 코드 리뷰, 보안 분석, CI/CD 점검 등과 같은 엔지니어 업무를 자율적으로 처리하는 플랫폼입니다. 이 글은 GitLab Duo Agent Platform의 특징과 핵심 구성 요소, 파운데이셔널 플로 활용, 에이전트 커스터마이징, 컨텍스트 확장, 세션 모니터링 방법을 다뤘습니다.
숙련된 엔지니어가 2-3일 걸리던 건물 도면 분석, AI가 10분 만에 완료한다면? 상업용 건물을 위한 에너지 효율적인 공조 시스템과 Building Management Systems (BMS, 건물 관리 시스템)를 개발하는 조직은 실시간 모니터링과 에너지 최적화를 통해 건물 운영의 효율성을 극대화하는 것이 이들의 핵심 미션입니다. 직면한 과제: 비구조화된 도면 데이터의 한계 BMS에서 설계도면(계통도)은 건물 제어 인프라의 핵심 구성요소입니다
부제 : LLM Top 10 (2025)과 Agentic Top 10 (2026)을 활용한 체크리스트 들어가며 생성형 AI(Generative AI) 워크로드의 양상이 빠르게 변화하고 있습니다. 현재 많은 프로덕션 환경에서 이미 멀티 에이전트 기반의 AI 워크로드가 수행되고 있으며, 이는 AI 애플리케이션의 주요 특징으로 자리잡아 가고 있습니다. 여러 에이전트가 목표를 분담하고, 도구를 호출하며, 서로 협업하고, 독립적으로 의사결정을 내리는 환
AFINIT Product팀의 AI활용 Self-served 실시간 메트릭 모니터링
이번 포스팅은 삼성전자 서비스의 핵심, 삼성계정 서비스에서 서비스 운영에 실질적인 문제를 해결하는데 GenAI를 어떻게 활용하는지 소개하는 2부작 시리즈 포스팅입니다. 사례가 AWS 기술블로그를 통해 세상에 알려질 수 있게 도움주신 모든 분들에게 감사의 마음을 전합니다. Part 1: 삼성계정 서비스의 AI SecOps – Multi-Agent로 진화하는 보안 위협 탐지 Part 2: Agentic AIOps – Multi-Agent 시스템으로
팀에서 Kubernetes를 도입한 이후 관리하고 있던 서비스들의 MSA 전환이 활발히 이루어지고 있습니다. 하지만 전환이 가속화 될수록 서비스간 연결이 복잡해졌습니다. 또한 Filebeat와 Metricbeat로 수집하며 파편화된 정보는 인입된 CS를 분석하기에 매우 힘들고 불필요한 시간을 보내왔습니다. 그러던 중 사람인에서 Observability 환경을 구축했다는 소식과 일부 서비스에서 도입 후 긍정적인 평가를 보여주어 적용을 검토하게 되
시작하며안녕하세요. SRE(Site Reliability Engineer)로 일하고 있는 어다희입니다. 저희 팀은 Media Platform SRE를 비롯해 글로벌 트래픽 관리 업...
개요 Amazon EBS(Elastic Block Store)는 Amazon EC2(Elastic Compute Cloud)의 인스턴스에 영구 블록 스토리지를 제공하는 핵심 서비스입니다. 엔터프라이즈 환경에서 수백, 수천 개의 EBS 볼륨을 운영할 때, 각 볼륨의 성능을 실시간으로 모니터링하고 병목 지점을 신속하게 파악하는 것은 서비스 안정성과 직결되는 중요한 과제입니다. Amazon CloudWatch는 EBS 볼륨에 대해 다양한 성능 지표를
“이 게시글은 AWS Big Data Blog에 작성된 “Improved resiliency with backpressure and admission control for Amazon OpenSearch Service” 블로그를 번역및 편집 하였습니다.” Amazon OpenSearch Service는 AWS가 관리하는 관리형 서비스로 클라우드 환경에서 OpenSearch 클러스터를 대규모로 보안, 배포 및 운영하는 것을 간단하게 만들어주는 관
들어가며안녕하세요. LINE NEXT DevOps 팀에서 일하고 있는 이동원입니다. 저는 쿠버네티스 기반 인프라 운영과 CI/CD 구축, 모니터링 및 장애 대응 등 인프라 운영 관...
HyperAccel의 CI/CD 인프라를 Actions Runner Controller(ARC) 기반으로 전면 재설계한 기술적 여정과 Vault JWT/Kubernetes Auth 이중 연동, 그리고 자체 개발한 Go 기반 Prometheus Exporter를 통한 파이프라인 관측성(Observability) 확보까지의 전 과정을 다룹니다.
First Action에 따라 달라지는 장애 영향 우아한형제들의 2025년 장애를 돌아보면 인지는 비교적 빠른 편이었습니다. 그러나, 장애로 고객 경험의 악영향이 오래 이어진 사례들이 적지 않았습니다. 장애 대응 과정을 하나씩 다시 들여다보면 차이는 대부분 인지 이후 가장 먼저 어떤 조치를 취했는지, 즉 First Action(초동 조치)에서 시작됐습니다. 실제 내부적으로 약 70여 건 이상의 장애 사례를 분석한 결과, 첫 […] The pos
ALB
대고객 서비스를 제공하는 워크로드의 경우 고객 경험을 지속적으로 향상시키기 위해서 다양한 이벤트나 프로모션을 진행합니다. 어떤 경우는 정기적으로 고객을 초청하여 인터뷰를 하며 서비스의 개선을 위한 피드백을 받기도 하고 어떤 경우는 웹 서비스상의 설문 조사를 통해 개선점을 수집하기도 합니다. 이커머스와 같은 서비스는 고객의 경험이 매출과 직결되는 대표적인 워크로드입니다. 따라서 다양한 고객의 피드백과 워크로드의 품질을 검토하기 위해서 해당 […]
페이지 5 / 11 (총 191개)