SSG.COM
2026-07-15 · 4일 전
기업 기술블로그의 Monitoring 관련 글 144개
SSG.COM
2026-07-15 · 4일 전
AWS
2026-07-15 · 4일 전
본 게시글은 Introducing OpenTelemetry and PromQL support in Amazon CloudWatch by Rodrigue Koffi를 2026년 7월 정식 출시(GA) 시점의 원문을 번역했습니다. 편집자 주(2026년 7월): 이 게시물은 Amazon CloudWatch의 OpenTelemetry 지표 네이티브 수집 및 PromQL 지원 정식 출시(GA), 그리고 새로 추가된 기능과 변경된 가격 정책을 반영하여 업
채널톡
2026-07-13 · 6일 전
Ambient mode 트러블슈팅 부록: 운영 중 만난 Istio/Envoy 관련 이슈 2가지
KT 클라우드
2026-07-13 · 6일 전
kt cloud 마케팅커뮤니케이션팀 요약 SUMMARY 이번 kt cloud 웨비나에서는 공공·엔터프라이즈 환경의 실제 사례를 기반으로, 고가용성(HA) 및 DR 구성 전략, 그리고 Multi-AZ 기반의 안정적인 플랫폼 운영 체계를 공유했습니다. 안녕하세요, kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 대응보다 ‘중단되지 않는 구조’를 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스템이 복잡해질수록 장애 대응
AWS
2026-07-09 · 10일 전
들어가며 AWS Site-to-Site VPN은 온프레미스와 AWS VPC를 연결하는 가장 빠르고 간편한 방법입니다. 하지만 운영을 하다 보면 한 번쯤은 이런 경험을 하게 됩니다. “새벽에 갑자기 VPN 터널이 끊기면서 온프레미스-AWS 간 통신이 중단되었습니다. AWS 측에서 예정된 유지보수라고 하는데, 이걸 왜 미리 몰랐을까요?” 실제로 많은 고객이 AWS Site-to-Site VPN 사용 중 터널 유지보수(Tunnel Endpoint M
버즈빌
2026-07-04 · 15일 전
세줄 요약 1. Pyroscope 모니터링으로 CPU 점유가 높은 경로 파악 2. DynamoDB wrapper 라이브러리 하위의 AWS SDK v1 unmarshal이 원인 — 라이브러리 메이저 버전 업데이트로 해결 3. 요청당 CPU 59% 감소, 피크 타임 기준 HPA가 요구하는 파드 수 245개 - 109개 감소 Supply 그룹에서 메인으로 운영…
KT 클라우드
2026-07-03 · 16일 전
[ kt cloud DC서부운용센터 서동진 님 ] 요약 이 글에서는 AI 데이터센터에서 발생하는 고조파의 원인과 전력 품질 대책을 다룹니다. 안정적인 전력 운영과 설비 장애 예방을 위한 실무적 판단 기준을 정리합니다. #AI데이터센터 #고조파 #전력품질 #SMPS #능동필터 먼저 짚고 넘어갈 부분이 있습니다. 고조파와 고주파는 서로 다른 개념입니다. 고주파는 수십 kHz 이상의 고속 스위칭 노이즈로 EMI 문제에 해당하고, 고조파는 기본파 60
AWS
2026-06-30 · 19일 전
본 사례는 AWS 3A(Agentic AI Acceleration) 프로그램에서 재사용 가능한 레퍼런스 asset으로 개발되었습니다. 이 글은 프로덕션 환경에서 에이전틱 AI를 운영하기 위한 2부작 시리즈입니다. 파운데이션을 세우는 것에서 시작해, 이를 안정적으로 운영하는 AgentOps까지 다루며, 이번 글은 그 두 번째 편입니다. Part 1: Amazon Bedrock AgentCore로 구축하는 AgentOps (1): 파운데이션과 게이
교보DTS
2026-06-30 · 19일 전
안녕하세요. 교보DTS입니다.이번 글에서는 SSL/TLS 인증서 유효기간 단축 흐름과 이에 따른 운영 리스크, 그리고 인증서를 안정적으로 관리하기 위한 대응 전략에 대해 살펴보겠습니다.특히 CSP 관리형 인증서 서비스 활용, 외부 인증서 관리 솔루션 도입, 모니터링 및 알림 체계 강화 등 운영 환경에서 현실적으로 검토할 수 있는 방안을 중심으로 정리했습니다. 1. 현재 SSL/TLS 인증서 유효기간 변화 SSL/TLS 인증서는 웹 … SSL/T
교보DTS
2026-06-30 · 19일 전
1. AI가 만든 비대칭 지난 글에서 우리는 생성형 AI와 거대언어모델(LLM)이 모의해킹의 생산성을 어떻게 폭발적으로 증가시키고 있는지 살펴보았습니다. 공격 스크립트 자동 생성부터 타겟 시스템의 세부 취약점 분석까지, AI는 이제 공격자의 가장 강력한 무기가 되었습니다. 문제는 여기서 발생합니다. 공격자는 AI라는 고성능 엔진을 달고 실시간으로 무기를 변형하며 밀고 들어오는데, 이를 막아야 하는 방어선은 여전히 과거의 패러다임에 머물러 있다는
네이버
2026-06-29 · 20일 전
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 End To End 모니터링을 별도의 작업없이 제공 받을수 있는 nFront RUM 서비스를 소개합니다. 내부 솔루션만으로 구현한 서비스로 별도의 비용 없이 AI report까지 제공되는 Real User Monitoring 서비스 입니다. 발표 대상 서비스 품질 측정과 모니터링 작업에 관심있는 개발자 목차 RUM
아임웹
2026-06-29 · 20일 전
흩어진 세 플랫폼 배포를 한 신호로 묶어, 장애 스레드에 자동으로 끌어오기까지
AWS
2026-06-27 · 22일 전
1. 개요 AWS DevOps Agent는 인시던트 대응을 위한 자율형 AI 에이전트입니다. 장애가 발생하면 AWS 리소스와 외부 모니터링 도구(Datadog 등)의 메트릭·로그를 자동으로 수집·분석하고, 근본 원인을 파악하여 우선순위가 지정된 권장사항을 제공합니다. 그런데 한 발 물러서 생각해보면, 성능 테스트 결과 분석도 본질은 같습니다 — “특정 시간대에 시스템에 부하가 가해졌을 때, 어떤 리소스가 어떤 상태였고, 어디가 병목이었는가?”를
채널톡
2026-06-26 · 23일 전
Ambient mode 트러블슈팅: Envoy의 stale connection 재사용에 따른 503 에러
네이버
2026-06-16 · 약 1개월 전
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 서드파티 SDK 환경에서 범용 에러 모니터링 도구 연동 시 발생하는 구조적 한계를 극복하기 위해, AI Agent를 활용해 전용 Javascript 에러 모니터링 시스템을 직접 구축한 경험과 그 가능성을 공유합니다. 발표 대상 외부 SaaS 도구의 한계를 경험해본 개발자 프론트엔드/SDK 에러 모니터링에 관심 있는
인포그랩
2026-06-10 · 약 1개월 전
이 글은 에이전트 옵저버빌리티의 개념과 동작 방식, APM·LLM 옵저버빌리티와의 차이, 구현 도구를 살펴봅니다. 아울러 Langfuse와 Google Gemini로 PR 리뷰 에이전트의 활동을 추적·평가하는 실습을 다룹니다. 또 에이전트 옵저버빌리티를 원활하게 운영하기 위해 유념할 사항도 알아봅니다.
네이버
2026-06-08 · 약 1개월 전
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 VictoriaMetrics의 수집(vmagent) → 라우팅(vminsert) → 저장(vmstorage) → 쿼리(vmselect) 순서로 내부 구조를 들여다기보고, 원리에 따라 수집의 좋은 구조를 살펴봅니다. 발표 대상 VictoriaMetrics 개발에 관심 있는 엔지니어 대규모 분산 시스템과 메트릭 인프라를
아임웹
2026-06-08 · 약 1개월 전
가장 근본적인 DB 전환은 미루고 캐싱·쿼리·부하 분산이라는 기본기로 잠재운 데이터 기록
페이지 1 / 8 (총 144개)