아임웹
2026-06-29 · 29일 전
세 개의 플랫폼, 하나의 배포 관측
흩어진 세 플랫폼 배포를 한 신호로 묶어, 장애 스레드에 자동으로 끌어오기까지
기업 기술블로그의 Monitoring 관련 글 151개
아임웹
2026-06-29 · 29일 전
흩어진 세 플랫폼 배포를 한 신호로 묶어, 장애 스레드에 자동으로 끌어오기까지
AWS
2026-06-27 · 약 1개월 전
1. 개요 AWS DevOps Agent는 인시던트 대응을 위한 자율형 AI 에이전트입니다. 장애가 발생하면 AWS 리소스와 외부 모니터링 도구(Datadog 등)의 메트릭·로그를 자동으로 수집·분석하고, 근본 원인을 파악하여 우선순위가 지정된 권장사항을 제공합니다. 그런데 한 발 물러서 생각해보면, 성능 테스트 결과 분석도 본질은 같습니다 — “특정 시간대에 시스템에 부하가 가해졌을 때, 어떤 리소스가 어떤 상태였고, 어디가 병목이었는가?”를
채널톡
2026-06-26 · 약 1개월 전
Ambient mode 트러블슈팅: Envoy의 stale connection 재사용에 따른 503 에러
네이버
2026-06-16 · 약 1개월 전
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 서드파티 SDK 환경에서 범용 에러 모니터링 도구 연동 시 발생하는 구조적 한계를 극복하기 위해, AI Agent를 활용해 전용 Javascript 에러 모니터링 시스템을 직접 구축한 경험과 그 가능성을 공유합니다. 발표 대상 외부 SaaS 도구의 한계를 경험해본 개발자 프론트엔드/SDK 에러 모니터링에 관심 있는
인포그랩
2026-06-10 · 약 2개월 전
이 글은 에이전트 옵저버빌리티의 개념과 동작 방식, APM·LLM 옵저버빌리티와의 차이, 구현 도구를 살펴봅니다. 아울러 Langfuse와 Google Gemini로 PR 리뷰 에이전트의 활동을 추적·평가하는 실습을 다룹니다. 또 에이전트 옵저버빌리티를 원활하게 운영하기 위해 유념할 사항도 알아봅니다.
네이버
2026-06-08 · 약 2개월 전
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 VictoriaMetrics의 수집(vmagent) → 라우팅(vminsert) → 저장(vmstorage) → 쿼리(vmselect) 순서로 내부 구조를 들여다기보고, 원리에 따라 수집의 좋은 구조를 살펴봅니다. 발표 대상 VictoriaMetrics 개발에 관심 있는 엔지니어 대규모 분산 시스템과 메트릭 인프라를
아임웹
2026-06-08 · 약 2개월 전
가장 근본적인 DB 전환은 미루고 캐싱·쿼리·부하 분산이라는 기본기로 잠재운 데이터 기록
롯데온
2026-06-04 · 약 2개월 전
네이버 클라우드 플랫폼
2026-06-02 · 약 2개월 전
안녕하세요, 누구나 쉽게 시작하는 클라우드 네이버 클라우드 플랫폼 ncloud.com 입니다. 기업의 정보보호 수준을 검증하는 국가 공인 보안 인증 체계 ISMS. ISMS는 기업 보안 수준을 판단하는 대표 인증 기준으로 활용되어 왔습니다. 하지만 최근 3년간 ISMS, ISMS-P 인증기업 중 179개사(약 14%)에서 침해 사고가 발생했는데요. 서면, 스냅샷 중심 심사의 구조적 한계가 주요 원인 중 하나로 지적되기도 하였습니다. 이에 따라
AWS
2026-06-02 · 약 2개월 전
1. HYBE 인프라운영팀 소개 하이브(HYBE)는 글로벌 엔터테인먼트 기업으로, 사내 시스템부터 B2C 서비스까지 다양한 워크로드를 AWS 위에서 운영하고 있습니다. 인프라운영팀은 다중 AWS 계정과 EKS 클러스터에 걸쳐 다수의 서비스를 효율적인 인력 구성으로 운영합니다. 모니터링은 Datadog, 소스 코드는 GitLab, 이슈 관리는 Jira를 사용하고 있습니다. 2. 개요 새벽 3시, Slack 알림과 함께 온콜 담당자의 전화가 울립니
AWS
2026-05-26 · 2개월 전
이 글은 “Kiro로 RDS/Aurora 장애 분석 자동화하기” 시리즈의 첫 번째 글입니다. Part 1 (해당글): “Kiro로 RDS/Aurora 장애 분석 자동화하기 — IDE에서 분석하기” Part 2: “Kiro로 RDS/Aurora 장애 분석 자동화하기 — 터미널에서 분석하기” Part 3: “Kiro로 RDS/Aurora 장애 분석 자동화하기 — 매일 자동으로 보고서 받기” 이 시리즈에서는 Kiro와 MCP(Model Context
AWS
2026-05-22 · 2개월 전
이 글은 현대오토에버의 GenAI Sandbox 활용 생산성 향상 해커톤 시리즈의 세번째 글이며, 현대오토에버의 오명우, 정세종님과 함께 작성하였습니다. 첫 번째 글에서는 현대오토에버와 AWS가 GenAI Sandbox를 활용해 어떻게 생산성 향상 해커톤을 기획하고 운영했는지, 그리고 14개 팀 150여 명이 참여한 이 행사의 전반적인 성과를 소개 했습니다. 두 번째 글에서는 Amazon Bedrock과 LangGraph를 활용해 어떻게 다중
데보션
2026-05-20 · 2개월 전
들어가며 지난 글에서 Slurm 스케줄러의 내부 구조와 실전 활용을 다루며, 마지막에 이렇게 말씀드렸습니다. "안정적인 클러스터는 Slurm 설정만으로 완성되지 않습니다. 네트워크, 스토리지, 모니터링, 사용자 정책...
AWS
2026-05-11 · 3개월 전
서론 많은 기업이 LLM 기반 에이전틱 워크플로우를 실제 업무에 투입하고 있습니다. 그러나 프로덕션 규모로 확대하면 단일 거대 LLM에 모든 호출을 의존하는 방식의 한계가 드러납니다. 에이전트 내부에서 발생하는 도구 분류·요약·포맷팅 등 매 단계마다 동일한 토큰 과금이 누적되고, 거대 모델의 긴 응답 지연(TTFT)은 실시간 대화에 부적합합니다. 요금 계산이나 약관 검증처럼 정확성이 요구되는 업무에서 환각(hallucination)은 비즈니스
아임웹
2026-05-07 · 3개월 전
Datadog RUM을 도입하고 비용을 최대로 줄인 이야기
라인
2026-04-22 · 3개월 전
시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...
AWS
2026-04-16 · 3개월 전
개요 GS리테일은 전국 18,000여 개의 편의점 GS25와 슈퍼마켓 GS THE FRESH, O4O 플랫폼 우리동네GS, 홈쇼핑 GS SHOP 등 온·오프라인을 아우르는 대한민국 대표 유통기업입니다. 매일 수천만 명의 고객이 이용하는 이 서비스들이 끊김 없이 운영되는 데에는 GS리테일 클라우드인프라팀의 24/7 모니터링이 뒷받침되고 있습니다. GS리테일의 클라우드 인프라는 사업 부문별로 독립된 Datadog 환경과 다수의 모니터링 도구들을 통
인포그랩
2026-04-15 · 3개월 전
GitLab Duo Agent Platform은 여러 AI 에이전트가 협업해 이슈 기획, 코드 리뷰, 보안 분석, CI/CD 점검 등과 같은 엔지니어 업무를 자율적으로 처리하는 플랫폼입니다. 이 글은 GitLab Duo Agent Platform의 특징과 핵심 구성 요소, 파운데이셔널 플로 활용, 에이전트 커스터마이징, 컨텍스트 확장, 세션 모니터링 방법을 다뤘습니다.
페이지 2 / 9 (총 151개)