Part 1: Kiro로 RDS/Aurora 장애 분석 자동화하기 — IDE에서 분석하기
이 글은 “Kiro로 RDS/Aurora 장애 분석 자동화하기” 시리즈의 첫 번째 글입니다. Part 1 (해당글): “Kiro로 RDS/Aurora 장애 분석 자동화하기 — IDE에서 분석하기” Part 2: “Kiro로 RDS/Aurora 장애 분석 자동화하기 — 터미널에서 분석하기” Part 3: “Kiro로 RDS/Aurora 장애 분석 자동화하기 — 매일 자동으로 보고서 받기” 이 시리즈에서는 Kiro와 MCP(Model Context
현대오토에버의 Amazon Bedrock으로 구축한 빅데이터 클러스터 장애 대응 자동화 에이전트 구축기
이 글은 현대오토에버의 GenAI Sandbox 활용 생산성 향상 해커톤 시리즈의 세번째 글이며, 현대오토에버의 오명우, 정세종님과 함께 작성하였습니다. 첫 번째 글에서는 현대오토에버와 AWS가 GenAI Sandbox를 활용해 어떻게 생산성 향상 해커톤을 기획하고 운영했는지, 그리고 14개 팀 150여 명이 참여한 이 행사의 전반적인 성과를 소개 했습니다. 두 번째 글에서는 Amazon Bedrock과 LangGraph를 활용해 어떻게 다중
HPC를 여행하는 히치하이커를 위한 안내서 Part 3 - 8단계로 완성하는 클러스터
들어가며 지난 글에서 Slurm 스케줄러의 내부 구조와 실전 활용을 다루며, 마지막에 이렇게 말씀드렸습니다. "안정적인 클러스터는 Slurm 설정만으로 완성되지 않습니다. 네트워크, 스토리지, 모니터링, 사용자 정책...
Amazon EKS에서 운영하는 자체 관리형 Agentic AI 플랫폼 : 인프라 자동화와 관측성으로 운영 안정성 확보하기
서론 많은 기업이 LLM 기반 에이전틱 워크플로우를 실제 업무에 투입하고 있습니다. 그러나 프로덕션 규모로 확대하면 단일 거대 LLM에 모든 호출을 의존하는 방식의 한계가 드러납니다. 에이전트 내부에서 발생하는 도구 분류·요약·포맷팅 등 매 단계마다 동일한 토큰 과금이 누적되고, 거대 모델의 긴 응답 지연(TTFT)은 실시간 대화에 부적합합니다. 요금 계산이나 약관 검증처럼 정확성이 요구되는 업무에서 환각(hallucination)은 비즈니스
Datadog RUM 도입기: 비용을 90% 줄이기까지
Datadog RUM을 도입하고 비용을 최대로 줄인 이야기
신뢰성 향상을 위한 SLO/SLI 도입 3편 - 서비스 적용 사례
시작하며안녕하세요. Service Reliability 팀에서 SRE(site reliability engineer)로 일하고 있는 천기철입니다. SRE 팀은 사용자에게 안정적이고...
GS리테일의 AIOps Agent 기반 운영 자동화 혁신
개요 GS리테일은 전국 18,000여 개의 편의점 GS25와 슈퍼마켓 GS THE FRESH, O4O 플랫폼 우리동네GS, 홈쇼핑 GS SHOP 등 온·오프라인을 아우르는 대한민국 대표 유통기업입니다. 매일 수천만 명의 고객이 이용하는 이 서비스들이 끊김 없이 운영되는 데에는 GS리테일 클라우드인프라팀의 24/7 모니터링이 뒷받침되고 있습니다. GS리테일의 클라우드 인프라는 사업 부문별로 독립된 Datadog 환경과 다수의 모니터링 도구들을 통
GitLab Duo Agent Platform으로 개발 업무 80%를 AI에 맡기기
GitLab Duo Agent Platform은 여러 AI 에이전트가 협업해 이슈 기획, 코드 리뷰, 보안 분석, CI/CD 점검 등과 같은 엔지니어 업무를 자율적으로 처리하는 플랫폼입니다. 이 글은 GitLab Duo Agent Platform의 특징과 핵심 구성 요소, 파운데이셔널 플로 활용, 에이전트 커스터마이징, 컨텍스트 확장, 세션 모니터링 방법을 다뤘습니다.
Agentic Workflow로 전문 엔지니어처럼 도면을 분석하다
숙련된 엔지니어가 2-3일 걸리던 건물 도면 분석, AI가 10분 만에 완료한다면? 상업용 건물을 위한 에너지 효율적인 공조 시스템과 Building Management Systems (BMS, 건물 관리 시스템)를 개발하는 조직은 실시간 모니터링과 에너지 최적화를 통해 건물 운영의 효율성을 극대화하는 것이 이들의 핵심 미션입니다. 직면한 과제: 비구조화된 도면 데이터의 한계 BMS에서 설계도면(계통도)은 건물 제어 인프라의 핵심 구성요소입니다
OWASP 기반 GenAI 보안 실무 점검 가이드
부제 : LLM Top 10 (2025)과 Agentic Top 10 (2026)을 활용한 체크리스트 들어가며 생성형 AI(Generative AI) 워크로드의 양상이 빠르게 변화하고 있습니다. 현재 많은 프로덕션 환경에서 이미 멀티 에이전트 기반의 AI 워크로드가 수행되고 있으며, 이는 AI 애플리케이션의 주요 특징으로 자리잡아 가고 있습니다. 여러 에이전트가 목표를 분담하고, 도구를 호출하며, 서로 협업하고, 독립적으로 의사결정을 내리는 환
[AI-Native AFINIT] AI와 함께하는 FPJR 실시간 메트릭 모니터링: 24시간 깨어있는 금융 플랫폼의 신경망 구축기
AFINIT Product팀의 AI활용 Self-served 실시간 메트릭 모니터링
Part2: 삼성계정 서비스의 Agentic AIOps, 운영환경에서 Multi-Agent 시스템으로 RCA 자동화 하기
이번 포스팅은 삼성전자 서비스의 핵심, 삼성계정 서비스에서 서비스 운영에 실질적인 문제를 해결하는데 GenAI를 어떻게 활용하는지 소개하는 2부작 시리즈 포스팅입니다. 사례가 AWS 기술블로그를 통해 세상에 알려질 수 있게 도움주신 모든 분들에게 감사의 마음을 전합니다. Part 1: 삼성계정 서비스의 AI SecOps – Multi-Agent로 진화하는 보안 위협 탐지 Part 2: Agentic AIOps – Multi-Agent 시스템으로
OpenTelemetry 도입기
팀에서 Kubernetes를 도입한 이후 관리하고 있던 서비스들의 MSA 전환이 활발히 이루어지고 있습니다. 하지만 전환이 가속화 될수록 서비스간 연결이 복잡해졌습니다. 또한 Filebeat와 Metricbeat로 수집하며 파편화된 정보는 인입된 CS를 분석하기에 매우 힘들고 불필요한 시간을 보내왔습니다. 그러던 중 사람인에서 Observability 환경을 구축했다는 소식과 일부 서비스에서 도입 후 긍정적인 평가를 보여주어 적용을 검토하게 되
신뢰성 향상을 위한 SLI/SLO 활용 1편 - SLI/SLO 프레임워크 및 서비스 상태 확인 도구 LINE Status 개발기
시작하며안녕하세요. SRE(Site Reliability Engineer)로 일하고 있는 어다희입니다. 저희 팀은 Media Platform SRE를 비롯해 글로벌 트래픽 관리 업...
“왜 노출이 안 될까?”를 한 번에 추적하는 방법
대규모 환경에서의 MCP를 활용한 효율적인 EBS 모니터링
개요 Amazon EBS(Elastic Block Store)는 Amazon EC2(Elastic Compute Cloud)의 인스턴스에 영구 블록 스토리지를 제공하는 핵심 서비스입니다. 엔터프라이즈 환경에서 수백, 수천 개의 EBS 볼륨을 운영할 때, 각 볼륨의 성능을 실시간으로 모니터링하고 병목 지점을 신속하게 파악하는 것은 서비스 안정성과 직결되는 중요한 과제입니다. Amazon CloudWatch는 EBS 볼륨에 대해 다양한 성능 지표를
Amazon OpenSearch Service백프레셔와 Admission Control에 대한이해와 클러스터 복원력 향상
“이 게시글은 AWS Big Data Blog에 작성된 “Improved resiliency with backpressure and admission control for Amazon OpenSearch Service” 블로그를 번역및 편집 하였습니다.” Amazon OpenSearch Service는 AWS가 관리하는 관리형 서비스로 클라우드 환경에서 OpenSearch 클러스터를 대규모로 보안, 배포 및 운영하는 것을 간단하게 만들어주는 관
Claude Code Action: 조직 전반의 코드 품질을 지키는 AI 코드 리뷰 플랫폼화
들어가며안녕하세요. LINE NEXT DevOps 팀에서 일하고 있는 이동원입니다. 저는 쿠버네티스 기반 인프라 운영과 CI/CD 구축, 모니터링 및 장애 대응 등 인프라 운영 관...