[kt cloud 웨비나] AI 시대, 데이터센터 운영의 기준을 높이다
요약SUMMARY 이번 kt cloud 웨비나에서는 kt cloud에서 25년간 축적한 데이터센터 운영 경험을 바탕으로, AI와 BIM을 실제 현장에 적용해 AIDC 구축·운영을 혁신한 사례를 공유합니다. 안녕하세요. kt cloud 마케팅커뮤니케이션팀입니다. AI 인프라의 고집적·고도화로 데이터센터 환경이 복잡해지면서, 어떻게 보다 효율적이고 지능적으로 데이터센터를 구축하고 운영할 것인가가 중요한 과제로 떠오르고 있습니다.이러한 과제에 대한
AWS Network Firewall 컨테이너 속성 기반 규칙으로 EKS와 ECS 트래픽 제어하기
2026년 6월 30일, AWS Network Firewall이 컨테이너 속성 기반 규칙(container attribute-based rules)을 출시했습니다. 이제 방화벽 규칙에 IP를 나열할 필요가 없습니다. “이 label을 가진 pod”나 “이 속성을 가진 인스턴스에서 실행되는 task”라는 조건만 선언하면 됩니다. Network Firewall이 해당 컨테이너의 IP를 자동으로 추적합니다. Amazon Elastic Kubernet
토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
토스증권이 Kubernetes GPU 클러스터의 운영 한계를 해결한 방법
AI 데이터센터 효율 지표 4가지 [PUE·WUE·ERF·REF]
AI가 데이터센터의 전력·물·폐열 부담을 동시에 키우면서 전력만 재는 PUE 하나로는 효율을 모두 확인하기 어려워졌습니다. AI 데이터센터 시대에는 실제 환경 성능을 보기 위해 물은 WUE, 폐열은 ... Read More
Amazon EKS 고급 컨트롤 플레인 구성하기
EKS 노드에 파드(Pod)를 더 밀도 있게 채워서 컴퓨트 비용을 줄이고 싶은데, 스케줄러 설정에는 손댈 방법이 없어 아쉬웠던 적이 있으신가요? 대규모 이벤트로 트래픽이 많아지는 순간 오토스케일링이 조금 더 빨리 반응해 주기를 바랐던 경험은 어떠신가요? 지금까지 Amazon EKS에서 이런 요구를 해결하기가 쉽지 않았습니다. kube-scheduler와 kube-apiserver 같은 컴포넌트의 구성이 EKS 컨트롤 플레인 고유의 영역이었기 때
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
1부에서는 Amazon EKS의 GPU 노드에서 Gemma 4 31B를 vLLM으로 서빙할 때의 콜드 스타트를 다뤘습니다. 파드가 Ready가 되기까지의 시간을 428초에서 226초로 줄인 과정입니다. 스트리밍 로더로 가중치를 S3에서 직접 읽고 컴파일 캐시를 hostPath와 S3에 남기고 유휴 상태는 sleep/wake로 전환하는 구성이었습니다. 모델은 NVIDIA가 공개한 NVFP4 체크포인트 nvidia/Gemma-4-31B-IT-NVF
AWS로 구현한 Internet Gateway가 없는 연구환경, 신뢰연구환경(TRE) 솔루션 NDS AI·RE
Internet Gateway 없는 격리 분석환경부터 Air-lock, AI Core까지, AWS로 구현한 신뢰연구환경(TRE) NDS AI·RE의 핵심 기술을 소개합니다. The post AWS로 구현한 Internet Gateway가 없는 연구환경, 신뢰연구환경(TRE) 솔루션 NDS AI·RE appeared first on NDS Cloud Tech Blog.
[데이터센터 입문 시리즈] AI 질문이 닿는 곳 데이터센터
AI 질문은 입력·네트워크·서버 배정·GPU 추론·응답까지 5단계를 거쳐 데이터센터를 왕복합니다. AI 질문 한 번은 약 0.3Wh를 씁니다. LED 전구를 2분 켜는 전력이지만, 하루 수십억 건이 쌓이면 ... Read More
if(kakao)2026 둘째 날, 기술 세션 소개
if(kakao)2026 둘째 날은 안정성과 인프라, 거버넌스, AI-DLC, Model & Agent에 대해 이야기합니다. 키노트를 제외한 총 30개의 기술 세션들이 아래와 같이 진행됩니다. [안전성과 인프라] 1. 유휴 서버를 찾다가 Hybrid Cloud까지 갔습니다: 비용 가시화에서 Unit Economics를 향해가는 카카오의 FinOps 여정 (백정태, 정원천) “서버가 놀고 있네? 그럼 빼면 되겠네!”…그렇게 간단하지 않았습니다.
GS리테일의 전사 AI Gateway 구축 사례 – 2부: 실사용을 견디는 운영과 거버넌스
이 블로그는 GS리테일과 AWS의 협업으로 작성되었습니다. 이 글은 GS리테일의 전사 AI Gateway 구축 사례 1부: 인증·라우팅·계정 자동화 설계에 이어지는 두 번째 글입니다. 1부를 아직 보지 않으셨다면 먼저 읽어보시길 권해드립니다. 1부에서는 GS리테일 클라우드인프라팀이 사내 AI 도구 수요를 조직 차원에서 안전하게 받아내기 위해, 모든 AI 호출을 하나의 관문으로 모으는 전사 AI Gateway를 구축한 과정을 다뤘습니다. Clau
Amazon ECS 실행 구조와 선택 기준 – 2부: 배포 전략과 네트워크, 설계 상한
이 글은 Amazon ECS 실행 구조와 선택 기준을 다루는 시리즈의 2부입니다. 1부에서는 launch type은 호환되는 실행 환경을 표시하는 용도로만 사용하고 실제 실행은 용량 공급자(capacity provider)로 구성한다는 원칙을 바탕으로, Fargate와 ECS Managed Instances, EC2에 걸친 컴퓨트 선택과 Express Mode부터 예약 Task까지의 실행 형태를 살펴봤습니다. 2부에서는 남은 선택지를 다룹니다.
삼성 계정 AIOps: AgentCore기반 AlOps의 실전 활용과 자율성 확장
지난 1부에서는 삼성계정 서비스의 멀티 에이전트 AIOps 시스템을 어떤 구조로 설계했고, 그 구조를 안정적으로 운영하기 위해 무엇을 뒷받침했는지, 그리고 그 위에서 자율성을 어떻게 조금씩 넓혀왔는지를 다뤘습니다. 이 글에서는 그 시스템이 실제 운영 현장에서 어떻게 쓰이고 있는지, 도입 전후로 업무가 어떻게 달라졌는지, 그리고 더 높은 수준의 자율운영으로 나아가기 위해 무엇을 준비하고 있는지를 다룹니다. 이 글은 2부작으로 […]
삼성 계정 AIOps: AgentCore기반 멀티 에이전트 운영 자동화 여정
삼성계정(Samsung Account)은 전 세계 약 21억 사용자에게 삼성 디바이스와 서비스를 연결하는 통합 인증 시스템입니다. Samsung Wallet, Bixby, SmartThings, Samsung Health를 비롯한 수많은 서비스가 삼성계정으로 사용자와 연결되며, 글로벌 대규모 트래픽을 365일 24시간 무중단으로 처리합니다. 이런 초대규모 서비스를 운영한다는 것은, 그만큼 방대한 인프라와 끊임없는 운영 업무를 동반한다는 뜻입니다
Amazon EC2 Nitro V6의 Connection Tracking 유휴 타임아웃 변경 대응하기
주말 내내 트래픽이 없던 서비스에서 월요일 아침 첫 요청들만 유독 타임아웃으로 실패합니다. Karpenter가 노드를 교체한 뒤부터는 원인을 알 수 없는 연결 오류가 늘었는데, 부하 테스트를 아무리 돌려도 재현되지 않습니다. 최근 이런 증상을 겪었다면 애플리케이션 코드보다 먼저 확인할 것이 있습니다. 워크로드를 실행 중인 인스턴스 타입의 세대와 Nitro 버전입니다. 2025년 6월부터 출시되고 있는 Nitro V6 기반 인스턴스(m8i, […
Kafka Streams를 k8s로 옮기며 얻은 스케일링 설계: 비용 80% 절감까지
EC2에서 운영하던 Kafka Streams 애플리케이션을 Kubernetes로 옮기면서, CPU 기반 HPA의 한계를 확인하고 KEDA와 consumer lag 기반 스케일링으로 인프라 비용을 80% 이상 절감한 과정을 공유합니다.
ArgoCD로 GitOps 구축할 때 막히는 5가지 지점: 홈랩 + GitLab Self-Managed 실습
홈랩 Kubernetes 클러스터에 ArgoCD를 설치하고 GitLab Self-Managed 저장소와 연동해 nginx를 배포하는 전 과정을 다룹니다. 포트 포워딩 접속 실패, 인증서 경고, 저장소 인증 오류, 로그인 반복, Kustomize 전환 실패까지 구축 중 자주 막히는 다섯 지점을 증상과 원인, 해결 순으로 정리했습니다.
Terraform Module에서 Terragrunt Stacks까지 IaC 구조를 다시 나눈 이유
AI 시대, 클라우드 엔지니어에게 더 중요해지는 역량
생성형 AI가 빠르게 발전하면서 IT 업계에서는 자연스럽게 이런 질문이 나오고 있습니다. “AI가 코드를 작성하고 아키텍처까지 제안하는 시대에 클라우드 엔지니어의 역할은 어떻게 달라질까?“ 최근의 AI는 Terraform 코드를 생성하고, Kubernetes Manifest를 작성하며, 로그를 분석하고, AWS 서비스 구성을 제안하는 수준까지 발전했습니다. 하지만 클라우드 엔지니어, 특히 Solutions Architect의 핵심 역할은 원래부