VictoriaMetrics 운영기 2편 — 장비 증설 없이 리소스 위기를 해결한 3단계 최적화 전략
VictoriaMetrics 운영기 1편에서는 네이버 검색의 대규모 메트릭 저장소 VictoriaMetrics 클러스터의 규모, 2계층 아키텍처, 180대 노드의 무중단 장비 교체와 증설 전략을 소개했습니다. 2편에서는 장비를 더 늘리지 않고 리소스 위기를 해결하기 위해 진행한 소프트웨어적 최적화 과정을 다룹니다. 메모리 문제를 해결한 뒤에도 쿠버네티스 전환은 계속 빨라졌고, 컨테이너 수는 수백만 개를 넘어섰습니다. 카디널리티가 급격히 증가하면
분산 학습을 위한 AWS 컴퓨트 선택 가이드 (1편: 모델 규모와 하드웨어 선택)
대규모 언어 모델(LLM) 학습을 준비하는 팀이 가장 먼저 부딪히는 질문은 결국 “어떤 GPU를 얼마나, 어떻게 확보할 것인가”로 귀결됩니다. 그러나 이 질문은 H100이냐 B200이냐를 고르는 단순한 하드웨어 선택으로 끝나지 않습니다. 하나의 노드로 충분한지, 아니면 여러 노드로 확장해야 하는지, On-Demand로 그때그때 띄울지, Capacity Block으로 미리 예약할지, 평범한 EC2 클러스터로 감당이 되는지, 아니면 Amazon E
[기술검증] 물리 서버는 그대로, Kubernetes는 새 버전으로: Cluster API In-place Upgrade
@keyframes kttblink { 50% { opacity:0; } } .ktt-cursor { animation:kttblink 1.05s step-end infinite; } @keyframes kttlive { 0% { box-shadow:0 0 0 0 rgba(63,185,80,0.55); } 70% { box-shadow:0 0 0 6px rgba(63,185,80,0); } 100% { box-shadow:0 0 0 0 rgba
[운영가이드] kt cloud 데이터센터 냉동기 원리와 냉각 효율 최적화 방법
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
Kiro 에이전트와 Harness Engineering: LGU+ Knowledge-based Mass Migration 자동화
국내 주요 통신사업자인 LG U+는 모바일, 홈(IPTV/IoT), 기업 서비스 등 다양한 사업 영역에서 서비스를 제공하고 있습니다. 이러한 서비스들을 뒷받침하는 백엔드 시스템은 오랜 기간 온프레미스 환경에서 구축·운영되어 왔으며, 서비스 간 의존성과 레거시 기술 스택이 복잡하게 얽혀 있습니다. LG U+는 시장 변화에 민첩하게 대응하고 인프라 운영 효율을 높이기 위해, 이 중 약 100개의 서비스를 AWS 클라우드로 전환하기로 […]
[클로바 시선 #52] NVIDIA GTC Taipei 2026 네이버클라우드 하이라이트: End-to-End 글로벌 AI 팩토리
올해는 대만 타이베이에서, NVIDIA의 연례 기술 콘퍼런스인 GTC(GPU Technology Conference)가 아시아 최대 IT 전시회 COMPUTEX와 함께 개최되었습니다! 이번 행사는 NVIDIA CEO 젠슨 황의 기조연설과 함께 AI 팩토리와 스케일링 인프라부터 에이전틱 AI, 피지컬 AI까지 첨단 기술의 현재와 미래를 보여주는 전문가 세션으로 구성되었습니다. AI 팩토리 시대의 청사진을 제시한 젠슨 황의 키노트 발표와 함께 본격
경계가 만든 길, Load Balancer(DSR)
[](https://www.nhncloud.com/kr) 기존의 프록시 방식 로드 밸런서(LB)는 클라이언트와 서버 사이에서 양쪽 연결을 모두 종단하고 데이터를 중계하는 구조입니다. 요
EKS 클러스터 11개를 서비스 중단 없이 버전 통일하기
버전이 제각각이던 EKS 클러스터 11개를, AI를 오퍼레이터로 두고 8일 만에 v1.35로 통일했습니다.
[구축사례] kt cloud PLATFORM OpenStack 검증용 Zuul.CI Gating System 구축
Tech-Frontier.md kt cloud $ whoami --team❯ kt cloud Cloud플랫폼팀 김건희 님 요약 TL;DR 이 글에서는 kt cloud PLATFORM의 OpenStack 내재화를 위해 Zuul.CI 기반 Gating System을 구축한 과정을 다룹니다.Upstream 변화에 따른 회귀 위험을 줄이고 안정적인 운영 검증 방향을 정리합니다.#OpenStack #ZuulCI #GatingSystem #CI파이프라인
[AI 인프라] RoCEv2 기반 AI GPU 클러스터 네트워크 설계 고려사항
kt cloud Foundation플랫폼팀 서준호 님 요약 SUMMARY 이 글에서는 RoCEv2 기반 AI GPU 클러스터 네트워크 설계와 무손실 이더넷 구현 고려사항을 다룹니다.안정적인 AI 인프라 운영과 비용 효율적인 확장 전략 수립의 중요성을 정리합니다.#RoCEv2 #AI_GPU_클러스터 #무손실_이더넷 #RDMA #InfiniBand kt cloud에서는 현재 인피니밴드(InfiniBand)와 같은 폐쇄적·독점적 솔루션에서 개방형 이
[NEWS] 네이버클라우드 데이터센터, 국가 정보보호평가 '최우수' 관리기관 선정
안녕하세요. 누구나 쉽게 시작하는 클라우드, 네이버 클라우드 플랫폼 ncloud.com 입니다. 오늘은 네이버클라우드를 이용하시는 분들께 더욱 든든한 소식을 전해드립니다☺️ 네이버의 첫 자체 데이터센터 '각 춘천'이 2025년 민간분야 주요정보통신기반시설 정보보호 종합수준 평가에서 최우수 관리기관으로 선정되어 과학기술정보통신부(이하 과기부) 장관 표창을 받았습니다! 주요 정보통신기반시설과 정보보호 종합수준 평가는 무엇인가요? 주요 정보통신기반시
[교육환경 AX와 데스크톱 가상화④] 대학 실습 과제 평가 환경 전환
콘텐츠 요약 1. VM 이미지 기반으로 과제 실행·검증 환경을 하나로 통일할 수 있습니다.2. 실행 환경이 제각각이면 채점 기준이 흔들리고 코드를 직접 실행하는 과정에서 보안 위험까지 ... Read More
벤치마크, 경량 런타임, 운영 자동화가 만나는 지점
오늘의 트렌드 이번 주 기술 이슈의 교집합은 ‘재현 가능한 품질과 운영’입니다. 대형모델을 객관적으로 비교하는 벤치마크 도구, 경량·대체 JavaScript 런타임의 등판, IaC로 인프라 변경을 기록·복구하는 사례...
[웨비나 후기] 장애를 견디는 아키텍처, 운영 안정성의 새로운 기준
kt cloud 마케팅커뮤니케이션팀 요약 SUMMARY 이번 kt cloud 웨비나에서는 공공·엔터프라이즈 환경의 실제 사례를 기반으로, 고가용성(HA) 및 DR 구성 전략, 그리고 Multi-AZ 기반의 안정적인 플랫폼 운영 체계를 공유했습니다. 안녕하세요, kt cloud 마케팅커뮤니케이션팀입니다. AI·클라우드 환경에서는 장애 대응보다 ‘중단되지 않는 구조’를 설계하는 역량이 더욱 중요해지고 있습니다. 특히 시스템이 복잡해질수록 장애 대응
AI 인프라 설계의 기술적 레퍼런스, <NHN FactoryX 기술 백서>를 소개합니다
[](https://www.nhncloud.com/kr) ## 어제의 경험으로 내일의 변화를 만들어 내는 공장, NHN FactoryX 필요한 만큼의 GPU를 사서 랙
[기술사례] Ceph 기반 스토리지 내재화로 상용 스토리지 대체하기
Tech-Frontier.md kt cloud $ whoami --team❯ kt cloud Storage플랫폼팀 엄주관 님 요약 TL;DR 이 글에서는 Ceph 기반 스토리지 내재화로 상용 스토리지를 대체하기 위한 배경과 설계 방향을 다룹니다.비용 효율과 기술 통제권이 클라우드 운영 경쟁력에 미치는 의미를 정리합니다.#Ceph #스토리지내재화 #분산스토리지 #오브젝트스토리지 #클라우드인프라 왜 스토리지 내재화가 필요했는가 클라우드 서비스를 운
[기술분석] AI 데이터센터에서 WUE가 중요해지는 이유
kt cloud DC북부운용센터 유승철 님 요약 SUMMARY 이 글에서는 AI 데이터센터에서 WUE가 중요해지는 배경과 수자원 효율 관리 방안을 다룹니다.전력 효율을 넘어 물 사용까지 통제해야 하는 운영 방향을 정리합니다.#AI데이터센터 #WUE #수자원효율 #데이터센터냉각 #PUE 핵심 요약AI 데이터센터의 급격한 열 밀도 증가로 냉각에 필요한 물 사용량이 폭증하고 있습니다. 이에 따라 수자원 효율 지수인 WUE(Water Usage Eff
누구도 손대지 못하던 13년의 운영 환경을 stage로 재구축하기까지
13년 레거시, AI Native 방식으로 구축한 stage 환경