[운영가이드] Kubernetes 기반 Fault-Tolerant GPU 클러스터 유지 관리
[ kt cloud Foundation플랫폼팀 서준호 님 ] 요약 이 글에서는 Kubernetes 기반 Fault-Tolerant GPU 클러스터의 안정적 운영과 유지 관리 방안을 다룹니다. 대규모 AI 인프라에서 장애 대응과 성능 저하 예방이 운영 신뢰성에 미치는 의미를 정리합니다. #Kubernetes #GPU클러스터 #FaultTolerance #Slurm #InfiniBand 생성형 AI와 대규모 언어 모델(LLM) 시대에 고성능 연산에
[도입전략] Git 시크릿 관리와 Vault 도입으로 보안 강화하기
[ kt cloud Foundation플랫폼팀 이초환 님 ] 요약 이 글에서는 Git 시크릿 관리 개선과 Kubernetes Secret 오브젝트 제거를 위한 Vault 도입 전략을 다룹니다. 시크릿 노출 위험을 줄이고 운영 환경의 보안 기준을 명확히 하는 방향을 정리합니다. #Vault #GitSecret #Kubernetes #CSIProvider #시크릿관리 왜 Sealed Secrets도 SOPS도 아닌 Vault였나 — 도입 배경과 전
[AI인프라] AI 시대의 보이지 않는 혈관, 데이터센터 전력 케이블 이해하기
[ kt cloud DC동부운용팀 이민재 님 ] 요약 이 글에서는 AI 데이터센터 전력 케이블의 구조, 설계, 시공, 진단과 차세대 기술을 다룹니다. 안정적인 전력 공급이 인프라 신뢰도와 운영 관리에 미치는 영향을 정리합니다. #AI데이터센터 #전력케이블 #데이터센터인프라 #HVDC #XLPE 전력 확보 전쟁, 그 중심에 선 케이블 최근 '전력 확보 전쟁'이라는 말이 뉴스 헤드라인을 장식하고 있습니다. 생성형 AI의 등장으로 데이터센터의 랙당
[설계가이드] Terraform 모듈 설계, 원칙 없이 만들면 반드시 무너진다
[ kt cloud Azure전환팀 변세림 님 ] 요약 이 글에서는 Terraform 모듈 설계 원칙과 표준 구조, 실무 적용 기준을 다룹니다. 안정적인 인프라 운영을 위해 모듈 복잡도와 변경 위험을 줄이는 방향을 정리합니다.#Terraform #IaC #Terraform모듈 #HashiCorp #인프라자동화 안녕하세요. 1부에서 IaC의 본질을 살펴봤는데요, 이번에는 조금 더 실전적인 이야기를 해볼게요. Terraform을 쓰다 보면 어느 순