[AI 인프라] RoCEv2 기반 AI GPU 클러스터 네트워크 설계 고려사항
kt cloud Foundation플랫폼팀 서준호 님 요약 SUMMARY 이 글에서는 RoCEv2 기반 AI GPU 클러스터 네트워크 설계와 무손실 이더넷 구현 고려사항을 다룹니다.안정적인 AI 인프라 운영과 비용 효율적인 확장 전략 수립의 중요성을 정리합니다.#RoCEv2 #AI_GPU_클러스터 #무손실_이더넷 #RDMA #InfiniBand kt cloud에서는 현재 인피니밴드(InfiniBand)와 같은 폐쇄적·독점적 솔루션에서 개방형 이
AI AgentAI/MLDevOpsInfraPerformance
AWS 환경에서 프로덕션-레디 확산 언어 모델(DLM) 검증하기
확산 언어 모델(Diffusion Language Model, 이하 DLM)은 일반적인 자기회귀(Autoregressive, 이하 AR) 모델과 다른 방식으로 텍스트를 생성하는 언어 모델입니다. 최근 AR 모델과 동일한 사이즈의 DLM 모델들이 공개되고 있으며, 벤치마크 결과에서 AR보다 낮은 응답 지연(latency)을 보이며 주목을 받고 있습니다. 다만 AR과 완벽히 동일한 구조의 모델이 아니기 때문에 워크로드에서 모델을 변경하기 앞서 검증
AI/MLAWSMLOpsPerformance
돌아오지 않는 메모리를 찾아서
MonitoringPerformance
Amazon Aurora 및 Amazon RDS의 PostgreSQL 18: 성능 향상
이 글은 AWS Blog의 “PostgreSQL 18 on Amazon Aurora and Amazon RDS: Security, monitoring, and developer enhancements” by Nazneen Jafri, Sukhpreet Kaur Bedi, Ranjan Burman, and Baji Shaik 게시글을 번역한 글 입니다. 복합 인덱스 전반의 쿼리 성능 관리, 구체화(materialized)된 CTE에서의 메모리 스
AWSDatabasePerformancePostgreSQL
천만 MAU를 지탱하는 커뮤니티 시스템을 소개해요
BackendDatabasePerformance
더 빠르게, 그리고 무너지지 않게 — 전시 아키텍처 개선기 (1/3)
ArchitectureDevOpsPerformance
Amazon Bedrock 모델 promptfoo 로 성능 평가하기
들어가며 “프롬프트를 바꿨는데, 정말 더 나아진 걸까?” 생성형 AI 애플리케이션을 개발하는 엔지니어라면 누구나 한 번쯤 마주치는 질문입니다. 프롬프트 한 줄을 수정하거나 모델을 교체할 때마다 품질이 좋아졌는지 확신하기 어렵고, 여러 모델을 두고 어느 쪽이 서비스에 더 맞는지 판단하려면 같은 질문을 양쪽에 던져 결과를 일일이 눈으로 비교해야 합니다. 문제는 대규모 언어 모델(Large Language Model, 이하 LLM)이 비결정적(non
AI/MLLLMPerformance
자취방부터 대형 평수까지, 와이파이 공유기 가이드
우리 집 평수와 가구 유형에 딱 맞는 인터넷 공유기 추천 가이드. 원룸 자취방부터 대형 평수 아파트까지 와이파이 공유기 선택 기준과 인터넷 설치 전 약정 만료 및 요금제 점검 팁까지 한 번에 확인하세요.
InfraPerformanceTools
Oracle Database@AWS 네트워크 구성 가이드
Oracle Database@AWS(ODB@AWS)는 AWS 데이터센터 내에 위치한 Oracle Exadata 인프라에서 Oracle Database를 네티브로 실행할 수 있게 해주는 서비스입니다. Oracle MAA Platinum 인증을 획득하였으며, 애플리케이션-데이터베이스 간 RTT(Round Trip Time) 165μs의 초저지연을 달성하여 미션 크리티컬 워크로드에 적합한 성능을 제공합니다. 그러나 ODB@AWS는 기존 AWS 서비스
AWSDatabaseInfraPerformance
[인프라를 소프트웨어처럼 5/5] 다섯 축의 운영 총합, 그리고 AI 시대의 플랫폼팀
배포·클라우드·시간·공간·테스트, 그리고 환경까지 다 지나왔습니다. 이제 한 장의 표로 돌아와, 그 여섯 줄이 사실은 같은 원리의 반복이었다는 것과, 그 원리가 왜 AI 시대에 더 중요해지는지를 정리합니다.
AI/MLAWSDevOpsInfraPerformance
FE News 26년 7월 소식을 전해드립니다.
주요소식 26년 6월 소식에서는 다음과 같은 유용한 정보들을 만나보실 수 있습니다. TypeScript 7.0 RC Go로 재작성된 네이티브 컴파일러를 탑재한 TypeScript 7.0의 릴리스 후보(RC)가 공개되었다. 기존 타입 체크 로직과 구조를 그대로 유지한 채 포팅해 6.0보다 약 10배 빠르며, Bloomberg, Figma, Google, Slack, Vercel 등 여러 기업의 팀과 프리릴리스 빌드를 테스트해 왔다. 향후 한 달
FrontendPerformanceTypeScript
[교육환경 AX와 데스크톱 가상화 ③] 전공별 실습 환경 전환
콘텐츠 요약 1. 데스크톱 가상화로 전공별 실습 환경을 중앙 서버에서 즉시 배포하고 GPU 자원을 탄력 배분합니다. 2. 물리 PC에 전공별 환경을 개별 세팅할 경우 관리 ... Read More
InfraPerformance
LLM 비용 64% 절감, 캐시 히트율 98% 달성기
MLOpsPerformance
Refine 실제 적용 사례(feat. 투표 플랫폼) — (2)
AI/MLBackendFrontendMobilePerformance
TVING의 새로운 백오피스 Refine 구축기 — (1)
BackendDatabaseDevOpsPerformance
티빙, ‘프로필 시청 등급’ 기능 신규 도입 및 OTT 청소년 보호 캠페인 참여
CultureMobilePerformance
Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과
'Iceberg가 더 효율적이다' 이론을 실제 운영 데이터로 검증. Athena와 PySpark 환경에서의 다섯 가지 벤치마크 결과를 공유합니다
AWSData AnalysisData EngineeringPerformanceTesting
Amazon OpenSearch 3.3 업그레이드로 미리캔버스의 검색 성능 개선
부제: derived source와 Lucene 10.3으로 stored fields 병목을 해소하고, 무중단·안전 롤백 전략으로 메이저 버전을 올린 이야기 본 게시글은 미리디의 김민석, 최시온, 이동진, 김백규님과 함께 작성하였습니다. 미리디의 미리캔버스 소개 미리캔버스는 “누구나 쉽게, 함께 만드는 디자인”을 지향하는 실시간 협업 디자인 플랫폼입니다. 프레젠테이션, SNS 카드뉴스, 유튜브 썸네일, 포스터까지 다양한 시각 콘텐츠를 브라우저에
AWSData AnalysisElasticsearchPerformanceSearch