분산 트레이닝 관점에서의 AWS 인터커넥트 기술 소개 – 분산 트레이닝을 위해 알아야 할 GPU 간 고속 통신 기술
대규모 분산 훈련에서 GPU 간 통신 성능은 전체 훈련 효율을 좌우하는 핵심 요소입니다. 수백 대의 GPU가 그래디언트(gradient, 모델이 실수를 고치는 방향 지시서)를 주고받아야 하는 환경에서, 데이터가 GPU 메모리에서 네트워크를 거쳐 원격 노드의 GPU 메모리에 도달하기까지의 경로를 얼마나 효율적으로 설계하느냐가 곧 성능의 차이로 이어집니다. 이번 블로그는 이 시리즈의 마지막 편으로, AWS 인스턴스에서 활용되는 GPU 간 고속 […
도쿄에서 후쿠오카까지, 현장에서 답을 찾다 - CS InquiryChat 도입기
프롤로그: 왜 시스템 전환을 선택했는가안녕하세요. ABC Platform 팀에서 플랫폼 기획자로 일하고 있는 김세리입니다. 저는 일본의 음식 배달 서비스인 데마에칸(Demaecan...
[AI가 읽을 수 있는 코드베이스 3/5] Standalone App: 도메인 슬라이스 독립 실행
Hexagonal Architecture로 AI 에이전트가 검증 가능한 도메인 슬라이스를 만드는 법
창식이와 함께하는 물류 개발 라이프(with 하네스)
폐쇄망 Maven 빌드가 429를 만난다면 - GitLab Virtual Registry로 의존성 에러 해결하기
폐쇄망 CI 환경에서 NAT 게이트웨이 뒤에 Maven 빌드를 돌리다 보면, 다른 빌드 도구에 비해 자주 멈추는 패턴을 마주합니다. 이 글은 폐쇄망 빌드의 의존성 수급 단계에서 발생하는 Maven 빌드 중단 문제를 GitLab Maven Virtual Registry로 해결한 과정과 실전 팁을 다뤘습니다.
플랫폼은 왜 계속 다시 설계되어야 할까 - Server Platform Team 이야기
Server Engineer 이찬희 님, 장강산 님, 하성준 님
Amazon EC2 G5/G6 인스턴스에서 GPU Tensor Parallelism으로 비용 효과적으로 LLM 서빙하기
최근 많은 기업들이 자체 LLM을 구축하거나, 오픈소스 sLLM(Small Large Language Model)을 활용하여 설치형 LLM서비스를 구성하려는 수요가 크게 증가하고 있습니다. 그런데 실제로 배포하려는 모델을 살펴보면, Llama 3 70B, Qwen 72B, EXAONE 3.5 32B 등 모델을 GPU에 로드할 때 필요한 메모리가 40GB에서 최대 150GB에 달하는 경우가 많아, GPU 메모리가 80GB인 H100/H200이 탑
VLM을 쓰지 않은 이유: Geometric Prior로 25배 빠른 의류 디테일컷 자동화
[AI가 읽을 수 있는 코드베이스 2/5] 빌드 피드백이 AI를 가르친다
컴파일 에러, 의존성 오류, 테스트 실패 — 빌드 피드백마다 AI에게 전달되는 정보의 질이 다르다
2026년 5월 인도 핀테크 뉴스
5월 인도 핀테크 관련 정부 규제, 경쟁사 및 업계 동향을 공유합니다.
ODW #7: 세 가지 방법으로 토큰 소비량 40% 절감! ADK를 이용한 컨텍스트 엔지니어링
안녕하세요. 2024년 4월에 신입 사원으로 LY Corporation에 입사한 Inoue Shuichi입니다. 현재 사내용 Kubernetes as a Service인 FKE 팀...
Git 커밋 로그로 주간 업무 정리 자동화하기 — Obsidian + Confluence + Claude Code
들어가며 매주 금요일, 이번 주에 뭘 했는지 정리하는 시간이 찾아옵니다. 여러 저장소를 돌아다니며 커밋 로그를 뒤지고, 그걸 문서로 정리하고, 다시 Confluence에 옮기는 작업. 매번 30분~1시간이 소요됩니다...
메시징 서버의 스트레스 테스트 노하우와 AI 가 덜어 준 부분
Part 1. 개요 - 안정적인 운영을 위한 노력들 안녕하세요 저는 톡메시징개발플랫폼 서버개발자 쟈미입니다. 톡메시징 개발 플랫폼팀은 카카오톡의 메시지 수발신 채팅방 목록 관리와 같은 카카오톡 채팅시스템의 개발, 운영을 담당하고 있습니다. 카카오톡의 채팅 트래픽을 담당하는 부서이기 때문에 어떤 상황에서든 안정적으로 운영하기 위한 노력을 기울이고있습니다. (추천 글 : https://tech.kakao.com/posts/603) 그 노력 중 하나
개발자 없이 5분 만에 버그를 고친 QA, 우리가 설계한 것과 설계하지 않은 것
6G를 위한 AI/ML 물리계층 – JSCM 기반 오디오 전송
이 글은 모든 비트를 완벽하게 지키는 것보다 사람이 자연스럽게 듣고 이해할 수 있도록 하는 것에 집중하는 오디오 전송 방식을 다룹니다. 이를 위해 AI를 활용하여 압축과 전송을 하나로 설계한 JSCM 기반 오디오 전송 방식을 소개하고, 시뮬레이션과 하드웨어 실험을 통해 입증된 성능 우위를 공유합니다. 검증 결과, 제안 방식은 기존 대비 열악한 무선 환경에서도 대등한 음질을 유지했으며, 이는 향후 6G 시스템이 사용자의 경험과 인지를 더 잘 반영
HPC를 여행하는 히치하이커를 위한 안내서 Part 3 - 8단계로 완성하는 클러스터
들어가며 지난 글에서 Slurm 스케줄러의 내부 구조와 실전 활용을 다루며, 마지막에 이렇게 말씀드렸습니다. "안정적인 클러스터는 Slurm 설정만으로 완성되지 않습니다. 네트워크, 스토리지, 모니터링, 사용자 정책...
씨미가 4K · 4초 저지연 라이브를 만든 방법 — Amazon IVS와 자체 구축의 하이브리드 설계
본 글은 씨미(ci-me) 라이브 스트리밍 플랫폼이 4K 저지연 라이브 시청 경험을 제공하기 위해 Amazon IVS의 매니지드 환경과 자체 구축 영역을 어떻게 결합했는지에 대한 사례입니다. 또한 1만 명 동시 시청자를 가정한 부하 테스트 과정에서 마주친 기술적 의사결정과 시행착오가 함께 공유됩니다. 1. 배경 씨미(CIME)는 버추얼 스트리머와 게임 스트리머를 위한 라이브 스티리밍 플랫폼입니다. 4K 초고화질, 초저지연 방송 환경, […]
MSA도, 모놀리스도 아닌 제3의 선택 — Spring Modulith