분산 학습을 위한 AWS 컴퓨트 선택 가이드 (3편: 클러스터 구축과 운영)
1편에서 모델 규모에 맞는 인스턴스 타입과 인터커넥트 기술을, 2편에서 Amazon EC2 UltraClusters(울트라클러스터) 및 Amazon EC2 UltraServer(울트라서버)와 고성능 GPU 인스턴스 확보 전략을 다뤘습니다. 무엇을 고르고 어떻게 확보할지가 정해졌다면, 이제 실제로 클러스터를 구성하고 운영할 차례입니다. 이번 3편에서는 컨테이너 기반 환경 구성, 클러스터를 구성하기 전 점검사항, 온프레미스 환경과의 비교, GPU와
Airflow 3의 새벽 배치를 멈춘 건 JWT가 아니라 OOM이었다
토스의 속도와 품질, 상용 도구로 충분한가 — 토션(Tossion)
우리 팀만의 vLLM 플러그인 만들기 2편 - 모델 변환부터 배포까지 AI-native로 자동화하기
1편에서는 검색·추천 모델을 vLLM 사용자 정의 플러그인으로 옮겨 서빙 성능을 높인 과정을 소개했습니다. 모델을 vLLM에서 실행할 수 있게 된 뒤에는 또 다른 문제가 남았습니다. 모델마다 반복해야 하는 변환 작업이 복잡하고, vLLM의 빠른 변화까지 계속 따라가야 한다는 점입니다. Hugging Face 모델 하나를 vLLM에 올리는 과정은 버튼 한 번으로 끝나지 않습니다. ‘딸깍’ 한 번으로 완성할 수는 없습니다. 하지만 자동화를 우리 문
[TVING WORK LOG] 티빙의 일하는 방식을 소개합니다!
이메일 기반 고객 문의를 채널톡 유저챗으로 연결하기
App Store가 메일 권한과 라우팅 경계를 맡고, 연동 앱은 고객 문의 처리에 집중하도록 나눈 이야기
한화솔루션의 Amazon Bedrock 기반 Claude Cowork 전사 도입 여정 — 사내 LLM Gateway로 완성한 거버넌스
이 블로그는 한화솔루션 분석/AI팀과 AWS의 협업으로 작성되었습니다 한화솔루션은 사내 임직원과 개발자가 Claude 기반 도구(Claude Cowork, Claude Code)를 안전하고 통제 가능한 방식으로 사용할 수 있도록, Amazon Bedrock 위에 단일 사내 LLM Gateway를 구축했습니다. 특히 Claude Cowork를 AWS 기반으로 전사에 안정 배포한 것은 국내 첫 사례입니다. 이 게이트웨이는 계열사별로 분리된 여러 인
[신청 중] 핫파티션과 트래픽 폭주, 우리는 이렇게 넘었습니다
세번째 CHANNEL DEVMEETUP, 이번 밋업은 Core Backend 팀과 함께 준비한 “DynamoDB Tech Talk”
AWS AI-DLC를 System Maintenance 환경에 맞게 커스터마이징하기
LG CNS는 AWS 프리미어 파트너로, 다수의 대규모 엔터프라이즈 고객을 대상으로 System Maintenance(운영 유지보수)/Application Modernization(현대화)/Migration 서비스를 제공하고 있습니다. 이 글은 그중 한 고객사의 System Maintenance 프로젝트에서 AI-DLC를 도입·커스터마이징하며 축적한 실전 경험을 바탕으로 작성되었습니다. 들어가며 생성형 AI를 개발에 활용하는 방식은 빠르게 진화
모노리포 희망편, 절망의 리포가 희망의 리포로 부활하기까지 걸린 1년
토스에서 100명이 넘는 엔지니어들이 모노리포에서 장점만을 누리기 위해 카탈로그를 도입한 이야기를 소개합니다.
데이터 요청 응대 30분을 3분으로 줄인 n8n AI 에이전트
에이전트 플러그인 등 8월 첫째 주 Google for Developers 위클리 업데이트를 지금 확인하세요!
개발자 여러분, 안녕하세요!8월 첫째 주 블로그에 발표된 Google의 주요 개발자 제품별 최신 소식을 살펴보세요.[주요 개발자 블로그 업데이트]AI & Machine Learning스킬, 도구 등을 하나로 묶어주는 에이전트 플러그인 (Agent Plugins package your skills, tools, and more) MCP Stateless 업데이트로 AI 에이전트 인프라 확장하기(Scaling AI Agent Infrastructu
개인 AI 활용의 다음 단계는 무엇인가 - LY Corporation에서 AIDD 워크숍을 통해 살펴본 AIDD 조직 도입의 조건
LY Corporation에서는 지금까지 AI 활용 역량 향상 워크숍인 Orchestration Development Workshop (ODW)를 통해, 개인이 AI를 활용해 개발...
No title
안녕하세요! 데이터서비스 조직의 비오, 소나, 테라입니다. 데이터서비스 조직은 다양한 기술로 데이터 생태계를 만들어 가며 모든 크루가 데이터로 문제를 해결할 수 있도록 돕고 있습니다. 그 과정에서 수많은 데이터 파이프라인을 다루고 있으며 이를 위해 수천 개의 Airflow DAG를 여러 하둡별 에어플로우 클러스터 위에서 운영하고 있습니다. 이렇게 여러 파이프라인을 다루다 보니 새로운 파이프라인을 개발하거나 기존 파이프라인을 개선하는 일이 잦습니
AI 에이전트를 개발하지 않고 조립한다 — Amazon Bedrock AgentCore 기반 엔터프라이즈 에이전트 플랫폼
들어가며: 에이전트를 한 명이 만들던 시대의 끝 지난 1년 동안 많은 엔지니어가 자기만의 AI 에이전트를 만들어 봤습니다. CloudWatch 지표를 조회하는 작은 도구, EKS 클러스터 상태를 점검하는 스크립트, 장애 로그를 요약하는 프롬프트. LLM과 몇 개의 도구를 엮으면 놀랍도록 빠르게 동작하는 에이전트가 나옵니다. 여기까지는 한 사람의 생산성 향상 이야기입니다. 문제는 그다음입니다. 10명, 20명이 일하는 클라우드 운영 조직에서 […
실패한 메시지는 어디로 가야 할까?- Kafka Retry/DLT 설계와 운영에서 밟은 3가지 함정
AI-Driven Development의 시대
AI API Gateway, 무엇을 보고 골라야 할까? 도입부터 운영까지 선택 기준 5단계
여러 AI 모델을 사용하려면 모델사마다 API 키를 발급받고 각 API를 개별적으로 연동해야 합니다. 모델 수가 늘어날수록 관리와 운영 부담도 함께 커...