[클로바시선 #58] 속도와 비용의 열쇠: 멀티모달 AI 학습을 갉아먹는 ‘이미지 토큰 불균형’ 이야기
소버린 AI를 개발하는 일은 막대한 비용을 감당해야 하는 승부입니다. ⚔️ 2025년 Meta가 공개한 자료에 따르면, Llama 4의 사전학습에는 H100 GPU 누적 738만 시간이 투입되었는데요. 이를 2026년 현재 클라우드 H100 임대 시세(시간당 약 2.5~3달러)로 단순히 환산하면 GPU 비용만 한화로 약 250억~300억 원 규모인 셈입니다. 이렇게 GPU를 수백만 시간 가동하는 데만 수백억 원이 소요되는 시대에, 학습 속도를
Amazon SageMaker AI와 AWS IoT Greengrass를 활용한 Physical AI 학습 파이프라인 구축하기
로봇을 움직이는 제어 정책을 학습할 때는 수백만 번의 시행착오가 필요합니다. 학습한 모델로 원하는 동작을 수행하는지 반복해서 검증해야 하는데, 실제 로봇으로 이를 반복하면 시간이 오래 걸리고 비용이 크며 로봇이 파손될 위험이 있습니다. 그래서 로봇 개발팀은 시뮬레이션에서 학습하고 실제 로봇에서 검증하는 Sim-to-Real 접근법을 사용합니다. 하지만 시뮬레이션에서 수많은 시행착오를 거치고 사전 학습된 모델을 로봇 데이터로 미세 조정하는 작업은
[26년 9월] 국가 보안 AI는 네이버클라우드에 맡기라구
AWS 인프라를 활용한 무븐트의 music-to-dance AI 학습·서빙 인프라 구축기
소개 무븐트(MVNT)는 춤을 위한 AI 인프라를 만드는 회사입니다. 전 세계 누구나 쉽게 춤을 만들 수 있도록 댄스 생성 AI 모델을 개발하고 있으며, 유명 안무가인 최영준 공동창업자를 필두로 모션 생성·3D·컴퓨터 비전·휴머노이드 백그라운드의 엔지니어들이 함께하고 있습니다. 현재 무븐트의 서비스는 웹앱과 API, 언리얼 엔진 플러그인 형태로 제공되고 있으며 안무가는 물론 K-Pop 기획사, AI UGC(사용자 생성 콘텐츠) 크리에이터, 게임
SageMaker Studio에서 TIP와 S3 Access Grants를 활용한 Athena 쿼리 실행하기
개요 기업 환경에서 여러 데이터 과학자가 Amazon SageMaker Studio를 공유하여 사용할 때, 사용자별로 세밀한 데이터 접근 권한을 관리하고 감사 추적을 수행하는 것은 중요한 보안 요구사항입니다. 그러나 기존의 IAM Role 기반 접근 방식에서는 SageMaker Studio의 모든 사용자가 동일한 Execution Role을 공유하게 되어, 개별 사용자를 식별하고 차별화된 권한을 부여하는 것이 어려웠습니다. IAM Identit
웅진프리드라이프의 AWS Elastic Disaster Recovery 기반 클라우드 DR 환경 구축
“재해 상황에서 모든 서버를 같은 방식으로 복구해야 할까요?” 재해복구(DR, Disaster Recovery)는 시스템 장애나 재해 상황에서 서비스를 복구하기 위한 체계입니다. 백업을 확보하고 복제를 구성하는 것까지는 비교적 명확한 작업에 해당합니다. 일반적으로 재해복구의 목표는 모든 시스템을 장애 이전 상태로 되돌리는 것으로 설정됩니다. 다만 모든 시스템에 동일한 복구 수준을 적용하려면 그만큼의 자원과 운영 부담이 따릅니다. 복구 시간을 짧
Amazon EKS와 NVIDIA FLARE로 구현하는 연합학습 (Federated Learning)
머신러닝의 학습 과정에서 고품질 모델을 훈련시키려면 대규모의 고품질 데이터가 필수적이며, 이를 준비하는 과정은 보통 여러 출처의 데이터를 한곳에 모으는 작업을 동반합니다. 이 방식은 효과적이지만 의료 기관, 금융 기관, 정부 기관과 같이 데이터 프라이버시, 규제 준수, 데이터 주권에 민감한 환경에서는 조직 밖으로 반출할 수 없는 소중한 데이터를 보유하고 있는 경우가 많습니다. 연합 학습(Federated Learning, FL)은 이에 […]
[활용사례] DevOps 엔지니어가 주목하는 MCP 생태계와 kt cloud PLATFORM 적용기
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
Strands Agents와 Amazon Bedrock AgentCore을 이용한 발전설비진단 구현하기
발전소에는 목적이 다른 시스템과 문서가 함께 존재합니다. 원격 진동 고장진단 시스템(Remote Vibration Monitoring System, RVMS)은 회전설비의 베어링 진동을 상시 감시하고 임계치 초과를 알려 줍니다. 운전 매뉴얼과 로직 도면에는 조치 절차와 설비 관계가 기록되어 있습니다. 하지만 경보가 발생한 뒤 원인 후보를 좁히고, 여러 지표를 비교하고, 필요한 근거를 찾아 조치 순서를 정하는 일은 여전히 전문가의 경험에 의존합니
Strands Agents와 Amazon Bedrock AgentCore을 이용한 발전설비진단 구현하기
발전소에는 목적이 다른 시스템과 문서가 함께 존재합니다. 원격 진동 고장진단 시스템(Remote Vibration Monitoring System, RVMS)은 회전설비의 베어링 진동을 상시 감시하고 임계치 초과를 알려 줍니다. 운전 매뉴얼과 로직 도면에는 조치 절차와 설비 관계가 기록되어 있습니다. 하지만 경보가 발생한 뒤 원인 후보를 좁히고, 여러 지표를 비교하고, 필요한 근거를 찾아 조치 순서를 정하는 일은 여전히 전문가의 경험에 의존합니
신뢰로 완성하는 금융 AI의 미래, KodeRunner 2026
2022년 시작된 카카오뱅크의 사내 기술 컨퍼런스 KodeRunner가 2026년 8월, 코엑스 그랜드볼룸에서 다섯 번째 막을 올렸습니다. 올해는 ‘기술적 성장과 콘텐츠’라는 본질에 집중하기 위해 장소를 확장했습니다. ‘Reliability(신뢰성)‘라는 핵심 키 메시지 아래 진행된 키노트, 글로벌 빅테크 4사(MS·Google·AWS·OpenAI) 핸즈온 실습, 마음을 돌보는 Soft Skill 트랙, 그리고 30대의 가챠 머신과 코인교환소,
쿠버네티스로 여는 AI 추론 인프라
이번 글에서는 AI 컴퓨팅 트렌드가 어디로 향하는지, 그 흐름에서 추론(inference) 인프라를 운영하는 데 쿠버네티스가 어떤 도움을 주는지, 그리고 AWS 위에서 대규모 추론을 안정적으로 돌리는 방법까지 다뤄보...
AWS 네트워크 데이터 전송 및 처리 요금, 아키텍처로 이해하기 [3부: VPC 간 연결과 하이브리드]
이 글은 여러 VPC와 계정, 온프레미스를 연결하는 네트워크를 설계하거나 운영하는 아키텍트와 네트워크 담당자를 대상으로, VPC 경계와 리전 경계를 넘는 트래픽에 어떤 요금이 과금되고 연결 방식별로 비용이 어떻게 달라지는지를 다룹니다. 1부에서는 AWS 네트워크 비용이 데이터 전송 요금과 데이터 처리 요금 두 축으로 정해진다는 점과 인터넷 게이트웨이, NAT Gateway, VPC 엔드포인트의 요금을 살펴보았습니다. 2부에서는 같은 리전 안에서
AWS 네트워크 데이터 전송 및 처리 요금, 아키텍처로 이해하기 [2부: 리전 안의 트래픽]
이 글은 VPC와 가용 영역(Availability Zone, AZ)의 기본 개념과 Elastic Load Balancing, Amazon ElastiCache, Amazon EKS를 운영해 본 경험이 있는 아키텍트와 운영 담당자를 대상으로, 같은 리전 안에서 AZ 경계를 넘는 트래픽이 어디에서 발생하고 어떻게 최적화하는지를 다룹니다. 1부에서는 AWS 네트워크 비용이 데이터 전송 요금과 데이터 처리 요금 두 축으로 결정된다는 점을 살펴보았습니
AWS 네트워크 데이터 전송 및 처리 요금, 아키텍처로 이해하기 [1부: 요금 구조와 인터넷 경계]
이 글은 VPC, 서브넷, 가용 영역(Availability Zone, AZ)의 기본 개념을 아는 아키텍트와 운영 담당자를 대상으로, AWS 네트워크 비용이 어느 경로에서 어떤 단위로 발생하는지와 이를 설계 단계에서 최적화하는 방법을 다룹니다. 데이터 전송 비용은 청구서에서 식별되기 어렵습니다. EC2 인스턴스나 RDS처럼 서비스 이름으로 묶이지 않고 여러 서비스에 흩어져 기록되기 때문입니다. 필자가 검토한 고객 사례들에서는 EC2-Other
VPC 내 프라이빗 서비스에 AWS DevOps Agent를 안전하게 연결하기
이 글은 2026년 4월 1일 AWS DevOps & Developer Productivity 블로그에 게시된 Securely connect AWS DevOps Agent to private services in your VPCs(Alexandra Huides, Jordan Merrick, Mohak Kohli, Tipu Qureshi 공저)를 한국어로 번역∙편집한 글입니다. 원문 게시 이후 서비스가 업데이트됨에 따라, 콘솔 화면 구성·연결 상
AWS 기반 EDA 환경으로 Rebellions의 차세대 AI NPU 개발 가속화하기
첨단 반도체를 개발하려면 수많은 Logic Simulation을 반복하고, DFT(Design for Test)와 Physical Design 같은 높은 컴퓨팅 성능이 필요한 EDA(Electronic Design Automation) 작업을 수행해야 합니다. 설계 규모와 검증 범위가 커질수록 필요한 CPU 코어와 메모리, 공유 스토리지 처리량도 함께 증가합니다. 필요한 시점에 충분한 인프라를 확보하지 못하면 EDA 도구의 실행 시간과 작업 대
쿼리가 아니라 정의를 고치기로 했습니다: Databricks Metric View 도입기
Metric View를 신규 런칭 게임의 데이터 파이프라인에 도입하면서, 대시보드와 분석 에이전트가 같은 지표 정의를 읽게 하기 위해 데이터 구조를 어떻게 나눴는지, 그 과정에서 정한 설계 규칙과 결과를 공유합니다.