Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
1부에서는 Amazon EKS의 GPU 노드에서 Gemma 4 31B를 vLLM으로 서빙할 때의 콜드 스타트를 다뤘습니다. 파드가 Ready가 되기까지의 시간을 428초에서 226초로 줄인 과정입니다. 스트리밍 로더로 가중치를 S3에서 직접 읽고 컴파일 캐시를 hostPath와 S3에 남기고 유휴 상태는 sleep/wake로 전환하는 구성이었습니다. 모델은 NVIDIA가 공개한 NVFP4 체크포인트 nvidia/Gemma-4-31B-IT-NVF
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [1부: 콜드 스타트 최적화]
Gemma 4는 Google이 공개한 오픈 웨이트 모델 패밀리로, E2B부터 31B까지 5가지 크기에 텍스트와 이미지 입력(E2B, E4B, 12B는 오디오도 지원), 최대 256K 토큰 컨텍스트(E2B, E4B는 128K), 추론(thinking) 모드를 제공합니다. 그중 31B는 밀집(dense) 구조의 최상위 모델로, NVFP4(4비트 부동소수점)로 양자화한 가중치 약 31GiB가 96GB GPU 1개에 올라가는 대신 시작할 때마다 수십
AWS로 구현한 Internet Gateway가 없는 연구환경, 신뢰연구환경(TRE) 솔루션 NDS AI·RE
Internet Gateway 없는 격리 분석환경부터 Air-lock, AI Core까지, AWS로 구현한 신뢰연구환경(TRE) NDS AI·RE의 핵심 기술을 소개합니다. The post AWS로 구현한 Internet Gateway가 없는 연구환경, 신뢰연구환경(TRE) 솔루션 NDS AI·RE appeared first on NDS Cloud Tech Blog.
[데이터센터 입문 시리즈] AI 질문이 닿는 곳 데이터센터
AI 질문은 입력·네트워크·서버 배정·GPU 추론·응답까지 5단계를 거쳐 데이터센터를 왕복합니다. AI 질문 한 번은 약 0.3Wh를 씁니다. LED 전구를 2분 켜는 전력이지만, 하루 수십억 건이 쌓이면 ... Read More
브랜드만의 GEO 전략을 세우는 가장 쉬운 방법
고객은 브랜드에 대해 질문하지 않습니다 여러분이 AI를 활용해 UX 분석 툴을 찾고 있는 고객이라고 가정해봅시다. AI에게 어떤 질문을 던질 것 같나요? ‘뷰저블 사용하기 쉬워?’라는 질문보다는 ‘초보자도 사용하기 쉬운 UX 분석 툴 뭐가 있어?’라는 질문을 던질 것입니다. 이처럼 고객은 AI에게 특정 브랜드명을 언급하며 질문하기보다는 자신이 처한 상황이나 해결하고 싶은 문제를 중심으로 질문합니다. 이때, 같은 UX 분석… 더 보기 »브랜드만의
AI가 팀 규칙을 지키도록 하는 방법
Coding Agent를 위한 Stylepack
격리 안 된 테스트의 초록불은, 에이전트가 믿을 수 없습니다
AI 에이전트가 스스로 검증하고 수정하려면, 테스트 결과부터 신뢰할 수 있어야 합니다
지피지기 7편: GPU로 만든 모델이 GPU보다 좋은 칩을 만들다
AI로 AI를 돌리는 칩을 만드는 시대가 도래했습니다. AI 회사인 OpenAI의 자체칩 할라피뇨의 공개된 정보들을 바탕으로 이를 알아봅니다.
if(kakao)2026 둘째 날, 기술 세션 소개
if(kakao)2026 둘째 날은 안정성과 인프라, 거버넌스, AI-DLC, Model & Agent에 대해 이야기합니다. 키노트를 제외한 총 30개의 기술 세션들이 아래와 같이 진행됩니다. [안전성과 인프라] 1. 유휴 서버를 찾다가 Hybrid Cloud까지 갔습니다: 비용 가시화에서 Unit Economics를 향해가는 카카오의 FinOps 여정 (백정태, 정원천) “서버가 놀고 있네? 그럼 빼면 되겠네!”…그렇게 간단하지 않았습니다.
if(kakao)2026 첫째 날, 기술 세션 소개
if(kakao)2026 첫째 날은 AI 방향성, 신뢰와 안전, Model & Agent, 상생과 성장에 대해 이야기합니다. 키노트를 제외한 총 23개의 기술 세션들이 아래와 같이 진행됩니다. [AI 방향성] 1. You Only Train Once: 더 효율적으로 Kanana SLM 개발하기 (류민호, 한규빈) 단 한 번의 학습으로, 4개의 Small Dense Model Family를 개발한 노하우를 공유합니다! 최근 공개한 Kanana-2
How Documents Find Developers at Toss
The Toss Frontend team no longer has to dig through documents to find what they need. We’re building an environment where developers can get immediate answers to their questions through docs and AI. Here’s how we built a new documentation system that
가격 예측부터 입찰 전략까지, LG에너지솔루션의 Amazon Bedrock AgentCore 기반 ERCOT 분석 에이전트 구축기
– 박경수(AWS Solutions Architect), 장현태(AWS Solutions Architect),, 백승연 (LG에너지솔루션, Product Owner) · 최수아 (LG에너지솔루션, Data Scientist “실시간으로 가격이 바뀌는 전력시장에서 최대 수익을 내려면 얼마에 입찰해야 할까? 그 가격을 예측하고 입찰 전략까지 분석해주는 에이전트가 있다면?” LG에너지솔루션 전력거래솔루션은 이 한 문장에서 출발했습니다. LG에너지솔루
카카오, if(kakao)26 컨퍼런스 개최... 모든 연결에 지능을
🔗 if(kakao)26 바로가기 - 10월 13일부터 14일까지 이틀간 카카오 AI 캠퍼스에서 온·오프라인 진행 -올해 슬로건 ‘모든 연결에 지능을’… AI가 확장할 연결의 경험과 신뢰할 수 있는 기술 기준 제시 - 50여개 기술 세션서 AI 적용 성과와 개발 경험 공유…파이어사이드 챗·네트워킹 프로그램도 운영 [2026-09-07] 카카오(대표이사 정신아)가 오는 10월 13일부터 14일까지 이틀간 경기도 용인시 소재 ‘카카오 AI 캠퍼스
AI가 만든 코드가 어드민이 되기까지
실시간으로 생성되는 코드를 어드민 화면으로 보여 주기 위해, 개발 환경을 브라우저 안으로 옮긴 이야기를 소개해요.
Gemini 3.8 Flash와 3.8 Flash Cyber 등 9월 첫째 주 Google for Developers 위클리 업데이트를 지금 확인하세요!
개발자 여러분, 안녕하세요!9월 첫째 주 블로그에 발표된 Google의 주요 개발자 제품별 최신 소식을 살펴보세요.[주요 개발자 블로그 업데이트]AI & Machine Learning‘Gemini 3.8 플래시’와 ‘3.8 플래시 사이버’를 소개합니다 (국문) 더 정밀하고 강력해진 차세대 글로벌 기상 예측 AI 모델, ‘WeatherNext 3’를 소개합니다 (국문) 2026년 8월 최신 Google AI 소식 모아보기(The latest AI
[26년 8월] 국방의 미래에도 AI가 필요하니까
FE News 26년 9월 소식을 전해드립니다.
26년 9월 소식에서는 다음과 같은 유용한 정보들을 만나보실 수 있습니다. 주요소식 The AI Engineering Skills Map Andrew Ng이 DeepLearning.AI 팀과 함께 1만 건이 넘는 채용 공고 분석과 전문가 인터뷰, 설문을 종합해 정리한 AI 엔지니어링 역량 지도다. AI 애플리케이션 구축·배포, 소프트웨어 엔지니어링 기본기, 코딩 에이전트 활용, 그리고 무엇을 만들지 정하는 일(shaping the bui
비주얼 디자이너는 AI로 어떤 문제까지 도전해볼 수 있을까?