LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
비어 있는 캐시, 완벽한 알리바이, 사라진 처리량
기업 기술블로그의 Performance 관련 글 549개
비어 있는 캐시, 완벽한 알리바이, 사라진 처리량
서버가 하던 필터링·정렬·검색·페이지네이션을 브라우저로 옮겼더니, 속도뿐 아니라 손대지 못하던 문제 네 개가 같이 풀렸습니다.
요즘 RAG(Retrieval-Augmented Generation) 기반 AI Agent를 구축하는 프로젝트가 정말 많습니다. 사내 문서를 검색해 답하는 어시스턴트, 고객 문의를 처리하는 봇, 방대한 기술 문서에서 근거를 찾아주는 에이전트까지. 그런데 이런 프로젝트를 지원하다 보면 거의 같은 질문을 드리게 됩니다. “검색 품질은 어떻게 측정하고 계신가요?” 돌아오는 답은 대개 비슷합니다. “체감상 좋아진 것 같아요.” “몇 개 돌려봤는데 괜찮
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
일반적인 UX 데이터 분석은 일정 기간 동안 누적된 사용자의 행동을 살펴보는 식으로 이루어집니다. 때로는 하루, 때로는 한 달 간의 데이터를 확인하며 사용자의 전반적인 행동 패턴을 파악하는 것입니다. 하지만 누적된 결과보다 특정 순간의 행동 변화가 더 중요한 경우도 있습니다. 오전 10시에 신제품을 출시한다고 가정해봅시다. 오픈 직후 사용자들은 가장 먼저 어디에 관심을 보일까요? 10분 후 신제품 출시를… 더 보기 »‘결정적인 순간’의 UX 데
AI의 작업 단위를 사람이 한 번에 검수할 수 있는 크기로 제한했습니다.
KV cache offload, 메모리 풀링, 메모리 tiering을 통해 CXL이 실제 워크로드에서 어떻게 쓰이는지 살펴봅니다.
네이버 플레이스 AI MLOps는 지난 1년간 검색과 추천에 사용하는 스코어링 모델의 서빙 구조를 vLLM 기반으로 전환했습니다. 이 글에서는 사내 Engineering Day에서 발표한 내용을 바탕으로, 모델 서빙 경로를 최적화해 성능을 높인 과정을 소개합니다. 먼저 결과부터 살펴보겠습니다. 0.6B 재순위화(reranking) 모델을 Hugging Face Transformer.encode로 서빙했을 때 처리량은 63.85 QPS였습니다.
세번째 CHANNEL DEVMEETUP, 이번 밋업은 Core Backend 팀과 함께 준비한 “DynamoDB Tech Talk”
격리 수준이 아니라 스냅샷 수명이 문제였습니다.
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
들어가며: 에이전트를 한 명이 만들던 시대의 끝 지난 1년 동안 많은 엔지니어가 자기만의 AI 에이전트를 만들어 봤습니다. CloudWatch 지표를 조회하는 작은 도구, EKS 클러스터 상태를 점검하는 스크립트, 장애 로그를 요약하는 프롬프트. LLM과 몇 개의 도구를 엮으면 놀랍도록 빠르게 동작하는 에이전트가 나옵니다. 여기까지는 한 사람의 생산성 향상 이야기입니다. 문제는 그다음입니다. 10명, 20명이 일하는 클라우드 운영 조직에서 […
안녕하세요, 포스타입 백엔드 엔지니어 장예훈이에요. 1부에서는 포스타입이 유저의 취향을 벡터로 표현하고, 그 벡터로 개인화 추천을 만들어 실제 구매까지 끌어올린 이야기를 했어요. 벡터 공간에서 가까운 포스트를 찾고, 나와 취향이 닮은 유저가 좋아한 걸 추천하고. 결과만 놓고 보면 꽤 매끄러운 여정처럼 보였을지도 모르겠습니다. 그런데 실제로는 전혀 그렇지 않았어요. 수백만 개의 벡터를 실시간으로 검색한다는 건, 만들고 나서가 진짜 시작이었거든요.
페이지 3 / 31 (총 549개)