torch.compile 해부 1편: TorchDynamo, AOTAutograd, TorchInductor
torch.compile의 세 구성 요소인 TorchDynamo, AOTAutograd, TorchInductor가 각각 어떤 원리로 동작하는지 설명합니다. 그래프의 개념부터 바이트코드 가로채기와 guard, graph break, 디스패처 하단에서의 연산 정규화, 원소 단위 IR과 코드 생성까지 다룹니다.
기업 기술블로그의 Performance 관련 글 549개
torch.compile의 세 구성 요소인 TorchDynamo, AOTAutograd, TorchInductor가 각각 어떤 원리로 동작하는지 설명합니다. 그래프의 개념부터 바이트코드 가로채기와 guard, graph break, 디스패처 하단에서의 연산 정규화, 원소 단위 IR과 코드 생성까지 다룹니다.
이 글은 AWS Physical AI Blog에 게시된 Training World Models on Scene Semantics, Not Pixels을 번역 및 편집한 글입니다. 사전학습된 AI 모듈과 고전 컴퓨터 비전을 조합하여, 도메인 데이터나 합성 프레임 없이 일반 단안(monocular) 영상에서 장면 의미론(scene semantics)을 추출하는 새로운 로봇 월드 모델 학습법을 소개합니다. 소개 오늘날 로봇 AI 학습은 어디를 가나
Intro 안녕하세요, 카카오의 AI 모델 개발을 담당하는 카나나(Kanana) 조직의 Martin(조대진), Abigail(박혜영), Edwin(강우영)입니다. 저희 팀에서는 사람처럼 보고, 듣고, 말하는 통합 멀티모달(Multimodal) 언어모델을 중점적으로 개발하고 있습니다. 지난 5월, 국내 최초로 공개한 통합 멀티모달 언어모델 공개 이후, 저희는 실제 서비스 환경에서 더 나은 사용자 경험을 제공하기 위해 계속해서 모델을 고도화하고 있
들어가며 아임웹은 2026년 7월 10일 새벽, Amazon ElastiCache 기반 운영 캐시들을 Redis 6.x/Valkey 7.2 에서 Valkey 9.1로 업그레이드했습니다. 대표 범용 캐시는 SSR(Server-Side Rendering) 경로와 여러 서비스 로직에서 반복적으로 조회되는 캐시로, 비교 구간 3.5시간 동안 7억 건 이상의 명령어를 처리했습니다. 업그레이드 이후 전날 동일 시간대 대비 전체 CPU는 86.6%, Eng
1편에서는 모델 규모에 맞는 GPU 인스턴스와 인터커넥트, 병렬화 전략, 그리고 모델 메모리 계산까지 ‘무엇을 고를까’를 다뤘습니다. 이번 2편에서는 그 선택을 수천 장 규모로 확장합니다. 수천에서 수만 개의 GPU를 하나의 학습으로 묶는 울트라클러스터와 울트라서버 아키텍처, 그리고 이런 고성능 인스턴스를 실제로 확보하는 ODCR 및 Capacity Block 전략을 다룹니다. 시리즈 블로그 보기 분산 학습을 위한 AWS 컴퓨트 선택 […]
서로 충돌하는 데이터는 어떻게 다룰까요? 최근 멀티모달 대규모 언어모델(MLLM)을 만드는 표준 레시피는 점점 더 큰 여러 종류의 지시 및 응답 데이터를 한데 섞은 학습 데이터인 'Instruction Mixture'를 활용한 후학습(Post-training)으로 자리잡고 있습니다. ✔️ 인식(Perception) ✔️ 추론(Reasoning) ✔️ OCR ✔️ 문서 이해 ✔️ 비디오 이해 등 모델이 수행해야 하는 능력이 다양해질수록, 학습에
LLM 환각 검출은 왜 중요할까요? LLM은 이제 질의응답부터 문서 작성, 블로그 콘텐츠 생성, 내용 요약까지 다양한 영역에서 자연스럽게 활용되고 있습니다. 모델의 답변은 점점 더 그럴듯하게 발전하고 있지만, 문제는 그것이 곧 사실성을 의미하지는 않는다는 점이죠. LLM이 생성한 글에는 ✔️ 실제로 존재하지 않는 사건 ✔️ 잘못된 인과관계 ✔️ 과거 문맥과 모순되는 주장 ✔️ 검증되지 않은 정보 등이 포함될 수 있는데요. 이러한 현상을 일반적으
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
올해로 5년째를 맞은 AWS GameDay 2026에서 카카오뱅크가 2년 연속 1위라는 쾌거를 달성했습니다. 이번 대회는 ‘AI 기반의 운영 및 개발 혁신’을 주제로, Amazon Q Developer와 Kiro CLI를 활용해 장애 및 개발 문제를 해결하는 방식으로 진행되었습니다. 카카오뱅크 키키404팀이 3시간 동안 치열하게 문제를 분석하고 점수를 쌓아가며 우승에 이른 과정을 공유합니다.
더 많은 음악이 팬을 만나고, 더 큰 무대로 이어져 성장할 수 있도록 음악 IP의 생애주기를 설계하고 성장시키는 드림어스컴퍼니의 IP 풀 밸류체인(Full Value-Chain)을 직접 만드는 팀과 사람들을 소개합니다. 드림어스컴퍼니가 그리는 음악 IP 풀 밸류체인의 하이라이트는 어디일까요? 이어폰 너머로 듣던 음악이 마침내 관객의 함성과 빛나는 조명 아래 살아 숨 쉬는 곳, 바로 ‘공연 현장’입니다. 총 430회가 넘는 공연을 발로 뛰며 팬들
안녕하세요, 매장결제 PM 토리토리상입니다. 👋 고객이 카드를 꽂고 결제를 마치기까지 걸리는 시간은 짧게는 1초 남짓입니다. 하지만 전국 약 1,380여 개 올리브영 매장의 POS와 SCO(셀프계산대) 뒤에서는, 그…
VictoriaMetrics 운영기 1편에서는 네이버 검색의 대규모 메트릭 저장소 VictoriaMetrics 클러스터의 규모, 2계층 아키텍처, 180대 노드의 무중단 장비 교체와 증설 전략을 소개했습니다. 2편에서는 장비를 더 늘리지 않고 리소스 위기를 해결하기 위해 진행한 소프트웨어적 최적화 과정을 다룹니다. 메모리 문제를 해결한 뒤에도 쿠버네티스 전환은 계속 빨라졌고, 컨테이너 수는 수백만 개를 넘어섰습니다. 카디널리티가 급격히 증가하면
.ktc-poster img { transition: transform .3s ease, box-shadow .3s ease; } .ktc-poster:hover img { transform: translateY(-4px); box-shadow:0 10px 22px rgba(0,154,135,0.22) !important; } .imageblock img { max-width:100% !important; height:auto !importan
kt cloud Foundation플랫폼팀 서준호 님 요약 SUMMARY 이 글에서는 RoCEv2 기반 AI GPU 클러스터 네트워크 설계와 무손실 이더넷 구현 고려사항을 다룹니다.안정적인 AI 인프라 운영과 비용 효율적인 확장 전략 수립의 중요성을 정리합니다.#RoCEv2 #AI_GPU_클러스터 #무손실_이더넷 #RDMA #InfiniBand kt cloud에서는 현재 인피니밴드(InfiniBand)와 같은 폐쇄적·독점적 솔루션에서 개방형 이
확산 언어 모델(Diffusion Language Model, 이하 DLM)은 일반적인 자기회귀(Autoregressive, 이하 AR) 모델과 다른 방식으로 텍스트를 생성하는 언어 모델입니다. 최근 AR 모델과 동일한 사이즈의 DLM 모델들이 공개되고 있으며, 벤치마크 결과에서 AR보다 낮은 응답 지연(latency)을 보이며 주목을 받고 있습니다. 다만 AR과 완벽히 동일한 구조의 모델이 아니기 때문에 워크로드에서 모델을 변경하기 앞서 검증
페이지 4 / 31 (총 549개)