KafkaItemReader 적용기
KafkaItemReader 적용기안녕하세요 VIP & Vertical 팀 김윤제입니다.VIP 파트에서 상품 상세 페이지 및 리뷰 업무를 맡고 있습니다.최근 리뷰 개편 작업에 Kafka 도입을 해보며 주니어 개발자로서 겪고 배운 내용을 공유드리기 위해 작성했습니다.부족하게 쓴 내용일지라도 도움이 되었으면 좋겠습니다. Kafka를 선택한 이유제가 속한 VIP & Vertical팀 (VIP 파트)에서 Kafka를 사용하게 된 이유는 크게 다음과 같이 두 가지 이유가 있었습니다.RDB의 부하 조절을 위해 미들웨어인 메시징 플랫폼을 두어 데이터를 처리Review 등록 이후에 같은 데이터를 가지고 여러 가지 작업(Junk 판독, Review Summary) 등의 배치 작업을 하는 병렬 프로세싱을 원했습니다. (..
오프라인 데이터가 필요할 땐, 로플랫!
컬리 검색이 카프카를 들여다본 이야기 2
카프카 스트림즈를 추가하다
데이터 리터러시(Data Literacy)를 올리는 방법
데이터리터러시 와 데이터 기반 의사결정 문화 데이터 리터러시는 데이터를 활용해 문제를 해결하는 능력입니다. 데이터를 보여주는 것만으로 문제 해결력이 좋아지지는 않았습니다. 데이터를 바라보는 올바른 관점을 만들고 이 관점을 유지·강화 시키기 위한 환경이 필요했습니다.
Continual Learning: 꾸준히 성장하는 모델을 만들기 위한 기술
주제별로 알아보는 continual learning
어서 와, 광고 데이터 수집은 처음이지? (feat. kraken)
이번 글에서는 매드업의 DMP 프리즘의 일부인 크라켄을 소개합니다. 크라켄은 매드업에서 구축한 데이터 수집 플랫폼입니다. API 호출 제약이 상대적으로 빡빡한 매체의 데이터 수집을 담당합니다. API 호출 제약으로 인해 어떤 어려움이 있었는지, 그리고 크라켄은 어떻게 이런 어려움을 극복했는지 알아보겠습니다. 비개발자도 편하게 읽으실 수 있도록 기술적인 내용은 후반부에 짧게 다룹니다. 어서 와, 광고 데이터 수집은 처음이지? 구글, 페이스북, 트
오토피디아 데이터 웨어하우스 구축하기
스타트업 데이터 배관공 생존기 1편 (DW.. 그거 어떻게 만드는건데)
화해의 Data Warehouse를 소개합니다
Data Lake 와 Data Warehouse DevDay에서 화해에서 데이터를 활용하는 과정에서 겪은 문제와 그 문제를 해결하기 위해 어떤 고민을 거쳐 Data Warehouse가 구축되고 있는지 소개하는 세션을 진행했는데, 당시의 발표자료를 다듬어 블로그에도 소개합니다.
주도적으로 데이터 플레이를 이끄는 전문가 되기
Google BigQuery와 Data Studio를 활용한 앱 광고 매출 대시보드 개발기
Apache Beam으로 머신러닝 데이터 파이프라인 구축하기 2편 - 개발 및 최적화
대규모 머신러닝 데이터 파이프라인 개발하고 최적화하기
[야놀자 R&D] 야놀자 데이터의 숨겨진 의미를 찾아내는, DI팀 Data Analyst
#02 그 많은 화해 데이터는 어떻게 사용되나요?
화해 화장품 리뷰 데이터 활용_AI 파트 650만 건이 넘는 리뷰 데이터를 더 가치 있는 서비스로 만들기 위해 끊임없이 분석하고 기술을 개발하는 데이터팀 AI 파트의 인터뷰입니다. 리뷰 데이터가 어떻게 유저에게 보다 쉽게 전달되는지 확인해보세요.
선형 모델과 회귀분석의 직관적 이해 (1)
18세기 말 인류 최고의 수학자 가우스가 정규분포와 최소제곱법을 만든 이후로, 선형 모델(Linear Model)은 다양한 방향으로 진화했고 발전해왔다. 20세기 이후 컴퓨터 계산과 모델링 기법의 발전에 힘입어, 소위 말하는 “빅데이터” 시대에 복잡한 계산까지 해줄 수 있는 “머신러닝”, ”딥러닝”이 각광을 받고 있다. 데이터 분석가나 데이터 사이언티스트가 되고 싶은, 혹은 이미 현업에 있는 분들의 상당수가 머신러닝, 딥러닝에 열광하고 이를 적
#01 데이터 분석가가 꿈꾸는 진정한 데이터 드리븐
데이터 드리븐 화해 데이터팀 분석 파트는 구성원들이 데이터 분석가에게 데이터를 요청하지 않아도 누구나 쉽게 데이터를 확인·활용할 수 있는 문화, 데이터를 봐야겠다는 의식 없이도 모든 업무와 생각의 흐름 안에 데이터가 녹아 있는 조직을 꿈꾸고 있다고 하는데요.
Redshift DW에서 PG DM을 만드는 여정
Redshift to PG Data Convenience Store 개요 매드업은 레버에 안정적으로 데이터를 공급하고 광고사업부에게 데이터를 공급하기 위하여 AWS S3에 데이터를 적재합니다. 완전한 raw data 는 아니지만, 각 매체(Facebook, Google 등) 에서 주는 데이터를 그대로 적재 합니다. 그리고 지금까지 이 S3 파일들을 Athena 라는 서비스로 쿼리하여 사용하였습니다. 하지만 Athena가 비용 대비 속도도 느리고
DynamoDB를 사용하는 Go 서비스의 응답 시간 최적화 #2 TLS Handshake
안녕하세요. 버즈빌의 데이터 엔지니어 Raf입니다. 이전 포스팅(DynamoDB를 사용하는 Go 서비스의 응답 시간 최적화 #1 AWS Credential Token)에 이어, Go 서비스에서 DynamoDB를 사용하면서 응답 시간 최적화를 시도한 경험을 공유드리도록 하겠습니다. 이번 편은 해결책을 만들지 못했지만, DynamoDB와 Go HTTP Clie…
세상을 늦게 보기 위해 잃었던 것들
안녕하세요. 플라네타리움 엔진팀에서 Libplanet을 개발하고 있는 이수호입니다. 오늘은 Libplanet을 개발하면서 생겼던 문제 중 블록체인에서 흔히 말하는 확정(Confirmation)으로 인해 생긴 문제와 그 문제를 발견하고 해결하는 과정을 이야기하고자 합니다. 확정(Confirmation) 블록체인에서의 블록은, 어떠한 사건이라고 볼 수 있고 체인은 사건으로 이루어진 일련의 시간 흐름이라고 볼 수 있습니다. 이전의 시간 흐름과는 맞지