Talend Studio와 TAC를 이용한 ETL 데모
안녕하세요 씨앤텍시스템즈 김준형입니다. 이번 포스트는 Talend 기능에 대해서 정리해 보았습니다. Oralce의 테이블을 호출하고 ETL 기능을 수행하면서 Talend 기능을 살펴보겠습니다. Talend Studio의 실행환경은 윈도우에서 진행하였습니다. TAC(Talend Administrator Center)는 Linux 환경에 설치하고 윈도우에서 Web환경에서 진행했습니다. 먼저 Talend Studio 실행화면입니다. 여기서 Local
다나와 웹 트래픽 로그 데이터 분석 시스템 도입기
개요 안녕하세요. 다나와에서 데이터 파트를 맡아 진행하고 있는 선지호입니다. 다나와에서는 웹 트래픽 로그 데이터 분석을 위해 새로운 내부 서비스를 구축 했습니다. 이 과정중에 저희가 했던 많은 고민과 결정을 공개하여 다나와를 관심있어하는 여러분들께 하나의 사례를 공유해 볼까 합니다. 여정 저희의 여정은 이렇습니다 1) 정책 및 필요조건 정하기 2) 유비쿼터스 언어 사전 만들기 3) 아키텍처 및 기술 검토 4) 데이터 포맷 선정 5) 데이터 필터
“여기가 집이 맞나요?”AI로 주소 등록 유도한 결과는 - 25편 – 집 추천을 위한 CDP 활용과 딥러닝 모델링
Abstract 티맵은 킬러 콘텐츠인 내비게이션 이용객의 사용 편의성을 높이기 위해 목적지로 자주 이용되는 집, 회사에 대한 원클릭 내비게이션 서비스를 제공하고 있습니다. 이번 10.0 앱 개편을 통해 다양한 모빌리티 서비스를 추가하였고, NIS(neural information seeking)을 강화하였습니다. NIS의 강화를 위해 저희는 집을 등록하지
RLHF 외에 LLM이 피드백을 학습할 수 있는 방법은 무엇이 있을까?
"RLHF 외에 Human feedback을 학습할 수 있는 방법론들에 대해서 소개하고 핑퐁팀에서 실험한 경험을 공유합니다."
다나와의 상품 색인 파이프라인
상품 색인 파이프라인 소개 안녕하세요. 다나와에서 검색 서비스를 개발하고 있는 곽명환 입니다. 오늘은 검색 개발팀에서 사용하고 있는 동적 색인 서비스의 흐름과 해당 서비스의 문제점, 해결 방안을 소개해 보도록 하겠습니다. 다나와에서는 약 11억건의 상품 데이터를 보유하고 있습니다. 대용량 데이터를 실시간에 가까운 속도로 처리하고, 전문 검색 등이 가능할 수 있도록 RDBMS 대신 엘라스틱 서치를 채택해 검색 엔진으로 사용하고 있습니다. 상품 데
업데이트 압축률 67%, 플레이스 리뷰 tagging 시스템 개선경험
킁킁!킁! 어디서 사기 냄새 안나요? : FDS 시스템에 AI 적용하기
카카오뱅크 데이터기술팀의 Logan이 작성한 이 글은 카카오뱅크의 사기 탐지 시스템(FDS)에 AI를 적용한 여정을 설명합니다. FDS 시스템의 기본 개념부터, 기존 Rule 기반 시스템의 한계와 AI 기반 시스템의 장점에 대해 다루며, AI를 적용하는 과정에서 겪었던 어려움과 해결책을 상세히 소개합니다. AI 기반 FDS의 데이터 파이프라인 구축, 이벤트 처리 시스템, Feature Store, 실시간 스트림 시스템, ML 서빙 분산 아키텍처
Hive 애널리틱스 로그를 활용한 ‘신규 유저 및 보상형 광고’ 데이터 분석 사례
Hive 애널리틱스는 게임을 플레이하면서 발생하는 대용량 로그를 수집하고 활용할 수 있는 여러 기능을 제공하고 있다. 지표, 세그먼트, 퍼널 분석뿐만 아니라 빅쿼리(Bigquery)를 통해 수집된 로그를 조회해 목적에 맞는 분석을 수행해 볼 수 있다. VIP 유저 분석, 유저 분류 분석, 유저 생애 주기 분석 등 그 주제는 다양하다. 본 글에서는 Hive 애널리틱스 로그를 활용한 한 가지 분석 […]
데이터 분석 결과를 배지로, 데이터에 스토리 입히기🪄
카카오뱅크 데이터Biz캠프의 데이터 기획자 Izel, 데이터 분석가 B와 Belle입니다. 이번 글에서는 카카오뱅크 앱에 새롭게 출시된 ‘배지 모으기 서비스’의 데이터 제품화 과정에 대해 공유합니다. 데이터 제품의 정의부터, 배지 모으기 서비스가 데이터 제품으로서 어떤 가치를 제공하는지, 고객의 행동 패턴을 반영한 배지 획득 기준 설정 과정까지 다양한 이야기를 담았습니다. 데이터 기반의 서비스를 구현하며 겪은 흥미로운 경험과 도전 과제를 함께
사내 데이터 플랫폼 개발, 처음이라면?
실시간 데이터 파이프라인 구축기 - Terraform으로 EKS를 띄워보자
CDC 파이프라인 구축하기
결빙주의! 티맵은 도로 상황 정보를 어떻게 빠르게 알까 - 22편 - 티맵의 도로 상황 정보 수집, 가공, 표출 시스템
티맵을 이용하여 경로 주행을 하면 진행방향의 도로에서 발생한 사건 사고에 대한 정보나 안개나 결빙 주의 안내, 혹은 도로 속도 안내 등을 볼 수 있습니다. 이러한 정보들은 티맵 서비스 요원들이 직접 수집한 정보와 여러 관계 기관들의 시스템으로부터 수집한 정보로 나뉘는데요. 오늘 테크노트에서는 이러한 정보들이 어떻게 수집되고 가공되어 티맵에 표출되는지 설명하
‘우리 게임의 진성 유저는?’, Google BigqueryML 솔루션을 활용한 유저 분류 모델 개발
하루에도 수많은 유저가 게임에 접속한다. 각 유저는 게임 내에서 광고 시청, 게임 플레이, 결제 등 다양한 행동 패턴을 보이고, 이 패턴은 유저마다 다르다. 다양한 행동 패턴을 보이는 유저들에게 획일화된 마케팅 활동을 전개하는 것은 게임 운영 측면에서 비효율적일 수 있다. 따라서 유저의 행동 패턴을 기반으로 게임 유저를 분류하고, 분류된 유저별 개인화된 마케팅 활동을 전개하는 것이 중요하다. […]
감성 AI 시장, 얼마나 커질까?
"해외에서 인기 있는 감성 AI 서비스들은 무엇이고 왜 잘될까? 국내 서비스 중에는 어디에 감성 AI를 접목시킬 수 있을까?"
딥러닝으로 내비에 필요한 도로 표지판 정보 얻는 법 - 21편 - TMAP의 딥러닝을 이용한 교통표지 인식 기술
TMAP은 어떻게 정확한 최신 도로 정보를 가지고 길안내를 할까요? TMAP은 도로 정보의 최신성과 정확성을 위해 조사차량이 매일 촬영한 도로 이미지로부터 수십가지의 도로표지판과 방면표지판 정보, 주행유도선의 색깔과 존재 유무 등의 정보를 추출하고 빠르게 업데이트 합니다. 놀랍게도 이 과정을 수작업으로 진행하기 때문에 상당한 운영비용 드는데요. 실수를 잡
핑크퐁의 통합 데이터 환경 구축기 (feat. Snowflake)
Retool을 활용한 로그 데이터 시각화
다나와의 상품 데이터 여정
다나와 상품 데이터 다나와에는 컴퓨터 부품부터 시작하여 옷, 가전, 가구 식품 등등 많은 다양한 상품들이 있습니다. 이 많은 상품 데이터들은 다나와에서는 어떻게 가지고 관리하고 있을까요? 데이터 흐름도 우선 데이터 흐름도를 보기 전에 일부 용어를 설명하고 가겠습니다. 기준 상품: 다나와에서 자체적으로 만든 상품입니다, 상품 클릭 시 링크 상품들이 모여있는 상세페이지로 이동합니다. 링크 상품: 기준 상품과 연결된 상품으로, 클릭 시 해당 제품의