신용평가에서 사용해보는 머신러닝
신용 평가 모델링 소개 안녕하세요. 에잇퍼센트 CSS(: Credit Scoring System)팀입니다. 에잇퍼센트는 대출과 투자를 연계하여 대출자에게는 대출의 기회를, 투자자에게는 새로운 투자 상품을 제공하는 8퍼센트 서비스를 제공하고 있습니다. 에잇퍼센트는 대출자의 신용을 평가하여 대출 조건을 결정합니다. 에잇퍼센트 CSS팀은 머신러닝 모델을 활용하여 더 나은 평가를 하기 위해 노력하고 있습니다. 이러한 노력의 시도들을 나누고자 합니다.
FMS(Fleet Management System) 주행이벤트 파이프라인 개선기
FMS 엔지니어링팀에서 파이프라인을 지속적으로 개선한 경험을 공유합니다.
병렬 네트워크 파일 시스템 pNFS의 재조명
AI 서비스의 정확도는 AI 모델의 정교함에 달려 있고, AI 모델의 정교함은 데이터셋을 얼마나 많이 학습했는지에 따라 고도화됩니다. 그리고 학습 시간과 비용을 줄이기 위해서는 데이터셋을 보다 빠르게 처리할 수 있는 컴퓨팅 자원과 데이터를 빠르게 주입해 주는 고성능 스토리지가 필요합니다. 하지만 스토리지는 고성능 컴퓨팅 환경에서 항상 병목의 근원으로 지목되어 왔습니다. 이러한 스토리지 병목 문제를 해결하기 위해 다양한 접근법이 연구되고 있는데,
전시 딜 내재화 프로젝트 회고: MongoDB 기반 데이터 구축과 API 개선 과정
안녕하세요, 11번가 전시서비스개발팀의 서장원입니다. 전시 딜 내재화 업무를 맡아 진행했던 과정과 개선 작업이 갖는 의미에 대한 개인적인 회고를 공유해 보고자 합니다. 내용 이해를 돕기위해, 기초적인 질문을 던져봅니다. 출처: https://chimhaha.net/story/111311 ‘딜’ 그리고 ‘내재화’ 라는게 무슨 뜻인가요? 딜은 상품 판매를 위한 판촉행사라고 생각하면 쉽습니다. 예를 들어, 단 10일간! 사과 한 박스에 단돈 3만원!
Google Cloud Next '24 방문기
안녕하세요, 저는 올리브영의 데이터 플랫폼 인프라를 담당하는 슈로쿤입니다. 현재 저희 회사는 데이터 플랫폼 인프라의 안정적이고, 유연한 확장 그리고 보다 더 빠른 데이터 분석을 위해 Google Cloud…
Snowflake Arctic의 기술적 진보
스노우파크 모델 레지스트리로 모델관리하기
데이터 엔지니어의 Airflow 데이터 파이프라인 CI 테스트 개선기
들어가며 안녕하세요, 버즈빌 데이터 엔지니어 Abel 입니다. 이번 포스팅에서는 데이터 파이프라인 CI 테스트에 소요되는 시간을 어떻게 7분대에서 3분대로 개선하였는지에 대해 소개하려 합니다.
Data Parallelism in Machine Learning Training
Random Forest with Grid Search
Data Product (2) AI(데이터)로 실제 운영 효율화가 가능할까?
AI 세차 도입기
홈페이지 제작 문의
" 고객의 미래를 함께하는 씨앤텍시스템즈 " 안녕하세요 씨앤텍시스템즈 기술연구소입니다. 회사소개 2005년에 설립된 DW, ETL, BA, BIG DATA, 솔루션 구축 컨설팅 전문기업 씨앤텍시스템즈의 소개합니다. 기술연구소는 전문화된 인력과 기술력을 바탕으로 차세대 기술 개발, R&D 사업 등 새로운 IT 기술에 도전하고 지속적인 연구 개발을 통하여 주도적인 기업으로 이끌어 나가고 있습니다. 최근 자사 ETL 솔루션 개발 및 디지털 헬스케어,
MongoDB Timeseries를 활용기
사건의 발단
금융 데이터의 이해와 분석의 가치
카카오뱅크 데이터 사이언티스트 Belle입니다. 이 글은 데이터를 통해 서비스 개선과 비즈니스 성공을 이루고자 하는 개발자와 분석가를 위한 것입니다. 데이터의 본질적 의미, 금융 데이터의 특성, 그리고 데이터의 가치를 극대화하는 방법에 대해 깊이 있게 다룹니다. 금융 도메인에서 데이터를 이해하고 분석하는 노하우를 공유하며, 궁극적으로 데이터 분석 역량을 강화하고 업무 생산성을 높이는 전략을 소개합니다.
RLHF - 어떻게 LLM의 성능을 향상시킬 수 있을까?
빅웨이브에이아이 이원석 님의 리뷰입니다. LLM 모델인 GPT-4, PaLM, LLama 등은 범용적인 목적에 맞게, 매우 큰 모델 사이즈와 매우 방대한 양의 데이터로 사전 학습이 수행됨 일반적인 LLM의 경우 방대한 양의 데이터로 부터 매우 다양한 도메인 지식을 습득 But, 사전 학습 데이터에서 욕설, 편향적인 정보, 부정확한 정보를 담은 문서 등 적절치 못한 데이터를 다수 포함 데이터 클렌징 및 필터링 등 방대한 양의 데이터를 사람이 전부
Data Product (1) 쏘카 고객은 무슨 목적으로 쏘카를 이용할까?
정차지분석 플랫폼 개발기
AI 뇌를 위한 닭고기 수프: 라벨링
사진으로 둘러보는 AWS re:Invent 2023 후기
안녕하세요. AdTech(Advertising technology) 스타트업 매드업에서 데이터 엔지니어 겸 사이트 신뢰성 엔지니어(SRE, Site Reliability Engineer)로 근무하고 있는 백재연입니다. 이번 글에서는 올해 라스베가스에서 열린 AWS re:Invent를 다녀온 후기를 다루려고 합니다. 키노트나 세션 등 기술과 관련된 콘텐츠는 유튜브와 AWS 공식 블로그에 잘 정리가 되어 있으니 생략하고, 처음 이 행사에 참석했던