[심화 프로젝트] 6일차 - 머신러닝 모델링 그동안 진행했던 EDA를 바탕으로 머신러닝 모델을 사용해 예측 모델을 만들어 보았다.과정 마무리EDA를 마무리하고 모델링에 들어가자마자 방대한 EDA를 통해 결정했던 것들을 다 잊어버렸다. 모델에 들어갈 피처만 생각하고 모델링을 하느라 주관이 너무 들어간 모델이 되어버렸다. 앞으로는 EDA, 모델링을 다른 단계라고 생각하기 보다는 그 두 개를 좀 더 유기적으로 생각하며 EDA 결과를 반영한 모델을 만들수 있도록 주의해야겠다. Data_10기 2025.12.26
[심화 프로젝트] 5일차 - EDA 마무리 오늘은 EDA 진행을 마무리하는 날이었다. 금요일부터 모델링에 들어가게 될 것 같아 기대가 된다.과정튜터님의 피드백유의 판매자 식별 모델에 집중 (+ 시각화) => 한 주제에 대한 완성도를 높일 것소비자 또는 판매자에게 메일링 서비스부정 리뷰 정의 => 불만족한 리뷰로 정의 (1~3점) 유의 판매자 기준출고일(approved ~ carrier) : Q3 기준 (6.3일)리뷰 지표 : 불만족 리뷰 비율 vs 평균 리뷰 점수 => 불만족 리뷰 비율 사용으로 기울어짐텍스트 기반 분석 => 모델링 하고 여유 되면 진행 LOWESS 회귀 분석을 통한 리뷰 지표 비교왜도가 심한 분포의 데이터에 일반 선형분석을 적용하는 것은 적절하지 않다. 이러한 경우, 평균에 대한 가정이 깨지기 쉬워 극단값의 영향을 과도하게 받게.. 카테고리 없음 2025.12.24
[심화 프로젝트] 4일차 - EDA 오늘은 본격적으로 EDA를 진행한지 이틀 째가 되는 날이다. 각자 데이터를 뜯어본 결과에 대해 회의하며 유의 판매자를 정의하기 위한 분석을 진행하였다.과정유의 판매자 정의 EDA 진행마무리연구를 하면서는 내가 원하는 주제를 정하고, 정제된 데이터를 사용해 연구가설에 필요한 데이터를 사용하는 느낌이었다. 하지만 프로젝트를 진행하면서는 데이터를 요리조리 뜯어보며 이상치를 발견하고, 이상치를 무조건 삭제하는 것이 아니라 이상치에서도 인사이트를 발굴하기도 하며, 이 데이터를 사용해서 우리가 진행할 수 있는 적절한 주제도 찾는 등 뭔가 멘 땅에 헤딩하는 느낌인 것 같다. Data_10기 2025.12.23
브라질 Olist 이커머스 데이터 분석을 위한 배경지식 정리 1. Olist는 어떤 회사인가?Olist는 브라질의 B2B SaaS 전자상거래 플랫폼으로, 소비자를 위한 쇼핑몰이 아니라 중소 판매자(SMB)를 위한 운영 플랫폼이다. Olist는 수십반 개에 달하는 소규모 판매자들이 여러 마켓플레이스를 한 번에 관리할 수 있도록 주문·재고·결제·배송을 묶어 제공하는 운영 도구로, 팔아주는 회사가 아니라 잘 팔 수 있게 만들어주는 회사이다. 2. Olist 작동 방식판매자→ Olista에 상품·재고 등록→ 여러 마켓플레이스에 자동 연동→ 제휴 배송사가 물류 철리→ Olist는 거래 기반 수수료 수취 3. 브라질 물류 시스템 한계① 물류 환경의 구조적 한계포장된 도로 비율이 매우 낮고물류의 대부분이 트럭에 의존국영 우편 서비스의 파업과 지연이 빈번=> 소규모 판매자가 개.. Data_10기 2025.12.18
SQL Recursive 1. CTE (Common Table Expression)CTE는 쿼리 안에서 사용하는 임시 결과 집합으로, WITH 절을 사용한다. CTE는 쿼리 실행 동안만 존재하며 서브쿼리와 비교해서 가독성이 좋고, 복잡한 쿼리를 단계적으로 분리할 수 있다는 장점이 있다.# 기본문법WIHT 테이블명 AS ( SELECT ...)SELECT *FROM 테이블명; 2. 재귀 (Recursive)재귀는 자기 자신을 다시 참조하며 반복적으로 실행되는 구조를 의미한다.SQL에서 재귀는 이전 결과를 다시 사용해 다음 결과를 만들어내는 방식으로 동작한다. 이 개념을 CTE에 적용한 것이 재귀 CTE이다.Python에서 for문과 비슷한 역할을 한다고 볼 수 있다. 3. 코드카타 : 프로그래머스 입양 시각 구하기(2)WITH R.. Data_10기 2025.12.17
머신러닝 비지도학습 - 클러스터링 오늘은 머신러닝 비지도학습에 대해 배웠다. 머신러닝 지도학습으로 회귀를 배울 땐 기존에 추론통계로써 활용하던 회귀 간 차이에 혼란이 조금 있었는데, 오늘 배운 비지도학습은 일반적으로 알려진 머신러닝에 대한 개념이라 배우는데 혼란은 없었다.Ⅰ. 머신러닝 비지도학습비지도학습은 정답(레이블)이 없는 데이터를 학습시켜 데이터의 구조, 패턴, 숨겨진 관계를 발견하는 머신러닝 기법이다.즉, 입력 데이터는 있지만 출력 정답이 없는 상태여서 유사한 데이터끼리 묶거나, 데이터의 차원을 줄이는 등의 작업을 수행한다. 비지도학습의 주요 작업클러스터링 (Clustering) : 비슷한 데이터끼리 그룹화차원 축소 (Dimensionality Reduction) : 많은 특성(feature)를 줄여 의미 있는 정보로 압축연관 규.. Data_10기 2025.12.16
머신러닝 지도학습 방법 - kNN, RF, XGBoost 오늘은 머신러닝 지도학습 방법에 대해 정리해 보았다. 지난 글에 머신러징 지도학습으로써의 로지스틱을 다뤘으니 이번에는 그 외 지도학습 방식에 대해 간략히 정리해보겠다.Ⅰ. k-NN (k-Nearest Neighbors)k-NN은 "비슷한 데이터는 비슷한 범주에 속한다"는 가정을 기반으로 동작하는 분류 알고리즘이다. 새로운 데이터가 들어왔을 때, 주변에 있는 데이터 중 가장 가까운 k개의 이웃을 참고하여 분류한다. 1. 기본 개념데이터 간 거리(distance)를 기준으로 유사성을 판단가까운 데이터들이 속한 클래스 중 가장 많이 등장한 클래스로 예측분류뿐만 아니라 이상치 탐지(outlier detection)에도 활용 가능2. 거리 측정 방식 유클리드 거리 (Euclidean Distance) 맨해튼 거.. Data_10기 2025.12.15
회귀분석 : 인과추론 VS 머신러닝 오늘은 어제 배운 선형회귀와 로지스틱 회귀에 대해 실습을 진행했다. 실습을 하면서 나는 그동안 추론통계로써 회귀분석을 배웠었는데, 머신러닝 지도학습의 일부로써 회귀분석을 배우게 되니 그 간극이 어떤 것인지 의문이 들었다. 그래서 오늘은 이 둘이 어떻게 다르고, 같은 회귀 호멜임에도 목적과 해석이 어떻게 달라지는지 정리해보려고 한다.Ⅰ. 통계적 회귀 vs 머신러닝 회귀선형회귀나 로지스틱 회귀는 수학적으로는 동일한 모델이다. 하지만 "왜 쓰는지" 목적이 완전히 다르기 때문에, (1) 모델을 어떻게 학습하고, (2) 어떤 지표를 중점으로 확인하며, (3) 결과는 어떻게 해석하는지가 달라진다. 구분통계적 회귀 (인과추론)머신러닝 회귀 (지도학습)목적독립변수(X)가 종속변수(Y)에 실제로 영향을 주는가효과의 크기.. Data_10기 2025.12.12
Python 머신러닝(회귀분석) 및 SQL 비상관/상관 쿼리 오늘은 본격적으로 머신러닝을 배우기에 앞서 통계와 머신러닝 간의 관계와 넓은의미의 머신러닝이라고 할 수 있는 회귀분석에 대해 배웠다. 그동안 연구를 하면서 몇몇 개의 회귀모델을 사용했지만 이런 것들이 머신러닝의 일부라고 생각해 본 적이 없었기 때문에 하루 종일 혼란스러운 하루였다. ChatGPT에게 물어봤을 때는 내가 한 연구는 인과추론 통계고, 머신러닝의 주 목적인 예측과는 거리가 조금 있기 때문에 머신러닝과는 구분된다고 말해주었지만, 머신러닝 파트에서 선형회귀, 로지스틱 회귀를 배우는 것이 여전히 어색했다.Ⅰ. 통계와 머신러닝의 관게데이터 분석 분야를 크게 나누면 (1) 통계적 가설검정과 (2) 머신러닝으로 나눌 수 있다고 한다. 특징통계적 가설검정머신러닝목적가설 검증 및 데이터 통계적 특성 파악예측.. Data_10기 2025.12.10
Logistic Regression 및 SQL 코드카타 오늘도 라이브 세션이 몰아치는 하루였다. 근데 내일은 라이브 세션이 더 많다. 복습을 하기 위해 베이직반 라이브세션까지 듣는데 애매하게 알고 있는 내용이라 그런지 집중을 오랫동안 유지하기가 힘들다. 과연 의미가 있을지, 그냥 익숙해지기만 반복하는 것은 아닌지 하는 의문이 들지만.. 익숙해 지는 것만으로도 도움이 되지 않을까 하며 내일도 세션을 들을 것 같다.Ⅰ. Logistic Regression회귀분석을 하기 전에는 Y(종속변수)의 분포를 살펴 보아야 한다. 오늘은 종속변수가 이분형 범주형 변수일 때 사용할 수 있는 로지스틱 회귀분석에 대해 배워보았다. 회귀분석에서 가장 기본이 되는 분석 방법은 일반 선형회귀 분석이다. 하지만 종속변수가 이분형 변수일 경우에는 데이터를 직선으로 설명하기 어렵다. 따라서.. Data_10기 2025.12.09