| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 딕셔너리
- 스파르타내일배움캠프
- 중첩 서브쿼리
- unstack
- 스파르타내일배움캠프TIL
- rename
- 튜플함수
- datetime
- Python
- cume dist
- percent rank
- countplot
- 리스트
- 데이터결합
- SQL
- 데이터분석
- 인덱싱
- 파이썬
- 파일호출
- 데이터 재구조화
- join
- 자료형
- key
- 내일배움캠프
- notna
- Else
- truncate
- 인덱스
- pass
- Drop
- Today
- Total
목록전체 글 (125)
Bastian 개발일지
이번 포스팅부터는 드디어 파이썬을 사용해서 데이터 분석을 할 때 가장 중요한 데이터 시각화에 대해서 다뤄보도록 하겠다. 보통 데이터 분석을 파이썬을 할 때 많이 사용하는 시각화 라이브러리인 matplotlib과 seaborn에 대해서 먼저 알아보겠다. 데이터 분석 과정에서 시각화는 단순히 결과를 예쁘게 보여주는 것이 아니라, 데이터 속 패턴과 인사이트를 직관적으로 전달하는 핵심 커뮤니케이션 도구이다. matplotlib은 Python 시각화의 근간이 되는 기본적인 라이브러리로, 세밀한 커스터마이징이 가능한 만큼 거의 모든 차트를 자유롭게 구현할 수 있는 강력한 유연성을 제공한다. 반면 seaborn은 matplotlib을 기반으로 구축된 고수준 라이브러리로, 통계적 시각화에 최적화되어 있어 분포, 상관관..
이번에는 crosstab, 피벗테이블에 이어 데이터셋을 재구조화하는 작업들인 stack, unstack, melt 세 가지 방법에 대해서 다뤄보겠다. stack과 unstack은 한 쌍으로 생각하면 되고 주로 데이터프레임의 구조를 변경하는 데에 쓰인다. ※ stack, unstackstack은 칼럼 레벨에서 인덱스 레벨로 데이터프레임을 변경하는 작업이며, 반대로 unstack은 인덱스 레벨에서 칼럼 레벨로 데이터프레임을 변경하는 작업이다. 직접 사용 예시를 살펴보며 어떻게 작동하는지 확인해 보자. 우선 지난번에 사용했던 피벗테이블을 이번에 사용해서 stack과 unstack의 차이점을 살펴보겠다.위의 피벗 테이블에는 인덱스, 칼럼 모두 레벨이 두 개인 데이터셋이 만들어진 것을 확인할 수 있다. 해당 피..
이번에는 데이터를 집계하여 재구조화하는 방법인 crosstab과 피벗테이블에 대해서 다뤄보겠다. crosstab은 주로 범주형 데이터를 비교, 분석할 때 유용하게 사용된다. 범주형 데이터는 쉽게 말하면 남성&여성, 생존&사망 등 범주의 형태를 가지고 있는 자료를 의미한다. 그리고 피벗테이블은 인덱스와 칼럼별 값에 연산이 가능한 형태의 데이터 구조이다.그럼 직접 사용하면서 어떻게 데이터가 출력되고, 어떻게 다뤄야 원하는 형태로 나오는지 확인해 보도록 하자. ※ crosstab# crosstab 기본 문법 구조pd.crosstab(index = 행, columns = 열, margins = True/False, normalize = True/False)crosstab은 위의 기본 문법 구조처럼 많은 옵션을..
지난번에는 데이터 집계 중에서 분포와 통계량에 대해 알아보았고, 이번에는 데이터를 집계할 때 그룹별로 구분 짓는 groupby에 대해서 살펴보겠다. groupby 역시 SQL을 다뤄보았다면 아주 익숙한 문법으로 보이는데, 작동원리를 잘 이해하고 사용한다면 데이터를 그룹화하여 분석할 경우 아주 유용하게 사용된다. 이번에도 판다스 라이브러리를 호출하고 드라이브를 마운트 하여 타이타닉 데이터셋을 불러온다. 다만 이번에는 PassengerID 칼럼을 집계 시 계산되지 않도록 문자열로 변환하는 작업을 추가해 주도록 하겠다. ※ groupby같은 값을 한 그룹으로 묶어서 여러 가지 연산 및 통계를 구하는 함수이다.# groupby 함수 기본 구조데이터.groupby(칼럼명).연산 및 통계함수 그룹 함수인 grou..
이번에는 파이썬을 사용해서 분포와 통계량을 구하는 방법에 대해 알아보겠다. 먼저, 데이터 분석은 통계학을 기반으로 두기 때문에, 데이터 분석을 한다면 통계학은 필수적으로 익혀야 하는 학문이다. 그리고 통계학에서 주로 다루는 개념인 분포와 통계량은 추후에 따로 다뤄볼 예정이며, 이번에는 파이썬을 사용해서 데이터 분석을 할 때 분포와 통계량을 쉽게 구하여 적용할 수 있다 정도로만 알고 넘어가면 될 것 같다. 우선 기본세팅으로는 타이타닉 데이터셋을 사용할 예정이므로, 구글 드라이브 마운트와 판다스 라이브러리를 호출하는 것으로 한다. ※ 분포와 통계량먼저, 파이썬에서 분포 및 통계량을 보기 위해 가장 기본적으로 사용되는 함수로는 describe() 함수를 사용한다. 해당 함수를 사용하면 데이터셋에서 칼럼별 값의..
이번에는 데이터 가공 중 데이터를 결합하는 방법에 대해서 다뤄보겠다. ※ 데이터 결합데이터를 결합하는 방법에는 Inner Join, Full Outer Join, Left Outer Join, Right Outer Join로 크게 4가지가 있다. 이 네 가지 결합방식은 SQL에서도 다뤄봤던 내용인데, 즉 SQL로 실행했던 쿼리문을 파이썬에서 사용하여 데이터셋을 결합하는 것이다.두 개의 데이터를 특정 칼럼 기준으로 합치며, pd.merge() 함수를 사용한다. 기본 문법구조는 아래와 같다.# 데이터 결합pd.merge(데이터1, 데이터2, on = 기준칼럼, how = 결합방법) 먼저, 이번에는 직접 데이터셋을 만들어서 데이터를 결합하는 과정을 확인해 보겠다. 판다스 라이브러리를 호출하고 customer..