class="layout-aside-right paging-number">
본문 바로가기
데이터 분석/Python

Pandas 메소드와 함수

by heestory323 2025. 3. 19.

info() 행, 열, 컬럼명, 자료형

head() 처음 5개 행

tail() 마지막 5개 행

describe() 데이터 정보 요약

 

.shape df의 크기(행과 열 수)

.columns 열 이름

.index 인덱스 

.dtypes 데이터 타입 확인

 

df[컬럼이름] 특정열 선택

loc[:n] [index] 기반 행 불러오기

iloc[컬럼이름] 위치 기반 행 불러오기 *마지막 컬럼이름까지 모두 포함되서 나타남

df[ df[컬럼] 조건 ] 조건으로 데이터 필터링

df[새로운컬럼] = df[컬럼1] + df[컬럼2] 기존 컬럼 이용하여 새로운 컬럼 생성

isin() 특정목록 포함된 데이터 선택

 

 

 

display() 데이터프레임 표로 출력

query() 특정조건 만족하는 데이터만 필터링

drop() 원하는 행,열 삭제

str.contains() 특정 문자열이 포함된 데이터 필터링

 

 

isnull() 결측치 여부 확인

isnull().sum() 결측치 갯수 확인

fillna(value) 결측치를 특정값value로 대체

dropna() 결측치가 있는 행,열 제거

 

pd.concat([df1,df2],  axis=0 행/1 열) 여러 df 연결    

                              .reset_index(drop=True) 기존인덱스제거 후 새로운 인덱스 

pd.merge(df1,df2, on='key', how = inner 공통된 값 / outer 전체값 / left 왼쪽기반 / right 오른쪽기반)
공통key(컬럼)을 기준으로 2개의 df 병합   

 

df[컬럼이름].groupby(그룹핑할컬럼)[연산수행컬럼].집계함수()

특정 열 기준으로 데이터를 그룹화하여 집계함수 수행

len() 문자열의 길이, 요소 개수

count() 개수

first() 첫번째 값

sum() 합계 

mean() 평균 

median() 중간값 

mode() 최빈값

agg({ : },{ : }) 다중집계(2개 이상), 집합 

df.pivot_table(index='row', columns='col', values='value' ,agg='집계함수' ) 피벗테이블 생성

.sort_values(by=정렬기준컬럼, ascending=True 오름차순/False 내림차순) 특정 열 기준 정렬

 

.apply(   lamda x:     ) 사용자 정의 함수, lamda를 행,열에 적용

   - lamda x : 결과값1 if 조건1 else 

                     결과값2 if 조건2 else

                     결과값3 ... 

 

astype.astype(새로운데이터타입) 컬럼을 새로운 데이터타입으로 변경

map() 문자열 -> 숫자 변환

pd.to_datetime(df, infer_datetime_format=True) 문자열str 날짜 -> datetime 형식으로 변환(일반형식으로 변환해줘)

.dt.to_datetime() 날짜 넣으면 -> 요일 변환 

.rolling(window=n).mean() 이동 평균 계산 등 시간데이터 분석

 

unique() 특정열에 distinct

nunique() 중복값 제거한 뒤  몇개인지

value_counts() 값이 몇번 등장하는 지 

count() 특정 문자가 몇개인지

cut() 특정 기간으로 나눌때

split() 특정 문자열로 나눌때

 

.to_pickle(저장할이름) df를 pickle 파일로 저장

read_pickle(파일이름) pickle 파일 불러오기