← 목록으로 체질량지수(BMI) 예측하기 - 회귀 프로젝트
객관식
데이터 분석 및 가공
🔬 데이터를 AI에게 주기 전에 어떻게 생겼는지 살펴보고(분석), 빈칸을 채워서(가공) 깨끗하게 만들어요.

1) 데이터 살펴보기

아래 번호를 하나씩 눌러서 확인해 보세요.

성별(Sex)
남자 50.4%, 여자 49.6%로 거의 반반이에요. 한쪽으로 쏠리지 않아서 좋은 데이터예요.

2) 그래프로 살펴보기 - 박스차트

📦 박스차트는 데이터가 어디에 모여 있는지 한눈에 보여주는 그래프예요. 상자의 아래(Q1)·가운데 선(중앙값)·위(Q3)로 데이터의 25%·50%·75% 지점을 알 수 있고, 상자에서 너무 멀리 떨어진 값은 이상치로 표시돼요.

3) 두 값이 얼마나 관련 있을까? - 상관관계

상관계수는 -1부터 +1 사이의 숫자예요. +1에 가까우면 한쪽이 커질 때 다른 쪽도 함께 커지고, -1에 가까우면 한쪽이 커질 때 다른 쪽은 작아져요. 0에 가까우면 서로 관계가 없어요.

4) 빈칸(결측값) 채우기

🕳️ BMI 칸이 빈 데이터 50개는 통째로 지워요. BMI는 AI가 맞혀야 할 "정답"인데, 정답이 없으면 공부를 시킬 수 없거든요. (AIDU ez가 학습할 때 알아서 지워줘요.)

키와 몸무게의 빈칸은 평균값으로 채워요. 숫자 데이터는 평균값이나 중앙값으로, 글자(범주형) 데이터는 가장 많이 나온 값(최빈값)으로 채우는 게 보통이에요.

배운 내용 확인하기

Q5-5. 데이터가 모여 있는 위치(Q1, 중앙값, Q3)와 이상치를 한눈에 보여주는 그래프는?
Q5-6. 키(Height) 칸의 빈칸을 평균값으로 채우려면 데이터 가공에서 어떤 옵션을 고를까요?
Q5-7. 몸무게와 키의 상관계수가 +0.9라면 두 값의 관계는?