사람은 경험과 지식을 통해 배우고 성장합니다. 데이터는 인공지능에게 사람의 경험과 지식 같은 역할을 합니다. 인공지능은 데이터를 학습하고 분석해 패턴을 찾고 예측하며 의사결정을 합니다. 데이터가 충분하고 다양할수록 인공지능은 더 정확하게 예측할 수 있습니다.
데이터는 형태와 구조에 따라 정형 데이터와 비정형 데이터로 나뉩니다.
| 정형 데이터 (Structured) | 비정형 데이터 (Unstructured) | |
|---|---|---|
| 구조 | 사전에 정의된 구조 (표, 데이터베이스) | 정해진 형식이 없음 |
| 예시 | 고객목록, 제품목록, 금융거래 등 | 웹페이지, SNS 게시글, 음원, 영상, 이미지 등 |
| 비중 | 전체 데이터의 약 20% 미만 | 전체 데이터의 약 80% 이상 |
정형 데이터는 주로 뒤에서 배울 머신러닝(회귀·분류)에 사용되고, 비정형 데이터는 딥러닝의 발전으로 자연어 처리·컴퓨터 비전·음성 인식 등에서 활발히 활용됩니다.
데이터는 수치형 데이터(숫자로 표현되는 데이터)와 범주형 데이터(숫자로 측정할 수 없는 데이터)로 구분합니다.
| 수치형 데이터 | 범주형 데이터 |
|---|---|
| 온도, 키, 몸무게, 거리, 웹 페이지 클릭 횟수, 상품 판매 수, 등교일 수, 꽃잎의 개수 | 성적(수·우·미·양·가), 만족도(매우만족~매우불만족), 성별, 혈액형, 연령대 |
인공지능이 학습하는 이유는 다음 4가지입니다.
아래 번호를 하나씩 눌러서 확인해 보세요.
인공지능은 크게 규칙 기반 인공지능과 학습 기반 인공지능으로 나뉩니다.
| 규칙 기반 인공지능 | 학습 기반 인공지능 |
|---|---|
| 사람이 정한 규칙(if-then)에 따라 판단·추론. 결과 추적이 쉽지만 예외 상황·복잡한 패턴에 대응하기 어려움 | 머신러닝 알고리즘으로 데이터를 스스로 학습. 성능이 우수하고 복잡한 문제 해결에 강하지만, 딥러닝은 판단 근거를 알기 어려운 '블랙박스' 문제가 있음 |
세 개념은 다음과 같은 포함 관계를 가집니다: 인공지능 ⊃ 머신러닝 ⊃ 딥러닝
머신러닝의 학습 방법은 크게 지도학습, 비지도학습, 강화학습으로 나뉩니다.
아래 번호를 하나씩 눌러서 확인해 보세요.
지도학습은 강아지·고양이 사진에 '강아지'·'고양이'라는 레이블(정답)을 붙여 학습시키면, 새로운 사진이 왔을 때 몇 %의 확률로 어떤 동물인지 예측합니다. 비지도학습은 레이블 없이 사진만 주어졌을 때 AI가 스스로 특징(색깔, 생김새 등)을 찾아 비슷한 것끼리 군집으로 묶습니다.
① 데이터는 사람의 경험이나 지식에 비유할 수 있다.
② 양질의 데이터를 확보한다면 AI 모델의 성능은 매우 좋아진다.
테이블(표)이나 데이터베이스와 같은 컴퓨터 시스템에서 쉽게 저장·관리할 수 있는 구조로, 고객목록·제품목록·금융거래내역 등에 사용