01

p.88~91

기계학습의 유형

학습 데이터에 정답이 있는지, 그리고 어떤 방식으로 학습하는지에 따라 나눈다.

01

지도 학습

정답 있음

입력과 정답의 관계를 학습

분류

정해진 범주 중 하나를 예측

스팸 메일 · 질병 판정의사 결정 트리 · 로지스틱 회귀 · k-NN
회귀

연속적인 수치를 예측

기온 · 주택 가격 예측선형 회귀
02

비지도 학습

정답 없음

데이터 속 구조 · 규칙을 발견

군집

특성이 비슷한 데이터끼리 묶기

고객 유형 나누기k-평균 군집
연관 규칙

함께 나타나는 항목의 관계 찾기

장바구니 상품 분석데이터 사이의 연관성
03

강화 학습

보상 있음

행동의 결과로 받은 보상을 이용

에이전트
환경
행동

보상을 최대화하는 행동을 학습

게임인공지능, 로봇제어, 자율주행

02

p.92

기계학습 모델 구현 과정

문제를 정의하고 데이터를 준비한 뒤, 모델을 만들어 평가하는 반복 과정

01

문제 정의

해결할 문제와 예측 목표를 정한다.

예측할 값 정하기해결 조건 확인하기
02

데이터 수집
및 전처리

데이터를 학습 가능한 형태로 준비한다.

데이터 수집데이터 탐색결측치·이상치 처리핵심 속성 선택
03

모델 생성

알맞은 알고리즘을 선택하여 모델을 학습시킨다.

학습 유형 선택알고리즘 선택모델 학습
04

모델 평가

새로운 데이터에 대한 예측 성능을 확인한다.

실제 값과 비교성능 평가모델 개선

03

p.94~95

기계학습 모델의 학습과 평가

문제에 맞는 모델을 선정하고 훈련 데이터로 학습한 뒤 테스트 데이터로 평가한다.

01

알고리즘 선정과 모델 생성

선형 회귀
분류
군집
02

데이터를 이용해 모델 학습

모델의 매개 변수 값을 조정하여 데이터에 최적화시키는 과정

모델 학습모델 평가
훈련 데이터
테스트 데이터

과적합훈련 데이터에만 최적화되어 새로운 데이터의 성능이 낮아지는 문제

교차 검증훈련 데이터를 나누어 훈련과 검증을 반복

03

모델 평가

데이터 충분
훈련검증테스트
데이터 부족
훈련테스트
데이터 매우 적음
교차 검증 결과

04

p.96

선형 회귀 모델

입력 속성과 예측값 사이의 관계를 가장 잘 나타내는 직선 또는 평면을 찾는다.

01

단순 선형 회귀

독립 변수가 한 개인 경우

허리둘레목둘레
ŷ = ax + b
02

다중 선형 회귀

독립 변수가 두 개 이상인 경우

목둘레체중
선형 회귀
모델
허리둘레
예측
ŷ = a₁x₁ + a₂x₂ + … + b

05

p.97~98

선형 회귀 모델의 성능 평가

오차 함수결정계수(R²)로 모델의 예측 성능과 설명력을 확인한다.

01

오차 함수

실젯값과 예측값의 차이를 구하는 함수
실젯값입력값
실젯값 오차 예측값을 나타내는 회귀선
02

결정계수(R²)

범위 해석

0 ~ 1

모델이 데이터를 얼마나 잘 설명하는지를 나타내며,
1에 가까울수록 설명력이 높다.

R² = 0예측력 없음

0.0 < R² < 0.3약한 설명력

0.3 ≤ R² < 0.5중간정도 설명력

0.5 ≤ R² < 0.7높은 설명력

0.7 ≤ R² ≤ 1매우강한 설명력

06

p.106

분류 모델

입력 데이터를 미리 정의된 여러 클래스 중 하나로 할당한다.

01

식품 분류 데이터

특징타깃
당도아삭함식품
101과일
38채소
72과일
선형 분류직선으로 영역 구분
비선형 분류곡선으로 영역 구분
02

분류의 핵심 개념

분류 모델의 핵심 목표클래스 영역의 경계 찾기
특징
타깃을 예측하는 데 사용하는 속성
타깃
분류 모델이 예측하려는 속성
클래스
타깃의 범주 · 과일, 채소
레이블
타깃의 실제 값
분류의 예정상 메일 ↔ 스팸 메일플라스틱 · 종이류 · 유리류

07

p.107~108

분류 알고리즘

분류 모델을 만드는 대표적인 세 가지 방법의 판단 원리를 비교한다.

01

결정트리

날개 길이 > 205?아니요젠투펭귄부리 길이로 다시 분할

특징의 분할 기준에 따라 데이터를 나누는 과정을 반복한다.

특징값을 기준으로 분할하므로 정규화가 필요 없다.
02

로지스틱 회귀

0확률S0.51

로지스틱 함수로 각 클래스에 속할 확률을 예측한다.

예: 확률 0.5를 기준으로 합격과 불합격 분류
03

k-최근접 이웃

?k = 3

가장 가까운 k개 데이터의 다수 레이블로 클래스를 정한다.

데이터 사이의 거리는 유클리디언 거리 등을 이용한다.

08

p.108

분류 모델 성능 평가

정확도혼동 행렬로 예측 결과를 확인한다.

01

정확도

예측값과 실제값이 같은 데이터 수전체 데이터 수

전체 데이터 중 모델이 올바르게 분류한 데이터의 비율

정확도정밀도재현율
02

펭귄 종 분류 모델의 혼동 행렬

실제 클래스와 예측 클래스를 비교하여 어떤 클래스를 혼동했는지 확인한다.

실제값 ↓
예측값 →
아델리턱끈젠투 아델리4220 턱끈3180 젠투0036
정확하게 분류잘못 분류

09

p.118

군집 모델과 k-평균 군집화

정답 없이 유사한 데이터끼리 묶어 각 집단의 특징을 파악한다.

01

군집

서로 비슷한 특성을 가진 데이터끼리 묶는 비지도학습 방법

에너지템포 C1C2C3
활용고객 세분화질병 진단소셜 네트워크 분석
02
대표 알고리즘

k-평균 군집화

주어진 데이터를 k개의 군집으로 묶는다.

  1. 01
    군집의 개수 k 결정k는 만들 군집의 수
  2. 02
    각 군집의 중심점 계산중심점은 군집 데이터의 평균점
  3. 03
    가장 가까운 중심점에 할당주로 유클리디언 거리 사용
k군집 개수+평균각 군집의 중심