스펙을 뛰어넘는 NCS 직무교육 - 윈스펙

머신러닝 종류 어떻게 나뉠까?|입문자용 모델 선택 기준

머신러닝 종류 어떻게 나뉠까?|입문자용 모델 선택 기준 

머신러닝 종류는 학습에 쓰는 데이터의 형태에 따라 지도학습·비지도학습·강화학습 세 갈래로 나뉜다. 정답(레이블)이 붙은 데이터가 있으면 지도학습, 없으면 비지도학습, 행동에 대한 보상만 주어지면 강화학습이다. 여기서 다시 지도학습은 회귀와 분류, 비지도학습은 군집화와 차원 축소로 갈라지며, 각 갈래마다 쓰는 머신러닝 모델이 다르다. 이 글은 머신러닝 입문 단계에서 "내 문제에 어떤 모델을 써야 하는가"를 기준으로 종류를 정리한 자료다.

 

핵심 요약

· 머신러닝 종류는 지도학습·비지도학습·강화학습 3가지다. 정답 레이블이 있느냐 없느냐가 첫 번째 갈림길이다

· 모델은 문제 유형이 먼저 정해진 뒤에 고른다. 숫자를 예측하면 회귀, 범주를 맞히면 분류, 묶으면 군집화, 줄이면 차원 축소다

· 정형 데이터에는 머신러닝, 이미지·텍스트에는 딥러닝이 기본 선택지다. 표 형태 데이터에서는 트리 계열이 여전히 강하다

· 2027년까지 AI 분야 신규인력 12,800, 클라우드 18,800명이 부족할 것으로 전망됐다 (고용노동부·한국직업능력연구원)

 

AI·머신러닝·딥러닝은 어떤 관계일까?

머신러닝 입문에서 가장 먼저 정리해야 할 것이 세 용어의 포함 관계다. 인공지능(AI)이 가장 넓은 개념이고, 그 안에 머신러닝이, 다시 그 안에 딥러닝이 들어간다. 셋은 나란한 선택지가 아니라 겹겹이 포함된 구조다.

 

구분

범위

정의

대표 예시

인공지능(AI)

가장 넓음

사람의 지능적 행동을 기계가 수행하도록 하는 기술 전반

규칙 기반 전문가 시스템, 탐색 알고리즘 포함

머신러닝(ML)

AI의 하위 분야

규칙을 사람이 짜지 않고 데이터에서 규칙을 학습하는 방식

선형회귀, 결정트리, 랜덤포레스트, SVM

딥러닝(DL)

머신러닝의 하위 분야

여러 층의 인공신경망으로 특징까지 스스로 학습

CNN, RNN, Transformer

 

핵심 차이는 특징(feature)을 누가 만드느냐. 전통적인 머신러닝은 사람이 "어떤 값을 볼지"를 설계해 넣어야 하고, 딥러닝은 그 특징 추출까지 모델이 학습한다. 그래서 딥러닝은 데이터와 연산량을 훨씬 많이 요구한다.

(출처: 성균관대 RF Research Center - 기술과 AI: 헷갈리는 인공지능, 머신러닝, 딥러닝 구분법

 

머신러닝 종류 3가지는 무엇이 다를까?

머신러닝 종류를 가르는 기준은 학습 데이터에 정답이 붙어 있는지. 이 하나로 세 갈래가 갈린다.

 

학습 방식

필요한 데이터

학습 목표

대표 활용

지도학습

입력 + 정답 레이블

입력에서 정답을 예측하는 함수 학습

스팸 분류, 매출 예측, 이탈 예측

비지도학습

입력만 (레이블 없음)

데이터 안의 구조·패턴 발견

고객 세분화, 이상 탐지, 시각화

강화학습

상태 + 행동 + 보상

누적 보상을 최대화하는 행동 정책 학습

게임 AI, 로봇 제어, 추천 정책

 

현업에서 가장 많이 쓰이는 것은 지도학습이다. 정답 레이블을 확보할 수 있느냐가 프로젝트 난이도를 결정하므로, 머신러닝 입문 단계에서는 레이블이 이미 붙어 있는 공개 데이터셋으로 지도학습부터 익히는 순서가 일반적이다.

 

지도학습은 다시 어떻게 나뉠까?

지도학습은 맞혀야 하는 값이 숫자인지 범주인지로 회귀와 분류로 갈린다. 같은 데이터라도 목표를 어떻게 잡느냐에 따라 두 유형을 오갈 수 있다.

 

유형

예측 대상

질문 형태

예시

회귀(Regression)

연속된 숫자

"얼마일까?"

아파트 가격, 다음 달 매출, 배송 소요 시간

분류(Classification)

정해진 범주

"어느 쪽일까?"

스팸 여부, 불량품 판정, 이탈 고객 여부

 

대표적인 머신러닝 모델은 다음과 같이 정리된다.

 

머신러닝 모델

적용 유형

특징

선형회귀

회귀

가장 단순하고 해석이 쉬움. 기준선(baseline)으로 자주 사용

로지스틱회귀

분류

이름은 회귀지만 분류 모델. 확률값을 출력

결정트리

회귀·분류

규칙을 그림으로 볼 수 있어 설명력이 높음. 과적합에 취약

랜덤포레스트

회귀·분류

결정트리를 여러 개 묶어 안정성 확보. 실무 기본기

그래디언트 부스팅(XGBoost·LightGBM )

회귀·분류

정형 데이터에서 성능이 가장 잘 나오는 계열

SVM

분류

경계를 최대한 넓게 잡는 방식. 데이터가 적을 때 유리

KNN

회귀·분류

가까운 이웃을 참고. 학습 과정이 사실상 없음

 

👉 AI 개발자 연봉 얼마일까?|2026 직무별 전망 정리

 

비지도학습은 어떤 문제에 쓰일까?

비지도학습은 정답이 없는 데이터에서 구조를 찾는 방식이다. "이 고객들을 몇 개 그룹으로 나눌 수 있나", "이 데이터에서 튀는 값은 무엇인가" 같은 질문에 쓰인다.

 

세부 유형

목적

대표 모델

군집화(Clustering)

비슷한 데이터끼리 묶기

K-means, DBSCAN, 계층적 군집화

차원 축소(Dimensionality Reduction)

변수 개수를 줄여 시각화·연산 효율 확보

PCA, t-SNE, UMAP

이상 탐지(Anomaly Detection)

정상 패턴에서 벗어난 값 찾기

Isolation Forest, 오토인코더

 

비지도학습의 어려운 점은 정답이 없어서 결과가 맞는지 확인하기 어렵다는 것이다. 군집화는 몇 개로 나눠야 하는지조차 정해져 있지 않아, 실루엣 계수 같은 보조 지표와 도메인 지식을 함께 봐야 한다.

 

강화학습은 앞의 둘과 뭐가 다를까?

강화학습은 데이터셋을 통째로 주는 방식이 아니라, 환경과 상호작용하면서 보상을 통해 배우는 구조다. 정답을 알려주는 대신 "잘했다/못했다"만 알려주고, 시행착오로 정책을 찾아간다.

 

구성 요소

역할

에이전트(Agent)

행동을 결정하는 주체

환경(Environment)

에이전트가 행동을 가하는 대상

상태(State)

현재 상황을 나타내는 정보

행동(Action)

에이전트가 선택할 수 있는 선택지

보상(Reward)

행동의 결과로 주어지는 점수

 

머신러닝 종류 중 가장 늦게 실무에 들어오는 영역이기도 하다. 시뮬레이션 환경을 만들 수 있는 게임·로봇 제어에서 먼저 자리를 잡았고, 최근에는 대화형 AI의 응답 품질을 사람 선호에 맞춰 조정하는 데도 쓰인다. 머신러닝 입문 단계에서 강화학습부터 시작하는 것은 권하지 않는다지도학습의 평가 개념이 잡혀 있어야 보상 설계를 이해할 수 있기 때문이다.

 

내 문제에는 어떤 모델을 써야 할까?

머신러닝 모델 선택은 알고리즘 이름부터 고르는 게 아니라 문제를 한 문장으로 정의하는 것에서 시작한다. 아래 매핑이 실무에서 쓰는 판단 순서다.

 

하고 싶은 일

문제 유형

첫 번째로 시도할 모델

다음 달 매출액을 예측하고 싶다

회귀

선형회귀랜덤포레스트그래디언트 부스팅

이 고객이 이탈할지 맞히고 싶다

이진 분류

로지스틱회귀랜덤포레스트그래디언트 부스팅

문의 내용을 카테고리로 나누고 싶다

다중 분류

로지스틱회귀트리 계열텍스트 임베딩 + 분류기

고객을 성향별로 묶고 싶다

군집화

K-means → DBSCAN

변수가 너무 많아 정리하고 싶다

차원 축소

PCA → t-SNE(시각화용)

설비 이상을 미리 잡고 싶다

이상 탐지

Isolation Forest → 오토인코더

사진에서 불량을 판정하고 싶다

이미지 분류

CNN 계열(딥러닝)

 

공통 원칙은 가장 단순한 모델로 기준선을 먼저 만드는 것이다. 선형회귀나 로지스틱회귀로 성능을 재보고, 그 기준선을 넘지 못하면 복잡한 모델을 써도 의미가 없다.

 

데이터 형태에 따라 머신러닝과 딥러닝 중 뭘 골라야 할까?

머신러닝 비전공자가 자주 하는 오해가 "딥러닝이 항상 낫다"는 것이다. (정형) 형태 데이터에서는 트리 계열 머신러닝 모델이 딥러닝보다 잘 나오는 경우가 많다.

 

데이터 형태

기본 선택

이유

정형 데이터 (엑셀·DB )

그래디언트 부스팅, 랜덤포레스트

변수 간 관계가 표로 정리돼 있어 트리 계열이 효율적

이미지

CNN 계열 딥러닝

픽셀에서 특징을 스스로 뽑아야 함

텍스트

Transformer 계열 딥러닝

문맥·순서 정보를 다뤄야 함

음성

CNN·RNN·Transformer 계열

시간축 신호 처리 필요

시계열 (매출·센서)

통계 모델 + 부스팅 조합, 필요 시 RNN

정형이면서 순서 정보가 있음

 

즉 머신러닝 입문에서 정형 데이터 다루는 법을 먼저 익히고, 이미지·텍스트로 넘어갈 때 딥러닝을 붙이는 순서가 합리적이다.

 

모델이 잘 만들어졌는지는 어떻게 판단할까?

머신러닝 모델은 "정확도 몇 퍼센트"만으로 판단하면 안 된다. 문제 유형마다 봐야 할 지표가 다르다.

 

문제 유형

주요 평가지표

의미

회귀

MAE, RMSE, R²

예측값이 실제값에서 평균적으로 얼마나 벗어나는가

분류 (균형 데이터)

정확도(Accuracy)

전체 중 맞힌 비율

분류 (불균형 데이터)

정밀도, 재현율, F1, AUC

드문 사건을 놓치지 않는지

군집화

실루엣 계수

같은 군집끼리 얼마나 뭉쳐 있는가

 

불량률 1%인 공정에서 "전부 정상"이라고 답하는 모델은 정확도 99%가 나온다. 이 함정 때문에 불균형 데이터에서는 재현율과 F1을 함께 보는 것이 기본이다.

 

비교 큐레이션입문이냐, 딥러닝 심화냐

머신러닝을 시작하는 지점에 따라 들어야 할 과정이 갈린다.

 

구분

처음부터 제대로 배우는 AI 기초

쉽게 배워 바로 쓰는 AI 딥러닝 실무 과정

대상

머신러닝 비전공자·완전 입문자

기초 개념은 잡혔고 딥러닝으로 넘어갈 단계

중심

AI 기초 개념 + 직무별 현업 데이터 분석 실습

딥러닝 실무 적용

다루는 데이터

정형 데이터 중심 실습

신경망 기반 과제

강의 유형

KDC (K-디지털 기초역량훈련)

KDC (K-디지털 기초역량훈련)

 

📚 A. 처음부터 제대로 배우는 AI 기초 (feat. 직무별 현업 데이터 분석 실습)

 

📌 이런 분께 추천합니다

· 머신러닝 종류와 모델 이름은 들어봤지만 직접 돌려본 적은 없는 분

· 비전공자라 어디서부터 손대야 할지 모르겠는 분

· 정형 데이터로 회귀·분류를 먼저 익히고 싶은 분

· 직무에 바로 쓸 수 있는 실습까지 해보고 싶은 분

 

💡 강의 장점

· AI 기초 개념부터 직무별 현업 데이터 분석 실습까지 순서대로 이어져 처음 접하는 분도 따라갈 수 있다

· 이론만 훑지 않고 실습으로 넘어가 머신러닝 입문 단계의 진입 장벽을 낮춘다

· ★ 고용노동부 지정 K-디지털 기초역량훈련(KDC) 공식 인증 과정이다

· KDC 수강료 90% 국비지원자부담 10%만 결제하면 수강할 수 있다

 

👉 강의 바로가기 (A. AI 기초)

 

📚 B. 쉽게 배워 바로 쓰는 AI 딥러닝 실무 과정

 

📌 이런 분께 추천합니다

· 지도학습·비지도학습 개념은 정리됐고 딥러닝으로 넘어갈 분

· 이미지·텍스트처럼 정형 데이터로 풀기 어려운 문제를 다뤄야 하는 분

· 머신러닝 모델과 신경망의 차이를 실습으로 확인하고 싶은 분

· 이공계 전공 지식을 AI 직무로 연결하려는 분

 

💡 강의 장점

· 딥러닝을 실무 적용 관점에서 다뤄 개념과 코드 사이의 간극을 줄인다

· 머신러닝 기초를 마친 뒤 이어 듣기 좋은 난이도로 구성돼 있다

· ★ 고용노동부 지정 K-디지털 기초역량훈련(KDC) 공식 인증 과정이다

· KDC 수강료 90% 국비지원자부담 10%만 결제하면 수강할 수 있다

 

👉 강의 바로가기 (B. AI 딥러닝 실무)

 

비전공자는 어떤 순서로 공부해야 할까?

머신러닝 비전공자가 가장 많이 실패하는 지점은 수학부터 완벽하게 끝내려다 진도가 멈추는 것이다. 도구를 먼저 돌려보고 필요한 수학을 그때그때 채우는 순서가 현실적이다.

 

단계

학습 내용

만들 산출물

1

Python 기본 문법, pandas로 데이터 불러오기·전처리

공개 데이터셋 요약·시각화

2

지도학습 기초 (선형회귀·로지스틱회귀), 평가지표 이해

회귀·분류 각 1개 기준선 모델

3

트리 계열 (랜덤포레스트, 그래디언트 부스팅), 교차검증

기준선을 넘긴 모델 1

4

비지도학습 (K-means, PCA)

고객 세분화 또는 이상 탐지 결과

5

딥러닝 입문 (신경망 구조, 이미지 또는 텍스트)

이미지 분류 또는 텍스트 분류 1

6

포트폴리오 정리 (문제 정의데이터모델평가한계)

정리된 프로젝트 2~3

 

도구 선택에서 고민할 필요는 크지 않다. Python 개발자 대상 조사에서 데이터 처리에는 pandas 사용률이 77%로 사실상 표준이고, Python 사용 목적 중 데이터 탐색·처리 48%, 데이터 분석 44%, 기계학습 34%로 데이터 관련 용도가 큰 비중을 차지한다.

(출처: JetBrains·Python Software Foundation - The State of Data Science 2024

언어 자체도 Python이 기본값에 가깝다. 개발자 31,771명이 응답한 2025년 조사에서 Python 사용률은 전체 응답자 57.9%, 전문 개발자 54.8%로 집계됐다.

(출처: Stack Overflow - 2025 Developer Survey, Technology

 

머신러닝을 배우면 어떤 직무로 이어질까?

머신러닝 관련 직무는 하나가 아니라 데이터 분석가·데이터 사이언티스트·ML 엔지니어로 갈리고, 요구 역량이 서로 다르다. 링커리어 커뮤니티의 진로 상담 글에서는 데이터 분석가 쪽에 SQL Hadoop·Spark 같은 대용량 처리 기술, A/B 테스트·코호트 분석 같은 실무 역량이 요구되고, 데이터 사이언티스트·ML 엔지니어 쪽은 모델링 경험과 컴퓨터비전·자연어처리 같은 특정 분야 심화 지식이 중요하다는 조언이 나왔다.

 

직무

중심 역량

자주 언급되는 스택

데이터 분석가

지표 설계, 실험 해석, 비즈니스 커뮤니케이션

SQL, A/B 테스트, 코호트 분석, 시각화

데이터 사이언티스트

모델링, 통계적 추론, 가설 검증

Python, 통계, 머신러닝 모델 전반

ML 엔지니어

모델 학습·배포·운영

딥러닝 프레임워크, 파이프라인, 특정 도메인(CV·NLP)

 

(출처: 링커리어 커뮤니티 - 데이터 분석가/데이터 사이언티스트/ML Engineer 진로 스펙 고민

 

수요 측 전망도 확인해둘 만하다. 고용노동부와 한국직업능력연구원이 발표한 신기술 인력수급 전망에서 2027년까지 인공지능 분야 신규인력 12,800, 클라우드 분야 18,800명이 부족할 것으로 집계됐고, 인공지능은 특히 연구개발(R&D) 등 고급인력 부족이 두드러진다고 지적됐다.

 

분야

2027년까지 신규인력 부족 전망

부족이 두드러지는 구간

인공지능(AI)

12,800

연구개발(R&D) 등 고급인력

클라우드

18,800

운영부터 개발 전반

 

(출처: KDI 경제정보센터 - 2027년까지 인공지능 12,800명·클라우드 18,800 신규인력 부족 전망

 

상황별 시작 지점 요약

내 상황

시작 지점

우선 익힐 머신러닝 모델

코딩을 처음 한다

Python 문법 + pandas

아직 모델 이전 단계

엑셀 데이터로 예측을 해보고 싶다

지도학습 회귀

선형회귀랜덤포레스트

고객을 그룹으로 나누고 싶다

비지도학습 군집화

K-means

이미지·텍스트를 다뤄야 한다

딥러닝 입문

CNN 또는 Transformer 계열

취업용 포트폴리오가 필요하다

문제 정의기준선개선평가 정리

그래디언트 부스팅 계열 1개는 필수

 

자주 묻는 질문 (FAQ)

Q1. 머신러닝 종류는 정확히 몇 가지인가요?

학습 방식 기준으로 지도학습·비지도학습·강화학습 3가지입니다. 지도학습은 다시 회귀(숫자 예측)와 분류(범주 예측), 비지도학습은 군집화·차원 축소·이상 탐지로 나뉩니다. 나누는 기준은 데이터에 정답 레이블이 붙어 있는지 여부이며, 강화학습은 정답 대신 보상만 주어진다는 점에서 앞의 둘과 구조 자체가 다릅니다.

 

Q2. 머신러닝 비전공자도 시작할 수 있나요?

가능합니다. 다만 수학을 먼저 완벽하게 끝내려는 순서는 대부분 중도에 멈춥니다. Python 문법과 pandas로 데이터를 다뤄보고, 선형회귀·로지스틱회귀로 기준선 모델을 만든 뒤, 그 과정에서 필요한 수학(선형대수·통계)을 채우는 순서가 현실적입니다. Python 개발자 조사에서 데이터 처리 용도의 pandas 사용률이 77%로 나타난 만큼, 도구 선택에 오래 고민할 필요는 없습니다.

 

Q3. 머신러닝 모델은 어떤 기준으로 고르나요?

알고리즘 이름이 아니라 문제 유형이 먼저입니다. 숫자를 예측하면 회귀, 범주를 맞히면 분류, 묶으면 군집화, 변수를 줄이면 차원 축소입니다. 유형이 정해지면 가장 단순한 모델(선형회귀·로지스틱회귀)로 기준선을 만들고, 그다음 랜덤포레스트나 그래디언트 부스팅으로 넘어갑니다. 정형 데이터에서는 이 트리 계열이 여전히 가장 강한 선택지입니다.

 

Q4. 딥러닝을 바로 배우면 안 되나요?

가능은 하지만 효율이 떨어집니다. 딥러닝은 머신러닝의 하위 분야이고, 평가지표·과적합·교차검증 같은 개념은 머신러닝 단계에서 잡히기 때문입니다. 또 표(정형) 형태 데이터에서는 딥러닝보다 그래디언트 부스팅 계열이 더 잘 나오는 경우가 많아, 실무에서 마주치는 문제의 상당 부분은 딥러닝 없이 풀립니다. 이미지·텍스트·음성을 다뤄야 할 때 딥러닝으로 넘어가는 순서가 자연스럽습니다.

 

Q5. 정확도가 높으면 좋은 모델인가요?

아닙니다. 불량률 1%인 공정에서 전부 "정상"이라고 답하는 모델도 정확도 99%가 나옵니다. 데이터가 한쪽으로 치우친 불균형 상황에서는 정밀도·재현율·F1·AUC를 함께 봐야 합니다. 회귀 문제라면 MAE·RMSE·R², 군집화라면 실루엣 계수를 봅니다. 문제 유형마다 봐야 할 지표가 다르다는 점이 머신러닝 입문에서 놓치기 쉬운 부분입니다.

 

결론

머신러닝 종류를 정리하면 학습 순서와 모델 선택이 함께 정리된다.

1. 큰 틀은 3가지: 지도학습(정답 있음비지도학습(정답 없음강화학습(보상만 있음). 지도학습은 회귀와 분류로, 비지도학습은 군집화와 차원 축소로 다시 갈린다

2. 모델보다 문제 정의가 먼저: "숫자를 맞힐지, 범주를 맞힐지, 묶을지"가 정해지면 쓸 수 있는 머신러닝 모델은 자동으로 좁혀진다

3. 정형 데이터에는 트리 계열, 이미지·텍스트에는 딥러닝: 딥러닝이 항상 우위인 것은 아니다. 표 형태 데이터에서는 그래디언트 부스팅 계열이 여전히 강하다

4. 평가지표는 문제 유형별로 다르다: 불균형 데이터에서 정확도만 보면 아무것도 못 잡는 모델을 좋은 모델로 착각하게 된다

 

머신러닝 입문 단계에서는 알고리즘을 많이 외우는 것보다 하나의 문제를 기준선부터 개선까지 끝까지 밀어본 경험이 더 오래 남는다.

 

📌 본 글은 2026년 기준으로 최신화하여 작성되었습니다.

 

📌 함께 보면 좋은 글

👉 코딩 AI 사이트 추천|2026 순위·무료·종류·선택 기준까지 총정리

댓글0