“ChatGPT는 RLHF로 정렬했다던데, RLHF가 뭔가요?” “추천 알고리즘은 비지도학습 기반이라서~” “이 모델은 지도학습으로 훈련했기 때문에 정답을 잘 맞혀요” — AI 도구 설명란, 뉴스 해설, 유튜브 영상 어디서나 이 세 단어가 번갈아 나옵니다. 그런데 세 단어의 차이를 한 줄로 말하지 못하면, “AI가 왜 이렇게 대답하지?”라는 질문에 영영 답할 수 없게 됩니다. “다 비슷한 거 아니야?”로 넘기면, 왜 어떤 모델은 번역을 잘하고 어떤 모델은 창작을 잘하는지, 왜 최근 챗봇 답변이 예전보다 “정중해졌는지”를 이해할 수 없습니다. 차이를 모르면 도구 비교도, 비용 판단도, 결과를 의심하는 눈도 흔들립니다.
요약 (TL;DR): 지도학습 · 비지도학습 · 강화학습 핵심 요약 세 방식은 “무엇을 먹고 자라는가”로 갈립니다. 지도학습은 정답(라벨)이 붙은 예시로 입력→정답 규칙을 배우는 방식이라 번역·사진 인식·스팸 차단이 비교적 정확하고, 비지도학습은 라벨 없는 데이터에서 스스로 패턴을 찾는 방식이라 “비슷한 상품·기사 추천”과 고객 자동 분류로 나타납니다. 강화학습은 행동의 결과(보상·벌점)를 받으며 시행착오로 배우는 방식이고, 최근 챗봇 답변이 “정렬”되어 더 쓸만해진 것이 이 방식의 결과입니다.
이 글은 5분 안에 읽고 AI가 배우는 세 가지 방식 — 지도학습 · 비지도학습 · 강화학습을 정리합니다. 각 방식이 “무엇을 먹고 자라는가”를 Photomath · Suno · Speak 같은 도구 화면과 일상 사례로 짚고, 흔히 빠지는 오해까지 잡습니다. 도구 사용법이 아니라 개념을 먼저 잡는 글입니다.
왜 “어떻게 배우는가”인가? 우리 블로그의 6편 임베딩 · 벡터 DB · 지식 절단은 AI가 ‘기억을 저장하고 찾는’ 원리를 다뤘고, 5편 파라미터 · 어텐션 · 스트리밍은 모델이 ‘작동하는’ 뼈대를 보았습니다. 이 글은 그 한 발 뒤로 물러서 그 모델이 애초에 어떻게 학습해서 만들어졌는지, 학습의 세 가지 큰 갈래를 보는 ‘AI 용어 사전’ 시리즈의 일곱 번째 글입니다.
지도학습·비지도학습·강화학습은 각각 무엇을 먹고 자랄까?
이 섹션에서 배우는 것: 세 학습 방식을 한 줄씩 먼저 훑고, 각각이 내 화면·판단에서 어떻게 나타나는지 보기.
| 방식 | 한 줄 정의 | 무엇을 먹고 자라는가 | 내 화면에서는 |
|---|---|---|---|
| 지도학습 | 정답이 붙은 예시로 “입력→정답” 규칙을 배우는 방식 | 라벨(정답)이 있는 데이터 | 번역·사진 인식·스팸 차단이 비교적 정확한 것 |
| 비지도학습 | 정답 없이 데이터에서 스스로 패턴을 찾는 방식 | 라벨 없는 데이터 | ”비슷한 상품/기사 추천”, 고객 자동 분류 |
| 강화학습 | 행동의 결과(보상·벌점)를 받으며 시행착오로 배우는 방식 | 행동 → 피드백 | 최근 챗봇 답변이 “정렬”되어 더 쓸만해진 것 |
⚠️ 한 모델이 보통 이 세 가지 중 하나로만 만들어지는 건 아닙니다. 오늘날 대형 언어모델은 여러 단계를 섞어 만들며, 각 단계에서 쓰는 학습법과 비중은 회사마다 다릅니다. 이 글은 2026년 8월 기준의 개념 설명이며, 정확한 학습 구성과 최신 현황은 각 사 공식 문서에서 확인하세요. 출처: 구글 ML 입문 강좌, 허깅페이스 강좌, 사이킷런 지도학습 문서
용어 1: 지도학습(Supervised Learning) — “정답을 알려주면서 배운다?”
이 섹션에서 배우는 것: 지도학습이 ‘정답이 붙은 예시’로 배우는 방식이라는 것, 그래서 번역·분류가 가능해지는 이유.
지도학습은 가장 직관적인 학습법입니다. 한 줄로 말하면, 정답이 적힌 예시를 잔뜩 보여주며 “이런 입력이 들어오면 이런 정답을 내놔라”는 규칙을 모델이 스스로 찾게 만드는 방식입니다. 예컨대 스팸 필터를 만든다고 하면, “이 메일은 스팸이다 / 이 메일은 아니다”라고 정답(라벨)이 붙은 수많은 메일을 보여주고, 모델이 그 패턴을 익히는 식입니다. 사진을 보고 ‘고양이다/강아지다’를 맞히는 것도, 음성을 텍스트로 바꾸는 것도, 입력과 정답의 ‘쌍’으로 가르치기에 ‘지도(supervised)‘라는 이름이 붙었습니다. 구글의 ML 입문 강좌와 사이킷런 지도학습 문서에서 이 구조를 공식 자료로 확인할 수 있습니다.
photomath.com 홈페이지
이 방식의 결정적 특징은 정답(라벨)이 반드시 있어야 작동한다는 점입니다. Photomath가 문제를 넣으면 풀이를 보여주는 구조를 떠올려 보세요. “문제(입력) → 풀이(정답)“라는 쌍이 지도학습이 학습에 쓰는 “입력 → 정답” 쌍과 같은 형태라는 걸 체감할 수 있습니다. 정답이 없는 데이터는 지도학습으로는 가르칠 수 없고, 그래서 라벨을 붙이는 일(이를 ‘라벨링’이라 합니다)이 비용과 시간의 큰 몫을 차지합니다. 번역 도구가 꽤 쓸만한 것도 “한국어 문장 → 영어 정답” 쌍을 방대하게 가르쳤기 때문이며, AI 번역 도구 비교 (2026)에서 이 결과가 도구별로 어떻게 드러나는지 볼 수 있습니다. 즉 지도학습의 품질은 ‘얼마나 많고 깨끗한 정답 쌍을 가르쳤느냐’에 달려 있습니다.
5분 안에 직접 확인하기
- photomath.com 에서 수학 문제를 넣어 보세요. 문제(입력)와 풀이(정답)가 짝을 이루는 구조가 지도학습이 학습에 쓰는 “입력→정답” 쌍과 같은 형태라는 걸 체감합니다.
- translate.google.com 에서 문장을 번역해 보세요. 이 번역기가 “한국어 문장 → 영어 정답” 쌍으로 학습됐다는 사실을 떠올리면, 왜 흔한 문장은 정확한지가 보입니다.
- 내 메일함의 ‘스팸함’을 열어 보세요. 스팸으로 자동 분류된 메일이 보인다면, 그것이 “스팸이다/아니다”라는 정답(라벨)으로 학습된 결과라는 점을 한 줄로 적어 봅니다.
잘 안 되는 경우
- 정답(라벨)을 직접 만들어야 해서 비용이 큰 경우: 지도학습은 ‘정답이 있는 데이터’가 있어야 작동합니다. 의료·법률처럼 전문가가 직접 정답을 붙여야 하는 분야는 라벨링 비용이 만만치 않으며, 정답 데이터가 부족하면 성능이 떨어집니다.
- “정답이 없는 문제”를 풀고 싶은 경우: 미지의 패턴을 찾거나 새로운 그룹을 발견하는 일에는 지도학습이 맞지 않습니다. 정답을 모르는 상황이라면 아래의 비지도학습이 더 적합한 도구입니다.
정답을 가르치는 방식을 알았다면, 정답 없이 스스로 패턴을 찾는 방식이 다음 단어입니다.
용어 2: 비지도학습(Unsupervised Learning) — “정답 없이 패턴을 찾는다?”
이 섹션에서 배우는 것: 비지도학습이 ‘정답 없이 데이터에서 구조를 찾는’ 방식이라는 것, 그래서 추천·분류가 가능해지는 이유.
비지도학습은 정답을 가르쳐주지 않습니다. 한 줄로 말하면, 정답(라벨)이 없는 데이터를 던져주고 모델이 스스로 “비슷한 것끼리 묶기”나 “공통 패턴 찾기”를 하게 만드는 방식입니다. 가장 대표적인 일이 ‘군집화(clustering)‘인데, 미리 “이 그룹, 저 그룹”을 정해주지 않고도 비슷한 성향의 고객끼리 자동으로 묶어 내는 식입니다. 우리가 쇼핑몰에서 “이 상품을 본 사람들은 이것도 봤습니다”라는 추천을 보거나, 뉴스 사이트에서 비슷한 주제의 기사가 한데 모이는 것도 라벨 없이 패턴을 찾아낸 결과입니다. 허깅페이스 강좌의 비지도학습·군집화 단원에서 이 구조를 공식 자료로 볼 수 있습니다.
suno.com 홈페이지
비지도학습이 빛을 발하는 순간은 정답을 일일이 붙이기 어려운, 방대하고 뒤죽박죽인 데이터를 다룰 때입니다. Suno가 수많은 곡에서 음악의 구조를 학습해 새 곡을 만들어내는 것처럼, 정답을 가르쳐주지 않아도 데이터 속에 숨은 규칙을 모델이 스스로 뽑아내는 게 핵심입니다. 여기서 꼭 구분해야 할 점이 있습니다. 지도학습은 “내가 정답을 알려주는” 일이고, 비지도학습은 “정답 없이 모델이 스스로 구조를 찾는” 일입니다. 그래서 비지도학습의 결과는 종종 사람이 미리 생각하지 못한 분류를 던져주기도 합니다 — “왜 이런 것끼리 묶였지?” 하는 놀라움이 이 방식의 특징입니다. 다만 결과의 의미를 사람이 해석해 줘야 하는 부담도 함께 옵니다. 6편에서 다룬 임베딩이 바로 이 ‘데이터 속 의미를 숫자로 뽑아내는’ 비지도학습의 일종이며, 거기서 뽑은 의미로 비슷한 것끼리 묶게 됩니다.
5분 안에 직접 확인하기
- suno.com 홈페이지를 열어 보세요. 수많은 곡에서 음악의 구조를 학습했다는 설명을 볼 때, “정답 라벨 없이 패턴을 뽑아낸다”는 비지도학습의 성격을 떠올려 봅니다.
- 구글 뉴스에서 한 주제를 검색해 보세요. 같은 사건을 다룬 기사가 자동으로 한 묶음으로 모이는 것을 볼 수 있는데, 이것이 라벨 없이 비슷한 기사를 군집화한 결과입니다.
- 내가 자주 쓰는 추천(영상·음악·쇼핑)에서 “비슷한 것”이 어떻게 묶여 있는지 관찰하세요. “이것을 좋아하는 사람은 이것도 좋아한다”가 정답 없이 찾아낸 패턴이라는 걸 한 줄로 적어 봅니다.
잘 안 되는 경우
- 결과를 사람이 해석해야 하는 부담이 큰 경우: 비지도학습은 “이것끼리 묶였다”까진 알려주지만, “왜 묶였고 그게 무슨 뜻인지”는 사람이 가름해야 합니다. 묶음의 의미가 불분명하면 실제 의사결정에 쓰기 어렵습니다.
- 정확한 정답이 꼭 필요한 과제인 경우: 질병 진단·법률 판단처럼 “틀리면 안 되는” 분야는 비지도학습만으로 부족합니다. 이런 곳에는 정답을 가르치는 지도학습이, 또는 둘을 섞은 접근이 더 안전합니다.
데이터에서 스스로 패턴을 찾는 방식을 알았다면, 마지막은 행동의 결과로 배우는 방식입니다.
용어 3: 강화학습(Reinforcement Learning) — “보상을 주며 가르친다?”
이 섹션에서 배우는 것: 강화학습이 ‘행동의 결과(보상·벌점)를 받으며 시행착오로 배우는’ 방식이라는 것, 그래서 최근 챗봇 답변이 “정렬”되어 온 이유.
강화학습은 가장 ‘시행착오’에 가까운 방식입니다. 한 줄로 말하면, 모델이 행동을 해보고 그 결과로 보상이나 벌점을 받으며, 보상을 최대로 만드는 행동을 점점 더 많이 하게끔 스스로 배우는 방식입니다. 정답을 직접 가르쳐주지 않고 “이 행동은 좋았다(보상) / 나빴다(벌점)“라는 피드백만 줍니다. 바둑을 두는 AI가 수억 판을 스스로 두며 ‘이기면 보상, 지면 벌점’으로 실력을 키운 것이 대표적이며, DeepMind 연구에서 이런 사례를 공식 자료로 확인할 수 있습니다.
speak.com 홈페이지
강화학습이 최근 가장 주목받는 이유는 바로 우리가 매일 쓰는 챗봇의 품질을 끌어올린 데 있습니다. 언어모델이 글을 쓰는 법을 배운 뒤, 사람이 “이 답변이 더 좋다/더 나쁘다”고 평가하는 피드백을 보상 신호로 써서 모델을 다듬는 기법을 **RLHF(Reinforcement Learning from Human Feedback, 인간 피드백 기반 강화학습)**라 부릅니다. 쉽게 말해 “도움 되고 무해한 답”에 보상을 주는 시행착오입니다. 최근 챗봇 답변이 예전보다 정중하고 쓸만해진 데는 이 과정이 큰 몫을 했으며, 이를 ‘정렬(alignment)‘이라 부릅니다. Speak 같은 언어 학습 앱에서 발음·문장을 넣으면 즉시 교정을 받는 구조가 “행동 → 피드백 → 개선” 루프와 닮아 있다는 점을 체감하면, 강화학습의 핵심인 ‘결과로 배우기’가 한결 가까워집니다. RLHF의 구체적 구조는 인스트럭트GPT 연구와 Anthropic 연구 페이지에서 공식 자료로 볼 수 있습니다.
5분 안에 직접 확인하기
- speak.com 홈페이지를 열어 보세요. 문장을 넣고 교정을 받는 구조가 “행동 → 피드백 → 개선” 루프와 같다는 걸 떠올리면, 강화학습의 ‘결과로 배우기’가 한결 가까워집니다.
- chatgpt.com 에서 답변 아래의 ‘좋아요/싫어요’ 버튼을 찾아 보세요. 이 피드백이 강화학습(RLHF)으로 모델을 개선하는 데 쓰인다는 사실을 떠올려 봅니다.
- deepmind.google 의 연구 페이지에서 바둑·체스 같은 보드게임 AI 사례를 찾아 보세요. “이기면 보상, 지면 벌점”으로 시행착오를 거듭한 사례가 강화학습의 뼈대라는 걸 확인합니다.
잘 안 되는 경우
- 보상의 기준을 잘못 정하면 엉뚱하게 배우는 경우: 강화학습은 ‘무엇에 보상을 줄지’에 극도로 민감합니다. 보상의 기준이 빠져 있거나 잘못되면 모델이 의도와 다르게 “보상만 노리는” 행동을 배울 수 있어, 보상 설계 자체가 어려운 영역입니다.
- 수많은 시행착오가 필요해 자원이 많이 드는 경우: 강화학습은 보통 방대한 반복 시도를 거쳐야 결과가 나옵니다. 시간·컴퓨팅 자원이 크게 들고, 단순한 과제에는 지도학습이 훨씬 경제적일 수 있습니다.
⚠️ 강화학습으로 모델을 ‘정렬’했다고 해서 답이 항상 옳은 건 아닙니다. 정렬은 “도움 되고 무해한 방향”으로 답을 다듬는 과정일 뿐, 사실 확인을 대신하지 않습니다. 정확한 사실은 여전히 출처 확인이 필요하며, 1편에서 다룬 환각과 이어지는 한계입니다.
세 단어가 이어지는 한 흐름
이 섹션에서 배우는 것: 세 학습 방식이 따로 놀지 않고 한 모델 안에서 차례로 이어진다는 것.
이 세 방식은 사실 하나의 모델이 만들어지는 과정의 서로 다른 단계로 볼 수 있습니다. 대형 언어모델은 보통 **“방대한 텍스트에서 패턴을 뽑는(비지도학습적) 사전학습 → 정답이 있는 예시로 다듬는(지도학습적) 미세조정 → 사람의 피드백으로 보상을 주며 정렬하는(강화학습, RLHF)“**의 흐름을 거칩니다. 즉 “스스로 패턴 익히기 → 정답으로 가르치기 → 결과로 다듬기”의 한 줄입니다. 이 흐름을 한 번 그려두면, 왜 최신 챗봇이 예전 모델보다 “정렬”되어 쓸만해졌는지가 한눈에 잡힙니다.
| 흐름 단계 | 이번 글의 단어 | 하는 일 | 결과가 나타나는 곳 |
|---|---|---|---|
| 사전학습 | 비지도학습 | 라벨 없이 방대한 데이터에서 패턴을 익힘 | 언어의 ‘골격’을 갖춘 기본 모델 |
| 미세조정 | 지도학습 | 정답이 붙은 예시로 원하는 일을 가르침 | 번역·요약 같은 특정 과제 수행 |
| 정렬 | 강화학습 | 사람의 피드백(보상)으로 답을 다듬음 | 더 도움 되고 무해한 답변 |
이 표를 2편에서 다룬 파인튜닝과 겹쳐 보면 재미있습니다. 2편이 “파인튜닝으로 모델을 내 입맛에 맞게 다듬는다”를 다뤘다면, 이번 편은 그 다듬기가 학습법의 언어로는 어떻게 펼쳐지는지를 보여줍니다. 두 지도를 합치면 뉴스의 “RLHF로 정렬했다”는 문장이 어디서 시작되는지가 자리를 잡습니다.
자주 묻는 질문 3가지
Q. 강화학습(RLHF)을 거쳤다고 해서 답이 항상 맞나요? 아닙니다. RLHF는 답을 “도움 되고 무해한 방향”으로 다듬는 정렬 과정일 뿐, 사실의 옳고 그름을 보장하지 않습니다. 정확한 사실은 여전히 출처 확인이 필요하며, 이 한계는 1편에서 다룬 환각과 이어집니다. RLHF의 구체적 구조는 인스트럭트GPT 연구에서 확인할 수 있습니다.
Q. 지도학습과 비지도학습 중 뭐가 더 좋은 건가요? ‘더 좋은’은 없고 ‘목적에 맞는’이 있습니다. 정확한 정답이 필요하고 라벨을 구할 수 있다면 지도학습이 적합하고, 미지의 패턴을 찾거나 분류를 발견하고 싶다면 비지도학습이 적합합니다. 구글 ML 입문 강좌에서 두 방식의 쓰임새를 비교해 볼 수 있습니다.
Q. 세 방식이 한 모델에 다 쓰이나요? 오늘날 대형 언어모델은 여러 학습법을 단계별로 섞어 만드는 게 보통입니다. 다만 각 단계에서 어느 학습법을 얼만큼 쓰는지는 회사마다 다르고 공개되지 않은 경우가 많습니다. 정확한 구성은 허깅페이스 강좌와 각 사 공식 문서에서 확인하세요.
요약
세 학습 방식을 한 문장씩만 기억해도 뉴스와 도구 화면이 다르게 읽힙니다.
- 지도학습 → 정답이 붙은 예시로 “입력→정답”을 가르치는 방식. 라벨이 있어야 작동하고, 품질은 정답 쌍의 양과 질에 달린다.
- 비지도학습 → 정답 없이 데이터에서 스스로 패턴을 찾는 방식. ‘비슷한 것끼리 묶기’가 가능하지만, 의미는 사람이 해석해야 한다.
- 강화학습 → 행동의 결과(보상·벌점)로 시행착오하며 배우는 방식. 최근 챗봇을 “정렬”해 쓸만하게 만든 힘(RLHF).
세 방식을 “스스로 패턴 익히기 → 정답으로 가르치기 → 결과로 다듬기”의 한 줄로 묶어두면, 내가 쓰는 도구가 어떤 과정을 거쳐 만들어졌는지가 그림으로 잡힙니다. 이번 주에는 한 가지만 해 보세요 — 뉴스에서 “지도학습으로 훈련했다”나 “RLHF로 정렬했다”를 볼 때, “이게 정답을 가르친 건가, 패턴을 찾은 건가, 보상으로 다듬은 건가?”를 한 줄로 적어보는 것입니다. 그 작은 분류 습관 하나가 “AI는 다 같이 배운다”는 오해를 깨줍니다. 다음 글에서는 “AI 모델의 성능을 평가하는 지표들 — 정확도·정밀도·재현율, 점수가 말하는 것과 숨기는 것”을 이어서 풀 예정입니다.