“이 모델은 70B 파라미터라서 좋다던데, 70B가 뭔가요?” “어텐션(attention) 덕분에 문맥을 이해한다는데, 어텐션이 도대체 뭔가요?” “ChatGPT 답이 한 글자씩 나오는데 그게 스트리밍이라고? 그러면 품질이 달라지나요?” — 뉴스, 도구 홈페이지, 유튜브 해설 어디서나 이 단어들이 튀어나옵니다. 그런데 이름은 수없이 들어도 정작 “그래서 그게 무슨 뜻이고, 내가 쓸 때 무슨 상관인데?”를 한 줄로 말하지 못하는 분이 훨씬 많습니다. 문제는 모델이 ‘어떻게’ 돌아가는지를 모르면, 성능 비교도 속도 불만도 기능 이해도 전부 흔들린다는 겁니다. “숫자가 크니까 무조건 좋겠지”라고 생각하고 비교 없이 돈을 쓰거나, 답이 느린 이유를 내 인터넷 탓만 하다가 진짜 원인을 놓치는 일이 대표적입니다.
요약 (TL;DR): 파라미터 · 어텐션 · 스트리밍 핵심 요약 세 단어는 모델이 답을 만드는 뼈대와 그 결과가 화면에 닿는 경로를 설명합니다. 파라미터는 모델이 학습하며 익힌 숫자의 개수로 용량·규모를 가늠하는 척도이고 모델 이름에 붙는 “8B·70B·405B”가 그것인데, 숫자가 크다고 무조건 좋은 게 아니라서 그렇게 믿으면 비교 없이 고르게 됩니다. 어텐션은 문장 안에서 어느 단어에 집중할지 스스로 정하는 메커니즘으로, 긴 글에서도 앞부분을 잊지 않고 대답하는 모습이 그 결과입니다. 스트리밍은 답을 한 번에 완성해 보내지 않고 글자(토큰)를 만드는 족족 흘려보내는 방식이라 ChatGPT 답이 타자기처럼 한 글자씩 나오는 것이고, 이걸 모르면 답이 느린 진짜 원인을 놓치고 엉뚱한 곳을 고치려 하게 됩니다.
이 글은 5분 안에 읽고 모델의 작동 원리를 여는 세 단어 — 파라미터 · 어텐션 · 스트리밍을 정리합니다. 각 용어마다 “그래서 내 화면·결정에서 무슨 상관인가”를 ChatGPT·Copilot·LMArena 같은 화면에서 직접 확인하는 방식으로 풀고, 흔히 빠지는 오해와 한계도 짚습니다. 도구 사용법이 아니라 개념을 먼저 잡는 글입니다.
왜 “작동 원리”인가? 우리 블로그의 4편 GPT·LLM·온도는 단어의 ‘관계와 조절’을 다뤘고, 1편 토큰·컨텍스트 윈도우·환각은 글자를 세는 단위와 한계를 짚었습니다. 이 글은 그 한 단계 깊이 — 모델이 답을 만들어내는 뼈대가 어떻게 생겼고, 그 결과가 화면에 어떻게 도달하는지를 보는, ‘AI 용어 사전’ 시리즈의 다섯 번째 글입니다.
파라미터·어텐션·스트리밍은 각각 무슨 뜻일까?
이 섹션에서 배우는 것: 세 단어를 한 줄씩 먼저 훑고, 각각이 내 화면·판단에서 어떻게 나타나는지 보기.
| 용어 | 한 줄 정의 | 내 화면에서는 | 이걸 모르면 생기는 일 |
|---|---|---|---|
| 파라미터 | 모델이 학습하며 익힌 ‘숫자’의 개수. 모델의 용량·규모를 가늠하는 척도 | ”8B”, “70B”, “405B”가 모델 이름에 붙어 나옴 | ”숫자가 크니까 무조건 좋다”고 믿고 비교 없이 선택 |
| 어텐션 | 문장 안에서 ‘어느 단어에 집중할지’를 스스로 정하는 메커니즘 | 긴 글도 앞부분을 잊지 않고 대답하는 모습 | ”AI가 문맥을 이해한다”는 말을 과신하거나 반대로 과소평가 |
| 스트리밍 | 답을 한 번에 완성해 보내지 않고, 글자(토큰)를 만드는 족족 흘려보내는 방식 | ChatGPT 답이 타자기처럼 한 글자씩 나오는 것 | 답이 느린 진짜 원인을 몰라 엉뚱한 곳을 고치려 함 |
⚠️ 모델의 정확한 파라미터 수, 어텐션 구현 세부, 스트리밍 동작은 플랫폼·버전마다 다르고 자주 바뀝니다. 이 글은 2026년 8월 기준의 개념 설명이며, 정확한 수치와 최신 지원 현황은 각 사 공식 문서에서 확인하세요. 출처: OpenAI 플랫폼 문서, Meta Llama, Hugging Face, lmarena.ai
용어 1: 파라미터(Parameter) — “70B가 뭔데? 왜 숫자가 성능이래?”
이 섹션에서 배우는 것: 파라미터가 모델의 ‘용량’을 가늠하는 숫자라는 것, 그리고 “숫자가 크다고 무조건 좋다”는 등식이 왜 위험한지.
파라미터는 모델이 학습하며 익혀둔 ‘숫자’의 개수입니다. AI 모델은 수많은 숫자들로 이루어진 거대한 수식 같은 존재인데, 그 숫자 하나하나가 “이런 상황에서는 이렇게 반응하라”는 미세한 가중치 역할을 합니다. 그 숫자가 몇 개냐를 세는 단위가 바로 파라미터 수이고, 뉴스나 모델 이름에서 보는 **‘B’는 billion(10억)**을 뜻합니다. 즉 “70B”는 약 700억 개의 학습된 숫자로 모델이 구성되어 있다는 뜻입니다. 대표적으로 Meta의 Llama 계열은 모델 이름 자체에 규모를 넣어 공개합니다 — 자세한 규모와 라이선스는 Llama 공식 페이지에서 확인할 수 있습니다.
lmarena.ai 홈페이지
여기서 조심할 점이 있습니다. “파라미터가 많으면 무조건 똑똑하다”는 등식은 반만 맞는 말입니다. 용량이 큰 그릇이 재료를 더 담을 수는 있지만, 요리의 맛은 재료의 질(학습 데이터), 레시피(모델 구조), 불 조절(학습 방법)에도 달려 있듯이요. 실제로 더 작은 규모의 모델이 특정 과제에서 더 나은 결과를 내는 경우도 흔합니다. 또 하나 중요한 사실 — ChatGPT의 GPT 계열처럼 폐쇄형 모델은 정확한 파라미터 수를 공개하지 않는 경우가 많습니다. 그래서 뉴스에서 “GPT-X는 몇 조 파라미터”라고 쓰는 숫자는 대부분 ‘추정치’이지 공식 확인값이 아닙니다. 숫자를 볼 때 그 출처가 회사 공식인지 언론 추정인지를 한 번 더 보는 습관이 필요합니다.
5분 안에 직접 확인하기
- lmarena.ai 에 접속해 리더보드를 봅니다. 이름에 숫자가 붙은 모델(Llama-3-70B 같은)과 그렇지 않은 모델(GPT·Claude)이 섞여 있고, 순위가 파라미터 크기 순이 아니라는 걸 확인하세요.
- huggingface.co 에서 ‘Llama’를 검색해 모델 카드를 열어보면 ‘Parameters’ 항목에 숫자가 적혀 있습니다. 공개 모델은 규모가 이렇게 명시된다는 점을 직접 봅니다.
- 뉴스에서 “N조 파라미터”라는 문장을 볼 때, “이 숫자가 회사가 발표한 건가, 아니면 언론이 추정한 건가?”를 한 줄로 적어보세요. 출처를 가르는 감각이 이 단어의 핵심입니다.
잘 안 되는 경우
- 폐쇄형 모델의 파라미터 수를 단정해서 말하는 경우: GPT·Claude 같은 모델은 정확한 규모를 공식적으로 밝히지 않는 경우가 많습니다. “GPT-4는 정확히 몇 조”라고 확언하는 정보는 추정치일 확률이 높으므로, 출처 없는 수치는 그대로 믿지 마세요.
- “숫자가 크니까 내 과제에도 무조건 낫다”고 가정하는 경우: 규모가 큰 모델은 일반적으로 능력의 ‘상한선’이 높지만, 그만큼 느리고 비싸며, 단순한 과제에는 차이가 안 날 수 있습니다. 내가 주로 하는 일에서 직접 비교해 보는 것이 가장 확실합니다.
⚠️ 모델 규모와 성능의 관계는 버전·학습 데이터·과제에 따라 크게 달라집니다. 특정 수치를 근거로 “이 모델이 항상 낫다”고 단정하지 마세요. 최신 비교는 AI 챗봇 비교 (2026)를 참고하세요.
모델의 용량이 무엇인지 알았다면, 그 용량을 써서 문장을 이해하는 방식이 다음 단어입니다.
용어 2: 어텐션(Attention) — “AI가 문맥을 이해한다는 게 구체적으로 뭔가요?”
이 섹션에서 배우는 것: 어텐션이 ‘어느 단어에 집중할지 정하는 방식’이라는 것, 그래서 긴 문장에서 대명사가 뭘 가리키는지 아는 게 가능해지는 이유.
어텐션은 지금 널리 쓰이는 언어모델들의 뼈대인 트랜스포머(Transformer) 구조의 핵심입니다. 한 줄로 말하면, 문장 안의 각 단어가 ‘나머지 단어 중 어느 것에 집중할지’를 스스로 가늠하는 방식입니다. 예를 들어 “고양이가 개를 쫓았는데, 그것은 배가 고팠기 때문이다”라는 문장에서 “그것”이 고양이인지 개인지를 문맥 전체를 살펴 결정하는 능력이 바로 어텐션의 결과입니다. 모든 단어가 동시에 다른 모든 단어와의 관계를 점수 매겨 가중합하는 구조 덕분에, 모델은 순서를 따라가면서도 멀리 떨어진 단어의 연결을 놓치지 않습니다. 이 메커니즘을 제안한 2017년 연구가 바로 “Attention Is All You Need”이며, 원문 논문에서 자세한 구조를 볼 수 있습니다.
copilot.microsoft.com 홈페이지
이 구조가 일상에서 체감되는 순간은 이렇습니다. 질문에 답할 때 내가 세 문장 전에 쓴 단어를 기억하고 대명사를 제대로 연결하거나, 긴 문서를 넣었을 때 앞부분의 내용을 뒤에서 정확히 끌어다 쓰는 모습이 모두 어텐션의 결과입니다. 코딩 도우미인 GitHub Copilot이 내 코드 파일 전체를 보고 다음 줄을 추천하는 것도 같은 원리로, AI 코딩 도구 비교 (2026)에서 도구별로 이 능력이 어떻게 드러나는지 볼 수 있습니다. 다만 여기서 컨텍스트 윈도우와 어텐션을 헷갈리면 안 됩니다. 컨텍스트 윈도우(1편에서 다룬)는 ‘최대 몇 글자까지 한 번에 볼 수 있는가’라는 용량의 문제이고, 어텐션은 ‘그 용량 안에서 어디에 집중하는가’라는 방식의 문제입니다. 창이 크다고 해서 반드시 더 잘 집중하는 건 아닙니다.
5분 안에 직접 확인하기
- chatgpt.com 에서 대명사가 포함된 긴 문장을 넣고 “여기서 ‘그것’은 누구를 가리키나요?”라고 물어보세요. 문맥을 훑어 정답을 내는 과정이 어텐션이 하는 일입니다.
- 코드를 다루신다면 Copilot에서 함수 앞뒤 문맥을 넣고 다음 줄 추천을 받아보세요. 파일 전체를 ‘보고’ 추천하는 정확도가 어텐션의 결과라는 점을 체감할 수 있습니다.
- 정말 긴 글(회의록 등)을 넣고 끝부분에서 앞부분 내용을 인용해 달라고 해보세요. 앞을 잊지 않고 답한다면 컨텍스트 윈도우와 어텐션이 함께 일하고 있다는 뜻입니다.
잘 안 되는 경우
- “어텐션이 있으니 완벽하게 기억할 것”이라고 과신하는 경우: 어텐션은 집중하는 ‘방식’일 뿐 완벽한 기록 장치가 아닙니다. 길고 복잡한 문맥에서는 중요한 부분을 놓치거나 섞기도 하며, 이것이 1편에서 다룬 환각과 이어지기도 합니다. “무조건 다 기억한다”는 기대는 위험합니다.
- 컨텍스트 윈도우와 어텐션을 같은 뜻으로 쓰는 경우: 둘은 다릅니다. 용량(얼마나 많이 볼 수 있나)과 방식(그중 어디에 집중하나)을 구분하지 않으면, “컨텍스트가 크니까 당연히 정확하겠지”라는 잘못된 기대를 하게 됩니다.
모델이 문맥을 이해하는 방식을 알았다면, 마지막은 그 이해의 결과가 내 화면에 도달하는 모습입니다.
용어 3: 스트리밍(Streaming) — “답이 한 글자씩 나오는 게 뭐가 중요한가요?”
이 섹션에서 배우는 것: 스트리밍이 ‘답을 만드는 족족 흘려보내는 전송 방식’이라는 것, 그래서 체감 속도는 올라가지만 답의 품질과는 무관한 이유.
스트리밍은 AI가 답을 끝까지 다 완성한 뒤 한꺼번에 보여주는 게 아니라, 글자(토큰)를 만들어내는 족족 순서대로 흘려보내는 방식입니다. ChatGPT 창에서 답이 타자기처럼 한 글자씩 나오는 모습이 바로 스트리밍입니다. 핵심은 체감 속도에 있습니다. 전체 답이 완성될 때까지 기다렸다가 한 번에 보여주면, 질문 후 첫 글자가 보일 때까지의 대기 시간이 길어집니다. 반면 스트리밍은 첫 글자가 나오는 시점(이를 ‘첫 토큰까지의 시간’이라 부릅니다)을 앞당겨, “곧 답이 오고 있다”는 느낌을 빨리 줍니다. OpenAI·Anthropic·Google 모두 API 수준에서 이 스트리밍 응답을 지원하며, 각사 문서(OpenAI API 참조, Anthropic 문서, Google AI 개발자 문서)에서 동작 방식을 확인할 수 있습니다.
chatgpt.com 홈페이지
여기서 꼭 짚고 넘어가야 할 오해가 있습니다. 스트리밍은 답의 ‘품질’을 바꾸지 않습니다. 한 글자씩 나온다고 해서 답이 더 똑똑해지거나 덜 똑똑해지는 게 아닙니다 — 스트리밍은 전송·표시 방식일 뿐, 답을 만드는 모델은 같습니다. 따라서 “답이 늦게 나온다”고 할 때 진짜 원인은 스트리밍 여부가 아니라, 모델이 답을 생성하는 데 걸리는 시간, 서버 부하, 내 인터넷 속도 등에 있습니다. 스트리밍은 ‘기다림의 체감’을 줄여줄 뿐, 생성 자체를 빠르게 하지는 않습니다. 이 차이를 알면 “한 글자씩 나오는데도 전체가 끝나기까지 오래 걸린다”는 현상을 이해할 수 있습니다. 3편에서 다룬 API를 쓰는 서비스라면, 이 스트리밍 설정을 켜고 끄는 것만으로 사용자 경험이 크게 달라지기도 합니다.
5분 안에 직접 확인하기
- chatgpt.com 에서 긴 답을 요구하는 질문을 던져보세요. 첫 글자가 나오는 시점과 전체 답이 끝나는 시점의 차이를 시계로 재보면, ‘첫 토큰까지의 시간’과 ‘전체 생성 시간’이 다르다는 걸 체감합니다.
- 답이 한 글자씩 나오는 도중 새 질문을 입력하려 하면 잠시 막히는 경우가 있습니다. 이는 앞선 답의 스트리밍이 진행 중이기 때문이고, 모델이 한 번에 하나의 흐름을 만드는 구조와 관련이 있습니다.
- 회사 네트워크처럼 응답이 느린 환경에서는 첫 글자가 늦게 뜹니다. 이때 모델 탓을 하기 전에, “생성 속도 vs 전송 속도” 중 어디가 병목인지를 먼저 가늠해 보세요.
잘 안 되는 경우
- 네트워크가 불안정해 스트리밍이 중간에 끊기는 경우: 긴 답변을 받다가 연결이 흔들리면 답이 잘리거나 처음부터 다시 받아야 할 수 있습니다. 중요한 결과가 필요할 때는 안정적인 연결 환경에서 진행하는 것이 안전합니다.
- 스트리밍을 켰다고 답 품질이 바뀐다고 기대하는 경우: 스트리밍은 보여주는 방식일 뿐입니다. “한 글자씩 나와서 더 정확한 것 같다”는 인상은 착시에 가깝고, 실제 정확도는 모델·프롬프트에 달려 있습니다. 무료 AI 한도 비교 (2026)에서 각 서비스의 응답 속도·한도 차이를 함께 보면 도움이 됩니다.
⚠️ 응답 속도는 시간대·서버 부하·네트워크 상태에 따라 크게 달라집니다. 특정 측정값을 “이 서비스가 항상 빠르다”의 근거로 단정하지 마세요.
세 단어가 이어지는 한 흐름
이 섹션에서 배우는 것: 파라미터·어텐션·스트리밍이 각각 따로 놀지 않고 한 흐름으로 연결된다는 것.
이 세 단어는 사실 하나의 흐름을 다른 각도에서 본 것입니다. 모델은 파라미터라는 학습된 숫자 덩어리로 출발해, 그 숫자들 사이의 관계를 어텐션으로 조율하며 문맥을 이해하고, 그렇게 만들어진 답을 스트리밍으로 내 화면에 실시간 흘려보냅니다. 즉 ” 용량 → 이해 방식 → 전달 방식”의 한 줄입니다. 이 흐름을 한 번 그려두면, 뉴스의 “N조 파라미터 모델 공개”가 어디서 시작되는지, 답이 한 글자씩 나오는 게 왜 품질과 무관한지가 한 번에 정리됩니다.
| 흐름 단계 | 이번 글의 단어 | 하는 일 | 결과가 나타나는 곳 |
|---|---|---|---|
| 용량 | 파라미터 | 모델이 학습한 숫자의 규모를 정의 | 모델 이름(70B 등), 뉴스의 규모 표현 |
| 이해 방식 | 어텐션 | 용량 안에서 어느 단어에 집중할지 결정 | 긴 문맥을 잃지 않고 답하는 모습 |
| 전달 방식 | 스트리밍 | 만들어진 답을 글자 단위로 실시간 전송 | 화면에 한 글자씩 나오는 답 |
이 표를 4편의 단어 관계와 겹쳐 보면 재미있습니다. 4편이 “무엇인가 → 어떤 종류 → 어떻게 조절”의 지도였다면, 이번 편은 “얼마나 담나 → 어떻게 이해하나 → 어떻게 보여주나”의 지도입니다. 두 지도를 합치면 뉴스와 설정창의 단어 대부분이 자리를 잡습니다.
자주 묻는 질문 3가지
Q. 파라미터가 많을수록 무조건 좋은 건가요? 대체로 용량의 ‘상한선’은 높아지지만, 무조건 좋다고 할 수는 없습니다. 학습 데이터의 질, 모델 구조, 학습 방법이 모두 결과에 영향을 미치고, 더 작은 모델이 특정 과제에서 더 나을 수도 있습니다. 또 폐쇄형 모델은 정확한 파라미터 수를 공개하지 않는 경우가 많아, 뉴스의 숫자가 공식 값인지 추정인지도 따져 봐야 합니다. 최신 비교는 AI 챗봇 비교 (2026)를 참고하세요.
Q. 어텐션과 컨텍스트 윈도우는 같은 말인가요? 다릅니다. 컨텍스트 윈도우는 ‘최대 몇 글자까지 한 번에 볼 수 있나’라는 용량의 문제이고, 어텐션은 ‘그 용량 안에서 어디에 집중하나’라는 방식의 문제입니다. 창이 크다고 반드시 더 정확하게 집중하는 건 아닙니다. 자세한 배경은 1편 토큰·컨텍스트 윈도우·환각을 참고하세요.
Q. 스트리밍을 끄면 답이 더 정확해지나요? 아닙니다. 스트리밍은 답을 만드는 모델을 바꾸지 않고, 보여주는 방식만 바꿉니다. 그래서 한 글자씩 나오든 한 번에 나오든 답 자체는 같습니다. 답의 정확도는 모델과 프롬프트에 달려 있고, 스트리밍은 체감 대기 시간을 줄이는 역할만 합니다. OpenAI 플랫폼 문서에서 스트리밍 동작을 직접 확인할 수 있습니다.
요약
세 단어를 한 문장씩만 기억해도 뉴스와 화면이 다르게 읽힙니다.
- 파라미터 → 모델이 학습한 숫자의 개수, 용량의 척도. ‘크다고 무조건 좋다’는 반만 맞는 말.
- 어텐션 → 문장에서 어느 단어에 집중할지 정하는 방식. ‘문맥을 이해한다’는 말의 뼈대. 컨텍스트 윈도우와는 다른 이야기.
- 스트리밍 → 답을 만드는 족족 흘려보내는 전송 방식. 체감 속도는 올리지만 답 품질과는 무관.
세 단어를 “용량 → 이해 방식 → 전달 방식”의 한 줄로 묶어두면, 모델이 어떻게 돌아가는지가 그림으로 잡힙니다. 이번 주에는 한 가지만 해 보세요 — 뉴스나 도구 화면에서 “70B”나 “한 글자씩 나오는 답”을 볼 때, “이게 용량인가, 이해 방식인가, 전달 방식인가?”를 한 줄로 적어보는 것입니다. 그 작은 분류 습관 하나가 이름만 아는 단어를 ‘이해하는 단어’로 바꿔줍니다. 다음 글에서는 “임베딩 · 벡터 데이터베이스 · 지식 절단, AI가 기억을 저장하고 찾는 3단어”를 이어서 풀 예정입니다.