“AI 에이전트가 사람 일을 대신한다던데, 에이전트가 뭔가요?” “멀티모달 AI가 뜬다던데, 멀티모달이 결국 뭘 하는 건가요?” “API를 쓰면 AI를 내 프로그램에 넣을 수 있다는데, 우리도 해야 하나요?” — 기술 뉴스, AI 도구 업데이트 알림, 유튜브 채널에서 이 세 단어를 매주 마주칩니다. 화면은 한국어인데 정작 이 용어들이 무엇을 가리키는지 우리말로 풀어주는 곳은 거의 없어서 “대충 최신 기술인가 보다” 하고 넘기는 분이 많습니다. 문제는 이 세 단어가 “AI의 활용 범위를 어디까지 넓힐 것인가”를 통째로 가리키고 있다는 겁니다. 에이전트를 모르면 “답을 주는 AI”에 머물고, 멀티모달을 모르면 텍스트만 다루는 시절에 갇히며, API를 모르면 “채팅창 밖으로 AI를 꺼내는 길”을 모릅니다.
이 글은 5분 안에 읽고 AI의 활용 범위를 넓히는 세 단어 — AI 에이전트, 멀티모달, API를 정리합니다. 각 용어마다 “그래서 내 화면에서 어떻게 쓰이는가”를 Devin·Gemini·Claude에서 직접 확인하는 방법으로 풀고, 초보가 흔히 빠지는 오해와 한계도 짚습니다. 1편 토큰·컨텍스트·환각이 “AI가 글을 어떻게 읽고 틀리는가”를 다루고, 2편 프롬프트엔지니어링·RAG·파인튜닝이 “AI를 어떻게 더 정확하게 내 맛대로 쓰는가”를 다뤘다면, 이번 3편은 **“AI의 쓰임 영역을 어디까지 넓힐 수 있는가”**를 다룹니다.
왜 1편·2편과 세트로 읽어야 하는가? 1편이 ‘AI의 한계를 아는 것’, 2편이 ‘한계 안에서 AI를 더 잘 쓰는 것’이었다면, 3편은 그다음 단계 — 한계를 아는 사람만 에이전트를 안전하게 쓰고, 멀티모달의 장단을 정확히 가리고, API의 비용을 합리적으로 통제할 수 있기 때문입니다. 개념의 사다리를 한 단계씩 올라가는 셈입니다.
3가지 용어 한눈에 보기
이 섹션에서 배우는 것: 세 단어를 한 줄씩 먼저 훑고, 각각이 AI의 어느 ‘영역’을 넓히는 개념인지 보기.
| 용어 | 한 줄 정의 | 내 화면에서는 | 이걸 모르면 생기는 일 |
|---|---|---|---|
| AI 에이전트 (AI agent) | AI가 목표를 받으면 스스로 여러 단계를 계획하고 수행하는 시스템 | Devin에 코딩 과제를 주면 알아서 코딩·실행·수정 | 챗봇과 에이전트를 같다고 믿고 자동화를 맡겨버림 |
| 멀티모달 (multimodal) | 하나의 AI가 글·그림·음성·영상을 함께 다루는 능력 | Gemini에 사진을 올리고 질문하면 사진을 보고 답함 | 사진·음성을 텍스트로 바꿔야만 AI에 넘긴다고 참음 |
| API (Application Programming Interface) | 프로그램이 다른 프로그램(여기선 AI)에게 말 거는 표준 창구 | 채팅창이 아니라 코드로 AI 기능을 내 앱에 끌어다 씀 | 채팅창만 쓸 수 있다고 믿고 자동화 가능성을 놓침 |
⚠️ 이 세 개념의 구체적 기능, 비용, 지원 범위는 플랫폼·모델에 따라 다르고 자주 바뀝니다. 이 글은 2026년 8월 기준의 개념 설명이며, 정확한 요금·기능은 각 사 공식 사이트에서 확인하세요. 출처: OpenAI 플랫폼 개요, Anthropic API 문서, Gemini API 문서
용어 1: AI 에이전트(AI Agent) — “답을 주는 게 아니라, 대신 한다”
이 섹션에서 배우는 것: 에이전트가 챗봇과 어떻게 다른지, 그리고 왜 “자율성”이 기회이자 위험인지.
에이전트는 AI가 단순히 질문에 답하는 것을 넘어, 목표를 주면 스스로 여러 단계를 계획하고 도구를 사용하며 결과를 확인하는 시스템입니다. 일반 챗봇은 “예약하는 법을 알려줘”라고 답하지만, 에이전트는 실제로 예약을 진행합니다. 코드를 작성하고 실행한 뒤 에러를 보면 스스로 수정하고, 웹사이트에서 정보를 찾아 비교한 뒤 결론을 내립니다. 핵심은 **“사람이 한 단계씩 지시하는 게 아니라, 목표만 주면 AI가 스스로 단계를 쪼개서 수행한다”**는 점입니다.
devin.ai 홈페이지
에이전트의 대표 사례가 코딩 에이전트 Devin입니다. Devin은 “이 웹사이트에 로그인 기능을 만들어 줘”라는 과제를 받으면, 코드를 직접 작성하고 실행하고 테스트한 뒤 결과를 보여줍니다. AI 코딩 도구 비교 (2026)에서 다룬 Cursor·GitHub Copilot이 “코드 한 줄을 추천하는 보조 도구”라면, 에이전트는 과제 단위로 직접 수행하는 주체에 가깝습니다. ChatGPT의 “작업(Task)” 기능이나 Claude의 컴퓨터 사용 기능도 같은 방향 — AI가 사람이 매번 개입하지 않아도 여러 단계를 스스로 이어가는 것 — 으로 발전하고 있습니다.
5분 안에 직접 확인하기
- devin.ai 홈페이지에 접속해 데모 영상이나 예시 과제를 확인합니다. AI가 코드를 작성하고 실행하는 과정이 어떻게 이어지는지 살펴봅니다.
- chatgpt.com에서 일반 질문(“파이썬으로 계산기 만드는 법 알려줘”)과 에이전트형 질문(“파이썬 계산기 코드를 작성하고, 에러가 있으면 스스로 수정한 뒤 최종 코드를 줘”)을 각각 던져보고 답의 구조가 어떻게 다른지 비교합니다.
- 자주 하는 반복 업무(예: 이메일 분류, 데이터 정리)를 떠올리고, “이 업무를 사람이 단계별로 지시하지 않아도 AI가 끝까지 할 수 있을까?”를 스스로 점검합니다.
- OpenAI 펑션 콜링 가이드의 첫 화면을 읽어 봅니다. AI가 외부 도구를 호출하는 구조가 어떻게 설명되는지 확인합니다.
- 에이전트가 대신 수행하면 좋을 일 하나를 정해 보세요. 단, 권한·비용·검증 가능성을 먼저 적어놓는 것이 안전합니다.
잘 안 되는 경우
- 에이전트에 중요한 계정 권한을 통째로 넘기는 경우: 에이전트는 이메일 전송, 결제, 파일 삭제 등 실제 행위를 수행할 수 있습니다. 계정 비밀번호나 결제 권한을 넘기기 전에 최소 권한 원칙(꼭 필요한 권한만, 확인 단계를 거쳐)을 반드시 적용하고, 실행 결과를 로그로 남기세요. 권한 없는 행위는 원천 차단하는 것이 안전합니다.
- 에이전트가 수행한 결과를 검증 없이 믿는 경우: 에이전트는 여러 단계를 자율적으로 수행하지만, 중간 단계에서 1편에서 배운 환각(hallucination)이 끼어들 수 있습니다. “에이전트가 했으니 맞겠지”가 아니라, 핵심 결과는 사람이 확인하는 단계를 유지하세요.
에이전트가 “대신 실행”하는 것이라면, 다음 개념은 AI가 다루는 데이터의 형태를 넓히는 것입니다. 코딩 에이전트가 궁금하다면 AI 코딩 설정 가이드에서 초보자용 환경 구성을 볼 수 있습니다.
용어 2: 멀티모달(Multimodal) — “글·그림·음성을 한 번에 다룬다”
이 섹션에서 배우는 것: 멀티모달이 왜 ‘여러 감각을 가진 AI’인지, 그리고 이게 일상에서 어떻게 나타나는지.
멀티모달은 하나의 AI 모델이 글(텍스트)뿐 아니라 그림(이미지), 음성(오디오), 영상(비디오)까지 함께 이해하고 다루는 능력을 가리킵니다. 이전 세대의 AI는 번역기는 번역만, 이미지 생성기는 이미지만 — 형태마다 다른 도구를 써야 했습니다. 멀티모달 AI는 하나의 모델 안에서 여러 형태를 오갑니다. 사진을 올리면 그 사진을 보고 질문에 답하고, 음성으로 말하면 텍스트로 바꿔 이해한 뒤 답을 음성으로 들려줍니다.
gemini.google.com 홈페이지
가장 쉽게 체험하는 길은 구글 Gemini입니다. Gemini에 레스토랑 메뉴판 사진을 올리고 “이 중에 비건 메뉴가 뭐야?”라고 물으면, 사진 속 텍스트를 읽고 조건에 맞는 항목을 골라 답합니다. 이건 단일 모델이 이미지 이해와 텍스트 추론을 동시에 수행한 결과입니다. ChatGPT에서 음성 대화 기능을 켜면 내 말을 듣고 이해한 뒤 음성으로 답하는 것도 멀티모달의 한 면입니다. 핵심은 더 이상 사진을 텍스트로 먼저 옮기고 AI에게 넘길 필요가 없다는 것 — 사진 그 자체를 AI에게 보여줄 수 있습니다.
⚠️ 멀티모달의 이미지·음성 처리 품질은 형태와 모델에 따라 편차가 큽니다. 텍스트는 잘 다루지만 이미지 속 세부 글자를 놓치거나, 한국어 음성을 영어로 잘못 인식하는 경우가 있습니다. 중요한 판단은 반드시 교차 확인하세요.
5분 안에 직접 확인하기
- gemini.google.com에 접속해 손에 있는 사진(메뉴판, 포스터, 표 등) 한 장을 업로드합니다. “이 사진에서 핵심 정보를 3줄로 요약해 줘”라고 물어봅니다.
- 같은 사진을 chatgpt.com에도 올려 같은 질문을 해 봅니다. 두 도구가 사진에서 읽어낸 정보가 어떻게 다른지 비교합니다.
- 음성 입력 기능이 있다면 “지금 내 주변에서 들리는 소리를 듣고 무슨 상황인지 추측해 줘”처럼 오디오 기반 질문을 시도해 봅니다. 음성을 텍스트로 바꾸는 정확도를 체감합니다.
- 영상이나 음성 파일을 올릴 수 있다면, 짧은 클립을 올리고 “이 영상의 핵심 장면을 시간 순으로 정리해 줘”라고 물어봅니다. 시간 정보를 정확히 잡아내는지 확인합니다.
- LM Arena에서 여러 모델의 멀티모달 성능을 비교해 봅니다. 같은 이미지를 넣었을 때 각 모델의 답이 어떻게 다른지 체감할 수 있습니다.
잘 안 되는 경우
- 얼굴·지문·민감 사진을 AI에 올리는 경우: 멀티모달 AI에 이미지를 올리면 해당 서비스의 서버로 전송됩니다. 신분증, 의료 사진, 타인의 얼굴 등은 각 서비스의 데이터 처리 정책과 회사 보안 규정을 먼저 확인하고, 불필요한 부분은 가린 뒤 올리세요.
- 이미지 속 작은 글자나 표를 완벽히 읽는다고 믿는 경우: 멀티모달 AI는 큰 텍스트와 전반적 장면은 잘 파악하지만, 표 안의 세부 숫자나 흐릿한 글자를 놓치는 경우가 있습니다. 숫자·금액·날짜가 중요하다면 반드시 원본과 대조하세요.
멀티모달이 AI가 다루는 형태를 넓힌다면, 마지막 개념은 AI를 채팅창 밖으로 꺼내는 통로를 만드는 것입니다. 멀티모달을 더 깊이 쓰고 싶다면 무료 AI 이미지 도구 비교 (2026)에서 관련 도구를 볼 수 있습니다.
용어 3: API(Application Programming Interface) — “채팅창 밖으로 AI를 꺼내는 창구”
이 섹션에서 배우는 것: API가 왜 ‘프로그램 간의 창구’인지, 그리고 이게 초보자에게 당장 필요한지 아닌지.
API는 Application Programming Interface의 약자로, 프로그램이 다른 프로그램에게 말을 거는 표준화된 창구를 가리킵니다. 일반 사용자는 ChatGPT 웹사이트의 채팅창에 글을 쳐서 AI와 대화합니다. 하지만 API를 쓰면 채팅창을 거치지 않고, 코드로 직접 AI의 기능을 호출할 수 있습니다. 식당에 비유하면: 채팅창은 직원이 안내하는 홀의 테이블이고, API는 주방에 직접 주문을 넣는 전화선입니다. 둘 다 같은 주방(AI 모델)을 쓰지만, 들어가는 길이 다릅니다.
claude.ai 홈페이지
API가 중요한 이유는 AI를 내 프로그램 안에 끼워 넣을 수 있기 때문입니다. 회사가 자동 고객 응대 시스템을 만들 때, 매번 직원이 ChatGPT 화면에 질문을 복사-붙여넣기 할 수는 없습니다. 대신 OpenAI API를 써서 회사 앱이 직접 AI에 질문하고 답을 받아 표시합니다. Anthropic의 Claude API, 구글의 Gemini API도 같은 원리 — 코드로 AI를 호출하는 창구입니다. 핵심은 채팅창은 AI를 ‘직접 쓰는’ 길이고, API는 AI를 ‘다른 곳에 심는’ 길이라는 차이입니다.
5분 안에 직접 확인하기
- OpenAI 플랫폼 개요 페이지를 읽어 봅니다. “코드로 API를 호출한다”는 게 어떤 구조인지 공식 문서에서 확인합니다.
- “우리 회사에서 매일 반복하는 업무 중 AI를 끼워 넣으면 좋은 게 있나?”를 떠올려 봅니다. 예: 이메일 자동 분류, 회의록 요약, 제품 설명 자동 생성.
- 그 업무가 있다면, 지금은 채팅창에서 수동으로 하는지 점검합니다. 수동이라면 API 연동으로 자동화할 수 있는 후보입니다.
- Anthropic API 시작 가이드에서 첫 예시 코드를 눈으로만 읽어 봅니다. 코드를 당장 짤 필요는 없지만, API가 어떤 형태인지 감을 잡습니다.
- 코딩 없이도 API를 활용하는 길이 있습니다. AI 업무 자동화 3배 가이드에서 Make·Zapier 같은 노코드 도구로 AI를 연동하는 실전을 확인하세요.
잘 안 되는 경우
- API 키를 코드에 그대로 적어놓거나 공개 저장소에 올리는 경우: API 키는 AI 계정의 비밀번호와 같습니다. 키가 유출되면 타인이 내 요금으로 AI를 호출할 수 있습니다. 키는 환경 변수(.env)로 관리하고, 절대 GitHub 같은 공개 저장소에 올리지 마세요.
- 비용을 예측하지 않고 API를 쓰는 경우: 채팅창은 정액제(월정액)인 경우가 많지만, API는 호출량(토큰 수)에 따라 비용이 발생합니다. 2편에서 배운 토큰 개념이 여기서 직결됩니다 — 1편의 토큰이 비용의 기준이기 때문입니다. 정확한 요금은 OpenAI 요금제·Anthropic 요금제·Gemini 요금제에서 확인하고, 사용 한도를 미리 설정하세요.
API는 “AI를 내 앱에 심는” 통로입니다. 하지만 대부분의 개인 사용자와 소규모 팀에게는 채팅창 + 프롬프트엔지니어링만으로 충분한 경우가 많습니다. API는 반복 업무 자동화가 명확히 필요할 때 진지하게 검토하는 단계입니다.
세 용어가 어떻게 연결되는가
이 섹션에서 배우는 것: 에이전트·멀티모달·API가 따로 노는 게 아니라, “AI를 더 넓게 쓰는” 세 방향이라는 걸 보기.
세 단어를 “무엇을 써야 하나?”로 묻기보다, AI를 어느 방향으로 넓히는 선택지인지로 이해하는 것이 맞습니다. 에이전트는 AI가 ‘수행하는 범위’를 넓히고(답 → 행동), 멀티모달은 AI가 ‘다루는 형태’를 넓히고(텍스트 → 이미지·음성·영상), API는 AI가 ‘쓰이는 위치’를 넓힙니다(채팅창 → 내 앱).
| 방향 | 핵심 질문 | 바뀌는 것 | 초보자 시기 |
|---|---|---|---|
| AI 에이전트 | ”대신 해줄 수 있어?” | 답에서 행동으로 | 반복 업무가 명확할 때 |
| 멀티모달 | ”사진·음성도 다뤄줄 수 있어?” | 텍스트에서 여러 형태로 | 지금 바로 (사진 올려보기) |
| API | ”내 앱에 넣을 수 있어?” | 채팅창에서 내 프로그램으로 | 자동화 필요가 생겼을 때 |
이 세 방향은 서로 독립이 아니라 겹칩니다. 예를 들어 멀티모달 API를 쓰면, 내 앱이 이미지를 받아 AI에게 보내고 답을 받을 수 있습니다. 에이전트에 API를 연결하면, 에이전트가 외부 도구(이메일·달력·데이터베이스)를 직접 호출하며 일을 수행합니다. 세 단어를 아는 순간, “AI로 여기까지 할 수 있다”는 지도가 그려집니다. 다만 1편·2편의 기초 — 환각을 아는 것, 프롬프트엔지니어링과 RAG를 쓰는 것 — 위에 세워야 안전합니다. 기초 없이 에이전트·API로 점프하면 비용과 위험이 커집니다. 자동화 실전이 궁금하다면 AI 업무 자동화 3배 가이드에서 흐름을 볼 수 있고, AI 자료 조사 도구 가이드에서 각 도구의 특징을 비교할 수 있습니다.
자주 묻는 질문 3가지
Q. 에이전트를 당장 써야 하나요? 일반 챗봇으로는 부족한가요?
대부분의 개인 사용자에게는 일반 챗봇(ChatGPT, Claude, Gemini)으로 충분합니다. 에이전트가 진가를 발휘하는 건 반복적이고 단계가 많은 작업을 자동화할 때입니다. 매일 들어오는 이메일을 분류하고 답장 초안을 만드는 작업, 코드를 작성하고 테스트하는 작업 등이 대표적입니다. 그런 반복 업무가 없다면 에이전트 도입은 시기상조입니다. 코딩 보조 도구의 차이가 궁금하다면 AI 코딩 도구 비교 (2026)를 참고하세요.
Q. 멀티모달이라는 말이 나오면 무조건 좋은 건가요?
보통은 유리하지만, 형태마다 성능 편차가 있습니다. 텍스트 이해력이 뛰어난 모델이 이미지 속 세부 글자는 놓칠 수 있고, 음성 인식은 억양·배경 소음에 따라 정확도가 달라집니다. “멀티모달이니까 완벽하겠지”가 아니라, 중요한 결과는 원본과 교차 확인하는 습관이 필요합니다. 각 모델의 현재 성능은 LM Arena에서 직접 비교해 볼 수 있습니다.
Q. API를 쓰려면 코딩을 꼭 해야 하나요?
직접 코드를 짜려면 프로그래밍 지식이 필요합니다. 하지만 노코드 도구(Make, Zapier 등)를 쓰면 코딩 없이도 API를 활용할 수 있습니다. “이메일이 오면 AI가 요약해 줘” 같은 자동화를 블록 맞추기로 만드는 방식입니다. 코딩 없이 시작하는 실전은 AI 업무 자동화 3배 가이드에서 다룹니다. 다만 요금은 API 호출량에 비례하므로, 사용 한도 설정은 필수입니다.
요약
세 단어를 한 문장씩만 기억해도 AI의 활용 지도가 보입니다.
- AI 에이전트 → AI가 목표를 받아 스스로 여러 단계를 수행하는 시스템. 챗봇이 답을 주면 에이전트는 대신한다.
- 멀티모달 → 하나의 AI가 글·그림·음성·영상을 함께 다루는 능력. 더 이상 텍스트로만 소통하지 않아도 된다.
- API → 프로그램이 AI에게 말 거는 표준 창구. 채팅창 밖으로 AI를 끌어내 내 앱에 심는 통로.
AI를 “더 넓게 쓴다”는 건 비싼 새 도구로 바꾸는 게 아니라, 같은 AI를 어느 방향까지 밀고 나가느냐의 문제입니다. 이번 주에는 한 가지만 해 보세요 — Gemini나 ChatGPT에 사진 한 장을 올리고 질문하는 것. 그 작은 경험 하나가 멀티모달을 낱말이 아니라 체감으로 바꿔줍니다. 이것으로 AI 용어 사전 시리즈 3편을 마칩니다 — 1편의 토큰·컨텍스트·환각부터 2편의 프롬프트엔지니어링·RAG·파인튜닝까지, 아홉 단어가 AI 활용의 기초 체력을 만들어 줍니다. 다음 글에서는 이 개념들을 실전에 연결하는 “AI 도구 100선 요약”을 다룰 예정입니다.