본문 바로가기

AI

04. Generative AI 완벽 이해하기 -LLM · Foundation Model · Token · Prompt · Embedding · RAG

ChatGPT가 등장하면서 AI에 대한 관심이 폭발적으로 증가했습니다.

하지만 ChatGPT를 사용하는 것과 Generative AI가 어떻게 동작하는지 이해하는 것은 다른 이야기입니다.

AWS AI Practitioner 시험에서는 Generative AI가 매우 중요한 영역입니다.

이번 글에서는 시험에 필요한 핵심 개념을 하나씩 정리해 보겠습니다.


1. Generative AI란?

Generative AI는 데이터를 분석하거나 분류하는 것을 넘어 새로운 콘텐츠를 생성하는 AI입니다.

대표적으로:

  • Text
  • Image
  • Audio
  • Video
  • Code

등을 생성할 수 있습니다.

예를 들어:

Text → 새로운 Text 생성
Image → 새로운 Image 생성
Audio → 새로운 Audio 생성
Code → 새로운 Code 생성

2. Foundation Model

Foundation Model은 다양한 AI 애플리케이션의 기반으로 사용할 수 있는 대규모 모델입니다.

예를 들어 하나의 Foundation Model을 활용하여:

Foundation Model
      │
      ├── Chatbot
      ├── Summarization
      ├── Translation
      ├── Q&A
      └── Content Generation

등 다양한 애플리케이션을 만들 수 있습니다.


3. Large Language Model

LLM은 Large Language Model입니다.

대규모 텍스트 데이터를 학습하여 자연어를 이해하고 생성합니다.

대표적인 사용 사례:

  • Chatbot
  • Document Summarization
  • Translation
  • Question Answering
  • Code Generation
  • Content Creation

4. Token

LLM은 문장을 그대로 처리하는 것이 아니라 Token이라는 단위로 텍스트를 처리합니다.

개념적으로:

Sentence
   ↓
Tokenization
   ↓
Token 1
Token 2
Token 3
...

Token은 반드시 하나의 단어와 동일한 것은 아닙니다.

단어의 일부가 하나의 Token이 될 수도 있습니다.

AWS AI Practitioner 시험에서는 Token의 정확한 계산보다는:

LLM이 텍스트를 처리하는 기본 단위

라는 개념을 이해하는 것이 중요합니다.


5. Prompt

Prompt는 AI 모델에 입력하는 지시사항 또는 질문입니다.

예:

"AWS Bedrock과 SageMaker AI의 차이를 설명해줘."

이 문장이 Prompt입니다.


6. Prompt Engineering

Prompt Engineering은 AI 모델이 원하는 결과를 얻도록 Prompt를 설계하고 개선하는 방법입니다.

좋은 Prompt에는 다음과 같은 요소를 포함할 수 있습니다.

Role
+
Context
+
Task
+
Constraints
+
Output Format

예:

"당신은 AWS Solution Architect입니다.
초보자가 이해할 수 있도록 Bedrock과 SageMaker AI의 차이를 표로 설명하세요."

단순히 질문하는 것보다 원하는 결과를 훨씬 명확하게 정의할 수 있습니다.


7. Embedding

Embedding은 텍스트와 같은 데이터를 숫자 벡터로 변환하여 의미를 표현하는 방법입니다.

개념적으로:

"AWS Cloud"
     ↓
Embedding Model
     ↓
[0.21, 0.83, 0.12, ...]

의미가 비슷한 문장은 벡터 공간에서도 가까운 위치에 나타날 수 있습니다.


8. Vector Database

Embedding된 데이터를 저장하고 유사한 정보를 검색하기 위한 데이터 저장소입니다.

Documents
    ↓
Embedding
    ↓
Vector Database
    ↓
Similarity Search

Generative AI에서 RAG를 구현할 때 중요한 구성 요소입니다.


9. RAG

RAG는 Retrieval-Augmented Generation의 약자입니다.

LLM이 가지고 있는 지식만 사용하는 것이 아니라 외부 정보를 검색하여 답변에 활용하는 방법입니다.

전체 과정은 다음과 같습니다.

User Question
      ↓
Vector Search
      ↓
Relevant Documents
      ↓
Prompt + Documents
      ↓
LLM
      ↓
Answer

예를 들어 회사의 HR 문서를 Vector Database에 저장해 놓으면:

"우리 회사의 휴가 정책은?"

이라는 질문에 관련 문서를 검색한 후 LLM이 답변하도록 만들 수 있습니다.


10. RAG가 필요한 이유

LLM 자체의 지식만 사용하는 경우 다음과 같은 문제가 발생할 수 있습니다.

최신 정보 문제

모델이 최신 정보를 가지고 있지 않을 수 있습니다.

Private Data 문제

회사 내부 문서와 같은 정보는 일반적인 LLM이 가지고 있지 않습니다.

Grounding 문제

모델이 사실이 아닌 정보를 생성할 가능성이 있습니다.

RAG는 외부 정보를 검색하여 이러한 문제를 줄이는 데 도움을 줄 수 있습니다.


11. Hallucination

Generative AI에서 매우 중요한 개념입니다.

Hallucination은 AI가 사실이 아닌 내용을 사실처럼 생성하는 현상입니다.

예를 들어 존재하지 않는 AWS 서비스를 실제 서비스인 것처럼 설명한다면 Hallucination의 사례가 될 수 있습니다.

따라서 Generative AI 시스템에서는:

  • Grounding
  • RAG
  • Human Review
  • Validation
  • Guardrails

등을 활용하여 위험을 줄일 수 있습니다.


12. Fine-tuning

Fine-tuning은 기존 Foundation Model을 특정 목적에 맞게 추가 학습시키는 방법입니다.

예를 들어 특정 산업이나 업무에 맞는 데이터로 모델을 추가 학습시킬 수 있습니다.

Foundation Model
       ↓
Specific Training Data
       ↓
   Fine-tuning
       ↓
Customized Model

13. RAG vs Fine-tuning

시험에서 중요한 비교입니다.

구분 RAG Fine-tuning
목적 외부 정보 활용 모델을 특정 목적에 맞게 조정
정보 업데이트 비교적 쉬움 추가 학습 필요
Private Knowledge 유리 가능
모델 변경 필요 없음 모델 자체를 추가 학습
대표 활용 내부 문서 Q&A 특정 스타일/업무 최적화

쉽게 기억하면:

RAG = 필요한 정보를 찾아서 모델에게 제공

Fine-tuning = 모델 자체를 추가 학습


14. Multimodal AI

최근 AI에서는 Text뿐만 아니라 여러 종류의 데이터를 동시에 처리하는 Multimodal AI도 중요합니다.

예:

Text
Image
Audio
Video
   ↓
Multimodal Model
   ↓
Understanding / Generation

예를 들어 이미지와 텍스트를 동시에 입력하고 이미지에 대해 질문하는 것이 가능합니다.


15. Generative AI 핵심 개념 정리

개념 의미
Generative AI 새로운 콘텐츠를 생성하는 AI
Foundation Model 다양한 AI 애플리케이션의 기반 모델
LLM 언어를 처리하는 대규모 모델
Token 모델이 텍스트를 처리하는 단위
Prompt 모델에 전달하는 입력/지시
Prompt Engineering Prompt를 설계하는 방법
Embedding 데이터를 벡터로 표현
Vector DB 벡터 기반 검색 저장소
RAG 외부 정보를 검색하여 생성에 활용
Fine-tuning 모델을 특정 목적에 맞게 추가 학습
Hallucination 사실이 아닌 내용을 생성
Multimodal 여러 데이터 형태를 처리

마무리

AWS AI Practitioner 시험에서 가장 중요한 영역 중 하나가 바로 Generative AI입니다.

특히 다음 개념은 반드시 이해해야 합니다.

Foundation Model

LLM

Token

Prompt

Embedding

RAG

Fine-tuning

Hallucination

다음 글에서는 이 개념들을 실제 AWS 서비스와 연결해 보겠습니다.

Next → Amazon Bedrock과 SageMaker AI, 그리고 AWS AI Services 완벽 이해하기