KIMKYUTAE.COM · ©
생성형 AI는 어떻게 글과 그림을 만들까? 원리 쉽게 이해하기
생성형 AI라는 말을 자주 듣지만, 막상 “어떻게 글을 쓰고 그림을 만드는가?”라고 물으면 설명하기 쉽지 않다.
가장 먼저 알아둘 점은 하나다. 생성형 AI 모델 자체는 검색엔진처럼 인터넷에서 완성된 답을 그대로 꺼내오는 것이 아니라, 학습 과정에서 익힌 패턴을 바탕으로 그 순간의 결과를 생성한다. 다만 웹 검색이나 문서 조회 도구가 연결된 서비스는 외부 자료를 가져와 답변에 활용할 수 있다.
생성형 AI는 많은 예시를 보며 패턴을 배우고, 사용자의 요청을 받으면 그 패턴을 이용해 새로운 글·이미지·음성·영상 등을 만들어내는 기술이다.
생성형 AI
기존의 많은 AI는 “분류”나 “판단”을 잘하는 데 초점이 맞춰져 있었다. 예를 들어 사진을 보고 고양이인지 개인지 구분하거나, 거래 내역을 보고 이상 거래인지 아닌지 판단하는 식이다.
생성형 AI는 여기서 한 단계 더 나아가 새로운 결과물을 만든다.
- ChatGPT는 문장을 만든다.
- 이미지 생성 AI는 그림을 만든다.
- 음악 생성 AI는 새로운 음악을 만든다.
- 영상 생성 AI는 프레임을 이어 새로운 영상을 만든다.
모두 생성형 AI라고 부르지만 내부에서 결과를 만드는 방식이 완전히 같은 것은 아니다. 텍스트 AI는 주로 다음에 올 글의 조각을 예측하고, 많은 이미지 생성 AI는 잡음에서 원하는 이미지를 점차 복원해가는 방식을 사용한다.
패턴 학습
사람도 새로운 것을 배울 때 여러 예시를 본다. 요리를 배우려면 레시피를 보고, 글쓰기를 배우려면 많은 문장을 읽는다.
AI도 비슷하다. 학습 단계에서 많은 텍스트, 이미지, 음성 등의 데이터를 보면서 반복되는 관계와 특징을 찾는다.
예를 들어 텍스트 AI가 아래와 같은 문장을 많이 봤다고 생각해보자.
“대한민국의 수도는 서울이다.”
“서울은 대한민국의 수도이다.”
“한국의 수도 서울에는 많은 사람이 산다.”
AI는 “대한민국”, “수도”, “서울”이라는 말이 자주 함께 등장하고 서로 강하게 연관된다는 패턴을 학습한다. 일반적으로 문장을 통째로 저장해 꺼내기보다 이런 관계를 수많은 숫자로 표현해 모델 내부에 담아두는 쪽에 가깝다. 다만 학습 자료의 일부를 기억해 길게 재현하는 현상을 완전히 배제할 수는 없으므로, 생성형 AI가 어떤 문장도 절대 복사하지 않는다고 단정하는 것도 정확하지 않다.
파라미터
생성형 AI의 내부에는 수많은 파라미터(Parameter)가 있다. 어렵게 들리지만, 일반적으로는 “AI가 학습하면서 조정한 아주 많은 숫자값”이라고 이해하면 충분하다.
학습 전에는 이 숫자들이 거의 아무 의미가 없다. AI가 데이터를 보고 예측을 해본 뒤 틀린 정도를 계산하고, 조금 더 잘 맞도록 숫자값을 계속 조정한다. 이 과정을 아주 많이 반복하면 언어와 이미지의 패턴이 모델 안에 반영된다.
학습 = 정답을 외우는 과정이라기보다, 수많은 예시에서 관계를 찾아 내부 숫자를 계속 조정하는 과정
텍스트 생성
ChatGPT 같은 언어 모델은 입력된 글을 먼저 작은 조각으로 나눈다. 이 조각을 토큰(Token)이라고 부른다.
그다음 지금까지 입력된 내용과 이미 만든 답변을 보고 다음에 어떤 토큰이 이어질 가능성이 높은지 계산한다.
예를 들어 다음 문장을 생각해보자.
“오늘 아침에 일어나서 커피를 한 잔…”
뒤에는 “마셨다”, “내렸다”, “샀다” 같은 말이 자연스럽게 이어질 가능성이 높다. 반대로 “수영장”이나 “자동차 엔진” 같은 말은 바로 이어질 가능성이 낮다.
AI는 가능한 후보마다 확률을 계산하고 그중 하나를 선택한다. 그리고 방금 선택한 토큰까지 포함해서 다시 다음 토큰을 예측한다.
지금까지의 문맥 확인 → 다음 토큰 예측 → 선택 → 다시 다음 토큰 예측 → 반복
이 과정을 빠르게 반복하면 한 문장이 되고, 문장을 계속 이어가면 긴 답변이 된다.
Transformer와 Attention
여기서 중요한 기술이 Transformer다. 현재 대부분의 대형 언어 모델은 Transformer 계열 구조를 사용한다.
Transformer의 핵심 중 하나는 Attention이다. 문장 안의 각 단어가 다른 단어와 얼마나 관련 있는지를 살펴보는 방식이라고 생각하면 된다.
예를 들어 다음 문장을 보자.
“철수가 사과를 냉장고에 넣었다. 다음 날 그것을 꺼내 먹었다.”
여기서 “그것”이 무엇인지 이해하려면 앞에 나온 “사과”와 연결해야 한다. Attention은 이런 관계를 계산해 어떤 정보에 더 주목해야 하는지 판단하도록 돕는다.
이 덕분에 생성형 AI는 단순히 바로 앞 단어만 보는 것이 아니라, 앞에서 나온 여러 내용을 함께 참고해 다음 내용을 만들 수 있다.
이미지 생성
이미지 생성 AI를 설명할 때는 텍스트 AI와 같은 방식으로 “다음 단어를 예측한다”고 하면 정확하지 않다.
많은 이미지 생성 모델은 Diffusion이라는 방식을 사용한다. 아주 단순하게 설명하면, 완전히 뒤섞인 잡음에서 시작해 조금씩 잡음을 제거하면서 원하는 이미지에 가까워지는 방식이다.
예를 들어 “창가에 앉아 있는 노란 고양이”라는 그림을 만든다고 해보자.
- 처음에는 의미 없는 잡음에 가까운 상태에서 시작한다.
- 프롬프트에 있는 “고양이”, “노란색”, “창가” 같은 조건을 참고한다.
- 잡음을 조금 제거하면서 고양이의 형태와 배경을 만든다.
- 이 과정을 여러 번 반복하면서 점점 선명한 이미지로 바꾼다.
학습 과정에서는 반대로 실제 이미지에 조금씩 잡음을 섞어가며, 모델이 원래 이미지를 복원하는 방법을 배우도록 한다. 그래서 생성할 때는 그 과정을 거꾸로 이용할 수 있다.
무작위성
생성형 AI는 항상 가장 가능성이 높은 결과 하나만 고르는 방식으로 동작하지 않는다. 어느 정도의 무작위성을 넣어 여러 후보 가운데 하나를 선택하기도 한다.
그래서 같은 질문을 두 번 하거나 같은 이미지 프롬프트를 여러 번 넣어도 결과가 조금씩 달라질 수 있다.
이 무작위성이 전혀 없다면 같은 입력에 거의 같은 결과만 나오게 된다. 반대로 무작위성이 너무 크면 창의적일 수는 있지만 결과가 불안정해진다. 생성형 AI 서비스들은 이 균형을 여러 설정으로 조절한다.
학습과 추론
| 구분 | 무엇을 하는가 |
|---|---|
| 학습(Training) | 많은 데이터를 보며 모델 내부의 파라미터를 조정한다. |
| 추론(Inference) | 학습이 끝난 모델에 사용자가 질문이나 요청을 넣어 실제 결과를 생성한다. |
우리가 ChatGPT에 질문하거나 이미지 생성 AI에 그림을 요청할 때는 대부분 학습이 아니라 추론 단계다.
즉 질문할 때마다 AI가 처음부터 다시 공부하는 것은 아니다. 이미 학습된 모델을 이용해 현재 입력에 맞는 결과를 만들어내는 것이다.
AI의 이해
이 부분은 표현을 조심할 필요가 있다. 생성형 AI는 문장과 개념 사이의 관계를 매우 복잡하게 처리할 수 있고, 결과만 보면 이해하고 있는 것처럼 보일 때가 많다.
하지만 사람처럼 경험하고 감정을 느끼며 의미를 받아들이는 것과 AI의 내부 계산을 같은 것으로 볼 수는 없다. 현재의 생성형 AI는 학습된 패턴과 입력 문맥을 바탕으로 결과를 계산해 만들어낸다.
일반적으로 사용할 때는 “이해한다”는 표현을 편의상 쓸 수 있지만, 사람의 사고방식과 완전히 동일한 과정이라고 생각하면 오해하기 쉽다.
Hallucination
생성형 AI의 목표는 기본적으로 문맥에 잘 맞는 결과를 생성하는 것이다. 이것과 모든 문장이 사실인지 확인하는 것은 별개의 문제다.
예를 들어 실제로 존재하지 않는 책 제목을 물었는데, AI가 비슷한 제목과 저자 이름의 패턴을 조합해 그럴듯한 답을 만들어낼 수 있다. 이런 현상을 흔히 환각(Hallucination)이라고 부른다.
자연스러운 문장을 만드는 능력과 사실을 검증하는 능력은 다르다.
그래서 최신 정보나 의료·법률·금융처럼 중요한 내용은 생성된 답변만 믿기보다 원문과 공식 자료를 확인해야 한다.
검색과 도구
최근의 생성형 AI는 언어 모델만 단독으로 사용하는 데서 끝나지 않는다. 필요하면 웹을 검색하거나, 문서를 읽거나, 계산기를 사용하거나, 외부 서비스를 호출하기도 한다.
예를 들어 최신 날씨를 물으면 언어 모델이 오래전에 학습한 기억만으로 답하는 것이 아니라 현재 날씨 정보를 가져온 뒤 그 결과를 사람이 읽기 쉬운 문장으로 정리할 수 있다.
이런 구조에서는 생성형 AI가 생각을 정리하고 설명하는 역할을 하고, 검색·DB·계산기 같은 외부 도구가 현재 정보나 정확한 데이터를 제공하는 역할을 맡는다.
전체 흐름
- 학습 데이터를 본다. 많은 글, 이미지, 음성 등에서 반복되는 패턴을 찾는다.
- 모델 내부의 숫자를 조정한다. 예측이 더 잘 맞도록 수많은 파라미터를 반복해서 바꾼다.
- 사용자가 프롬프트를 입력한다. 질문이나 요청이 모델에 전달된다.
- 입력의 관계를 분석한다. 텍스트 모델이라면 문맥과 토큰 사이의 관계를 살핀다.
- 새로운 결과를 만든다. 텍스트는 다음 토큰을 이어가고, 이미지 모델은 잡음을 제거하는 식으로 결과를 생성한다.
- 필요하면 외부 도구를 함께 사용한다. 검색, 문서, 계산, 데이터베이스 등을 이용해 결과를 보완할 수 있다.
정리
생성형 AI는 많은 데이터를 보면서 패턴을 학습하고, 사용자의 요청을 받으면 그 패턴을 이용해 가장 그럴듯한 새로운 결과를 만들어내는 기술이다.
텍스트 AI는 다음에 올 내용을 예측하는 방식이 중심이고, 이미지 생성 AI는 잡음에서 원하는 이미지를 복원해가는 방식이 많이 사용된다. 내부 방식은 다르지만 공통점은 이미 존재하는 결과를 단순히 복사하는 것이 아니라, 학습된 관계를 이용해 그 순간의 결과를 새로 만든다는 점이다.
이 원리를 알고 나면 생성형 AI를 조금 더 현실적으로 볼 수 있다. 매우 자연스럽고 창의적인 결과를 만들 수 있지만, 사실을 스스로 완벽하게 검증하는 기계는 아니다. 그래서 잘 활용하려면 좋은 질문을 하는 것만큼 결과를 확인하고 검증하는 습관도 중요하다.






