모든 강의를 무료로 볼 수 있어요. 회원가입 없이도 학습 가능합니다.

2강 / 전체 7강

생성형 AI, 어떻게 콘텐츠를 만드나

11분 읽기 조회 1

생성 모델이 데이터의 패턴을 학습해 글·이미지·음성·영상을 만드는 원리(트랜스포머, GAN, 확산 모델, 음성 토큰)와 그 목표가 사실이 아닌 그럴듯함이라는 한계를 설명한다.

🎯 학습 목표

이 강을 마치면 생성형 AI가 글·그림·목소리·영상을 만들어 내는 원리를 수식 없이 설명할 수 있습니다. 구체적으로는 '대규모 학습으로 패턴을 익힌다'는 말의 뜻, 텍스트 모델이 다음 단어를 고르는 방식, 이미지 모델이 잡음에서 그림을 빚어내는 과정, 음성·영상 모델이 짧은 표본으로 특정인을 흉내 내는 구조를 차례로 이해하게 됩니다. 마지막으로 AI 결과물이 왜 '그럴듯하지만 사실은 아닐 수 있는지'를 원리 차원에서 짚어, 이후 강의에서 다룰 허위정보 문제의 기술적 뿌리를 확인합니다.

🧠 출발점: 대규모 학습과 '패턴'

먼저 인공지능이 하는 일을 두 갈래로 나눠 보겠습니다. 사진을 보고 고양이인지 개인지 가려내는 AI는 판별 모델입니다. 주어진 입력에 꼬리표를 붙이는 것이 임무입니다. 반면 생성 모델은 '고양이 사진처럼 보이는 새 이미지'를 만들어 냅니다. 정답을 고르는 대신, 학습한 데이터와 닮은 무언가를 처음부터 지어내는 것입니다.

생성 모델이 배우는 대상은 개별 사진이나 문장 자체라기보다, 그 데이터들이 공유하는 규칙성입니다. 수많은 얼굴 사진을 학습하면 눈은 대체로 코 위에 두 개가 있고, 그림자는 빛의 반대편에 진다는 식의 경향을 숫자 형태로 내면화합니다. 전문 용어로는 데이터가 어떻게 분포하는지, 즉 확률 분포를 근사한다고 표현합니다. 새 결과물은 이 분포에서 '있을 법한 지점'을 하나 뽑아낸 것입니다.

이 학습에는 엄청난 양의 데이터가 들어갑니다. 예를 들어 마이크로소프트가 2023년 1월 공개한 음성 합성 연구 모델 VALL-E는 7,000명 이상이 말한 6만 시간 분량의 영어 음성(LibriLight)으로 훈련되었습니다. 데이터의 양이 늘어날수록 모델은 더 미묘한 규칙까지 포착하고, 그만큼 결과물은 진짜와 구별하기 어려워집니다.

여기서 중요한 함의가 하나 나옵니다. 생성 모델에게 '진짜'와 '가짜'의 구분은 학습 목표에 들어 있지 않습니다. 모델이 추구하는 것은 학습 데이터와 얼마나 닮았는가, 곧 그럴듯함입니다. 이 점이 강의 후반부의 핵심 논지로 다시 돌아옵니다.

✍️ 텍스트 생성: 다음 단어 맞히기의 반복

챗GPT 같은 대화형 AI의 바탕에는 대규모 언어 모델(LLM)이 있습니다. 작동 원리는 놀라울 만큼 단순한 과제의 반복입니다. 지금까지의 글을 보고 다음에 올 토큰(단어 또는 단어 조각) 하나를 예측하고, 고른 토큰을 붙인 뒤 다시 다음 토큰을 예측합니다. "대한민국의 수도는"이라는 입력 다음에는 '서울'이 올 확률이 압도적으로 높다는 것을, 모델은 방대한 문서를 읽으며 익혀 둔 것입니다.

이 방식이 긴 글에서도 앞뒤가 맞는 문장을 만들 수 있게 된 데에는 2017년 구글 연구진의 논문 「Attention Is All You Need」가 제안한 트랜스포머(Transformer) 구조가 결정적이었습니다. 트랜스포머의 어텐션 장치는 문장 속 각 단어가 다른 어떤 단어와 관련이 깊은지 가중치를 계산합니다. 덕분에 문단 앞쪽에 나온 주어를 기억해 뒷부분의 동사와 호응시키는 일이 가능해졌습니다.

모델이 항상 확률 1위 단어만 고르면 글이 단조로워지므로, 실제 서비스는 상위 후보 가운데 일정한 무작위성을 두고 선택합니다. 같은 질문에 매번 조금씩 다른 답이 나오는 이유입니다. 이 무작위성은 창의적인 문장을 만들어 주지만, 동시에 사실과 무관한 그럴듯한 문장이 끼어들 여지도 남깁니다.

허위정보의 관점에서 텍스트 생성이 바꾼 것은 '규모와 맞춤'입니다. 예전에는 여론을 조작하려면 사람이 직접 글을 써야 했지만, 이제는 같은 주장을 말투·연령·지역이 다른 수천 개의 글로 변주하는 일이 몇 분이면 끝납니다. 이 문제는 8강 「여론 조작과 정보 작전」에서 자세히 살펴봅니다.

🖼️ 이미지 생성: 잡음에서 그림을 빚다

이미지 생성 기술은 크게 두 세대를 거쳤습니다. 첫 세대의 대표는 2014년 이언 굿펠로(Ian Goodfellow) 등이 발표한 생성적 적대 신경망(GAN)입니다. 위조범 역할의 생성자와 감정사 역할의 판별자가 서로 경쟁하며 실력을 키우는 구조로, 실존하지 않는 사람의 사실적인 얼굴 사진을 처음으로 대중에게 보여 주었습니다. GAN이 딥페이크 역사에서 차지하는 자리는 3강에서 다룹니다.

오늘날 주류는 확산 모델(Diffusion Model)입니다. 2020년 조너선 호(Jonathan Ho) 등이 발표한 DDPM 논문이 기틀을 세웠습니다. 원리는 두 단계로 나뉩니다. 학습할 때는 멀쩡한 사진에 잡음을 조금씩 더해 결국 TV 화면의 지지직거림 같은 순수한 잡음으로 만드는 과정을 수없이 보여 주고, 모델에게 '한 단계 전의 덜 흐린 상태'를 복원하는 법을 가르칩니다. 생성할 때는 이를 거꾸로 돌려, 무작위 잡음에서 출발해 잡음을 한 겹씩 걷어 내며 그림을 완성합니다. 조각가가 돌덩이에서 형상을 깎아 내는 모습에 비유하곤 합니다.

그렇다면 "노을 지는 해변의 강아지"라는 문장은 어떻게 그림이 될까요? 2022년 로빈 롬바흐(Robin Rombach) 등이 발표한 잠재 확산 모델(Latent Diffusion)은 두 가지 아이디어로 이 문제를 풀었습니다. 하나는 고해상도 이미지를 직접 다루는 대신 압축된 '잠재 공간'에서 확산 과정을 수행해 계산량을 크게 줄인 것이고, 다른 하나는 교차 어텐션으로 문장의 의미를 잡음 제거의 매 단계에 반영한 것입니다. 이 연구는 누구나 개인 컴퓨터에서 내려받아 쓸 수 있는 공개 모델 스테이블 디퓨전(Stable Diffusion)의 토대가 되었고, 이미지 생성 도구가 대중화되는 결정적 계기가 되었습니다.

구분GAN확산 모델
핵심 아이디어생성자와 판별자의 경쟁잡음을 단계적으로 제거
대표 연구Goodfellow 외(2014)Ho 외(2020), Rombach 외(2022)
강점생성 속도가 빠름다양하고 정교한 결과, 문장 조건 반영에 유리
약점학습이 불안정하고 결과가 단조로워지기 쉬움여러 단계를 거쳐 계산량이 많음

🎙️ 음성과 영상: 짧은 표본, 정교한 흉내

목소리 복제는 허위정보와 사기에서 가장 실질적인 위협으로 꼽힙니다. 앞서 언급한 VALL-E는 단 3초 분량의 녹음만으로 그 사람의 음색과 감정까지 살린 새 문장을 읽게 만들 수 있다고 발표되었습니다. 비결은 음성을 잘게 쪼갠 '소리 토큰'으로 바꾸어, 언어 모델이 다음 단어를 예측하듯 다음 소리 조각을 예측하게 한 데 있습니다. 텍스트 생성 원리가 음성으로 확장된 셈입니다. 마이크로소프트는 2024년 후속 모델 VALL-E 2가 평가 지표상 사람 수준에 도달했다고 밝히면서도, 음성 인증 우회와 사칭에 악용될 위험을 들어 일반에 공개하지 않고 연구용으로만 두겠다고 했습니다.

영상 생성은 이미지 생성보다 한 단계 어렵습니다. 프레임 하나하나가 자연스러워야 할 뿐 아니라, 시간이 흘러도 인물의 얼굴과 옷, 배경이 일관되게 유지되고 물체가 물리 법칙에 맞게 움직여야 하기 때문입니다. 최근 모델들은 확산 방식을 시간 축까지 넓혀 이 문제를 풀고 있습니다.

2025년은 영상 생성의 '무성 시대'가 끝난 해로 평가됩니다. 구글은 2025년 5월 개발자 행사(I/O)에서 영상과 함께 대사·효과음·배경음을 한 번에 생성하는 Veo 3를 공개했고, 오픈AI는 같은 해 9월 30일 입 모양에 맞춘 대사와 효과음을 함께 만드는 Sora 2를 내놓았습니다. 이제는 말하는 인물과 목소리가 처음부터 짝을 이뤄 생성되므로, 따로 만든 음성을 영상에 덧입힐 때 생기던 어색함이 크게 줄었습니다.

동시에 이 분야는 서비스 지형이 몇 달 단위로 바뀝니다. 오픈AI는 Sora 앱과 웹 서비스를 2026년 4월 26일 종료했고, 개발자용 API도 2026년 9월 24일 종료한다고 공지했습니다. 반면 구글 Veo 3.1처럼 오디오 동시 생성을 기본으로 갖춘 모델들은 계속 등장하고 있습니다. 특정 제품 이름보다 '어떤 원리로, 무엇까지 가능한가'를 이해해 두어야 하는 이유가 여기에 있습니다.

유형핵심 원리대표 사례허위정보 측면의 위험
텍스트다음 토큰 예측(트랜스포머)대화형 AI 챗봇대량·맞춤형 선전 글, 가짜 후기
이미지잡음 제거(확산)스테이블 디퓨전가짜 사건·현장 사진
음성소리 토큰 예측VALL-E(연구용)보이스피싱, 가짜 녹취
영상시간 축까지 확장한 확산 + 음성 동시 생성Veo 3, Sora 2가짜 연설·인터뷰·현장 영상

🎭 '그럴듯함'의 원리와 그 한계

네 가지 생성 방식을 관통하는 공통점이 있습니다. 모두 학습 데이터에서 본 패턴과 가장 잘 어울리는 결과를 만든다는 것입니다. 생성 모델에게 좋은 결과란 '사실인 결과'가 아니라 '있을 법한 결과'입니다. 그래서 AI는 존재하지 않는 논문 제목을 실제 논문처럼 그럴듯하게 지어내기도 하고, 찍힌 적 없는 사건 현장을 진짜 보도 사진처럼 그려 내기도 합니다. 텍스트 모델이 사실과 다른 내용을 자신 있게 말하는 현상, 곧 환각은 9강에서 집중적으로 다룹니다.

이 원리를 오해하면 판단을 그르치기 쉽습니다. 흔한 오해 세 가지를 바로잡아 두겠습니다.

  • "AI는 학습한 사진을 오려 붙인다." 기본 작동은 짜깁기가 아니라 패턴에서 새로 생성하는 것입니다. 다만 특정 이미지를 지나치게 반복 학습한 경우 원본과 거의 같은 결과를 내놓는 '암기' 현상이 연구로 확인되어 있어, 저작권과 사생활 문제가 함께 제기됩니다.
  • "AI가 일부러 거짓말을 한다." 생성 모델에는 속이려는 의도가 없습니다. 의도는 그것을 쓰는 사람에게 있습니다. 같은 도구가 교육 자료를 만들 수도, 선전물을 찍어 낼 수도 있다는 점이 4강에서 허위정보를 '의도' 기준으로 분류하는 이유입니다.
  • "손가락 개수만 세면 AI 이미지를 가려낼 수 있다." 초기 모델의 어색한 손, 뭉개진 글자 같은 흔적은 세대가 바뀔 때마다 빠르게 사라지고 있습니다. 눈에 보이는 결함에 기대는 판별법은 유통기한이 짧습니다. 17강의 판별 체크리스트가 시각적 단서보다 출처와 맥락 확인에 무게를 두는 것도 이 때문입니다.

정리하면, 생성형 AI는 그럴듯함을 극도로 정교하게 만드는 기술이고, 그럴듯함과 진실 사이의 간극을 메우는 일은 여전히 사람과 제도의 몫으로 남아 있습니다.

📝 핵심 요약과 다음 강 예고

개념한 줄 정리
생성 모델데이터의 확률 분포를 학습해 '있을 법한' 새 결과물을 만든다
텍스트(LLM)트랜스포머로 다음 토큰을 반복 예측한다
이미지GAN의 경쟁에서 확산 모델의 잡음 제거로 주류가 옮겨 갔다
음성·영상수 초 표본으로 목소리 복제, 2025년부터 영상·음성 동시 생성이 표준화
핵심 한계모델의 목표는 사실이 아니라 그럴듯함이다

생성 기술 전반을 이해했으니, 이제 그중 사회에 가장 큰 충격을 준 갈래로 들어갈 차례입니다. 다음 3강 「딥페이크의 탄생과 진화」에서는 '딥페이크'라는 말이 어디서 처음 등장했는지, 얼굴 바꾸기 기술이 어떤 단계를 거쳐 실시간 화상통화 사칭에까지 이르렀는지를 연대순으로 따라가 보겠습니다.

📚 참고 자료

관련 주제

  • 생성 모델
  • 대규모 언어 모델
  • 트랜스포머
  • 확산 모델
  • GAN
  • 잠재 확산
  • 음성 복제
  • 영상 생성
  • VALL-E
  • 시사
  • 시사 강의
  • AI 허위정보와 딥페이크 — 진실의 위기
  • 무료강의
  • 무료 온라인 강의
  • NUGUNA
  • 누구나

📚 시리즈 전체 공유

AI 허위정보와 딥페이크 — 진실의 위기

이 강의가 속한 시리즈는 총 7강, 모두 무료입니다. 처음부터 배우려는 동료에게 시리즈 전체를 알려 주세요.

댓글

0/1000

불러오는 중...