모든 강의를 무료로 볼 수 있어요. 회원가입 없이도 학습 가능합니다.

3강 / 전체 7강

딥페이크의 탄생과 진화

12분 읽기 조회 0

Face2Face부터 레딧 deepfakes, StyleGAN, 사진 한 장 얼굴 교체, 실시간 변조, 음성 복제까지 딥페이크 기술의 발전사를 따라가며 제작 문턱 하락이 바꾼 위험을 살핀다.

🎯 학습 목표

이 강을 마치면 '딥페이크'라는 말이 언제 어디서 처음 쓰였는지, 그리고 이 기술이 연구실의 시연에서 누구나 쓰는 도구로 바뀌기까지 어떤 단계를 거쳤는지 연대순으로 설명할 수 있습니다. 얼굴 교체의 기본 구조인 오토인코더 방식을 그림처럼 떠올릴 수 있고, 얼굴 합성·음성 복제·실시간 변조가 각각 언제 실용 단계에 들어섰는지 구분할 수 있습니다. 무엇보다 '제작 문턱의 하락'이 왜 위험의 성격 자체를 바꾸었는지 근거를 들어 말할 수 있게 됩니다.

📼 이름이 붙기 전: 연구실의 합성 영상

사람의 얼굴과 목소리를 바꾸는 일은 오랫동안 영화 특수효과의 영역이었습니다. 대형 스튜디오가 배우의 얼굴을 디지털로 젊게 만들거나 고인이 된 배우를 화면에 복원할 때는 수많은 전문가와 고가 장비, 몇 달의 작업이 들었습니다. 결과는 놀라웠지만, 그만큼 일반인이 흉내 낼 수 없는 기술이었습니다.

변화의 신호는 학계에서 먼저 나왔습니다. 2016년 컴퓨터 비전 학회 CVPR에서 독일·미국 연구진(Thies 외)이 발표한 Face2Face는 일반 웹캠으로 찍은 한 사람의 표정을 다른 사람의 영상에 실시간으로 옮겨 입혔습니다. 연구진은 유명 정치인의 연설 영상 위에서 입 모양과 표정을 마음대로 움직이는 시연을 보여 주었고, 이는 '이미 존재하는 영상 속 인물을 조종할 수 있다'는 가능성을 처음 대중에게 각인시켰습니다.

이듬해인 2017년 미국 워싱턴대학교 연구진은 컴퓨터그래픽스 학회 시그래프(SIGGRAPH)에서 「Synthesizing Obama」를 발표했습니다. 버락 오바마 전 대통령의 주례 연설 영상 여러 시간 분량을 학습한 신경망이 음성만 듣고 그에 맞는 입 모양을 생성해, 원래 다른 주제를 말하던 영상에 새 연설을 자연스럽게 입혔습니다. 오디오만 있으면 그럴듯한 연설 영상을 만들 수 있다는 점에서 훗날 가짜 연설 영상의 원형이 된 연구입니다.

이 시기의 공통점은 높은 문턱입니다. 연구 성과는 논문과 시연 영상으로 공개되었지만, 그대로 따라 하려면 전문 지식과 대량의 학습 데이터, 연구용 장비가 필요했습니다. 위협은 '가능성'의 단계에 머물러 있었습니다.

🧬 2017년, '딥페이크'라는 이름의 등장

문턱이 무너진 계기는 학회가 아니라 온라인 커뮤니티였습니다. 2017년 12월 미국 IT 매체 마더보드(Motherboard)의 기자 서맨사 콜(Samantha Cole)은 레딧(Reddit)에서 'deepfakes'라는 아이디를 쓰는 이용자가 유명 여배우들의 얼굴을 성인 영상 속 인물에 합성해 올리고 있다고 보도했습니다. 그는 연구자들이 공개한 오픈소스 기법을 이용했고, 이 아이디가 곧 기술 전체를 가리키는 일반명사가 되었습니다. 딥페이크(deepfake)는 심층 학습을 뜻하는 '딥러닝(deep learning)'과 가짜를 뜻하는 '페이크(fake)'를 합친 말입니다.

당시 쓰인 방식은 오토인코더(autoencoder)라는 신경망 구조였습니다. 오토인코더는 이미지를 핵심 특징만 남긴 압축 정보로 줄이는 인코더와, 그 압축 정보에서 원래 이미지를 되살리는 디코더로 이루어집니다. 얼굴 교체에서는 인코더 하나를 두 사람이 함께 쓰고, 디코더는 사람마다 따로 둡니다. A의 사진과 B의 사진을 번갈아 학습시키면 공용 인코더는 '고개 각도, 표정, 조명' 같은 공통 정보를 뽑는 법을 익히고, 각 디코더는 그 정보를 자기 담당 인물의 얼굴로 그려 내는 법을 익힙니다. 이제 A가 등장하는 영상의 프레임을 인코더에 넣고 B의 디코더로 복원하면, A의 표정과 움직임을 그대로 따라 하는 B의 얼굴이 나옵니다.

이 방법은 학습에 대상 인물의 사진 수백~수천 장과 그래픽카드로 며칠의 계산이 필요했지만, 연구용 장비까지는 요구하지 않았습니다. 코드가 공개되자 일반인도 개인 컴퓨터로 따라 할 수 있게 되었고, 이 지점에서 딥페이크는 연구 주제에서 사회 문제로 넘어왔습니다. 레딧은 2018년 2월 비동의 성적 촬영물 금지 정책을 근거로 관련 커뮤니티를 폐쇄했고, 트위터와 일부 성인 사이트도 뒤따랐습니다. 2018년 4월에는 영화감독 조던 필(Jordan Peele)이 미국 매체 버즈피드와 함께 오바마 전 대통령의 얼굴에 자신의 목소리를 입힌 경고 영상을 공개해, 이 기술이 정치 영역으로 번질 수 있음을 알렸습니다.

초기 피해의 성격은 통계로도 확인됩니다. 네덜란드 보안 기업 딥트레이스(Deeptrace)가 2019년 9월 발표한 보고서는 온라인에서 1만 4,678건의 딥페이크 영상을 찾아냈고, 그중 96%가 비동의 성적 영상물이었다고 밝혔습니다. 정치적 조작보다 개인, 특히 여성을 겨냥한 성적 착취가 딥페이크의 첫 번째 얼굴이었던 것입니다. 이 문제는 7강에서 집중적으로 다룹니다.

👤 얼굴 기술의 세대 교체

2018년 이후 얼굴 관련 기술은 네 갈래로 빠르게 분화했습니다. 각각 무엇을 바꾸었는지 차례로 짚어 보겠습니다.

첫째, 존재하지 않는 얼굴의 생성입니다. 엔비디아 연구진이 2018년 12월 공개한 StyleGAN은 실제 사진과 구별하기 어려운 가상 인물의 얼굴을 만들어 냈습니다. 2019년 2월에는 이를 이용해 접속할 때마다 새로운 가상 인물 사진을 보여 주는 웹사이트(ThisPersonDoesNotExist.com)가 등장했습니다. 이 기술은 실존 인물을 흉내 내지는 않지만, 가짜 소셜미디어 계정의 프로필 사진으로 쓰이면서 여론 조작용 계정망을 꾸미는 데 활용되었습니다. 기존에는 다른 사람의 사진을 훔쳐 써야 했기 때문에 이미지 역검색으로 들킬 수 있었는데, 세상에 하나뿐인 얼굴은 그런 추적을 피할 수 있었습니다.

둘째, 사진 한 장짜리 얼굴 교체입니다. 오토인코더 방식이 수백 장의 사진과 긴 학습을 요구했다면, 2023년 7월 깃허브에 공개된 오픈소스 도구 루프(roop)는 별도 학습 없이 원본 얼굴 사진 단 한 장으로 영상 속 얼굴을 바꿨습니다. 미리 학습된 얼굴 인식·교체 모델을 이용하는 이 방식을 '원샷(one-shot)' 교체라고 합니다. 루프의 개발자는 얼마 뒤 기술이 미칠 파급 효과를 이유로 개발을 중단했지만, 공개된 코드는 수많은 파생 도구로 이어졌습니다. 한번 공개된 기술은 회수할 수 없다는 사실을 보여 준 사례입니다.

셋째, 실시간 변조입니다. 녹화된 영상을 나중에 바꾸는 것이 아니라, 화상회의나 생방송 중에 얼굴을 바꿔 송출하는 기술입니다. 딥페이크 영상 제작 도구 딥페이스랩(DeepFaceLab)의 기술을 실시간용으로 옮긴 딥페이스라이브(DeepFaceLive) 같은 오픈소스 도구가 대표적이며, 성능이 좋은 그래픽카드에서는 초당 25프레임 안팎으로 웹캠 화면을 바꿔 가상 카메라로 내보낼 수 있다고 알려져 있습니다. 미국 연방수사국(FBI)은 2025년 1월 공공 경보에서 북한 IT 인력이 원격 채용 화상 면접에서 AI와 얼굴 교체 기술로 신원을 숨기는 사례가 관찰되었다고 밝혔습니다.

넷째, 장면 전체의 생성입니다. 2강에서 본 영상 생성 모델은 얼굴만 바꾸는 단계를 넘어, 인물과 배경, 목소리까지 문장 한 줄로 통째로 만들어 냅니다. 원본 영상이 아예 없어도 되는 단계에 이른 것입니다.

세대대표 기술·시점필요한 재료대표적 악용
오토인코더 교체레딧 'deepfakes'(2017.12)대상 사진 수백~수천 장, 수일 학습비동의 성적 영상물
가상 얼굴 생성StyleGAN(2018.12)없음(실존 인물 불필요)가짜 계정 프로필 사진
원샷 교체roop(2023.7)얼굴 사진 1장지인 합성 성범죄, 사칭
실시간 변조DeepFaceLive 등사전 준비된 얼굴 모델 + 웹캠화상회의 사기, 채용 면접 위장
장면 전체 생성Veo 3·Sora 2(2025)문장 프롬프트가짜 현장·연설 영상

🎙️ 목소리 복제가 걸어온 길

얼굴보다 한발 늦게 주목받았지만, 실제 금전 피해는 음성 쪽에서 먼저 터졌습니다. 2019년 미국 일간지 『월스트리트저널』은 영국의 한 에너지 회사 최고경영자가 독일 모회사 상사의 목소리를 흉내 낸 전화를 받고 22만 유로(약 24만 3,000달러)를 헝가리 계좌로 송금한 사건을 보도했습니다. 피해 회사의 보험사 율러 에르메스(Euler Hermes)는 범인이 상용 음성 생성 소프트웨어를 쓴 것으로 보인다고 밝혔습니다. 피해자는 상사 특유의 독일어 억양과 말투의 리듬까지 똑같았다고 진술했습니다. 송금된 돈은 곧바로 멕시코 등지로 빠져나갔고, 범인이 두 번째 송금을 요구하고 나서야 의심을 받았습니다.

이후 음성 복제는 필요한 표본의 길이가 급격히 줄어드는 방향으로 발전했습니다. 초기에는 대상 인물의 깨끗한 녹음이 수십 분에서 몇 시간 필요했지만, 2강에서 본 것처럼 2023년 연구 모델은 3초 표본으로도 음색을 흉내 낼 수 있다고 발표되었습니다. 영상 플랫폼에 올린 짧은 동영상, 음성 메시지 한 통이 곧 복제의 재료가 될 수 있다는 뜻입니다.

음성이 특히 위험한 이유는 판단 단서가 적기 때문입니다. 영상은 조명이나 경계선의 어색함을 살필 여지라도 있지만, 전화 통화는 음질이 원래 낮아서 합성 특유의 잡음이 자연스럽게 묻힙니다. 여기에 "급하다", "비밀로 하라" 같은 압박이 더해지면 의심할 시간 자체가 사라집니다. 국내에서도 가족의 목소리를 흉내 내 납치를 가장하는 수법에 대한 주의 경보가 이어지고 있습니다.

📉 제작 문턱의 급격한 하락이 바꾼 것

지금까지의 흐름을 한 문장으로 줄이면 '필요한 재료와 기술은 줄고, 결과물의 품질은 올라갔다'입니다. 이 변화가 위험을 어떻게 바꿨는지 세 가지로 정리해 보겠습니다.

항목2017년 전후2025년 이후
필요한 얼굴 자료수백~수천 장사진 1장 또는 불필요
필요한 음성 자료수십 분 이상수 초 수준(연구 발표 기준)
제작 시간학습에 수일실시간~수 분
요구 전문성코드 실행·환경 설정 능력앱·웹 서비스 조작 수준

첫째, 표적이 넓어졌습니다. 재료가 많이 필요하던 시절에는 영상 자료가 풍부한 유명인이 주된 대상이었습니다. 사진 한 장이면 충분해지자 소셜미디어에 사진을 올린 평범한 사람, 특히 학생들이 피해자가 되었습니다. 2024년 한국에서 불거진 지인 합성 성범죄가 바로 이 변화의 결과입니다.

둘째, 품질이 낮아도 효과가 있습니다. 2022년 3월 해킹된 우크라이나 방송 '우크라이나 24'의 웹사이트와 자막을 통해, 볼로디미르 젤렌스키 대통령이 군에 항복을 지시하는 딥페이크 영상이 유포되었습니다. 머리와 몸의 비율이 어색하고 목소리도 달라 금방 들통났고 메타·유튜브 등이 신속히 삭제했지만, 전쟁 중인 나라의 지휘 체계를 흔들려는 시도가 실제로 있었다는 점에서 기록에 남았습니다. 위기 상황에서는 몇 분의 혼란만으로도 목적을 이룰 수 있다는 점을 기억해야 합니다.

셋째, 판별의 무게중심이 옮겨 갔습니다. 초기 딥페이크는 눈을 거의 깜빡이지 않거나 얼굴 경계가 번지는 등 맨눈으로 찾을 수 있는 흔적이 많았습니다. 그러나 그런 흔적은 다음 세대 기술에서 빠르게 보완되었습니다. 이제는 '이 영상이 이상하게 생겼는가'보다 '이 영상은 어디서 처음 나왔고, 누가 확인했는가'를 묻는 편이 훨씬 믿을 만합니다. 이 관점은 10강의 탐지 기술과 17강의 판별 체크리스트로 이어집니다.

흔한 오해도 하나 짚어 두겠습니다. "딥페이크는 유명인이나 정치인 문제"라는 생각입니다. 통계와 사건이 보여 주듯 피해의 대다수는 평범한 개인에게 돌아갔고, 기업의 송금 담당자, 채용 담당자처럼 '확인 절차의 한 칸'을 맡은 사람이 주된 표적이 되고 있습니다.

📝 핵심 요약과 다음 강 예고

  • 전사(前史): Face2Face(2016), Synthesizing Obama(2017) 등 연구실에서 얼굴·입 모양 조작 가능성이 먼저 입증되었습니다.
  • 명칭의 기원: 2017년 12월 레딧 이용자 'deepfakes'의 얼굴 합성 성적 영상이 보도되며 이름이 굳어졌고, 초기 딥페이크의 96%가 비동의 성적 영상물이었습니다(2019).
  • 기술 세대: 오토인코더 교체 → 가상 얼굴 생성 → 사진 한 장 교체 → 실시간 변조 → 장면 전체 생성.
  • 음성: 2019년 22만 유로 사기를 시작으로, 필요한 표본이 수 초 수준까지 줄었습니다.
  • 핵심 변화: 제작 문턱이 낮아지며 표적이 일반인으로 넓어졌고, 판별의 기준이 '생김새'에서 '출처'로 옮겨 가고 있습니다.

이처럼 거짓 콘텐츠를 만드는 수단은 다양해졌지만, 그 모두를 '가짜뉴스'라는 한 단어로 부르면 대응도 뭉툭해집니다. 다음 4강 「허위정보·오정보·악의정보 구분」에서는 의도와 진위를 기준으로 거짓 정보를 정확히 나누는 국제적 분류 틀을 배우고, 왜 이 구분이 법과 플랫폼 정책에서 중요한지 살펴보겠습니다.

📚 참고 자료

관련 주제

  • 딥페이크 역사
  • 오토인코더
  • Face2Face
  • StyleGAN
  • 원샷 얼굴 교체
  • 실시간 딥페이크
  • 음성 복제 사기
  • 젤렌스키 딥페이크
  • 제작 문턱
  • 시사
  • 시사 강의
  • AI 허위정보와 딥페이크 — 진실의 위기
  • 무료강의
  • 무료 온라인 강의
  • NUGUNA
  • 누구나

📚 시리즈 전체 공유

AI 허위정보와 딥페이크 — 진실의 위기

이 강의가 속한 시리즈는 총 7강, 모두 무료입니다. 처음부터 배우려는 동료에게 시리즈 전체를 알려 주세요.

댓글

0/1000

불러오는 중...