AI는 어떻게 영상을 만들까?
2024년 2월, 오픈AI 사무실의 몇몇 연구원들은 한 문장을 입력했습니다.
“도쿄 거리를 걷는 한 여성. 네온사인이 반사된 비 오는 밤거리.”
몇 분 후, 화면에 나타난 것은 놀랍게도 실제 촬영본처럼 보이는 1분짜리 영상이었습니다. 카메라가 인물을 따라 움직였고, 빗물 웅덩이에 네온 간판이 정확한 각도로 반사되었으며, 여성의 코트 자락이 바람에 자연스럽게 흔들렸습니다. 이 영상을 만든 것은 카메라도, 촬영 스태프도, 조명 감독도 아니었습니다. 단 한 줄의 텍스트와 ‘소라(Sora)’라는 이름의 인공지능이었습니다.
이 장면을 처음 본 사람들의 반응은 거의 비슷했습니다. “이게 정말 가짜라고?” 실제로 소라가 만든 영상 중 일부는 전문가들조차 실사 촬영본과 구분하지 못할 정도였습니다. 그런데 여기서 정말 신기한 질문이 하나 생깁니다. 이 AI는 카메라로 무언가를 찍은 적이 단 한 번도 없습니다. 배우를 고용한 적도, 조명을 세팅한 적도 없습니다. 그런데 어떻게 빛이 반사되는 방식을, 옷감이 바람에 흔들리는 물리 법칙을, 컵이 떨어지면 깨진다는 사실을 ‘알고’ 있었을까요?
답은 의외로 우리가 흔히 상상하는 것과 다릅니다. AI는 그림을 그리듯 영상을 만들지 않습니다. 오히려 정반대에 가깝습니다. AI는 완전히 부서진 세상, 즉 순수한 노이즈(잡음)에서 출발해서, 그것을 조금씩 ‘지워나가며’ 하나의 장면을 조각해냅니다. 마치 대리석 덩어리 속에 이미 형상이 숨어있다고 믿고 필요 없는 부분을 깎아낸 미켈란젤로처럼 말이지요. 이 글에서는 이 신비로운 과정, 그러니까 무無에서 영상이 태어나는 그 순간의 비밀을 하나씩 풀어보려 합니다. 다 읽고 나면 여러분은 유튜브에서 마주치는 ‘AI가 만든 영상인지 아닌지 애매한’ 그 수많은 클립들이 어떤 원리로 만들어지는지, 왜 손가락이 여섯 개로 나오고 컵의 물이 이상하게 흐르는지, 그리고 이 기술이 앞으로 우리 삶을 어떻게 바꿀지 명확한 그림을 그릴 수 있게 될 것입니다.
왜 이것이 중요한가
영상은 인류가 만든 가장 정보량이 많은 매체입니다. 사진 한 장이 천 마디 말과 같다면, 영상은 그 사진이 초당 24장씩 쏟아지는 것과 같습니다. 그래서 오랫동안 ‘영상 제작’은 소수의 전문가만이 할 수 있는 영역이었습니다. 카메라, 조명, 배우, 편집자, 그리고 무엇보다 시간과 돈이 필요했습니다. 광고 한 편을 찍는 데 수천만 원, 영화 한 편에는 수백억 원이 들어가는 것이 당연했습니다.
그런데 AI 영상 생성 기술은 이 진입 장벽을 근본적으로 무너뜨리고 있습니다. 이제는 스마트폰 하나만 있어도 문장 몇 줄로 영화 같은 장면을 만들어낼 수 있는 시대가 열렸습니다. 이것이 왜 중요할까요? 첫째, 창작의 민주화입니다. 자본이 없던 개인 창작자도 이제 할리우드급 영상미를 시도해볼 수 있습니다. 둘째, 산업 구조의 재편입니다. 광고, 영화, 게임, 교육 콘텐츠 산업 전체가 이 기술을 중심으로 빠르게 재조정되고 있습니다. 셋째, 그리고 가장 무거운 문제인데, 진짜와 가짜의 경계가 흐려지고 있다는 점입니다. 이제는 ‘내가 보는 영상이 실제로 일어난 일인가’라는 질문을 매번 던져야 하는 시대가 되었습니다. 이 기술의 원리를 이해하는 것은 단순한 기술 교양을 넘어, 앞으로 우리가 살아갈 정보 환경을 이해하는 열쇠이기도 합니다.
역사적·사회적 배경
AI가 영상을 만들기까지의 길은 생각보다 오래되고 굴곡졌습니다. 2014년, 이안 굿펠로우라는 연구자가 ‘GAN(생성적 적대 신경망)’이라는 개념을 발표했습니다. 두 개의 AI가 서로 경쟁하며 학습하는 방식이었죠. 하나는 가짜 이미지를 만드는 ‘위조범’ 역할을, 다른 하나는 진짜와 가짜를 구별하는 ‘감별사’ 역할을 맡습니다. 위조범은 감별사를 속이기 위해 점점 더 정교해지고, 감별사는 위조범을 잡아내기 위해 점점 더 예리해집니다. 이 창과 방패의 싸움 속에서 놀랍도록 진짜 같은 이미지가 탄생했습니다. GAN은 사실적인 합성 이미지 기술을 크게 발전시킨 중요한 전환점이었습니다. 이후 GAN과 오토인코더, 얼굴 교체 기술 등이 함께 발전하면서 오늘날의 딥페이크와 생성 이미지 기술이 확산됐습니다.
하지만 GAN에는 치명적인 약점이 있었습니다. 학습이 불안정했고, 특히 ‘시간’이라는 차원, 즉 동영상처럼 연속된 프레임을 일관성 있게 만드는 데는 크게 취약했습니다. 프레임 하나하나는 그럴듯한데, 연결하면 인물의 얼굴이 조금씩 바뀌거나 배경이 흔들리는 문제가 계속 발생했습니다.
전환점은 2020년대 초반, ‘디퓨전 모델(확산 모델)’이라는 완전히 다른 접근법이 등장하면서 찾아왔습니다. 이 아이디어의 원천은 놀랍게도 물리학의 열역학이었습니다. 잉크 한 방울을 물에 떨어뜨리면 서서히 퍼져나가 결국 물 전체에 고르게 흩어집니다. 이 과정을 거꾸로 되돌릴 수 있다면 어떨까요? 흩어진 잉크 분자들을 다시 한 방울로 모을 수 있다면? 디퓨전 모델은 정확히 이 발상을 이미지에 적용했습니다. 선명한 사진에 노이즈를 조금씩 더해 완전한 잡음으로 만드는 과정을 AI에게 학습시킨 뒤, 그 과정을 거꾸로 돌리는 법을 가르친 것입니다. 즉 잡음에서 시작해 한 단계씩 잡음을 제거하면, 결국 그럴듯한 이미지가 남는다는 원리입니다.
이 방식은 이미지 생성에서 먼저 폭발적인 성공을 거두었습니다. 미드저니, 달리(DALL-E), 스테이블 디퓨전 같은 이름을 한 번쯤 들어보셨을 겁니다. 문제는 여기서 시간 축을 어떻게 더할 것인가였습니다. 정지된 그림 한 장을 만드는 것과, 24장의 그림이 자연스럽게 이어지는 1초짜리 영상을 만드는 것은 차원이 다른 난이도였습니다. 2024년 2월, 오픈AI가 이 문제에 대한 해법을 담아 내놓은 결과물이 바로 ‘소라’였고, 이후 구글의 ‘베오(Veo)’, 알리바바의 ‘완(Wan)’, 중국 콰이쇼우의 ‘클링(Kling)’ 등 경쟁자들이 잇따라 등장하며 지금의 AI 영상 생성 춘추전국시대가 열리게 되었습니다.
AI는 실제로 어떻게 영상을 ‘조각’하는가
어떻게 1 — 세상을 잘게 쪼개기: 시공간 패치
가장 먼저 이해해야 할 것은, AI가 영상을 ‘통째로’ 인식하지 않는다는 사실입니다. 대신 영상을 아주 작은 조각들, 이른바 ‘시공간 패치(spatio-temporal patch)’로 잘게 쪼갭니다. 사진 한 장을 작은 정사각형 타일로 나누는 것을 상상해보세요. 여기에 ‘시간’이라는 축을 하나 더 얹으면, 하나의 타일은 공간(가로세로 위치)뿐 아니라 시간(몇 번째 프레임인지)까지 포함하는 작은 정육면체 조각이 됩니다.
왜 이렇게 복잡하게 쪼갤까요? 이유는 컴퓨터가 언어를 다루는 방식에서 힌트를 얻었기 때문입니다. 챗GPT 같은 언어 모델이 문장을 ‘토큰’이라는 작은 단어 조각으로 나누어 처리하듯이, 영상 생성 AI는 영상을 이런 시공간 패치라는 ‘영상 토큰’으로 나누어 처리합니다. 이렇게 하면 1초짜리 짧은 영상이든 1분짜리 긴 영상이든, 세로로 긴 화면이든 가로로 넓은 화면이든 같은 방식으로 다룰 수 있게 됩니다. 마치 레고 블록으로 작은 자동차도, 커다란 성도 만들 수 있는 것과 비슷한 유연함입니다.
어떻게 2 — 잡음 속에서 형상을 찾아내는 디퓨전 과정
이제 진짜 핵심입니다. AI는 이 패치들이 가득한 캔버스를 순수한 ‘스노우 노이즈’ 상태, 그러니까 텔레비전 채널이 안 잡힐 때 나오는 지지직거리는 화면 같은 완전한 무작위 상태에서 시작합니다.
그리고 여기서부터 AI는 마치 안개 속에서 형체를 알아보려 애쓰는 사람처럼 행동합니다. “이 노이즈 안에 ‘도쿄 거리를 걷는 여성’이 숨어 있다고 치면, 지금 이 픽셀은 얼마나 노이즈에 가깝고 얼마나 진짜 그림에 가까울까?”를 계산합니다. 그리고 아주 조금, 노이즈를 걷어냅니다. 이 과정을 수십 번, 많게는 수백 번 반복합니다. 한 겹 한 겹 안개가 걷히듯, 처음에는 흐릿한 색 덩어리였던 것이 점점 인물의 윤곽이 되고, 그 다음엔 옷의 질감이 되고, 마지막엔 빗방울에 반사된 네온사인의 색감까지 선명해집니다.
이 과정이 정지 이미지에서만 일어나는 것이 아니라, 앞서 만든 시공간 패치 전체, 즉 시간 축을 포함한 전체 영상 덩어리에 동시에 일어난다는 점이 핵심입니다. 그래서 프레임 하나하나가 따로 노는 게 아니라, 마치 조각가가 대리석 덩어리 전체를 조금씩 깎아내며 형상을 완성하듯, 전체 영상이 한 몸처럼 서서히 완성되는 것입니다.
어떻게 3 — 방향을 잡아주는 나침반: 트랜스포머와 조건화
그런데 여기서 의문이 생깁니다. 노이즈를 지운다고 아무 형상이나 나오는 게 아니라, 왜 하필 ‘도쿄 거리를 걷는 여성’이 나올까요? 여기에 필요한 것이 바로 ‘조건화(conditioning)’라는 나침반입니다.
사용자가 입력한 텍스트 프롬프트는 먼저 언어 모델을 거치며 아주 상세한 설명으로 다시 쓰입니다. 예를 들어 “도쿄 거리를 걷는 여성”이라는 짧은 문장은 내부적으로 “저녁 시간, 비에 젖은 아스팔트, 걷는 속도, 카메라 앵글, 주변 간판의 색감” 등을 포함한 훨씬 풍부한 묘사로 확장됩니다. 이를 ‘리캡셔닝(recaptioning)’이라고 부릅니다.
이렇게 풍부해진 설명은 노이즈를 지우는 매 단계마다 “지금 이 방향이 맞는 방향이야”라고 계속 신호를 보내는 나침반 역할을 합니다. 이 신호를 처리하고 전체 장면의 논리적 일관성(카메라가 오른쪽으로 움직였으면 다음 프레임에서도 그 방향으로 이어져야 한다는 등)을 유지시켜주는 것이 ‘트랜스포머’라는 구조입니다. 트랜스포머는 문장 속 단어들이 서로 어떻게 연관되는지를 파악하는 데 뛰어난 기술인데, 이를 영상에 적용하면 “이 프레임의 이 부분이, 다음 프레임의 어느 부분과 이어져야 하는가”를 파악하는 데 사용됩니다.
그래서? — 놀랍게도 ‘물리학’을 흉내 내게 된 이유
여기까지 오면 자연스레 드는 생각이 있습니다. “이 AI, 물리 법칙을 따로 배운 것도 아닌데 어떻게 컵이 떨어지면 깨지고, 연기가 위로 피어오르는 걸 알까?”
답은 단순하지만 강력합니다. AI는 물리 법칙을 ‘이해’한 것이 아니라, 수억 개의 실제 영상을 보면서 그런 일이 ‘항상 그렇게 일어난다’는 통계적 패턴을 몸에 새긴 것입니다. 유리잔이 바닥에 떨어지는 영상을 수백만 번 보면, “떨어짐 → 충돌 → 파편이 사방으로 흩어짐”이라는 순서가 노이즈를 지우는 과정에서 가장 ‘그럴듯한’ 경로로 자리 잡습니다. 물의 표면이 빛을 반사하는 방식, 천이 바람에 나부끼는 방식도 마찬가지입니다. AI에게 뉴턴의 운동법칙을 가르친 사람은 아무도 없지만, 그런 법칙을 따르는 수많은 사례를 보여주었더니 결과적으로 물리 법칙을 ‘흉내 내는’ 능력이 저절로 생겨난 셈입니다.
그런데 이 지점이 동시에 AI 영상의 가장 유명한 약점이 시작되는 지점이기도 합니다. AI는 ‘규칙’을 아는 것이 아니라 ‘패턴’을 아는 것이기 때문에, 훈련 데이터에 별로 없던 상황, 예를 들어 손가락이 복잡하게 겹치는 장면이나 거울에 비친 모습, 텍스트 글자 같은 것에서는 여전히 어색한 결과물이 나옵니다. 손가락이 여섯 개가 되거나, 배경의 간판 글씨가 알아볼 수 없는 이상한 문자가 되는 이유가 바로 여기에 있습니다. 통계적으로 흔한 패턴은 기가 막히게 잘 만들지만, 흔치 않고 정교한 디테일 앞에서는 아직 허점을 드러내는 것입니다.
실제 사례
2024년 오픈AI가 소라를 처음 공개했을 때 함께 선보인 데모 영상 중 하나는 “매머드가 눈 덮인 초원을 걷는” 장면이었습니다. 매머드는 지구상에 실제로 존재하지 않으므로 참고할 실제 촬영본이 있을 수 없습니다. 그런데도 AI는 코끼리, 눈밭 위 동물들의 걸음걸이, 매머드에 대한 그림과 화석 복원도 등 방대한 간접 자료를 조합해 그럴듯한 걸음걸이와 털의 흔들림을 만들어냈습니다. 이는 AI가 단순히 ‘기존 영상을 짜깁기’하는 것이 아니라, 학습한 물리적·시각적 규칙을 새로운 조합에도 적용할 수 있음을 보여준 사례로 회자되었습니다.
이후 2025년 하반기에 공개된 소라 2는 여기서 한 걸음 더 나아가, 사용자가 자신의 얼굴이나 목소리를 등록하면 스스로가 등장하는 영상을 만들 수 있는 ‘카메오’ 기능을 선보였습니다. 동시에 대사와 음향 효과까지 함께 생성하는 능력을 갖추면서, 영상 제작에서 ‘편집’의 개념 자체를 흔들어놓았습니다. 비슷한 시기 구글의 베오 시리즈는 음성과 배경음까지 통합해서 생성하는 데 강점을 보이며, 실사에 가까운 화질로 광고 업계에서 특히 주목받았습니다. 실제로 국내외 여러 광고 대행사들은 시제품(프로토타입) 광고 영상을 제작할 때, 예전 같으면 며칠씩 걸리던 스토리보드 시각화 작업을 이제는 몇 시간 만에 AI로 끝내고, 클라이언트 확인을 받은 뒤에야 실제 촬영에 들어가는 방식으로 작업 흐름을 바꾸고 있습니다.
교육 분야에서도 변화가 감지됩니다. 역사 다큐멘터리 제작자들은 실제 자료 화면이 없는 고대 사건, 예를 들어 폼페이 화산 폭발 당시 거리의 모습이나 중세 도시의 일상 같은 장면을 재연 배우와 세트 없이 AI로 시각화하는 시도를 늘려가고 있습니다. 물론 이런 시도에는 “역사적 사실과 AI의 상상이 뒤섞여도 괜찮은가”라는 새로운 윤리적 질문도 함께 따라옵니다.
주요 AI 영상 생성 모델은 무엇이 다른가
2026년 현재 시장에는 여러 AI 영상 모델이 경쟁하고 있으며, 저마다 강점이 다릅니다. 아래 표는 대표적인 모델들의 특징을 비교한 것입니다.
| 모델 (개발사) | 강점 | 상대적 약점 | 대표 활용 분야 |
|---|---|---|---|
| 소라 2 (오픈AI) | 이야기 전개의 자연스러움, 역동적인 움직임, 대사·음향 동시 생성 | 장시간 생성 시 화질 뭉개짐 현상 | 내러티브 중심 콘텐츠, 영화적 연출 |
| 베오 3.1 (구글 딥마인드) | 실사에 가까운 화질, 통합 오디오 생성 | 상대적으로 높은 비용 | 광고, 고화질 프로덕션 |
| 완 2.6 (알리바바) | 빠른 생성 속도, 저렴한 비용 | 최상급 화질 대비 다소 아쉬운 디테일 | 프로토타입 제작, 스토리보드, 빠른 아이디어 검증 |
| 클링 (콰이쇼우) | 인물 동작의 자연스러움 | 서구권 대비 상대적으로 낮은 인지도 | 소셜미디어 숏폼 콘텐츠 |
이 표에서 알 수 있듯, ‘가장 뛰어난 하나의 모델’은 존재하지 않습니다. 영화 같은 서사가 필요하면 소라나 베오를, 빠르게 아이디어만 확인하고 싶다면 완처럼 가볍고 빠른 모델을 선택하는 식으로, 목적에 따라 도구를 골라 쓰는 시대가 된 것입니다. 이는 마치 사진 한 장을 찍을 때도 전문가용 카메라와 스마트폰 카메라를 상황에 따라 골라 쓰는 것과 비슷한 이치입니다.
오늘날 우리에게 주는 의미
AI 영상 생성 기술은 이제 막 대중화의 문턱을 넘고 있습니다. 이것이 우리 삶에 던지는 의미는 크게 세 갈래로 나뉩니다.
첫째, 창작자에게는 기회의 확장입니다. 예전이라면 억대의 제작비가 필요했던 시각적 표현이 이제는 누구나 접근할 수 있는 영역이 되었습니다. 웹툰 작가가 자신의 작품을 짧은 애니메이션으로 만들어보거나, 소상공인이 전문 스튜디오 없이 제품 광고 영상을 만드는 일이 가능해졌습니다.
둘째, 소비자에게는 새로운 형태의 ‘분별력’이 요구됩니다. 진짜 촬영본과 AI 생성 영상의 경계가 점점 흐려지면서, “이 영상이 실제로 일어난 일을 담고 있는가”를 스스로 판단해야 하는 부담이 커졌습니다. 뉴스나 시사 정보를 접할 때 출처를 확인하는 습관이 그 어느 때보다 중요해진 이유입니다.
셋째, 사회 전체로는 저작권과 초상권, 가짜 정보에 대한 새로운 규범을 만들어야 하는 숙제가 남았습니다. 실존 인물과 매우 닮은 얼굴을 동의 없이 영상에 등장시키는 문제, AI가 학습한 원본 영상의 저작권 문제 등은 아직 명확한 사회적 합의에 이르지 못한 영역입니다. 기술의 발전 속도가 제도의 정비 속도보다 빠르다는, 익숙하지만 여전히 풀리지 않은 딜레마가 이 분야에서도 반복되고 있는 셈입니다.
결국 이 기술을 대하는 가장 현명한 태도는 두 가지를 동시에 갖는 것입니다. 새로운 창작 도구가 열어주는 가능성에 열려 있으면서도, 화면 속 장면을 무조건 있는 그대로 믿지 않는 건강한 의심을 함께 갖추는 태도 말입니다.
핵심 정리
- AI는 영상을 ‘그리는’ 것이 아니라, 순수한 노이즈에서 출발해 이를 점진적으로 ‘지워나가며’ 형상을 만들어내는 디퓨전(확산) 방식으로 작동한다.
- 영상은 시간과 공간을 함께 담은 작은 조각인 ‘시공간 패치’로 잘게 쪼개져 처리되며, 이 덕분에 길이와 화면 비율이 다른 다양한 영상을 유연하게 만들 수 있다.
- 텍스트 프롬프트는 훨씬 상세한 설명으로 재구성된 뒤, 노이즈를 지우는 매 단계에서 방향을 잡아주는 나침반 역할을 한다.
- AI가 물리 법칙을 따르는 듯 보이는 것은 실제 물리학을 이해해서가 아니라, 방대한 실제 영상 속 패턴을 통계적으로 학습했기 때문이다.
- 2026년 현재 소라, 베오, 완, 클링 등 여러 모델이 각자의 강점을 앞세워 경쟁하고 있으며, 목적에 맞는 도구 선택이 중요해졌다.
- 기술의 발전은 창작의 민주화라는 기회와, 진위 판별이라는 새로운 과제를 동시에 던지고 있다.
오늘의 한 문장
AI는 세상을 그리는 것이 아니라, 잡음 속에 숨어 있던 가능성을 조각조각 깎아내어 세상을 ‘드러낸다’.
FAQ
Q1. AI 영상 생성 기술의 원리를 한 문장으로 설명하면 무엇인가요? A. 완전한 잡음(노이즈) 상태에서 시작해, 텍스트 프롬프트를 나침반 삼아 노이즈를 단계적으로 제거하면서 하나의 완성된 영상 장면을 만들어내는 ‘디퓨전(확산)’ 방식입니다.
Q2. 소라, 베오, 클링 중 어떤 AI 영상 생성 모델이 가장 좋은가요? A. 절대적으로 ‘가장 좋은’ 모델은 없으며 목적에 따라 다릅니다. 영화적인 서사와 음향까지 원한다면 소라나 베오가, 빠르고 저렴하게 아이디어를 검증하고 싶다면 완 같은 모델이 더 적합합니다.
Q3. AI가 만든 영상은 실제 영상과 어떻게 구별하나요? A. 완벽한 구별법은 아직 없지만, 손가락 개수나 형태의 부자연스러움, 배경 속 글자가 뭉개지는 현상, 물체가 갑자기 사라지거나 나타나는 장면 전환의 어색함 등이 여전히 흔한 단서로 꼽힙니다. 다만 기술 발전 속도가 빨라 이런 단서도 점점 줄어들고 있습니다.
Q4. AI 영상 생성 기술은 왜 물리 법칙을 이해하는 것처럼 보이나요? A. 실제로 물리학을 학습한 것이 아니라, 수억 개의 실제 영상 속에서 반복적으로 나타나는 패턴(예: 물체가 떨어지면 깨진다)을 통계적으로 학습했기 때문에 마치 물리 법칙을 아는 것처럼 행동하는 것입니다.
Q5. AI 영상 생성 기술이 저작권 문제를 일으키나요? A. 네, 현재 가장 뜨거운 논쟁거리 중 하나입니다. AI가 학습에 사용한 원본 영상의 저작권 문제, 실존 인물과 닮은 얼굴을 동의 없이 생성하는 초상권 문제 등이 아직 사회적·법적으로 명확히 정리되지 않은 상태입니다.