AI 롱폼 제작 A to Z (프롬프트 전부 공개)

“AI 롱폼, 도대체 어디서부터 시작해야 할지 막막하셨죠?

AI로 유튜브 영상 만든다는 얘기는 많이 들었는데, 막상 시작하려니 어떤 툴을 써야 할지, 프롬프트는 어떻게 짜야 할지 막막하셨던 분들 많으실 거예요.

이 글 하나면 스크립트 작성부터 이미지·영상 생성, 편집, 썸네일까지 10분짜리 AI 롱폼 한 편을 처음부터 끝까지 만드실 수 있습니다.

사용한 프롬프트도 전부 공개했으니, 복붙해서 따라오기만 하시면 돼요.

심리학 채널을 예시로 들었지만, 주제만 바꾸면 어떤 분야든 똑같이 적용할 수 있습니다.

  1. 벤치마킹할 채널 분석하기

AI 롱폼을 만들 때 가장 먼저 해야 할 일은 잘 되고 있는 채널을 찾아 분석하는 것입니다. 맨땅에서 주제를 짜내는 것보다, 이미 검증된 채널의 성공 공식을 참고하는 게 훨씬 빠르고 안전하거든요.

제가 선택한 채널: 한눈에 심리학

개설일: 2025년 12월 21일 (약 5개월 전)

구독자: 7만 명 돌파

영상 개수: 33개

5개월 만에 영상 33개로 구독자 7만 명을 모은 건 정말 잘하고 있는 채널입니다. 그중에서도 제가 주목한 건 조회수 82만을 기록한 영상이에요. 이 영상이 어떤 구조와 후킹 요소를 갖고 있는지 분석해서, 같은 공식으로 새로운 심리학 영상을 만들어볼 겁니다.

💡 참고: 단순히 주제를 똑같이 베끼는 게 아니라, 구조와 패턴만 참고하고 내용은 완전히 새로 만들어야 합니다. 그래야 저작권에서 안전하고, 독자적인 채널로 키워나갈 수 있어요.

  1. 스크립트 만들기 (대본 작성)

대본은 AI 롱폼의 뼈대입니다. 이 단계만 잘 잡으면 나머지 작업(이미지, 영상, 편집)은 그냥 끼워 맞추는 일이에요. 그래서 가장 공을 많이 들여야 하는 단계입니다.

전체 흐름은 이렇습니다:

원본 영상 스크립트 추출 → 줄거리 분석 → 새 주제 추천받기 → 기승전결 뼈대 만들기 → 5000자 대본 완성

⚠️ 저작권 주의 : 원본 영상을 그대로 따라하면 저작권에 위반됩니다. 반드시 다른 내용으로 진행해주세요. 대본을 완성한 뒤에는 AI에게 “원본과 얼마나 비슷한지” 물어보고, 최대 20% 정도만 유사하게 조정하는 걸 추천합니다.

2-1. 원본 영상 스크립트 추출하기

먼저 1단계에서 골라둔 벤치마킹 영상의 스크립트를 가져옵니다.

  1. 인기 있는 영상을 클릭합니다.

저는 이 영상을 선택했습니다.

  1. 영상 설명란에서 스크롤을 살짝 내리면 ‘스크립트 표시’ 버튼이 있습니다. 버튼을 클릭합니다.

  2. 전체 스크립트 내용을 복사합니다.

2-2. AI로 줄거리 분석 + 새 주제 10개 추천받기

복사한 스크립트를 가지고 제미나이, GPT, 클로드 중 사용하시는 AI 툴로 이동합니다. 저는 젠스파크의 제미나이를 사용했어요.

  1. 먼저 줄거리를 파악하게 합니다.

  2. 그다음 같은 주제의 다른 콘텐츠를 추천받습니다.

그러면 이렇게 후킹 요소가 있는 가제목 10개를 추천해줍니다.

💡 마음에 드는 제목이 없다면 “더 추천해줘”라고 하면 다른 주제를 다시 추천해줍니다.

저는 7번 “절대 잊어버리지 않는 천재들의 꼼수 암기법 (해마를 자극하는 ‘기억의 궁전’)” 이 마음에 들어서 이걸로 진행할게요.

2-3. 기승전결 뼈대 만들기

주제를 정했다면 이제 대본의 뼈대를 잡습니다. 여기서 가장 중요한 건 기승전결 구조를 반드시 요청하는 것이에요. 이 구조 없이 대본을 뽑으면 단조롭고 지루해져서 시청자가 중간에 이탈하기 쉽습니다.

2-4. 결과가 마음에 안 들 때 — 원본과 비교시키기

그런데 첫 결과물이 너무 추상적이고 설명조로 나왔어요. “~을 다룹니다”, “~을 설명합니다” 같은 메타 설명만 가득해서 실제 대본으로 쓰기엔 부족했습니다.

[저의 결과]

기 (도입): 평범한 뇌를 천재의 뇌로 바꾸는 마법의 열쇠

시청자들의 일상적인 고충을 건드리며 강렬한 호기심을 유발하는 단계입니다. 밤새워 영어 단어나 역사 연도를 달달 외웠지만, 다음 날 아침이면 거짓말처럼 백지상태가 되어버리는 허탈한 경험을 상기시킵니다. 그리고 세계 기억력 대회에서 수백 개의 무작위 숫자나 카드 팩을 단 몇 분 만에 완벽하게 외우는 ‘기억력 챔피언’들의 이야기를 꺼냅니다. 시청자들은 이들이 타고난 천재일 것이라고 생각하지만, 사실 이들의 뇌를 MRI로 촬영해 보면 일반인과 물리적인 구조가 전혀 다르지 않다는 충격적인 사실을 밝힙니다. 단지 이들은 뇌가 정보를 받아들이는 아주 특별한 ‘꼼수’를 하나 알고 있을 뿐이며, 고대 로마 시대부터 이어져 온 이 비법이 바로 오늘 소개할 ‘기억의 궁전(Method of Loci)‘이라는 점을 강조하며 본격적인 이야기를 시작합니다.

이럴 땐 그냥 “다시 써줘”보다 원본 대본과 비교하게 만드는 게 훨씬 효과적입니다.

그러면 AI가 두 대본을 객관적으로 분석해줍니다. 제 경우엔 이런 결과가 나왔어요:

원본 대본은 ‘완벽한 맞춤형 과외’ 를 받는 듯한 구조 — 강력한 공감 → 과학적 원인 → 5단계 빌드업 → 3일 실천 루틴으로 이어지는 구조.시청자가 느끼는 재미는 예능적 웃음이 아니라 “아, 내가 이래서 공부를 못했구나!” 라는 유레카(깨달음)의 쾌감.

분석 결과를 보니 원본 구조가 훨씬 좋아 보였습니다. 문제 제기 → 과학적 원인 → 단계별 해결책 → 실천 루틴 흐름을 그대로 가져가되, 기승전결로 재구성하기로 했어요.

이번엔 훨씬 마음에 들게 나왔습니다.

💡 꿀팁: AI 결과물이 마음에 안 들면 그냥 “다시”라고 하지 말고, 무엇이 왜 부족한지 비교 분석을 시킨 다음 다시 요청하세요. 결과물 퀄리티가 확 달라집니다.

2-5. 완성본 요청 + 불필요한 요소 제거

대본을 읽어봤을 때 마음에 들면 그대로 가시고, 아쉬운 부분이 있다면 구체적으로 어느 부분이 왜 아쉬운지 짚어서 다시 요청하시면 됩니다.

그런데 보통 AI가 대본을 줄 때 이런 화면 지시문이 함께 붙어 나오는 경우가 있습니다. 이런 건 나레이션에 그대로 들어가면 안 되니까 제거 요청을 합니다.

이제 깔끔한 나레이션 대본만 남았습니다.

2-6. 클로드로 분량 확장하기 (5000자 이상)

여기까지 받은 대본은 분량이 너무 적습니다. 10분짜리 롱폼을 만들려면 최소 5000자 이상은 필요해요. 그래서 클로드로 넘어갑니다.

💡 왜 클로드로 넘어가는가? 분량이 긴 대본을 자연스럽게 풀어내는 데는 클로드가 강합니다. 제미나이는 구조 짜기와 아이디어 추천에 강하고, 클로드는 긴 글쓰기에 강해서 도구를 바꿔 쓰는 게 효율적입니다.

클로드가 5000자 이상의 풍성한 대본을 뽑아줍니다. 한 번 읽어보시고 어색한 부분이 없다면 이대로 사용하시면 됩니다.

📌 2단계 핵심 요약

원본 영상 스크립트 추출 (유튜브 스크립트 표시 기능)

제미나이/GPT로 새 주제 10개 추천받기

마음에 드는 주제로 기승전결 뼈대 요청

결과가 별로면 원본과 비교 분석시킨 뒤 재요청

화면 지시문 등 불필요한 요소 제거

클로드로 넘어가서 5000자 이상으로 확장

⚠️ 원본과의 유사도는 20% 이내로 유지하세요!

  1. 이미지 만들기

🛠 사용 도구: 제미나이(스타일 분석 + 프롬프트 생성) + 나노바나나(이미지 생성)

대본이 완성됐다면 이제 영상에 들어갈 이미지를 만들 차례입니다.

전체 흐름은 이렇습니다:

스타일 정하기 → 스타일 프롬프트 추출 → 문장별 이미지 프롬프트 생성 → 테스트 이미지 1장 생성 → 전체 이미지 일괄 생성

3-1. 어떤 스타일로 갈지 정하기

먼저 벤치마킹 채널의 영상을 다시 한번 살펴봅니다. 어떤 캐릭터, 어떤 화풍을 쓰는지 파악하기 위해서예요.

심리학 채널들을 분석해보니 대부분 두 가지 스타일 중 하나를 씁니다:

💡 심리학 채널 이미지 스타일 두 가지  ① 졸라맨 스타일 — 단순한 캐릭터, 제작 부담 적음, 일관성 유지 쉬움 ② 인간 캐릭터 스타일 — 몰입감 좋음, 표정 표현 풍부, 일관성 유지 다소 어려움

처음 만드시는 분이라면 졸라맨 스타일을 추천드립니다. 캐릭터가 단순할수록 매 이미지마다 동일하게 유지하기 쉽거든요. 저도 졸라맨으로 진행할게요.

3-2. 스타일 프롬프트 추출하기

원하는 스타일이 정해졌다면, 그 스타일을 AI가 이해할 수 있는 프롬프트로 바꿔야 합니다. 직접 영어 프롬프트를 짜는 건 어려우니까, 참고 이미지를 캡처해서 AI에게 분석을 맡기는 게 가장 빠릅니다.

그러면 제미나이가 스타일 요소를 분해해서 프롬프트 키워드로 정리해줍니다.

이 키워드 묶음이 앞으로 모든 이미지에 공통으로 들어갈 스타일 베이스입니다. 잘 저장해두세요.

3-3. 문장별 이미지 프롬프트 한번에 생성하기

이제 대본의 각 문장에 맞는 개별 프롬프트를 만들 차례입니다. 이게 이 단계에서 가장 중요한 작업이에요.

💡 핵심 포인트: “각 문장에 맞춰서” 라는 말을 꼭 넣으세요.  이 한 줄이 없으면 AI가 대본 전체를 하나의 이미지로 뭉뚱그려 표현하려 합니다. “각 문장별로”라고 명시해야 문장 수만큼 개별 프롬프트를 뽑아줍니다. 나중에 영상 편집할 때 문장-이미지 매칭이 깔끔해져요. 가끔 문장별로 나오지 않는 경우는 다시 재요청 하시면서 프롬프트를 직접 수정해야합니다.

이렇게 문장 수만큼 개별 프롬프트가 나옵니다

3-4. 테스트 이미지 1장 먼저 생성하기

여기서 바로 모든 이미지를 뽑으면 안 됩니다. 만약 스타일이 마음에 안 들면 수십 장을 다시 만들어야 하거든요.

먼저 1번 프롬프트만 나노바나나에 넣어서 테스트 이미지 한 장을 생성해봅니다.

원하는 느낌으로 나왔는지 꼼꼼히 확인하세요. 캐릭터 생김새, 색감, 분위기가 마음에 들면 다음 단계로, 아쉬우면 3-2의 키워드를 조정한 뒤 다시 테스트합니다.

⚠️ 반드시 체크할 것이미지 비율은 16:9로 설정 (롱폼 영상은 가로형)

캐릭터 생김새가 내가 의도한 것과 일치하는지

배경 톤이 일관되게 나올 수 있는 스타일인지

3-5. 전체 이미지 일괄 생성하기

테스트 이미지가 마음에 들었다면 이제 나머지 프롬프트를 모두 돌려서 전체 이미지를 생성합니다.

💡젠스파크

저는  젠스파크에서 세 가지 AI를 한 화면에서 사용했어요. 프롬프트 생성과 이미지 생성을 같은 창에서 처리할 수 있어 편합니다.

📌 3단계 핵심 요약

벤치마킹 채널의 이미지 스타일 분석 (졸라맨 vs 인간 캐릭터)

참고 이미지 캡처 → 제미나이로 스타일 프롬프트 추출

추출한 스타일 + 대본 → 문장별 이미지 프롬프트 일괄 생성

테스트 이미지 1장 먼저 생성해서 스타일 확인

만족스러우면 나머지 전체 이미지 생성 (비율은 반드시 16:9)

  1. 영상 만들기 (이미지 → 동영상 변환)

🛠 사용 도구: 제미나이(영상 프롬프트 생성) + 그록(영상 생성)

이미지가 모두 준비됐다면 이제 그 이미지들을 움직이는 영상으로 바꿀 차례입니다. 정지 이미지만 쓰면 영상이 단조로워 보이거든요. 핵심 장면들은 짧은 영상(6초 ~ 10초 내외)으로 만들어주면 훨씬 풍성한 롱폼이 됩니다. 저는 6초로 만들어볼게요.

전체 흐름은 이렇습니다:

영상 프롬프트 일괄 생성 → 그록에 이미지 + 프롬프트 입력 → 6초 영상 생성 → 반복

💡 이미지를 전부 영상으로 바꿔야 하나요? 그럴 필요 없습니다. 영상 1개당 생성 시간과 비용이 꽤 들기 때문에, 장면 전환이 큰 부분이나 강조하고 싶은 핵심 장면만 영상으로 만들고 나머지는 이미지로 가도 상관없습니다. 벤치마킹 채널을 참고해서 진행하면 됩니다.

4-1. 영상 프롬프트 일괄 생성하기

3단계에서 이미지 프롬프트를 만들었던 그 대화창에서 바로 이어서 영상 프롬프트를 요청합니다. 같은 맥락에서 이어가야 이미지와 영상의 흐름이 어색하지 않거든요.

4-2. 그록에서 영상 생성하기

프롬프트가 준비됐다면 그록으로 이동합니다. 3단계에서 만든 이미지를 첨부하고, 방금 생성한 영상 프롬프트를 함께 입력하세요.

생성된 영상을 확인하고, 만족스러우면 다음 장면으로 넘어갑니다. 이런 식으로 필요한 모든 장면의 영상을 만드시면 됩니다.

⚠️ 체크리스트이미지와 영상의 캐릭터·스타일이 일치하는지

움직임이 너무 과하지 않고 자연스러운지

영상 비율이 16:9인지

📌 4단계 핵심 요약

3단계 대화창에서 이어서 영상 프롬프트 일괄 생성

그록에 이미지 + 프롬프트 입력해서 6 ~ 10초 영상 생성

  1. 편집하기 (Vrew로 합치기)

🛠 사용 도구: Vrew (TTS + 영상 편집)

이제 만들어둔 이미지와 영상을 하나의 롱폼으로 합칠 차례입니다. 영상 편집 프로그램으로 많이 쓰는 건 캡컷과 Vrew(브루) 두 가지인데, 저는 아티클 작성용이기 때문에 Vrew를 선택했어요.

💡 TTS 도구 선택 가이드Vrew TTS — 무료, 편집과 통합되어 편함

일레븐랩스 — 유료, 가장 자연스러운 음성, 영어 강세

타입캐스트 — 유료, 한국어 음성 퀄리티 최상

📌 Vrew의 자세한 사용법은 공식 홈페이지에서 직접 확인해주세요. 여기서는 핵심 흐름만 짚어드릴게요.

5-1. 새 프로젝트 만들기

Vrew를 실행하고 ‘새로 만들기’ 를 클릭합니다.

여러 옵션 중 ‘텍스트로 비디오 만들기’ 를 선택합니다. 우리는 이미 대본이 준비되어 있으니까요.

5-2. 대본 붙여넣기 + 정리

2단계에서 완성한 대본을 붙여넣고, 불필요한 부분은 지워줍니다.

정리가 끝나면 다음을 클릭합니다.

5-3. TTS 성우 목소리 선택

성우 목록에서 헤드셋 아이콘을 클릭하면 목소리를 미리 들어볼 수 있습니다. 채널 콘셉트와 어울리는 목소리를 골라주세요.

저는 가현1 로 선택했어요. 차분한 톤이라 심리학 콘텐츠에 잘 어울린다고 생각했

5-4. 자동 생성 옵션 모두 끄기

Vrew는 기본적으로 이미지·비디오·배경음악을 자동으로 넣어주는데, 우리는 직접 만든 이미지와 영상이 따로 있으니 모두 ‘사용 안 함’ 으로 설정합니다.

배경음악도 일단 ‘사용 안 함’으로 두고, 필요하면 나중에 추가하시면 됩니다.

설정이 끝나면 완료 버튼을 클릭해서 비디오를 생성합니다.

5-5. 직접 만든 이미지·영상 삽입하기

아티클 이미지 갯수를 초과하여 하나의 이미지만 사용합니다. 브루에서 사용 방법을 확인해주세요

이제 핵심 작업입니다. Vrew가 대본을 문장 단위로 끊어서 빈 클립을 만들어줬을 거예요. 여기에 3단계에서 만든 이미지와 4단계에서 만든 영상을 매칭해서 넣습니다.

영상이나 이미지를 끌어서 가져오면 클립에 추가되고, ‘잘라서 채우기’ 를 클릭하면 화면에 꽉 차게 들어갑니다.

⚠️ 체크할 것영상의 원본 소리는 꺼주세요 (TTS와 겹치면 안 됩니다)

한 영상을 어느 문장까지 적용할지는 직접 보면서 조정

5-6. TTS 음성 다듬기 + 내보내기

이미지와 영상을 모두 매칭했다면 처음부터 끝까지 한 번 재생해보세요. TTS가 자연스럽게 읽지 못하는 부분이 분명히 있을 거예요.

띄어쓰기를 잘못 읽는 부분

외래어 발음이 어색한 부분

끊어 읽기가 부자연스러운 부분

이런 곳은 띄어쓰기를 조정하거나 글자를 살짝 바꿔서 다시 생성하시면 됩니다. 이 작업이 영상 퀄리티를 가장 크게 좌우합니다.

문제가 없다면 내보내기 → 영상 파일(mp4) 로 내보내면 끝입니다.

  1. 썸네일 만들기

🛠 사용 도구: 제미나이(프롬프트 생성) + 나노바나나 or GPT(이미지 생성) + 미리캔버스(텍스트 편집, 선택)

영상이 완성됐다면 마지막 관문, 썸네일입니다.

전체 흐름은 이렇습니다:

원본 썸네일 분석 → 썸네일 프롬프트 생성 → 이미지 생성 → 제목 텍스트 입히기

6-1. 원본 썸네일 분석 + 프롬프트 생성

벤치마킹 채널의 잘 된 영상 썸네일을 캡처해서 첨부한 뒤, 비슷한 느낌으로 프롬프트를 뽑아달라고 요청합니다.

6-2. 썸네일 이미지 생성

생성된 프롬프트를 나노바나나 또는 GPT에 넣어서 썸네일 이미지를 만듭니다.

마음에 들 때까지 몇 번 다시 생성해보세요. 저는 마음에 들어서 바로 사용할게요.

6-3. 제목 텍스트 입히기

이미지가 준비됐다면 그 위에 제목 텍스트를 올립니다. 두 가지 방법이 있어요:

방법 1: 미리캔버스 (추천) 폰트·크기·색상을 직접 조정할 수 있어 자유도가 높습니다. 무료 사용 가능하고, 썸네일 템플릿도 많아요.방법 2: GPT 이미지 생성 텍스트까지 한 번에 만들어주지만, 폰트 선택권이 적고 한글 텍스트가 가끔 깨질 수 있습니다.

6-4. 제목 문구 다듬기

대본 주제를 그대로 써도 되지만, AI에게 더 후킹 있는 제목 후보를 받아보시면 좋습니다.

대본 원제: 절대 잊어버리지 않는 천재들의 꼼수 암기법

저는 이걸 좀 더 직관적으로 다듬어서 → “한 번 보면 절대 안 까먹는 천재들의 암기법” 으로 정했어요.

GPT로 만들었더니 이렇게 나왔네요. 저는 마음에 들어서 그대로 사용할게요. 만약 마음에 안든다면 여러번 다시 시도하시면 됩니다.

  1. 마무리

이렇게 해서 심리학 AI 롱폼 영상 한 편이 완성됐습니다.

처음 시작할 때는 “이걸 내가 할 수 있을까?” 싶으셨을 텐데, 막상 따라와보니 생각보다 어렵지 않으셨죠? 저도 처음엔 막막했지만, 한 번 흐름을 잡으면 그다음부터는 쉽게 할 수 있는 작업입니다.

전체 흐름 한눈에 다시 보기

1️⃣ 벤치마킹 채널 분석 → 잘 되는 채널의 공식 찾기

2️⃣ 스크립트 만들기 → 제미나이 + 클로드로 5000자 대본

3️⃣ 이미지 만들기 → 나노바나나로 일관된 캐릭터 생성

4️⃣ 영상 만들기 → 그록으로 6초 단위 영상 제작

5️⃣ 편집하기 → Vrew로 TTS + 합치기

6️⃣ 썸네일 만들기 → 클릭률 90%를 결정하는 마지막 관문

이 흐름은 심리학뿐 아니라 자기계발, 역사, 경제, 미스터리 등 어떤 주제에도 똑같이 적용됩니다. 주제만 바꿔서 본인만의 채널을 만들어보세요.

⚠️ 시작하기 전 반드시 알아야 할 것

여기서 끝내면 안 됩니다. 이 글을 끝까지 읽으신 분들께 가장 중요한 이야기를 드릴게요.

2025년 7월부터 유튜브는 AI로만 양산된 영상에 대한 단속을 대폭 강화했습니다. 단순히 AI로 생성한 이미지·음성·영상만으로 만든 채널들은 수익화 박탈, 채널 정지 사례가 속출하고 있어요.

반드시 허위콘텐츠 관련 아티클을 읽어주시고, 사람이 직접 개입했다는 흔적을 남겨서 운영하시는게 가장 안전합니다. (사람이 등장하는게 가장 안전하며, 수익정지 되지 않은 채널들이 어떻게 운영하는지 참고해보세요)

마지막으로

만들기만 하는 것으로는 부족합니다.

수익화에 성공하시려면 결국 분석이 필요해요.

분석 없이 만들기만 한다면 어쩌다 한두 번 조회수가 잘 나올 순 있어도, 꾸준히 잘 나오긴 어렵습니다. 운으로 한 번 터지는 것과, 계속 터뜨리는 것은 완전히 다른 영역이거든요.

그러니 반드시 잘되는 채널들을 분석해서 본인의 채널에 적용해보시길 바랍니다.


원문: https://x.com/anna_creator00/status/2053756754119286954?s=20