GPT 6 아스트라(Astra)가 AI 동영상 편집을 완전히 끝냈습니다
AAI LABS
Computing/SoftwareAdvertising/MarketingInternet Technology
Transcript
00:00:00요즘 많은 사람들이 기획부터 샷 구성,
00:00:04편집과 음악 삽입에 이르기까지 AI 모델에 맡겨 영상을 제작하고 있습니다.
00:00:09제품을 만든다면 이러한 영상 제작 법을 아는 것이 훨씬 더 중요합니다.
00:00:13사용자가 직접 써보지 않더라도 만든 제품에 주목하게 만드는 가장 빠른 방법이기 때문입니다.
00:00:18하지만 곧바로 영상 제작에 뛰어들면 원하는 퀄리티를 얻지 못하고
00:00:22많은 시간과 토큰을 낭비하게 됩니다. 이를 방지하려면 영상이 원하는 대로 나오도록
00:00:27보장하는 전체 워크플로를 따라야 합니다. 저희 워크플로에서는 Claude Code 내부에서 GPT-6 Astra를 사용합니다.
00:00:33Astra는 영상 편집에 가장 뛰어난 모델 중 하나이며, 이 설정을 통해 양쪽의 강점을 모두 활용할 수 있습니다.
00:00:37처음 오신 분들을 위해 말씀드리면 저희는 소프트웨어 회사이자 AI Labs입니다.
00:00:42이번 영상에서는 도중에 겪을 수 있는 문제들과 해결 방법을 포함해
00:00:47그 워크플로를 단계별로 살펴보겠습니다. Astra가 이미 Codex에 자체 도구를 가지고 있는데
00:00:52왜 Claude Code 안에서 실행하는지 궁금하실 겁니다. 이유는 저희가 Claude Code가 제공하는
00:00:58도구들을 더 선호하기 때문이며, 만드는 거의 모든 것에 그것을 사용하는 이유이기도 합니다.
00:01:02그리고 그 안에서 Claude 자체 모델을 사용하지 않는 이유는 Astra가 전반적인 디자인 방향성이 더 좋고
00:01:08지난 영상에서 Fable과 비교했을 때 디자인 면에서 앞서 나왔기 때문입니다.
00:01:14이 설정으로 Astra는 영상의 크리에이티브 방향성을 제공하고 Claude Code는 제작 도구를 실행합니다.
00:01:18하지만 Claude Code를 사용하고 싶지 않다면 Codex나 원하는 다른 코딩 에이전트를 직접 써도 됩니다.
00:01:24Codex를 사용 중이라면 Claude Code에 Astra를 설정하는 단계를 건너뛰고 바로 영상 도구 설치로 넘어가면 됩니다.
00:01:29저희처럼 Claude Code에서 Astra를 사용하려면 먼저 몇 가지 단계를 거쳐야 합니다.
00:01:35Claude Code가 모델로 인식할 수 있도록 Astra를 설정해야 합니다. 한 가지 방법은 OpenAI의
00:01:42API 값을 지불하고 이를 Claude Code에 연결하는 것이지만, 모델 비용이 비싸고
00:01:47영상을 만들 때 토큰이 많이 소모되므로 비용 부담이 너무 커지기 때문에 권장하지 않습니다. 다른 방법은
00:01:53이미 보유한 Codex 구독을 통해 Astra를 사용하는 것입니다. 하지만 이를 Claude Code에서
00:01:58사용 가능하게 하려면 CLI Proxy API라는 도구를 사용해야 합니다. 컴퓨터에서 작은 서버를 실행해
00:02:04Claude Code와 이미 설치한 코딩 에이전트를 연결해 줍니다. 이 서버를 사용하면
00:02:09API 비용을 따로 내지 않고 기존 구독을 사용할 수 있으며 많은 에이전트와 호환됩니다.
00:02:14이 도구는 Kimi 디자인 영상에서도 사용했습니다. 사용하려면 터미널에서 brew install 명령어로
00:02:20설치해야 합니다. 설치가 끝나면 일부 설정을 변경하고 API 키를 만드는 등의
00:02:25초기 설정이 필요합니다. 하지만 직접 이 모든 것을 하는 대신 사용하는 에이전트에게
00:02:30설정을 부탁하고 도구를 통해 사용할 모델을 프롬프트에 언급하는 것이 훨씬 쉽습니다.
00:02:35에이전트가 설정을 완료하면 Claude Code가 이 도구에 연결할 때 사용할 API 키를 제공합니다.
00:02:40연결 단계를 위해 해당 키를 저장해 두어야 합니다. 이 도구가 설치되면
00:02:45자동으로 시작되므로 별도의 시작 명령어를 실행할 필요가 없습니다. 이제 에이전트가 준
00:02:50키는 토큰마다 과금되는 일반적인 API 키가 아닙니다. 이 키는 단순히
00:02:55컴퓨터에서 실행되는 서버를 통해 설치한 코딩 에이전트를 사용할 수 있게 해줄 뿐입니다.
00:03:00다른 사람이 아닌 본인의 시스템에서만 작동합니다. 다음으로 login 명령어를 사용하여
00:03:06CLI Proxy API를 Codex 계정에 연결해야 합니다. 터미널에서 실행하면 브라우저가 열리고
00:03:11계정으로 로그인하게 됩니다. 로그인하면 도구가 Codex 로그인을 저장하여 요금제를
00:03:16사용할 수 있게 해줍니다. 로그인이 완료되면 Astra와 함께 Claude Code를 실행해야 합니다.
00:03:21원래 Claude Code는 요청한 모든 내용을 Anthropic으로 보내며, 이를 통해 Claude 모델에 액세스합니다.
00:03:26하지만 지금은 Claude 모델을 원하지 않으므로 base URL이라는 설정을 변경해야 합니다.
00:03:32이를 통해 Claude Code가 모든 요청을 컴퓨터에서 실행 중인 서버로 대신 보내게 됩니다. 그런 다음
00:03:36앞서 복사해 둔 API 키를 추가하고 모델로 gpt-6-extra를 입력합니다. Claude Code를 실행하면
00:03:43gpt-6-extra를 사용할 수 있게 되며 바로 이용을 시작할 수 있습니다. 완료되면 설정의 마지막 단계인
00:03:48영상 제작 과정을 돕는 도구 설치가 남습니다. 여기서 잠시 멈추고 이 목록을 캡처해서
00:03:53에이전트에게 주면 알아서 모두 설치해 줍니다. 이러한 도구들에는
00:03:58영상을 만들 때 도구를 사용하는 방법을 에이전트에게 알려주는 스킬이 포함되어 있습니다. 설치가 끝나면
00:04:03영상 제작을 시작할 준비가 된 것입니다. 본격적인 워크플로로 넘어가기 전에,
00:04:08채널을 구독하고 좋아요 버튼을 눌러주시면 저희에게 아주 큰 힘이 됩니다.
00:04:13제품 영상용으로 옷을 조합해 구매할 수 있는 아트 의류 쇼핑몰을 사용했습니다.
00:04:18이 쇼핑몰은 커뮤니티에 이미 공유한 앱 템플릿을 사용하여 제작했으며, 나만의 앱을 빌드하는 시작점을 제공합니다.
00:04:23영상을 만들기 전에 쇼핑몰의 어느 부분을 어떻게 보여줄지 기획해야 했습니다.
00:04:28영상을 만드는 데 몇 시간이 걸릴 수 있으므로 기획을 먼저 확인하지 않으면
00:04:33원하지 않는 영상을 만드느라 몇 시간을 낭비할 수 있기 때문에 기획은 정말 중요합니다.
00:04:38기획을 위해 쇼핑몰이 실행 중인 주소를 Claude Code에 프롬프트로 전달하여
00:04:43쇼핑몰을 열고 그에 맞춰 영상을 기획하도록 했습니다. 원하는 분량과 레이아웃도 함께 지정했습니다.
00:04:48제품 데모 영상에서 볼 수 있는 가로형 레이아웃인 16:9 비율의 30초짜리 영상을 원했습니다.
00:04:55숏폼 콘텐츠용 세로 영상이 필요하다면 9대 16 비율을 선택할 수도 있습니다. 저희는
00:05:00음성 해설 없이 배경음악만 들어가는 영상을 원했기 때문에 그 내용도 프롬프트에 포함했습니다.
00:05:05기획서가 텍스트로만 샷을 설명하면 어떤 모습일지 상상하기 어렵기 때문에
00:05:10브라우저에서 기획안을 보여달라고 요청하여 영상의 시각적 형태를 확인하고 수정 사항을 요구할 수 있게 했습니다.
00:05:15또한 에이전트에게 변경하고 싶은 부분을 지시할 수 있도록 기획안에 댓글을 남길 공간도 요청했습니다.
00:05:20영상의 외형과 움직임의 레퍼런스로 Anthropic과 Linear의 제품 출시 영상을 사용하도록 요청했습니다.
00:05:26레퍼런스를 제공해야 에이전트가 어떤 아이디어를 염두에 두고 있는지 알 수 있으므로 중요합니다.
00:05:31레퍼런스는 페이지 전체에서 시점이 어떻게 이동하고 버튼을 어떻게 확대하는지 기획하는 데도 도움이 됩니다.
00:05:36프롬프트를 주자 Hyperframes와 함께 설치된 스킬들을 로드했습니다. Hyperframes는
00:05:41에이전트의 영상 제작을 돕기 위해 설치한 도구 중 하나입니다. 에이전트는 영상 스킬을 사용하여
00:05:46샷을 기획한 다음, 다른 스킬들을 사용하여 전체 영상의 세부 계획을 세웠고 완료되자마자
00:05:52브라우저에 전체 기획안을 띄웠습니다. 기획안에는 영상의 매 초마다 무엇이 나타날지,
00:05:56카메라가 어떻게 움직일지, 사이트에서 어떤 일이 벌어질지가 표시되었습니다. 요청한 대로
00:06:01변경하고 싶은 사항을 에이전트에게 전달할 수 있는 댓글 섹션이 있어
00:06:06원하는 만큼 댓글을 추가해 기획을 마음에 들게 다듬을 수 있습니다. 검토가 끝나면
00:06:11댓글을 확인하고 기획안을 업데이트한 뒤 변경 사항을 적용하라고 요청할 수 있습니다. 기획이 만족스러우면
00:06:16에이전트에게 최종 방향성임을 알 수 있도록 기획안을 잠그라고 요청합니다. 그 후에 다음 단계로
00:06:21넘어갈 수 있지만, 먼저 스폰서인 Luma AI의 이야기를 전해드립니다. 모든 AI 영상 도구는
00:06:27빠름, 저렴함, 고품질 중 두 가지를 고르게 하지만 Ray 3.2는 그 틀을 깼습니다. 시네마틱 샷과 애니메이션을 실행해 본 결과,
00:06:34모든 결과물이 네이티브 1080p 풀 HDR로, Ray 3보다 4배 빠른 속도와 3분의 1 비용으로 나왔습니다.
00:06:41나란히 놓고 비교한 속도는 놀라울 정도였습니다. 기다릴 줄 알고 생성을 누르면 이미 완료되어 있었습니다.
00:06:46더 놀라운 것은 정확도였습니다. 프롬프트가 요청한 내용에 더 가깝게 구현되었고, 글리치가 줄어들었으며,
00:06:52프레임 간 일관된 스타일이 유지되었습니다. 렌더링 후 대충 이 정도면 됐어,
00:06:57나중에 후반 작업에서 수정하지 생각했던 적이 있다면 이제 그럴 필요가 없습니다. Ray 3.2는 키프레임과 수정 도구를 지원하므로
00:07:04그리고 루마에서는 이제 댄스 2.0에서 크게 발전한 댄스 2.5뿐만 아니라 젠 4.5와 클링 3.0도 제공하므로
00:07:13가장 알맞은 모델을 고를 수 있습니다. 고정 댓글의 링크나 화면의 QR 코드를 스캔해 Ray 3.2를 체험해 보세요.
00:07:20다음 단계는 기본적으로 각 샷을 개별적으로 생성하는 것입니다. 이 단계에서는
00:07:25세부적인 다듬기에 시간을 쏟기 전에 카메라 움직임을 확인할 수 있도록 각 샷의 기본 버전을 만듭니다.
00:07:30각 샷을 따로 만드는 이유는 특정 샷이 마음에 들지 않을 때 전체 영상을 다시 만들 필요 없이
00:07:35해당 샷만 수정하면 되기 때문입니다. 이 단계는 또한 줌과 기타 카메라 방향이
00:07:40원하는 대로 되었는지 확인하는 시점입니다. 이를 위해 브라우저를 열고
00:07:45모든 샷을 전체 화면 해상도로 녹화한 뒤 각각을 영상으로 변환하여 카메라 움직임이
00:07:51제대로 되었는지 확인할 수 있도록 지시하는 프롬프트를 입력했습니다. 프롬프트 입력 후 샷 작업을 시작하여
00:07:56첫 번째 샷을 만들고 다음으로 넘어가기 전에 검토해 달라고 요청했습니다. 문제가 있는 경우
00:08:01영상 전체에 걸쳐 동일한 문제가 반복되는 것을 나중에 발견하는 대신 일찍 잡아낼 수 있기 때문입니다.
00:08:06브라우저에서 이미지와 녹화된 클립을 보여주는데 첫 번째 장면에 수정이 필요하면 요청할 수 있습니다
00:08:12만족스러우면 나머지 분량을 생성하라고 지시할 수 있습니다. 완료되면
00:08:17브라우저에서 모든 내용을 함께 검토할 수 있습니다. 우리 경우에는 무슨 영문인지 일부 클립이 매우 흔들렸고
00:08:22일부 줌인은 기획안에 설명한 것과 달랐기 때문에 수정을 요청했습니다.
00:08:26최종 결과물이 마음에 들 때까지 마음에 들지 않는 부분에 대한 수정 요청을 계속할 수 있습니다.
00:08:31이러한 기본 샷들을 먼저 확인하는 이유는 샷을 다시 만들어야 할 경우 이미 세부적인 다듬기에
00:08:36시간을 쏟지 않았기 때문입니다. 각 샷이 보여주는 내용을 승인한 후에는 움직임을 개선하고
00:08:41샷들을 하나의 영상으로 결합할 수 있습니다. 이 시점에서 기본 움직임과 줌이 적용된 개별 클립들이 생겼고,
00:08:47부드럽게 이어지는 하나의 영상으로 결합해야 했습니다. 클립을 다듬기 위해 Claude Code에
00:08:53움직임을 개선하고 각 샷이 다음 샷으로 부드럽게 넘어가도록 클립을 결합해 달라고 요청했습니다.
00:08:58해당 프롬프트에서는 카메라가 어떻게 움직여야 하는지, 어디서 확대되어야 하는지, 타이핑은 언제 일어나야 하는지를 설명했습니다.
00:09:02결합된 영상을 만드는 데는 시간이 꽤 걸렸으며 완료되자 음악 없는 하나의 영상으로 샷들이 합쳐졌습니다.
00:09:07에이전트는 작업 중인 폴더에 영상을 저장하므로 거기서 열어 확인하면 됩니다.
00:09:13뭔가 어색해 보인다면 영상의 어느 부분인지 에이전트에게 알려주어야 합니다.
00:09:17우리 경우에는 샷 중 하나가 너무 오른쪽으로 치우쳐 배치되어 해당 샷을 제자리로 돌려놓으라고 요청했습니다.
00:09:22그런 다음 모든 수정이 완료되면 영상을 다시 검토하고 여전히 남아 있는 문제가 없는지
00:09:27확인해 달라고 요청해야 합니다. 설치한 도구에는 영상의 작은 문제를 찾아내는 검사 기능이
00:09:32이미 포함되어 있어서 해당 검사가 실행되면 최종 영상에는 그런 문제들이 포함되지 않습니다.
00:09:38영상의 마지막 단계는 음악을 추가하는 것입니다. 음악은 모든 샷을 통해
00:09:43시청자의 몰입을 유지하고 영상을 훨씬 더 흥미롭게 시청할 수 있게 만들어주는 매우 중요한 단계이기 때문입니다.
00:09:48에이전트에게 그냥 음악을 추가하라고만 하면 임의로 트랙을 고르겠지만, 그 트랙이 영상에 어울리지 않을 수 있습니다.
00:09:54원하는 음악 스타일에 대해 어느 정도 가이드를 주어야 합니다. 그래서 이를 안내하기 위해
00:09:59에이전트가 음악을 고르는 방법을 정확히 지시하는 스킬을 만들었습니다. 이 스킬은 기획안에서
00:10:04제품 스타일을 읽고 영상이 한 샷에서 다음 샷으로 얼마나 자주 바뀌는지 확인합니다.
00:10:10그 타이밍을 활용해 영상에 어울리는 비트를 가진 음악을 찾습니다. 잔잔함이나 피아노 같은 카테고리의
00:10:16무료 음악을 위해 Mixkit이라는 사이트를 검색합니다. 이 스킬을 만들기 위해 Claude Code에
00:10:21따라야 할 정확한 워크플로를 프롬프트로 전달했으며, 에이전트는 음악을 찾아 영상에 추가하는 데 필요한 모든 것을 갖춘 스킬을 만들었습니다.
00:10:26이 스킬이 필요하다면 프롬프트를 복사해 에이전트에게 주어 동일한 워크플로를 따르고
00:10:31스킬을 생성하도록 할 수 있습니다. 사용하려면 슬래시와 스킬 이름을 입력하기만 하면
00:10:36음악을 찾아 영상에 추가해 줍니다. 그런 다음 음악이 추가된 새로운 버전의 영상을 생성합니다.
00:10:42이제 방금 보신 전체 워크플로를 워크플로에서 직접 사용할 수 있는 스킬 형태로 다듬었습니다.
00:10:52해당 스킬은 여러 차례의 테스트와 개선을 거쳐 만들어졌으며, 저희 커뮤니티인
00:10:57AI Labs Pro에서 이용하실 수 있습니다. 따라서 저희 활동에서 가치를 느끼셨고 채널을
00:11:03지원하고 싶다면 이것이 가장 좋은 방법입니다. 링크는 설명란에 있습니다. 이것으로 이번 영상의
00:11:08마무리입니다. 채널을 지원하고 이와 같은 영상을 계속 만들 수 있도록 돕고 싶으시다면
00:11:13아래의 슈퍼 뱅크스 버튼을 이용해 주시면 됩니다. 언제나처럼 시청해 주셔서 감사드리며 다음 영상에서 뵙겠습니다.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video