Das hat gerade die KI-Videobearbeitung mit GPT 6 Astra zerstört

AAI LABS
컴퓨터/소프트웨어마케팅/광고AI/미래기술

스크립트

00:00:00Sehr viele Leute lassen mittlerweile Modelle ihre Videos von Anfang bis Ende erstellen, von der Planung
00:00:04der Aufnahmen über den Schnitt bis hin zum Hinzufügen von Musik. Zu wissen, wie man diese Videos erstellt,
00:00:09ist umso wichtiger, wenn man ein Produkt entwickelt, denn diese Videos sind der schnellste Weg,
00:00:13die Aufmerksamkeit der Leute auf das zu lenken, was man gebaut hat, ohne dass sie es tatsächlich nutzen müssen.
00:00:18Aber wenn man sich direkt in die Videoerstellung stürzt, bekommt man nicht die gewünschte Qualität und
00:00:22verschwendet außerdem jede Menge Zeit und Tokens. Um das zu vermeiden, muss man einem kompletten Workflow folgen,
00:00:27der sicherstellt, dass das Video genau so wird, wie man es möchte. Für unseren Workflow nutzen wir GPT-6 Astra in Cloud Code,
00:00:33da Astra eines der besten Modelle für den Videoschnitt ist, und dieses Setup ermöglicht es uns, die Stärken
00:00:37von beiden zu nutzen. Wenn du zum ersten Mal hier bist: Wir sind ein Softwareunternehmen und das hier ist AI Labs.
00:00:42In diesem Video gehen wir diesen Workflow Schritt für Schritt durch, einschließlich möglicher Probleme,
00:00:47auf die du dabei stoßen könntest und wie man sie behebt. Nun fragst du dich vielleicht, warum wir Astra in Cloud Code
00:00:52ausführen, obwohl Astra bereits eigene Tools in Codex mitbringt. Der Grund dafür ist, dass wir die Tools von Cloud Code
00:00:58bevorzugen, und deshalb nutzen wir es für so ziemlich alles, was wir bauen. Der Grund, warum wir nicht
00:01:02die eigenen Modelle von Cloud darin verwenden, ist, dass Astra im Allgemeinen eine bessere Design-Richtung hat und im Design
00:01:08auch die Nase vorn hatte, als wir es in unserem vorherigen Video mit Fable verglichen haben. Mit diesem Setup liefert Astra
00:01:14die kreative Richtung für das Video und Cloud Code führt die Tools aus, um es zu erstellen. Wenn du aber
00:01:18kein Cloud Code verwenden möchtest, kannst du auch Codex direkt oder einen beliebigen anderen Coding-Agenten deiner Wahl nutzen.
00:01:24Wenn du Codex verwendest, kannst du den Teil überspringen, in dem wir Astra in Cloud Code einrichten, und direkt
00:01:29zur Installation der Videotools übergehen. Wenn du also Astra genau wie wir in Cloud Code nutzen willst, musst du zuerst ein paar Schritte tun.
00:01:35Du musst Astra so einrichten, dass Cloud Code es als Modell erkennen kann. Ein Weg das zu tun, ist die Bezahlung von OpenAI's
00:01:42API und deren Verbindung mit Cloud Code. Das würden wir jedoch nicht empfehlen, da das Modell teuer ist und
00:01:47die Erstellung von Videos viele Tokens verbraucht, was für dich sehr kostspielig werden wird. Der andere Weg ist die Nutzung von Astra
00:01:53über dein bereits vorhandenes Codex-Abonnement. Um das in Cloud Code verfügbar zu machen, musst du
00:01:58ein Tool namens CLI Proxy API verwenden. Es startet einen kleinen Server auf deinem Computer, der Cloud Code mit den
00:02:04bereits installierten Coding-Agenten verbindet. Dieser Server ermöglicht es dir, dein bestehendes Abonnement zu nutzen, ohne
00:02:09separat für die API zu zahlen. Es funktioniert mit vielen Agenten und wir haben dieses Tool auch in unserem Kimi Design
00:02:14Video verwendet. Um es zu nutzen, musst du das Tool zuerst installieren, indem du den Befehl “brew install” in deinem
00:02:20Terminal ausführst. Sobald es installiert ist, steht etwas Einrichtung an, was das Ändern einiger Einstellungen
00:02:25und das Erstellen eines API-Keys dafür beinhaltet. Aber anstatt das alles selbst zu machen, ist es viel einfacher, einfach den
00:02:30Agenten, den du gerade benutzt, darum zu bitten, es für dich einzurichten, und in deinem Prompt zu erwähnen, welches Modell
00:02:35du über das Tool verwenden möchtest. Sobald der Agent diese Einstellungen abgeschlossen hat, gibt er dir den API-Key, den Cloud Code
00:02:40verwenden wird, um sich mit diesem Tool zu verbinden. Du musst diesen Key für den Verbindungsschritt speichern. Sobald dieses Tool
00:02:45installiert ist, wird es automatisch gestartet. Du musst keinen Befehl ausführen, um es zu starten. Nun, der
00:02:50Key, den dir der Agent gegeben hat, ist nicht die normale Art von API-Key, die dich für jeden Token zur Kasse bittet. Dieser Key
00:02:55ermöglicht es dir lediglich, die installierten Coding-Agenten über einen auf deinem Computer laufenden Server zu nutzen. Er funktioniert nur
00:03:00auf deinem System und auf keinem anderen. Als Nächstes musst du die CLI Proxy API mit deinem Codex-
00:03:06Konto verbinden, indem du den Login-Befehl verwendest. Wenn du ihn in deinem Terminal ausführst, öffnet sich der Browser, in dem du dich
00:03:11mit deinem Konto anmeldest. Sobald du eingeloggt bist, speichert das Tool deine Codex-Anmeldung, damit es deinen Tarif verwenden kann.
00:03:16Sobald du also eingeloggt bist, musst du Claude Code mit Astra starten. Normalerweise sendet Claude Code
00:03:21alles, wonach du fragst, an Anthropic, was dir Zugriff auf Claudes Modelle verschafft. Aber du willst
00:03:26gerade keine Claude-Modelle, also musst du eine Einstellung namens “Base URL” ändern, wodurch Claude Code
00:03:32stattdessen alles an den auf deinem Computer laufenden Server sendet. Dann fügst du den API-Key hinzu, den du vorhin
00:03:36kopiert hast, und gibst “GPT-6 Astra” als Modell ein. Sobald du Claude Code startest, steht dir GPT-6 Astra
00:03:43darin zur Verfügung und du kannst es verwenden. Und sobald das erledigt ist, gibt es noch einen weiteren Schritt für die Einrichtung:
00:03:48die Installation der Tools, die beim Videoerstellungsprozess helfen. Du kannst hier anhalten, einen Screenshot
00:03:53dieser Liste machen und ihn deinem Agenten geben, und er wird sie alle für dich installieren. Diese Tools kommen mit
00:03:58Fähigkeiten, die dem Agenten zeigen, wie er sie bei der Videoerstellung nutzen muss. Und sobald sie installiert sind, bist du
00:04:03bereit, mit der Erstellung der Videos zu beginnen. Bevor wir jedoch mit dem Workflow fortfahren, wäre es großartig, wenn du
00:04:08den Kanal abonnierst und den Hype-Button drückst. Diese kleine Geste der Unterstützung bedeutet uns sehr viel.
00:04:13Für unser Produktvideo haben wir einen künstlerischen Bekleidungsshop verwendet, in dem man ein Outfit zusammenstellen und kaufen
00:04:18kann. Wir haben den Shop mit der App-Vorlage aufgebaut, die wir bereits in unserer Community geteilt haben, was dir einen
00:04:23Startpunkt für den Bau deiner eigenen App gibt. Vor der Erstellung des Videos mussten wir planen, welche Teile
00:04:28des Shops wir zeigen und wie wir sie zeigen sollten. Planung ist wirklich wichtig, da die Erstellung des Videos
00:04:33Stunden dauern kann. Wenn man den Plan nicht vorher prüft, verbringt man womöglich Stunden damit, ein Video zu erstellen, das nicht dem
00:04:38entspricht, was man wollte. Für die Planung haben wir Claude Code einen Prompt mit der Adresse gegeben, unter der unser Shop lief, damit es
00:04:43den Shop öffnen und das Video darum herum planen konnte. Wir haben auch die Länge und das Layout angegeben, die wir uns wünschten. Wir
00:04:48Wir wollten ein 30-sekündiges Video im 16:9-Format, also dem horizontalen Format, das man von Produkt-Demo-Videos kennt.
00:04:55Man kann 9:16 wählen, wenn man ein vertikales Video für Kurzform-Inhalte möchte. Wir wollten Musik in
00:05:00unserem Video ohne Sprachausgabe, also haben wir das auch in den Prompt aufgenommen. Wenn der Plan nun nur die
00:05:05Einstellungen im Text beschreibt, ist es schwer, sich vorzustellen, wie das Video aussehen wird. Deshalb haben wir gebeten, den Plan auf
00:05:10unserem Browser anzuzeigen, damit wir sehen konnten, wie das Video aussehen würde, und um Änderungen bitten konnten. Außerdem baten wir um einen
00:05:15Ort, an dem man Kommentare zum Plan hinterlassen kann, damit wir dem Agenten sagen konnten, welche Teile geändert werden sollen. Wir
00:05:20baten ihn auch, die Produktstartvideos von Anthropic und Linear als Referenzen dafür zu verwenden, wie unser Video
00:05:26aussehen und sich bewegen sollte. Es ist wichtig, Referenzen anzugeben, weil der Agent auf diese Weise weiß, welche Idee man
00:05:31hast, helfen die Referenzen ihm auch dabei, die Kamerafahrt über die Seite
00:05:36zu planen und auf einen Button zu zoomen. Nach unserer Vorgabe lud es die
00:05:41Skills, die mit Hyperframes installiert wurden. Hyperframes ist eines der Werkzeuge,
00:05:46die wir installiert haben, um dem Agenten beim Erstellen des Videos zu helfen. Der Agent nutzte seine Video-Skills,
00:05:52um die Einstellungen zu planen, und verwendete dann die anderen Skills, um das gesamte Video zu entwerfen. Danach öffnete er
00:05:56den gesamten Plan im Browser. Der Plan zeigte, was in jeder Sekunde des Videos zu sehen sein würde, wie sich die
00:06:01Kamera bewegen würde und was auf der Website passiert. Genau wie gewünscht gibt es einen Kommentarbereich,
00:06:06in dem du dem Agenten mitteilen kannst, was geändert werden soll. Du kannst beliebig viele Kommentare hinzufügen, um sicherzustellen,
00:06:11dass der Plan deinen Vorstellungen entspricht. Sobald die Prüfung abgeschlossen ist, kannst du ihn bitten, die Kommentare zu überprüfen, den
00:06:16Plan zu aktualisieren und die Änderungen vorzunehmen. Wenn du mit dem Plan zufrieden bist, bittest du den Agenten, ihn zu sperren,
00:06:21damit er weiß, dass diese Richtung endgültig ist. Danach können wir zum nächsten Schritt übergehen, aber hören wir uns erst ein Wort unseres Sponsors Luma AI an. Jedes KI-Videowerkzeug zwingt dich dazu, zwei von
00:06:27drei Optionen zu wählen: schnell, günstig, gut. Ray 3.2 bricht mit dieser Regel. Wir haben filmische Aufnahmen und Anime durchlaufen lassen und alles
00:06:34kam in nativem 1080p Full HDR zurück, viermal schneller und zu einem Drittel der Kosten von Ray 3. Der Geschwindigkeitsvergleich
00:06:41im direkten Vergleich war fast schon nervig: Wir klickten auf Generieren und erwarteten zu warten, aber es war bereits fertig. Noch mehr überraschte uns
00:06:46die Genauigkeit: Prompts trafen eher das, worum wir baten, Störungen nahmen ab und der Stil blieb von Frame zu Frame einheitlich.
00:06:52Wenn du jemals etwas gerendert und gedacht hast „Gut genug, ich patche es in der Nachbearbeitung“, dann
00:06:57musst du das jetzt nicht mehr. Ray 3.2 unterstützt Keyframes und ein Modifikationswerkzeug, sodass du in einen fertigen Clip zurückkehren
00:07:04und ihn korrigieren kannst. Luma hostet jetzt auch C-Dance 2.5, einen großen Fortschritt gegenüber C-Dance 2.0, sowie Gen 4.5 und Kling 3.0,
00:07:13sodass du das beste Modell auswählen kannst. Probiere Ray 3.2 aus, Links findest du im angepinnten Kommentar oder scanne den QR-Code auf dem Bildschirm.
00:07:20Der nächste Schritt besteht im Grunde darin, die Einstellungen separat zu erstellen. In dieser Phase erstellen wir eine einfache
00:07:25Version jeder Einstellung, damit wir die Kamerabewegungen überprüfen können, bevor wir Zeit in die Feinarbeit investieren. Der
00:07:30Grund, warum wir jede Einstellung einzeln erstellen, ist, dass du bei Nichtgefallen einer Einstellung nur diese eine ändern musst,
00:07:35anstatt das gesamte Video noch einmal neu machen zu müssen. Dies ist auch der Punkt, an dem
00:07:40du die Zooms und anderen Kamerarichtungen überprüfst, um zu sehen, ob sie deinen Vorstellungen entsprechen. Dafür gaben wir ihm
00:07:45den Auftrag, den Browser zu öffnen, jede Einstellung in Vollbildauflösung aufzunehmen und jede einzelne in ein
00:07:51Video umzuwandeln, damit wir prüfen konnten, ob die Kamerabewegungen korrekt ausgeführt wurden. Nach unserem Prompt begann er
00:07:56mit der Arbeit an den Einstellungen. Er erstellte die erste und bat uns, sie vor dem Fortfahren zu überprüfen, damit wir,
00:08:01falls etwas nicht stimmte, dies frühzeitig beheben konnten, anstatt denselben Fehler im ganzen Video wiederholt zu finden.
00:08:06Er zeigte uns daraufhin die Bilder und den aufgenommenen Clip in unserem Browser. Wenn du Änderungen am ersten wünschst, kannst du darum bitten,
00:08:12und sobald du damit zufrieden bist, kannst du ihn anweisen, den Rest zu generieren. Wenn er fertig ist, kannst du alles
00:08:17gemeinsam in deinem Browser überprüfen. In unserem Fall waren einige Clips aus irgendeinem Grund sehr verwackelt und
00:08:22einige Zooms entsprachen nicht unserer Beschreibung im Plan, also baten wir ihn, das zu korrigieren. Du kannst
00:08:26weiterhin Änderungen an jedem ungeliebten Teil anfordern, bis du mit dem Endergebnis zufrieden bist. Der Grund,
00:08:31warum wir diese einfachen Einstellungen zuerst überprüfen, ist, dass wir keine Zeit mit der Feinarbeit verschwendet haben, falls eine Einstellung wiederholt werden muss.
00:08:36Sobald wir genehmigt haben, was jede Einstellung zeigt, können wir die Bewegung verbessern und die Einstellungen
00:08:41zu einem einzigen Video zusammenfügen. Zu diesem Zeitpunkt hatten wir separate Clips mit grundlegenden Bewegungen und Zooms. Wir mussten sie
00:08:47zu einem fließend zusammenhängenden Video verbinden. Um sie zu verfeinern, baten wir Claude Code, diese
00:08:53Bewegungen zu verbessern und die Clips so zu kombinieren, dass jede Einstellung nahtlos in die nächste übergeht. In diesem Prompt
00:08:58erklärten wir, wie sich die Kamera bewegen, wohin sie zoomen und wann das Tippen stattfinden sollte. Die Erstellung
00:09:02des kombinierten Videos nahm viel Zeit in Anspruch, und als sie abgeschlossen war, hatten wir die Einstellungen in einem Video
00:09:07ohne Musik vereint. Der Agent speichert das Video in dem Ordner, in dem er arbeitet, sodass du es von dort aus öffnen und
00:09:13überprüfen kannst. Wenn etwas nicht richtig aussieht, musst du dem Agenten sagen, an welcher Stelle im Video das passiert.
00:09:17In unserem Fall hat er eine der Einstellungen zu weit nach rechts platziert, also baten wir ihn, diese Einstellung an ihren Platz zurückzubringen.
00:09:22Sobald alle Änderungen vorgenommen wurden, musst du ihn bitten, das Video erneut zu überprüfen und
00:09:27nach verbliebenen Problemen zu suchen. Die von uns installierten Werkzeuge beinhalten bereits Prüfungen, die nach
00:09:32kleinen Mängeln im Video suchen. Wenn diese ausgeführt werden, enthält das Endvideo keine dieser Mängel mehr.
00:09:38Der letzte Schritt für das Video besteht darin, Musik hinzuzufügen. Das ist ein sehr wichtiger Schritt, denn die Musik ist es,
00:09:43die den Zuschauer bei jeder Einstellung fesselt und das Video viel ansprechender zu schauen macht. Wenn
00:09:48du den Agenten einfach nur aufforderst, Musik hinzuzufügen, wählt er selbst einen Titel aus, der jedoch möglicherweise nicht zum Video passt.
00:09:54Du musst ihm einige Vorgaben bezüglich der gewünschten Musikart geben. Um dies zu steuern, haben wir einen Skill erstellt,
00:09:59der dem Agenten genau vorgibt, wie er die Musik auszuwählen hat. Der Skill liest den Produktstil aus dem
00:10:04Plan ab und prüft, wie oft das Video von einer Einstellung zur nächsten wechselt. Er nutzt dieses Timing, um nach
00:10:10Musik mit einem Takt zu suchen, der zum Video passt. Er durchsucht eine Website namens Mixkit nach kostenloser Musik in Kategorien wie
00:10:16Ruhig und Klavier. Um den Skill zu erstellen, gaben wir Claude Code einen Prompt, der ihm den genauen Arbeitsablauf
00:10:21vorgab, den er befolgen musste, und er erstellte den Skill mit allem, was er brauchte, um die Musik zu finden und dem Video hinzuzufügen.
00:10:26Wenn du diesen Skill ebenfalls haben möchtest, kannst du den Prompt kopieren und deinem Agenten geben, damit er denselben
00:10:31Arbeitsablauf befolgt und den Skill auch für dich erstellt. Um ihn zu verwenden, musst du nur einen Schrägstrich und den Namen des Skills
00:10:36eingeben, woraufhin er die Musik findet und deinem Video hinzufügt. Er erstellt dann eine neue Version des Videos mit
00:10:42hinzugefügter Musik. Nun haben wir den gesamten soeben gesehenen Arbeitsablauf in Form eines Skills verfeinert, den du
00:10:52direkt in deinem Workflow verwenden kannst. Dieser Skill wurde durch mehrere Test- und Verfeinerungsrunden entwickelt und
00:10:57ist in AI Labs Pro, unserer Community, verfügbar. Wenn du also einen Mehrwert in unserer Arbeit siehst und
00:11:03den Kanal unterstützen möchtest, ist dies der beste Weg dafür. Der Link ist in der Beschreibung. Damit sind wir am Ende
00:11:08dieses Videos angelangt. Wenn du den Kanal unterstützen und uns helfen möchtest, weiterhin solche Videos zu machen, kannst du dies tun,
00:11:13indem du die Super Thanks-Schaltfläche unten nutzt. Wie immer vielen Dank fürs Zusehen und bis zum nächsten Mal!

핵심 요약

Ein strukturierter, mehrstufiger KI-Workflow mit GPT-6 Astra in Claude Code ermöglicht die Erstellung professioneller Produktvideos inklusive automatisierter Kameraführung und passender Hintergrundmusik ohne hohes API-Budget.

하이라이트

  • GPT-6 Astra bietet im Vergleich zu Cloud-Modellen eine überlegene Design-Richtung für die automatisierte Erstellung von Produktvideos.

  • Die Ausführung von GPT-6 Astra über die CLI Proxy API und ein bestehendes Codex-Abonnement spart teure API-Kosten pro Token.

  • Das dreistufige System aus interaktiver Browser-Planung, einfachen Test-Shots und anschließender Verfeinerung verhindert zeitintensive Korrekturen am Gesamtwortlaut.

  • Das Open-Source-Tool Hyperframes steuert die präzise Kameraführung und Zoom-Effekte direkt über den Webbrowser.

  • Ein benutzerdefinierter Musik-Skill analysiert Produktstil sowie Schnittfrequenz und wählt auf Mixkit rhythmisch passende lizenzfreie Audio-Tracks aus.

타임라인

Grundlagen und Setup-Architektur für KI-Videobearbeitung

  • KI-generierte Produktvideos bieten den schnellsten Weg zur Kundengewinnung ohne direkte Produktnutzung.
  • GPT-6 Astra steuert die kreative Regie, während Claude Code die technische Ausführung der Werkzeuge übernimmt.
  • Die CLI Proxy API verbindet lokale Coding-Agenten mit bestehenden Codex-Abonnements ohne zusätzliche Token-Kosten.

Unstrukturierte Videoerstellung führt zu hoher Token-Verschwendung und schlechter visueller Qualität. GPT-6 Astra übertrumpft andere Modelle in der visuellen Design-Richtung. Ein lokaler Server via CLI Proxy API ersetzt den kostenintensiven direkten API-Zugriff von OpenAI durch die Nutzung des regulären Codex-Tarifs. Nach der Base-URL-Umstellung in Claude Code installieren automatische Video-Skills die benötigte Umgebung.

Interaktive Videoplanung und Visuelle Freigabe

  • Die gründliche Vorplanung verhindert stundenlange Fehlgenerierungen von Videomaterial.
  • Ein lokales Browser-Board visualisiert die sekundengenaue Kameraführung und bietet eine Kommentarfunktion.
  • Das Werkzeug Hyperframes übersetzt Design-Referenzen wie Linear oder Anthropic in präzise Steuerungsbefehle.

Der Agent analysiert eine laufende Web-Applikation und entwirft ein 30-sekündiges Demo-Video im 16:9-Format. Statt reinem Text erzeugt das Setup eine visuelle Vorschau im Browser, in der Sekundenabläufe, Zoom-Aktionen und Button-Klicks simuliert werden. Über ein Feedback-Feld lassen sich Anpassungswünsche eingeben, bevor der Plan final gesperrt wird.

Generierung einfacher Test-Shots zur Fehlervermeidung

  • Einzelne Szenen werden zunächst als Rohfassung gerendert, um grundlegende Bewegungen zu prüfen.
  • Die isolierte Kontrolle verhindert das Wiederholen von Rendering-Fehlern im gesamten Video.
  • Kamera-Ruckeln und fehlerhafte Zoom-Stufen lassen sich vor der finalen Zusammenfügung korrigieren.

Der Agent nimmt jede geplante Szene einzeln in voller Auflösung auf und konvertiert sie in einen Kurzclip. Der Anwender prüft die erste Szene im Browser und gibt erst nach Freigabe die Batch-Erstellung aller weiteren Szenen frei. Das schont Rechenressourcen und ermöglicht die rasche Ausbesserung von wackeligen Kamerafahrten.

Verfeinerung, Nahtloser Schnitt und Musik-Integration

  • Szenen werden durch optimierte Kameratransitionen zu einem durchgehenden Video verschmolzen.
  • Automatische Prüfskripte scannen das Endergebnis auf visuelle Artefakte und Korrekturstellen.
  • Ein spezialisierter Musik-Skill wählt anhand der Schnittfrequenz passende Audio-Tracks von Mixkit aus.

Nach dem Zusammenfügen der Rohclips korrigiert der Agent Positionsfehler von Elementen und wendet automatische Qualitätsprüfungen an. Der Musik-Skill analysiert das Szenentempo sowie den Produktcharakter und lädt gebührenfreie Musiktitel herunter. Das Ergebnis ist ein vollautomatisches, vertontes Produktvideo.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기