Bild & Video

Erstellen und bearbeiten Sie beeindruckende Bilder und Videos aus Text-Prompts und visuellen Referenzen.

Überblick

Mit Bild & Video erstellen Sie hochwertige visuelle Inhalte aus einfachen Textbeschreibungen oder Referenzbildern. Erzeugen Sie statische Bilder oder dynamische Videos in jedem Stil, verfeinern Sie sie iterativ mit zusätzlichen Prompts, skalieren Sie sie für hochauflösende Ausgabe hoch und fügen Sie sogar Lippensynchronisation mit Audio hinzu.

Einige Bild & Video-Modelle und Funktionen zum Hochladen von Eingaben sind in den Vereinigten Staaten aufgrund regulatorischer Anforderungen oder Vorgaben von Anbietern eingeschränkt. Prüfen Sie die einzelnen Modellbeschreibungen auf die konkrete Verfügbarkeit.

Nutzer des Free-Plans können nur Bilder erstellen und sind auf drei Bildanfragen pro Tag beschränkt. Die Videoerstellung erfordert einen kostenpflichtigen Plan. Die Erstellung über die API erfordert einen Pro-Plan oder höher. Für API- Anfragen sind ByteDance-Modelle standardmäßig deaktiviert und erfordern vor der Nutzung eine ausdrückliche Genehmigung. Enterprise-Kunden können den Support kontaktieren, um Zugriff anzufordern.

Kernfunktionen

  • Bildgenerierung: Erstellen Sie hochwertige Bilder aus Text-Prompts oder Referenzbildern mit Modellen, die auf Geschwindigkeit oder Qualität optimiert sind
  • Videogenerierung: Erstellen Sie dynamische Videos mit filmischen Bewegungen, realistischer Physik und integriertem Audio. Die Videogenerierung ist nur mit kostenpflichtigen Plänen verfügbar
  • Iterative Verfeinerung: Verfeinern Sie Generierungen mit zusätzlichen Prompts und erstellen Sie Varianten
  • Verbesserungstools: Erhöhen Sie die Auflösung um bis zu 4x und wenden Sie realistische Lippensynchronisation mit Audio an
  • Mehrere Modelle: Nutzen Sie spezialisierte Modelle für verschiedene Anwendungsfälle – von schneller Iteration bis zu produktionsreifen Inhalten
  • Referenzunterstützung: Steuern Sie die Generierung mit Startframes, Endframes und Stilreferenzen. Unterstützt eine große Auswahl an Bilddateiformaten, darunter JPG, PNG, WEBP und weitere
  • Flexible Exporte: Laden Sie Dateien einzeln herunter oder importieren Sie sie direkt in ElevenCreative Studio-Projekte

Workflow

Der Erstellungsprozess führt in vier Phasen von der Inspiration zum fertigen Asset:

Entdecken: Finden Sie Community-Kreationen als Inspiration und analysieren Sie wirksame Prompts.

Generieren: Beschreiben Sie im Prompt-Feld, was Sie erstellen möchten, wählen Sie ein Modell aus und passen Sie die Einstellungen an.

Iterieren und verbessern: Prüfen Sie Generierungen, erstellen Sie Varianten und wenden Sie Verbesserungen wie Upscaling und Lippensynchronisation an.

Exportieren: Laden Sie fertige Assets herunter oder senden Sie sie direkt an ElevenCreative Studio.

Unterstützte Downloadformate

Video:

  • MP4: Codecs H.264, H.265. Qualität bis zu 4K (mit Upscaling)

Bild:

  • PNG: Hochauflösende, verlustfreie Ausgabe

Modelle

Bild & Video bietet Zugriff auf spezialisierte Modelle, die für unterschiedliche Anwendungsfälle optimiert sind. Jedes Modell bietet eigene Funktionen – von schneller Iteration bis zu produktionsreifer Qualität.

Nachbearbeitungsmodelle benötigen eine bestehende generierte Ausgabe. Sie können jedoch auch eine eigene Bild- oder Videodatei hochladen.

Enterprise-Workspace-Admins können steuern, welche Modelle zur Bild- und Videogenerierung für Workspace-Mitglieder verfügbar sind. Standardmäßig sind alle Modelle für Enterprise-Workspaces deaktiviert und müssen von Admins ausdrücklich aktiviert werden. Mehr über Modellfreigaben erfahren.

Bei API-Anfragen sind ByteDance-Modelle standardmäßig deaktiviert und erfordern vor der Nutzung eine ausdrückliche Freigabe. Enterprise-Kunden können den Support kontaktieren, um Zugriff anzufordern.

Jedes Modell unten ist in der Bild-&-Video-App verfügbar. Modelle, die auch über die Bild-&-Video-API aufgerufen werden können, führen ihre model_id unter API auf; die übrigen sind nur in der App verfügbar.

Ein einheitliches multimodales Videomodell mit gemeinsamer Audio-Video-Generierung, das Regie-Kontrolle über Performance, Beleuchtung, Schatten und Kamerabewegung für ultrarealistische, filmische Ergebnisse bietet.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen
  • Videoreferenzen
  • Audioreferenzen

Funktionen:

  • Einheitliche multimodale Architektur, die synchronisiertes Audio und Video in einem Durchlauf generiert
  • Branchenführende multimodale Referenz- und Bearbeitungsfunktionen mit gleichzeitiger Verarbeitung von Text-, Bild-, Audio- und Videoeingaben
  • Außergewöhnliche Bewegungsstabilität mit filmrealisierter Qualität nach Branchenstandards
  • Kreative Kontrolle auf Regieebene über Performance, Beleuchtung, Schatten und Kamerabewegung
  • Flexible Generierungslängen von 4 s bis 15 s
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p, 1080p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Filmisches Storytelling mit synchronisiertem Audio und Bild
  • Referenzbasierte Inhalte mit strikter Orientierung an Quellbildern, -videos oder -audio
  • Professionelle Produktionen, die präzise Kontrolle über Beleuchtung und Kameraarbeit benötigen

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: bytedance-seedance-v2

Einstellungen können angepasst werden, um den Creditverbrauch zu steuern.

Seedance 2.0 ist in den Vereinigten Staaten nicht verfügbar.

Eine schnellere, kostengünstigere Variante von Seedance 2.0 mit denselben multimodalen Referenzeingaben, begrenzt auf 720p-Ausgabe.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 9)
  • Videoreferenzen (bis zu 3, zusammen 15 s)
  • Audioreferenzen (bis zu 3, zusammen 15 s)

Funktionen:

  • Gleiche Referenzverarbeitung wie Seedance 2.0, mit einem gemeinsamen Limit von 12 Referenzen pro Generierung
  • Bilder und Referenzen schließen sich gegenseitig aus: Verwenden Sie ein Start- oder Endbild oder Referenzen, nicht beides
  • Flexible Generierungslängen von 4 s bis 15 s
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Iteration von Seedance-2.0-Prompts vor einem Rendering in voller Auflösung
  • Referenzbasierte Clips, bei denen 720p-Ausgabe ausreicht

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: bytedance-seedance-v2-fast

Seedance 2.0 Fast ist in den Vereinigten Staaten nicht verfügbar.

Die kleinste Seedance-2.0-Variante: etwa doppelt so schnell wie Seedance 2.0 bei ungefähr halben Kosten, mit denselben Eingaben und 720p-Ausgabe.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 9)
  • Videoreferenzen (bis zu 3, zusammen 15 s)
  • Audioreferenzen (bis zu 3, zusammen 15 s)

Funktionen:

  • Gleiche Referenzverarbeitung wie Seedance 2.0, mit einem gemeinsamen Limit von 12 Referenzen pro Generierung
  • Bilder und Referenzen schließen sich gegenseitig aus: Verwenden Sie ein Start- oder Endbild oder Referenzen, nicht beides
  • Flexible Generierungslängen von 4 s bis 15 s
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Entwürfe und Vorschauen mit hohem Volumen
  • Kostenbewusste Workflows, die dennoch Audio- und Referenzeingaben benötigen

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: bytedance-seedance-v2-mini

Seedance 2.0 Mini ist in den Vereinigten Staaten nicht verfügbar.

Der Nachfolger von Seedance 2.0 mit realistischerer Darstellung, bis zu 50 kombinierten Bild-, Video- und Audioreferenzen sowie Generierungen von bis zu 30 Sekunden.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 30)
  • Videoreferenzen (bis zu 10, zusammen 30 s)
  • Audioreferenzen (bis zu 10, zusammen 30 s)

Funktionen:

  • Kein gemeinsames Limit über Referenztypen hinweg; reine Audioreferenzen werden ohne Bild oder Video akzeptiert
  • Bilder und Referenzen schließen sich gegenseitig aus
  • Flexible Generierungslängen von 4 s bis 30 s
  • Das Seitenverhältnis wird bei Angabe eines Startbilds oder Referenzvideos daraus übernommen
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Längere Clips, die bei vielen Referenzen konsistent bleiben müssen
  • Dialog- und Performanceszenen, die von Referenzaudio gesteuert werden

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: bytedance-seedance-v2.5

Seedance 2.5 bietet keine Seed-Steuerung.

Seedance 2.5 ist in den Vereinigten Staaten nicht verfügbar.

Bearbeitet ein bestehendes Video durch Beschreibung der Änderungen. Ausgabelänge und Seitenverhältnis folgen dem Eingabevideo.

Generierungseingaben:

  • Zu bearbeitendes Video (erforderlich, bis zu 30 s)
  • Text-Prompt zur Beschreibung der Bearbeitungen
  • Bildreferenzen (bis zu 30)
  • Zusätzliche Videoreferenzen (bis zu 10, zusammen 30 s)
  • Audioreferenzen (bis zu 10, zusammen 30 s)

Funktionen:

  • Keine Steuerung der Dauer: Die Ausgabe entspricht der Länge des Eingabevideos
  • Das Seitenverhältnis wird vom Eingabevideo übernommen
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p

Ideal für:

  • Änderung von Kleidung, Requisiten, Beleuchtung oder Umgebung in vorhandenem Material
  • Stiltransfer unter Beibehaltung der ursprünglichen Bewegung

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Seedance 2.5 Video Edit ist in den Vereinigten Staaten nicht verfügbar.

Setzt ein bestehendes Video an seinem Ende fort, gesteuert durch einen Prompt und optionale Referenzen.

Generierungseingaben:

  • Zu verlängerndes Video (erforderlich, bis zu 30 s)
  • Text-Prompt zur Beschreibung der Fortsetzung
  • Bildreferenzen (bis zu 30)
  • Zusätzliche Videoreferenzen (bis zu 10, zusammen 30 s)
  • Audioreferenzen (bis zu 10, zusammen 30 s)

Funktionen:

  • Verlängerungsdauer von 4 s bis 30 s
  • Das Seitenverhältnis wird vom Eingabevideo übernommen
  • Native Soundsteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p

Ideal für:

  • Verlängerung einer Aufnahme, die zu früh endet
  • Verknüpfen mehrerer Generierungen zu einer längeren Sequenz

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Seedance 2.5 Video Extend ist in den Vereinigten Staaten nicht verfügbar.

Ein fortschrittliches Videomodell, das wie ein KI-Regisseur arbeitet und bei komplexen Kamerabewegungen eine hohe Konsistenz von Figuren, Objekten und Szenen bewahrt.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild

Funktionen:

  • Hochpräzise Beibehaltung von Figuren und Szenen mit Bild- oder Videoreferenzen aus mehreren Perspektiven
  • Native Audio-Video-Kogenerierung mit mehrsprachigem Lip-Sync und Umgebungsgeräuschen
  • Flexible Generierungslängen von 3 s bis 15 s
  • Bis zu 4 Varianten gleichzeitig generieren
  • Verbesserte Verarbeitung von Text, Fluiddynamik und komplexen physikalischen Interaktionen

Ausgabeoptionen:

  • Auflösungen: nur 1080p
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Figurengetriebenes Storytelling, das visuelle Kontinuität erfordert
  • Werbung und Assets mit spezifischen Anforderungen an die Textdarstellung

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Unterstützt negative Prompts für präzise Steuerung. Sound kann pro Generierung aktiviert oder deaktiviert werden.

Kling 3.0 ist in den Vereinigten Staaten nicht verfügbar.

Ein Videomodell mit hoher Konsistenz, das wie ein KI-Regisseur arbeitet und die Identität von Figuren, Objekten und Szenen bei komplexen Kamerabewegungen bewahrt.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Videoreferenz
  • Bildreferenz

Funktionen:

  • Bewahrt die präzise visuelle Identität von Hauptfiguren und Objekten mithilfe von Referenzen aus mehreren Perspektiven
  • Unterstützt nahtlose Generierungslängen von 3 s bis 15 s
  • Bis zu 4 Varianten gleichzeitig generieren
  • Präzise Modellierung von Elementinteraktionen und kohärenten Bewegungen
  • Native Unterstützung für aktiviertes oder deaktiviertes Audio pro Generierung

Ausgabeoptionen:

  • Auflösungen: nur 1080p
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Figurengetriebenes Storytelling, das strikte visuelle Kontinuität erfordert
  • Professionelle Marketing- und Marken-Assets mit konsistenter Objektdarstellung

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Einstellungen können angepasst werden, um den Creditverbrauch zu steuern.

Kling O3 ist in den Vereinigten Staaten nicht verfügbar.

Ein durch natürliche Sprache gesteuertes Video-zu-Video-Bearbeitungsmodell auf Basis der O3-Architektur. Es ermöglicht komplexe visuelle Transformationen – etwa den Austausch von Figuren und Umgebungen – ohne manuelle Maskierung oder Anpassungen Bild für Bild.

Generierungseingaben:

  • Quellvideo
  • Bildreferenzen (bis zu 4 unterschiedliche Elemente/Perspektiven)
  • Textbeschreibung (Anweisungen in natürlicher Sprache)

Funktionen:

  • Interpretiert dialogorientierte Prompts, um Motive oder Umgebungen zu ersetzen und dabei die ursprüngliche Bewegungsstruktur zu berücksichtigen
  • Bewahrt während der Bearbeitung ursprüngliche Kamerawinkel, Bewegungsmuster und räumliche Beziehungen
  • Kombiniert bis zu 4 Elemente insgesamt, einschließlich Frontal- und Mehrperspektivenbildern, für hochpräzise Figurenkonsistenz
  • Option, das ursprüngliche Quellaudio zu bewahren oder pro Generierung eine stumme Ausgabe zu erzeugen
  • Bis zu 4 bearbeitete Varianten gleichzeitig generieren

Ausgabeoptionen:

  • Auflösungen: Abhängig vom Quellvideo
  • Seitenverhältnisse: Entsprechen dem Quellvideo

Ideal für:

  • Hochpräzisen Austausch von Figuren in vorhandenem Material bei Beibehaltung der ursprünglichen Bewegungen
  • Vollständige Transformationen der Szenenumgebung (z. B. eine Stadt bei Tag in eine futuristische Nachtlandschaft verwandeln)
  • Stiltransfers, die eine strikte Orientierung an bestehender Kameradynamik erfordern

Kosten: Variieren je nach Videodauer und ausgewählten Einstellungen

Kling O3 Edit ist in den Vereinigten Staaten nicht verfügbar.

Ein Modell auf professionellem Niveau für hochwertige, filmische Videogenerierung.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen

Funktionen:

  • Hervorragende Qualität und kreative Steuerung mit negativen Prompts
  • Vollständig integriertes und synchronisiertes Audio
  • Realistische Dialoge, Lip-Sync und Soundeffekte
  • Feste Dauern: 4 s, 6 s und 8 s
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig
  • Dedizierte Soundsteuerung

Ausgabeoptionen:

  • Auflösungen: 720p, 1080p
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Hochwertige, filmische Videogenerierung mit vollständiger kreativer Kontrolle

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: veo-3.1-generate-001

Das Aktivieren oder Deaktivieren von Sound verändert die Generierungs-Credits.

Ein Hochgeschwindigkeitsmodell für schnelle Vorschauen und Generierungen, das schärfere Bilder bei geringerer Latenz liefert.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild

Funktionen:

  • Erweiterte kreative Steuerung mit negativen Prompts und dedizierter Soundsteuerung
  • Feste Dauern: 4 s, 6 s und 8 s
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig
  • Modelliert reale Physik präzise für realistische Bewegungen und Interaktionen

Ausgabeoptionen:

  • Auflösungen: 720p, 1080p
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Schnelle Iteration und A/B-Tests von Visuals
  • Schnelllebige Social-Media-Inhalte

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

API: veo-3.1-fast-generate-001

Eine kosteneffiziente Hochgeschwindigkeitsvariante von Veo 3.1, die für schnelle Generierung bei reduziertem Rechenaufwand optimiert ist.

Generierungseingaben:

  • Text-zu-Video
  • Startbild

Funktionen:

  • Präzise kreative Steuerung mit negativen Prompts und dedizierter Soundsteuerung
  • Feste Dauern: 4 s, 6 s und 8 s
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Inhaltserstellung mit hohem Volumen, bei der Geschwindigkeit und Kosteneffizienz im Vordergrund stehen
  • Schnelle Konzepterkundung und Vorschauen

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Googles physikbewusstes Videomodell mit nativem Audio, Ausgabe bis 4K sowie sowohl Bildinterpolation als auch referenzgestützter Generierung.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 10)
  • Videoreferenzen (bis zu 3, jeweils bis zu 10 s)

Funktionen:

  • Bilder und Referenzen schließen sich gegenseitig aus: Interpolieren Sie zwischen Bildern oder steuern Sie mit Referenzen
  • Feste Dauern von 3 s bis 10 s; bei angehängtem Referenzvideo richtet sich die Dauer danach
  • Starke Darstellung von kurzem Text und Beschriftungen im Bild
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 360p, 720p, 1080p, 4K
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Erklärvideos und kinetische Typografie mit lesbarem Text
  • Physikalisch überzeugende Bewegungen mit konsistenten Motiven über Referenzen hinweg

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Setzt ein bestehendes Video mit Gemini Omni Flash 1.1 an seinem Ende fort, für eine Gesamtlänge von bis zu 40 Sekunden.

Generierungseingaben:

  • Zu verlängerndes Video (erforderlich, bis zu 30 s)
  • Text-Prompt zur Beschreibung der Fortsetzung

Funktionen:

  • Verlängerungsdauer von 3 s bis 10 s
  • Das Seitenverhältnis folgt dem Eingabevideo
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 360p, 720p, 1080p, 4K

Ideal für:

  • Verlängerung von Gemini-Omni-Flash-Generierungen ohne sichtbaren Schnitt
  • Aufbau von Sequenzen, die länger sind als eine einzelne Generierung erlaubt

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Das erste Gemini-Omni-Videomodell: physikbewusste Bewegung, natives Audio und die beste Textdarstellung im Bild unter den verfügbaren Videomodellen, bei 720p.

Generierungseingaben:

  • Text-zu-Video
  • Bildreferenzen (bis zu 8)
  • Videoreferenz (1, bis zu 10 s)

Funktionen:

  • Feste Dauern von 3 s bis 10 s; bei angehängtem Referenzvideo richtet sich die Dauer danach
  • Kein Start- oder Endbild; verwenden Sie stattdessen Bildreferenzen, um ein Motiv zu verankern
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Kurze Bildunterschriften, Titel und beschriftete Erklärvideos
  • Konsistenz über mehrere Bilder bei 720p

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Ein verbessertes Spezialmodell für dynamische Sequenzen mit hoher Detailtreue, besserer zeitlicher Stabilität und präziser Steuerung der Übergänge zwischen Keyframes.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild

Funktionen:

  • Verbindet Start- und Endbilder nahtlos zu konsistenten Sequenzen mit mehreren Einstellungen
  • Detailgetreue Modellierung komplexer Aktionen und konsistenter Umgebungen
  • Unterstützt feste Generierungslängen von 4 s bis 12 s
  • Generieren Sie bis zu 4 Varianten gleichzeitig
  • Native Unterstützung für aktiviertes oder deaktiviertes Audio pro Generierung

Ausgabeoptionen:

  • Auflösungen: 420p, 720p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Storytelling und Actionszenen, die stabile Physik zwischen bestimmten visuellen Referenzpunkten erfordern
  • Filmische Übergänge und professionelle Video-Assets mit festen Anforderungen an Start und Ende

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Seedance 1.5 Pro ist veraltet. ByteDance stellt das Modell am 11. November 2026 ein, und es wird nicht mehr für neue Generierungen angeboten. Verwenden Sie stattdessen ein Seedance-2.0-Modell. Seedance 1.5 Pro ist in den Vereinigten Staaten nicht verfügbar.

Das Videomodell von Black Forest Labs mit natürlichen Bewegungen, Szenen mit mehreren Einstellungen, generiertem Audio und Videoverlängerung.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Zu verlängerndes Video (1, bis zu 15 s)

Funktionen:

  • Die Videoverlängerung kann nicht zusammen mit Start- und Endbildern verwendet werden
  • Flexible Generierungslängen von 5 s bis 20 s
  • Native Audiosteuerung mit aktiviertem oder deaktiviertem Audio pro Generierung
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p, 1080p
  • Seitenverhältnisse: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Szenen mit mehreren Einstellungen aus einem einzigen Prompt
  • Verlängern eines bestehenden Clips mit passenden Bewegungen und Audio

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Das Flaggschiff-Videomodell von MiniMax mit multimodalen Referenzen, generiertem Audio und Ausgabe bis 4K.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 9)
  • Videoreferenzen (bis zu 3, jeweils 2 s bis 15 s, zusammen 15 s)
  • Audioreferenzen (bis zu 3, jeweils 2 s bis 15 s, zusammen 15 s)

Funktionen:

  • Insgesamt maximal 12 Referenzen pro Generierung; Audioreferenzen erfordern mindestens eine Bild- oder Videoreferenz
  • Bilder und Referenzen können nicht zusammen verwendet werden
  • Flexible Generierungslängen von 5 s bis 15 s
  • Generiert synchronisiertes Audio
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 768p, 2K, 4K (2K und 4K werden aus 768p hochskaliert)
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Referenzbasierte Szenen, die in hoher Auflösung bereitgestellt werden müssen
  • Dialogclips, die durch Referenz-Audio gesteuert werden

Kosten: Variieren je nach gewählten Einstellungen und Dauer

MiniMax H3 ist in den Vereinigten Staaten nicht verfügbar.

Eine nahezu sofortige Variante von MiniMax H3 mit denselben Eingaben und ausgeprägter Ästhetik, nativ gerendert mit bis zu 768p.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild
  • Bildreferenzen (bis zu 9)
  • Videoreferenzen (bis zu 3, jeweils 2 s bis 15 s, zusammen 15 s)
  • Audioreferenzen (bis zu 3, jeweils 2 s bis 15 s, zusammen 15 s)

Funktionen:

  • Insgesamt maximal 12 Referenzen pro Generierung; Audioreferenzen erfordern mindestens eine Bild- oder Videoreferenz
  • Bilder und Referenzen können nicht zusammen verwendet werden
  • Flexible Generierungslängen von 5 s bis 15 s
  • Generiert synchronisiertes Audio
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 768p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Schnelle Iteration mit Prompts und Referenzen
  • Vorschauen vor dem Rendern mit MiniMax H3

Kosten: Variieren je nach gewählten Einstellungen und Dauer

MiniMax H3 Max ist in den Vereinigten Staaten nicht verfügbar.

Ein hochmodernes Videomodell mit Schlussfolgerungsfähigkeit für präzise Prompt-Befolgung und komplexe Simulationen der physikalischen Welt. Es nutzt fortschrittliche logische Verarbeitung, um detaillierte Anweisungen zu interpretieren und umzusetzen.

Generierungseingaben:

  • Text-zu-Video (Beschreibung)
  • Startbild & Endbild
  • Videoreferenz
  • Bildreferenz

Funktionen:

  • Außergewöhnliche Fähigkeit, mehrschichtige Prompts zu interpretieren und komplexe chronologische Aktionen auszuführen
  • Nutzt Bilder und Videos als visuelle Anker, um eine hohe Konsistenz von Charakteren und Szenen zu gewährleisten
  • Überlegene Modellierung physischer Interaktionen, von Ursache und Wirkung sowie Fluiddynamik
  • Unterstützt hochwertige Generierung für Clips mit 5 s und 10 s
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: Abhängig von der Eingabe
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Sehr spezifische kreative Konzepte, die präzise Befolgung langer, detaillierter Beschreibungen erfordern
  • Professionelles Storytelling, bei dem physischer Realismus und Konsistenz über mehrere Referenzen hinweg entscheidend sind

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Kling O1 ist in den Vereinigten Staaten nicht verfügbar.

Ein Videobearbeitungsmodell, das über natürliche Sprache gesteuert wird und komplexe visuelle Transformationen wie Charakteraustausch und Umgebungswechsel ermöglicht – ohne manuelles Maskieren oder Anpassungen Bild für Bild.

Generierungseingaben:

  • Quellvideo
  • Bildreferenzen (bis zu 4 unterschiedliche Elemente/Winkel)
  • Textbeschreibung (Anweisungen in natürlicher Sprache)

Funktionen:

  • Interpretiert konversationelle Prompts, um Motive oder Umgebungen zu ersetzen, während die ursprüngliche Bewegungsstruktur erhalten bleibt
  • Erhält ursprüngliche Kamerawinkel, Bewegungsmuster und räumliche Beziehungen während der gesamten Bearbeitung
  • Kombiniert bis zu 4 Elemente insgesamt, einschließlich frontaler Bilder und Bilder aus mehreren Winkeln, für detailgetreue Charakterkonsistenz
  • Option, das ursprüngliche Quellaudio zu erhalten oder pro Generierung eine stumme Ausgabe zu erzeugen
  • Generieren Sie bis zu 4 bearbeitete Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: Abhängig vom Quellvideo
  • Seitenverhältnisse: Entsprechen dem Quellvideo

Ideal für:

  • Detailgetreuen Charakteraustausch in bestehendem Material bei Beibehaltung der ursprünglichen Bewegungen
  • Vollständige Transformationen der Szenenumgebung, z. B. eine Stadt bei Tag in eine futuristische Nachtlandschaft verwandeln
  • Stilübertragungen, die eine strikte Einhaltung bestehender Kameradynamik erfordern

Kosten: Variieren je nach Videodauer und gewählten Einstellungen

Kling O1 Edit ist in den Vereinigten Staaten nicht verfügbar.

Ein Spezialmodell für präzise Bewegungsübertragung. Steuern Sie ein Charakterbild mit einem Referenzvideo, um bestimmte Bewegungen, Gesten und Kamerawinkel nachzubilden.

Generierungseingaben:

  • Charakterbild (Quelle)
  • Bewegungsvideo (Referenz)
  • Textbeschreibung (optional)

Funktionen:

  • Wählen Sie „Video abgleichen“ für die exakte Bewegungsreplikation oder „Bild abgleichen“, um einem Charakter neue kreative Bewegungen hinzuzufügen
  • Unterstützt bis zu 30 s im Modus „Video abgleichen“ und 10 s im Modus „Bild abgleichen“
  • Detailgetreue Übertragung menschlicher Bewegungen aus Referenzmaterial auf einen statischen Charakter
  • Native Unterstützung zum Aktivieren oder Deaktivieren von Audio pro Generierung
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: Abhängig von der Quelle
  • Seitenverhältnisse: Abhängig von der Quelle

Ideal für:

  • Nachbildung komplexer Choreografien oder bestimmter Bewegungen mit einem individuellen Charakter
  • Langformatige Charakteranimationen, die hohe Bewegungsgenauigkeit erfordern
  • Social-Media-Inhalte, die von angesagten Videobewegungen inspiriert sind

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Kling 2.6 Motion Control ist in den Vereinigten Staaten nicht verfügbar.

Ein Spezialmodell für präzise Bewegungsübertragung auf Basis der Kling-3.0-Architektur. Steuern Sie ein Charakterbild mit einem Referenzvideo, um bestimmte Bewegungen, Gesten und Kamerawinkel detailgetreuer nachzubilden.

Generierungseingaben:

  • Charakterbild (Quelle)
  • Bewegungsvideo (Referenz)
  • Textbeschreibung (optional)

Funktionen:

  • Wählen Sie „Video abgleichen“ für die exakte Bewegungsreplikation oder „Bild abgleichen“, um einem Charakter neue kreative Bewegungen hinzuzufügen
  • Unterstützt bis zu 30 s im Modus „Video abgleichen“ und 10 s im Modus „Bild abgleichen“
  • Detailgetreue Übertragung menschlicher Bewegungen aus Referenzmaterial auf einen statischen Charakter
  • Native Unterstützung zum Aktivieren oder Deaktivieren von Audio pro Generierung
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: Abhängig von der Quelle
  • Seitenverhältnisse: Abhängig von der Quelle

Ideal für:

  • Nachbildung komplexer Choreografien oder bestimmter Bewegungen mit einem individuellen Charakter
  • Langformatige Charakteranimationen, die hohe Bewegungsgenauigkeit erfordern
  • Social-Media-Inhalte, die von angesagten Videobewegungen inspiriert sind

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Kling 3.0 Motion Control ist in den Vereinigten Staaten nicht verfügbar.

Ein optimiertes generatives Modell für höhere Bewegungsgenauigkeit und flüssigere Übergänge. Es bietet ein Gleichgewicht zwischen schneller Iteration und visueller Ausgabe in Produktionsqualität.

Generierungseingaben:

  • Text-zu-Video
  • Startbild (Bild-zu-Video)

Funktionen:

  • Verbesserte Bewegungsdynamik: Deutliche Verbesserungen bei Bewegungsflüssigkeit und realistischen physikalischen Interaktionen
  • Flexible Soundsteuerung: Native Unterstützung zum Aktivieren oder Deaktivieren von Audio pro Generierung
  • Stapelerstellung: Generieren Sie bis zu 4 Varianten gleichzeitig
  • Detaillierte Verfeinerung: Erweiterte kreative Kontrolle durch Unterstützung negativer Prompts
  • Feste Dauern: Unterstützt Generierungslängen von 5 s und 10 s

Ausgabeoptionen:

  • Auflösungen: Abhängig von der Eingabe
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Aktionsreiche Clips, die flüssige Charakterbewegungen erfordern
  • Professionelle Social-Media-Inhalte mit präziser Prompt-Befolgung

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Kling 2.6 ist in den Vereinigten Staaten nicht verfügbar.

Ein ausgewogenes und vielseitiges Modell für hochwertige Full-HD-Videogenerierung.

Generierungseingaben:

  • Text-zu-Video
  • Startbild

Funktionen:

  • Hervorragend bei der Simulation komplexer Bewegungen und realistischer Physik
  • Modelliert Fluiddynamik und Ausdrücke präzise
  • Feste Dauern: 5 s und 10 s
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1080p
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Realistische Physiksimulationen und komplexe Bewegungen

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Endbild wird derzeit nicht unterstützt. Bildreferenzen können nicht bereitgestellt werden. Soundsteuerung ist nicht verfügbar.

Kling 2.5 ist in den Vereinigten Staaten nicht verfügbar.

Hochmoderne Bewegungsqualität, Prompt-Befolgung und visuelle Detailtreue für filmische, äußerst realistische Videos.

Generierungseingaben:

  • Text-zu-Video
  • Startbild (Bild-zu-Video)

Funktionen:

  • Außergewöhnliche Bewegungsqualität mit branchenführendem Realismus und Physiksimulation
  • Überlegene Prompt-Befolgung für präzise kreative Kontrolle komplexer Szenen
  • Hohe visuelle Detailtreue für Ausgabe in Kinoqualität
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: 16:9, 9:16

Ideal für:

  • Filmische Inhalte, die höchste Bewegungsqualität und Realismus erfordern
  • Professionelle Produktionen mit Anforderungen an präzise Prompt-Befolgung
  • Visuelles Storytelling mit hoher Detailtreue

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Ein fortschrittliches Videomodell für schnelle Iteration und kosteneffiziente Erstellung, das hochwertige Videos erzeugen kann.

Generierungseingaben:

  • Text-zu-Video
  • Startbild (Bild-zu-Video)

Funktionen:

  • Optimiert für extrem schnelle Generierung und liefert Ergebnisse bis zu viermal schneller als frühere Iterationen
  • Ermöglicht die präzise Steuerung von Charakterbewegungen, Kamerawinkeln und Szenenkompositionen
  • Hervorragend bei der Aufrechterhaltung visueller Kohärenz und Stabilität in dynamischen Szenen
  • Unterstützt Generierungslängen von 2 s bis 10 s
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Schnelles Prototyping und kreative Experimente, die nahezu sofortiges Feedback erfordern
  • Professionelle Projekte mit kurzen Durchlaufzeiten für hochauflösende Marketing-Assets
  • Filmische Inhalte mit spezifischen Anforderungen an Kamerabewegungen

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Ein hochmodernes In-Context-Videomodell für visuelle Generierung mit mehreren Aufgaben. Es kann komplexe Bearbeitungen ausführen und zugleich die Grundstruktur des Quellmaterials erhalten.

Generierungseingaben:

  • Quellvideo
  • Referenzbild
  • Textbeschreibung

Funktionen:

  • Fügt Objekte und Motive in einer Szene nahtlos hinzu, entfernt oder transformiert sie – mit natürlicher Beleuchtung, Schatten und Perspektive
  • Ändert Orte, Jahreszeiten und Tageszeiten, z. B. durch Umwandeln von Aufnahmen bei Bewölkung in einen dramatischen Sonnenuntergang, mit realistischen Anpassungen der Farbtemperatur
  • Verändert Alter und Aussehen von Darstellern oder gestaltet Kleidung und Motive per einfachen Prompts in natürlicher Sprache neu
  • Überträgt die spezifische Bewegung und Kamerafahrt eines Referenzvideos auf ein statisches Bild für präzise Animationssteuerung
  • Generiert vollständig neue Kamerawinkel wie Gegenschüsse oder Untersichten aus einer einzigen bestehenden Videosequenz
  • Umfasst präzises Green-Screening (Isolierung mit Kantenerkennung), Generierung der nächsten Einstellung zur Fortsetzung einer Geschichte und ästhetische Stilübertragung
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: Automatisch

Ideal für:

  • Professionelle Aufgaben für visuelle Effekte wie digitale Verjüngung, Neuausleuchtung und Objektentfernung
  • Schnelles filmisches Prototyping und Generierung alternativer Kameraabdeckungen aus einer einzigen Einstellung
  • Kreative Marketinginhalte, die drastische Änderungen von Umgebung oder Stil erfordern

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Das Videobearbeitungsmodell von Runway: Transformiert ein bestehendes Video in Richtung eines Ziel-Looks und erhält dabei Bewegung und Konsistenz.

Eingaben:

  • Quellvideo (erforderlich, 2 s bis 30 s)
  • Bild mit Ziel-Look (erforderlich)
  • Text-Prompt zur Beschreibung der Bearbeitungen

Funktionen:

  • Ausgabelänge und Bildausschnitt folgen dem Quellvideo
  • Stilübertragung, gesteuert durch das Bild mit Ziel-Look
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig

Ideal für:

  • Neuausleuchten, Umstylen oder Ändern der Umgebung von bestehendem Material
  • Übertragen des Looks eines Referenzbilds auf einen gesamten Clip

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Ein Spezialmodell zur Übertragung von Darstellungen, das Charaktere animiert, indem es Bewegungen, Sprache und Gesichtsausdrücke aus einem Steuerungsvideo auf ein Charakterbild oder eine Videoreferenz überträgt.

Generierungseingaben:

  • Steuerungsdarstellung (Video)
  • Charaktereingabe (Bild oder Video)

Funktionen:

  • Überträgt nuancierte Gesichtsausdrücke, Lippensynchronisation und synchronisiertes Audio direkt von einem Ausgangsschauspieler auf jeden Charakter
  • Fügt statischen Charakterbildern automatisch Sekundärbewegungen und dezente Kamerawackler für einen natürlicheren Look hinzu
  • Präzise Umschaltoption zum Aktivieren oder Deaktivieren von Körper- und Handbewegungen bei Verwendung eines Charakterbilds
  • Anpassbare Einstellungen für das Gleichgewicht zwischen intensiver emotionaler Darstellung und visueller Konsistenz des Charakters
  • Möglichkeit, die Stimme des Charakters nach der Generierung zu ändern, während die perfekte Ausrichtung an der Steuerungsdarstellung erhalten bleibt

Ausgabeoptionen:

  • Auflösungen: 720p
  • Seitenverhältnisse: Automatisch

Ideal für:

  • Statische Charakterporträts mit realistischen menschlichen Bewegungen und Sprache zum Leben erwecken
  • Animation nicht-menschlicher Charaktere oder stilisierter Avatare mit detailgetreuen Ausdrücken
  • Schnelle Erstellung von Talking-Head-Inhalten mit integrierten Körpergesten

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Ein Spezialmodell für dynamische Sequenzen mit mehreren Einstellungen, großen Bewegungen und Action.

Generierungseingaben:

  • Text-zu-Video
  • Startbild
  • Endbild

Funktionen:

  • Sehr stabile Physik und nahtlose Übergänge zwischen Einstellungen
  • Feste Dauern: 3 s, 4 s, 5 s, 6 s, 7 s, 8 s, 9 s, 10 s, 11 s und 12 s
  • Stapelerstellung mit bis zu 4 Generierungen gleichzeitig
  • Maximale kreative Flexibilität durch zahlreiche Optionen für Seitenverhältnisse

Ausgabeoptionen:

  • Auflösungen: 480p, 720p, 1080p
  • Seitenverhältnisse: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Storytelling und Actionszenen, die stabile Physik erfordern

Kosten: Variieren je nach gewählten Einstellungen und Dauer

Seitenverhältnis und Auflösung wirken sich nicht auf Generierungsguthaben aus, die Dauer jedoch schon.

Seedance 1 Pro ist in den Vereinigten Staaten nicht verfügbar.

Ein DiT-basiertes Basismodell zur Generierung synchronisierter Videos und Audios in einem einzigen Durchlauf. Es gewährleistet stimmige Sprache und realistische Bewegungen.

Generierungseingaben:

  • Text-zu-Video
  • Bild-zu-Video
  • Audio-zu-Video
  • Tiefe-zu-Video

Funktionen:

  • Generiert Dialoge, Lippenbewegungen und Umgebungsgeräusche gleichzeitig für perfekte Abstimmung ohne externe Tools
  • Dynamische Szenen mit stabilen Bewegungen, konsistenter Identität und hoher Kohärenz zwischen den Frames
  • Unterstützt hochwertige synchronisierte Generierung für bis zu 20 Sekunden
  • Erweiterte kreative Steuerung durch detaillierte Unterstützung negativer Prompts
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 720p, 1080p
  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Stimmige Sprache und ausdrucksstarke Charakterdarstellungen
  • Narrative Inhalte, die integrierte Umgebungsgeräusche und konsistentes Timing erfordern
  • Dynamische Szenen mit komplexer kamerabewusster Bewegungslogik

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Ein generatives Modell mit hoher Detailtreue, optimiert für maximale visuelle Details und strukturelle Stabilität. Es kann produktionstaugliche 4K-Ausgaben mit flüssigen Bewegungen erzeugen.

Generierungseingaben:

  • Text-zu-Video
  • Startframe (Bild-zu-Video)

Funktionen:

  • Priorisiert visuelle Qualität und Konsistenz gegenüber Geschwindigkeit und gewährleistet stabile Ergebnisse über längere Sequenzen hinweg
  • Unterstützt sowohl 25 FPS als auch 50 FPS für besonders flüssige und professionelle Bewegungen
  • Integrierte audiovisuelle Generierung mit Schalter zum Aktivieren oder Deaktivieren von Ton
  • Entwickelt für native 1080p-, 2k- und 4k-Ausgaben ohne Detailverlust
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1080p, 2k, 4k
  • Bildraten: 25 FPS, 50 FPS
  • Seitenverhältnis: 16:9 (Standard)
  • Dauer: 6 s, 8 s, 10 s

Ideal für:

  • Hochauflösende Kinoproduktionen, die 4K-Klarheit erfordern
  • Professionelle Inhalte, die flüssige Bewegungen mit 50 FPS erfordern
  • Detaillierte Sequenzen, bei denen visuelle Stabilität und strukturelle Integrität entscheidend sind

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Ein präzises KI-Regietool, das gezielte Änderungen von Dialogen, Emotionen und Aktionen in bestehenden Einstellungen ermöglicht, ohne die Kontinuität zu brechen oder die gesamte Sequenz neu zu generieren.

Generierungseingaben:

  • Quellvideo
  • Textbeschreibung

Funktionen:

  • Ändern Sie bestimmte Segmente und bewahren Sie dabei den Kontext der umgebenden Frames
  • Formulieren Sie gesprochene Zeilen um und erhalten Sie Stimme, Darstellung und Umgebung des Charakters
  • Mehrere Bearbeitungsmodi: Wählen Sie zwischen „Audio & Video“, „Nur Audio“ oder „Nur Video“, um bestimmte Elemente der Einstellung zu isolieren und neu zu generieren
  • Neue Inhalte übernehmen Bewegungen, Beleuchtung und Ton des Originals für nahtlose Übergänge
  • Experimentieren Sie sofort mit alternativen Charakterreaktionen, emotionalen Momenten oder Kamerabewegungen innerhalb einer einzigen Einstellung
  • Generieren Sie bis zu 4 Varianten gleichzeitig für den direkten kreativen Vergleich

Ausgabeoptionen:

  • Seitenverhältnisse: nur 16:9

Ideal für:

  • Anpassung von Skripten und Verfeinerung von Dialogen ohne Nachdrehs oder Neuaufnahmen
  • Korrektur emotionaler Momente oder Probleme mit dem Tempo in der Postproduktion
  • Testen mehrerer Markenbotschaften und Handlungsaufforderungen in einem einzelnen Marketing-Asset

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Ein geschwindigkeitsoptimiertes generatives Modell für kurze Feedbackschleifen und schnelle Inhaltserstellung. Es liefert hochauflösende Visuals bei deutlich reduzierten Renderzeiten.

Generierungseingaben:

  • Text-zu-Video
  • Startframe (Bild-zu-Video)

Funktionen:

  • Für Geschwindigkeit und schnelle Iterationen entwickelt, für schnelle visuelle Experimente und nahezu sofortige Vorschauen
  • Unterstützt native 1080p-, 2k- und 4k-Ausgaben mit geringerem Rechenaufwand als das Pro-Modell
  • Unterstützt 25 FPS und 50 FPS für flüssige Bewegungen bei hoher Geschwindigkeit
  • Ermöglicht die schnelle Generierung synchronisierter audiovisueller Inhalte mit einer Dauer von bis zu 20 Sekunden
  • Native Unterstützung zum Aktivieren oder Deaktivieren von Audio pro Generierung
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1080p, 2k, 4k
  • Bildraten: 25 FPS, 50 FPS
  • Seitenverhältnis: 16:9 (Standard)
  • Dauer: 6 s, 8 s, 10 s, 12 s, 14 s, 16 s, 18 s, 20 s

Ideal für:

  • Schnelles Prototyping und kreative Erkundung, wenn Geschwindigkeit wichtiger ist als maximale Details
  • Social-Media-Inhalte in hohem Volumen, die schnelle Durchlaufzeiten erfordern
  • A/B-Tests verschiedener visueller Konzepte und Bewegungsstile

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Ein filmisches Videomodell mit Bild-, Video- und Audio-Referenzen, generiertem Audio und Generierungen von bis zu 30 Sekunden.

Generierungseingaben:

  • Text-zu-Video
  • Startframe
  • Endframe
  • Bildreferenzen (bis zu 10)
  • Videoreferenzen (bis zu 5, insgesamt 15 s)
  • Audioreferenzen (bis zu 5, insgesamt 15 s)

Funktionen:

  • Frames und Referenzen schließen sich gegenseitig aus
  • Feste Dauer: 5 s, 10 s, 15 s, 20 s und 30 s
  • Native Tonsteuerung mit pro Generierung aktiviertem oder deaktiviertem Audio
  • Optionale Prompt-Optimierung
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p, 1080p
  • Seitenverhältnisse: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Längere filmische Einstellungen mit hoher Prompt-Treue
  • Referenzbasierte Szenen mit Audio

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Wan 3.0 ist in den Vereinigten Staaten nicht verfügbar.

Eine schnellere Variante von Wan 3.0 mit denselben Eingaben und Ausgabeoptionen, geeignet für die Ideenfindung.

Generierungseingaben:

  • Text-zu-Video
  • Startframe
  • Endframe
  • Bildreferenzen (bis zu 10)
  • Videoreferenzen (bis zu 5, insgesamt 15 s)
  • Audioreferenzen (bis zu 5, insgesamt 15 s)

Funktionen:

  • Etwa halb so lange Generierungszeit wie Wan 3.0
  • Feste Dauer: 5 s, 10 s, 15 s, 20 s und 30 s
  • Native Tonsteuerung mit pro Generierung aktiviertem oder deaktiviertem Audio
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p, 1080p
  • Seitenverhältnisse: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Erkundung von Ideen vor dem finalen Wan-3.0-Rendern
  • Workflows mit zeitkritischen Durchlaufzeiten

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Wan 3.0 Prime ist in den Vereinigten Staaten nicht verfügbar.

Eine filmische Videoplattform der nächsten Generation, die eine einheitliche multimodale Architektur nutzt, um produktionstaugliche 1080p-Inhalte mit nativer Audiosynchronisierung und intelligenter Sequenzierung mehrerer Einstellungen bereitzustellen.

Generierungseingaben:

  • Text-zu-Video
  • Startframe (Bild-zu-Video)
  • Videoreferenz (Video-zu-Video)
  • Audioreferenz (optionales Hintergrundaudio oder Dialog)

Funktionen:

  • Einheitliches multimodales System: Verarbeitet Text, Bilder, Videos und Audio in einem integrierten Framework für konsistente Ausgabequalität
  • Native Audiosynchronisierung: Generiert und synchronisiert automatisch Dialoge, Erzählungen und Umgebungsgeräusche mit den Bewegungen auf dem Bildschirm
  • Intelligente Sequenzierung mehrerer Einstellungen: Ordnet zusammenhängende Videosequenzen automatisch zu stimmigen Handlungsbögen an und erhält die Konsistenz der Charaktere
  • Erweiterte Dauer: Unterstützt stabile, hochwertige Generierung mit festen Längen von 5 s, 10 s und 15 s
  • Erweiterte kreative Steuerung: Unterstützt negative Prompts für detaillierte Kontrolle und Batch-Erstellung von bis zu 4 Varianten

Ausgabeoptionen:

  • Auflösungen: 720p, 1080p
  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Professionelles narratives Storytelling und komplexe filmische Sequenzen mit mehreren Einstellungen
  • Social-Media-Anzeigen und Marketinginhalte, die integriertes, hochwertiges Audio erfordern
  • Charakterbasierte Inhalte, die durch Videoreferenzen eine strikte visuelle und Bewegungskonsistenz erfordern

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Wan 2.6 ist in den Vereinigten Staaten nicht verfügbar.

Ein vielseitiges Modell, das filmische Bewegungen und hohe Prompt-Treue aus Text oder einem Startbild liefert.

Generierungseingaben:

  • Text-zu-Video
  • Startframe (Bild-zu-Video)

Funktionen:

  • Detaillierte kreative Steuerung mit negativen Prompts und spezieller Tonsteuerung
  • Feste Dauer: 5 s und 10 s
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p, 1080p
  • Seitenverhältnisse: 16:9, 1:1, 9:16

Ideal für:

  • Filmische Inhalte mit hoher Prompt-Treue

Kosten: Variieren je nach ausgewählten Einstellungen und Dauer

Die Generierungskosten variieren je nach ausgewählten Einstellungen.

Wan 2.5 Video ist in den Vereinigten Staaten nicht verfügbar.

OpenAIs produktionstaugliches Bildmodell für hochdetaillierte Ausgaben und präzise Bearbeitung.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 10)

Funktionen:

  • Fünf Qualitätsstufen von Niedrig bis Maximum
  • Benutzerdefinierte Auflösung bis zu 3840 px pro Seite bei Seitenverhältnissen bis 3:1
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K, 4K oder benutzerdefiniert
  • Seitenverhältnisse: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Ideal für:

  • Finale Assets, bei denen Details und Qualität besonders wichtig sind
  • Präzise Bearbeitungen bestehender Bilder

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gpt-image-2.5-sunburst

Eine schnelle GPT-Image-2.5-Variante mit denselben Steuerungsmöglichkeiten wie Sunburst, optimiert für die alltägliche Generierung in hohem Volumen.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 10)

Funktionen:

  • Fünf Qualitätsstufen von Niedrig bis Maximum
  • Benutzerdefinierte Auflösung bis zu 3840 px pro Seite bei Seitenverhältnissen bis 3:1
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K, 4K oder benutzerdefiniert
  • Seitenverhältnisse: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Ideal für:

  • Bildgenerierung in hohem Volumen
  • Schnelle Iterationen, die dennoch 4K und benutzerdefinierte Größen benötigen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gpt-image-2.5-flare

Ein fortschrittliches KI-Modell für präzise Bildgenerierung mit verbesserter Textdarstellung und hochauflösenden Ausgabefunktionen.

Funktionen:

  • Präzise Textsteuerung zum Erstellen von Bildern mit korrekter Typografie und hoher Klarheit
  • Hochauflösende PNG-Ausgabe für den professionellen und kommerziellen Einsatz
  • Unterstützt mehrere Bildreferenzen zur Steuerung von Stil und Komposition
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 3:2, 1:1, 2:3
  • Qualitätsoptionen: niedrig, mittel, hoch

Ideal für:

  • Marketingvisuals und Design-Assets, die eine präzise Textplatzierung erfordern
  • Professionelle Inhalte mit Anforderungen an hohe Auflösung
  • Kreativprojekte, die eine präzise textbasierte Bildsteuerung benötigen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gpt-image-2

Ein fortschrittliches KI-Bildgenerierungsmodell, das produktionstaugliche Qualität mit ultraschneller Verarbeitung kombiniert und über verbessertes Weltwissen sowie konsistente Motive verfügt.

Funktionen:

  • Native 4K-Auflösung ohne Upscaling für gestochen scharfe Details
  • Extrem schnelle Bildgenerierung in nur 1–2 Sekunden
  • Hohe Prompt-Treue durch fortschrittliches Reasoning und Befolgen von Anweisungen
  • Klare, präzise Textdarstellung in mehreren Sprachen für Mockups, Beschilderung und Infografiken
  • Konsistentes Styling mehrerer Motive, das die Identität über mehrere Charaktere und Objekte hinweg bewahrt
  • Verbessertes Weltwissen für präzisere Szenengenerierung
  • Unterstützt mehrere Bildreferenzen zur Steuerung der Generierung
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
  • Auflösungen: Bis zu 4K

Ideal für:

  • Schnelle kreative Workflows, die Iterationen in Echtzeit erfordern
  • Markeninhalte und Storytelling mit konsistenter Charakteridentität
  • Professionelle Visuals mit präzisem Text und korrekter Typografie

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gemini-3.1-flash-image

Eine schnelle, kostengünstige Variante von Nano Banana 2 für schnelle Generierung und Bearbeitung in 1K.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 14)

Funktionen:

  • Feste 1K-Ausgabe für konstante Geschwindigkeit und Kosten
  • Dieselbe Kapazität von 14 Bildreferenzen wie Nano Banana 2
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K
  • Seitenverhältnisse: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Ideal für:

  • Schnelle Iterationen und Entwürfe
  • Massenbearbeitungen, bei denen 1K ausreicht

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gemini-3.1-flash-lite-image

Ein vielseitiges, produktionstaugliches Bildgenerierungsmodell von Krea AI, das Qualität und Geschwindigkeit für eine breite Palette kreativer Workflows ausbalanciert.

Funktionen:

  • Bildgenerierung mit hoher Detailtreue und starker Prompt-Treue
  • Unterstützt mehrere Bildreferenzen zur Steuerung der Generierung
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Professionelle Inhaltserstellung mit Anforderungen an gleichbleibende Qualität
  • Schnelle Iterationen über vielfältige kreative Konzepte hinweg

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Das Flaggschiff-Modell von Krea AI für Bildgenerierung. Es liefert maximale visuelle Detailtreue und erweiterte kreative Steuerung für professionelle Produktionsworkflows.

Funktionen:

  • Hohe Detailgenauigkeit und Realismus für professionelle Ausgaben
  • Erweiterte Stilsteuerung mit Unterstützung für mehrere Bildreferenzen
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Hochwertige kommerzielle und redaktionelle Bildproduktion
  • Komplexe kreative Kompositionen, die maximale Detailtreue erfordern

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein designorientiertes Text-zu-Bild-Modell mit hoher Prompt-Steuerung und klarer Komposition.

Generierungseingaben:

  • Text-zu-Bild

Funktionen:

  • Die 2K-Ausgabe verwendet die Pro-Modellvariante
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K
  • Seitenverhältnisse: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Ideal für:

  • Layoutorientierte Grafiken, Icons und Poster
  • Klare Kompositionen allein aus Text

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein designorientiertes Bildmodell, das den Stil von Referenzbildern übernehmen kann.

Generierungseingaben:

  • Text-zu-Bild
  • Stilreferenzen (bis zu 10)

Funktionen:

  • Stilabgleich: Präzise folgt dem Referenzstil genau, Flexibel übernimmt die allgemeine Optik
  • Die 2K-Ausgabe verwendet die Pro-Modellvariante
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K
  • Seitenverhältnisse: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Ideal für:

  • Markenkonsistente Grafiken aus einer Reihe von Stilreferenzen
  • Illustrations- und Designarbeiten

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein schlankes Bildmodell von ByteDance für schnelle Generierung, das hochwertige Ergebnisse mit geringerem Rechenbedarf liefert.

Funktionen:

  • Schnelle Generierung für rasche kreative Iterationen
  • Unterstützt mehrere Bildreferenzen zur Steuerung der Generierung
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Workflows zur Bildgenerierung in hohem Volumen, die Geschwindigkeit erfordern
  • Schnelle Konzepterkundung und Vorschauen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: bytedance-seedream-5-lite

Seedream 5 Lite ist in den Vereinigten Staaten nicht verfügbar.

Die höherauflösende Seedream-5-Variante für präzise Bearbeitung, mehrsprachigen Text und umfangreiche Infografiken.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 10)

Funktionen:

  • Präzise Darstellung mehrsprachiger Texte
  • Bewältigt umfangreiche Layouts wie Infografiken und Poster
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K
  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Textlastige Designs in mehreren Sprachen
  • Bearbeitung mehrerer Bilder mit strikter Einhaltung der Referenzen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: bytedance-seedream-5-pro

Seedream 5 Pro ist in den Vereinigten Staaten nicht verfügbar.

Ein schnelles Flaggschiffmodell für präzise textbasierte Bildgenerierung und komplexe, nicht-destruktive Fotobearbeitung, die Originaldetails erhält.

Funktionen:

  • Führt angeforderte Änderungen zuverlässig aus und bewahrt dabei Licht, Komposition und Erscheinung des Motivs in Quellbildern
  • Unterstützt komplexe Bearbeitungsaufgaben wie das Hinzufügen, Entfernen, Kombinieren und Überblenden von Elementen
  • Liefert Ergebnisse bis zu viermal schneller als frühere Versionen
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 3:2, 1:1, 2:3
  • Qualitätsoptionen: niedrig, mittel, hoch

Ideal für:

  • Praktische Fotoanpassungen und realistische virtuelle Anproben für Kleidung oder Frisuren
  • Konzeptuelle Transformationen und Stilfilter, die den Charakter des Eingabebilds bewahren
  • Schnelle Iteration von Text-zu-Bild-Konzepten

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gpt-image-1.5

OpenAIs Bildmodell der ersten Generation mit guter Prompt-Treue, lesbarem Text und detaillierter Bearbeitung.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 5)

Funktionen:

  • Drei Qualitätsstufen: Niedrig, Mittel, Hoch
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 3:2, 1:1, 2:3

Ideal für:

  • Workflows, die bereits auf GPT-Image-1-Ausgaben basieren
  • Einfache Bearbeitungen und Text-im-Bild-Aufgaben in Standardauflösung

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gpt-image-1

Ein leistungsstarkes multimodales Basismodell, das Text-zu-Bild-Synthese, präzise Bildbearbeitung und komplexe Kompositionen aus mehreren Bildern in einem effizienten Framework vereint.

Funktionen:

  • Native Unterstützung für die schnelle Generierung detailreicher Bilder mit bis zu 4K Auflösung
  • Bewahrt Gesichtszüge, Beleuchtung, Farbton und feine Details bei Bearbeitungsaufgaben auf Basis von Referenzeingaben besonders zuverlässig
  • Erkennt und kombiniert Zielelemente über mehrere Eingabebilder hinweg präzise für steuerbare, konsistente Ergebnisse
  • Bietet Kompositionsfunktionen auf Designerniveau mit klarer, präziser Darstellung kleinen Texts für Poster und Markenvisuals
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16
  • Auflösungen: 2K, 4K

Ideal für:

  • Professionelle Grafikdesign-Workflows mit Anforderungen an präzises Layout und Typografie
  • Komplexe Fotobearbeitung mit strikter Einhaltung von Referenzidentität und Beleuchtung
  • Hochauflösende kreative Composings mit mehreren visuellen Quellen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Seedream 4.5 ist in den Vereinigten Staaten nicht verfügbar.

Ein detailreiches Bildgenerierungsmodell mit fortschrittlichen Reasoning-Funktionen für hohe Prompt-Treue und präzise visuelle Konsistenz in komplexen Kompositionen.

Funktionen:

  • Interpretiert und setzt komplexe, mehrschichtige Textbeschreibungen mit hoher Präzision um
  • Nutzt Bildreferenzen, um Motividentität, Beleuchtung und ästhetischen Stil über mehrere Generierungen hinweg beizubehalten
  • Optimiert für realistische Texturen, komplexe räumliche Beziehungen und Beleuchtungseffekte in professioneller Qualität
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
  • Auflösungen: 1K, 2K

Ideal für:

  • Professionelle kreative Assets, die detaillierte und technische Text-Prompts strikt einhalten müssen
  • Bildbearbeitung mit hoher Konsistenz und Charakterdesign mit visuellen Referenzen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Kling O1 Image ist in den Vereinigten Staaten nicht verfügbar.

Ein produktionsreifes Modell für Bildgenerierung und -bearbeitung, das für professionelle Workflows entwickelt wurde und erstklassige Bildqualität mit Fokus auf Geschwindigkeit, Präzision und Konsistenz bietet.

Funktionen:

  • Referenzieren Sie mehrere Bilder gleichzeitig, um branchenführende Konsistenz bei Charakteren und Identitäten über Hunderte von Assets hinweg zu erzielen
  • Liefert einen beispiellosen Qualitätssprung bei Details und schließt die Lücke zur echten Fotografie – von Stofftexturen bis zu Architekturelementen
  • Liefert produktionsreife Textdarstellung für komplexe Typografie, UI-Mockups und Infografiken
  • Unterstützt präzise Markenfarbvorgaben per Hex-Code ohne Annäherung
  • Gewährleistet präzise Objektpositionierung, realistische Physik, stimmige Beleuchtung und korrekte Perspektive in komplexen Szenen
  • Optimiert für höhere Genauigkeit und Reaktionsfähigkeit bei strukturierten, komplexen Anweisungen
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16
  • Auflösungen: 720p, 1080p, 2K

Ideal für:

  • Kampagnen mit konsistenten Charakteren und präzise platzierte Produkte in jedem Kontext
  • Erstellung von Interface-Mockups mit lesbarem Text und konsistenten visuellen Designsystemen
  • Skalierbare Produktfotografie und kontextbezogene Lifestyle-Aufnahmen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein professionelles, Reasoning-basiertes Modell für Bildgenerierung und -bearbeitung, entwickelt für detailreiche Asset-Produktion, fortgeschrittene kreative Steuerung und präzise Umsetzung von Anweisungen.

Eingaben:

  • Bildreferenz
  • Textbeschreibung (unterstützt komplexe, mehrschichtige Prompts)

Funktionen:

  • Plant Szenen vor dem Rendern, um physikalisch präzise Beleuchtung, korrekte Objektbeziehungen und hohe Prompt-Treue zu liefern
  • Generiert scharfen, gut lesbaren mehrsprachigen Text in verschiedenen Schriftstilen und Handschriften für wirkungsvolle Poster und Produkt-Mockups
  • Bewahrt hohe Detailtreue und Ähnlichkeit für bis zu 5 Personen und mehrere Objekte über verschiedene kreative Ausgaben hinweg
  • Integriert Google Search, um Visuals mit tatsächlichen Daten, Wissen aus der realen Welt und Echtzeitinformationen wie Wetter oder Sport anzureichern
  • Passen Sie Kamerawinkel, Brennpunkte und Szenenbeleuchtung an, etwa für die Umwandlung von Tag zu Nacht, mit fortschrittlichen lokalen Bearbeitungstools
  • Überlegenes räumliches Verständnis ermöglicht die Generierung präziser Infografiken, technischer Diagramme und Präsentationsfolien
  • Generiert bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 1K, 2K, 4K
  • Seitenverhältnisse: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Ideal für:

  • Professionelle Werbung, Marken-Assets und hochwertige E-Commerce-Produktfotografie
  • Erklärinhalte für Bildung, datengestützte Infografiken und komplexe technische Dokumentation
  • Schnelles Prototyping hochauflösender visueller Designs mit konsistenter Charakter- oder Markenidentität

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gemini-3-pro-image

Ein schnelles Modell für die direkte, schnelle und hochwertige Bildgenerierung und -bearbeitung aus Text-Prompts.

Funktionen:

  • Unterstützt mehrere Bildreferenzen zur Steuerung der Generierung
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Ideal für:

  • Schnelle Bilderstellung und Iteration

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

API: gemini-2.5-flash-image

Ein fortschrittliches Basismodell für detailreiche Bildgenerierung, das beispiellose stilistische Kontrolle und visuelles Gedächtnis zur Wahrung der Konsistenz über Szenen hinweg bietet.

Funktionen:

  • Verankern Sie Charaktere, Stile oder bestimmte Objekte mithilfe von Eingabebildern, um professionelle Konsistenz über mehrere Ausgaben hinweg zu wahren
  • Optimiert für die Interpretation komplexer Beschreibungen in natürlicher Sprache zur präzisen Steuerung visueller Details, Beleuchtung und Emotionen
  • Erzeugt hochwertige Visuals für verschiedenste Anwendungsfälle – von filmischen Storyboards bis zu professioneller Produktfotografie
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16
  • Auflösungen: 720p, 1080p

Ideal für:

  • Sicherstellen, dass Protagonisten ihr Erscheinungsbild in unterschiedlichen Umgebungen und Beleuchtungen behalten
  • Schnelle Erstellung hochauflösender Marken-Assets, virtueller Anproben und skalierbarer Produktvisualisierungen
  • Erkundung verschiedener künstlerischer Richtungen bei gleichzeitiger Fixierung der visuellen Kernidentität durch Bildreferenzen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein für Geschwindigkeit optimiertes Bildgenerierungsmodell, das Ergebnisse 2,5-mal schneller als das Standardmodell Gen-4 Image liefert und dabei dieselbe Ausgabequalität beibehält.

Funktionen:

  • Optimierte Verarbeitung ermöglicht schnelle kreative Erkundung und generiert detailreiche Bilder in einem Bruchteil der Zeit
  • Laden Sie bis zu drei Referenzbilder hoch, um das Modell beim Verständnis bestimmter Charaktere, Umgebungen und künstlerischer Stile zu unterstützen
  • Löst die Herausforderung visueller Abweichungen, indem spezifische visuelle Merkmale aus Referenzbildern kodiert werden, um die Identität über mehrere Generierungen hinweg zu bewahren
  • Wenden Sie Ästhetik, Beleuchtung und Textur eines Referenzbilds mühelos auf völlig neue Motive und Szenen an
  • Nutzen Sie Seed-Parameter, um Varianten systematisch zu erkunden oder bestimmte Ausgaben präzise zu reproduzieren
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16
  • Auflösungen: 720p, 1080p

Ideal für:

  • Schnelle, skalierbare Erstellung plattformoptimierter Visuals für Instagram Stories (9:16) oder Standardbeiträge (1:1)
  • Wahrung einer strikten visuellen Identität über Kampagnen hinweg durch Marken-Styleguides als Referenzbilder
  • Entwicklung konsistenter Charakterposen und Umgebungen, während der Protagonist erkennbar bleibt
  • Präzise Erstellung vielfältiger Lifestyle- und saisonaler Produktaufnahmen mithilfe referenzbasierter Steuerung

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein spezialisiertes Bildmodell für die Generierung von Mehrfachaufnahmen oder Szenen mit starken Bewegungen und Action.

Funktionen:

  • Besonders geeignet für Bilder mit stabiler Physik und stimmigen Übergängen
  • Unterstützt mehrere Bildreferenzen zur Steuerung der Generierung
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: auto, 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Actionszenen und dynamische Kompositionen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Seedream 4 ist in den Vereinigten Staaten nicht verfügbar.

Die Bildvariante von Wan 2.5 mit hoher Prompt-Treue und Unterstützung für Referenzbilder.

Generierungseingaben:

  • Text-zu-Bild
  • Bildreferenzen (bis zu 2)

Funktionen:

  • Steuerung durch negative Prompts und Seeds
  • Batch-Erstellung mit bis zu 4 Generierungen gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 16:9, 4:3, 1:1, 3:4, 9:16

Ideal für:

  • Standbilder, die dem Look von Wan-Videogenerierungen entsprechen
  • Prompt-getreue Konzeptbilder

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Wan 2.5 Image ist in den Vereinigten Staaten nicht verfügbar.

Ein professionelles Modell für fortgeschrittene Bildgenerierung und -bearbeitung mit starker Szenenkohärenz und Stilkontrolle.

Funktionen:

  • Bildbasierte Stilkontrolle, die ein Referenzbild zur Steuerung der visuellen Ästhetik erfordert
  • Generiert bis zu 4 Bilder gleichzeitig

Ausgabeoptionen:

  • Seitenverhältnisse: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21

Ideal für:

  • Professionelle Inhalte mit präzisen Stilanforderungen

Kosten: Variieren je nach ausgewählten Einstellungen und Anzahl der Varianten

Ein hochmodernes Diffusion-Transformer-Modell (DiT) zur Erstellung ultrarealistischer, reaktiver Avatare, die durch Audio- und Textvorgaben gesteuert werden.

Eingaben für die Generierung:

  • Avatar (Quellbild)
  • Sprache (Audiodatei)
  • Textbeschreibung (Vorgabe)

Funktionen:

  • Geht über einfache Lippensynchronisation hinaus und umfasst kontextabhängiges Blinzeln, Atmen und natürliche Gesichtsausdrücke
  • Synchronisiert Hand- und Ganzkörperbewegungen automatisch anhand von Stimmton und Betonung für eine Performance in Studioqualität
  • Interpretiert Stimmintensität und Tonhöhe präzise, um emotional passende Gesichtsausdrücke zu erzeugen
  • Bewahrt hohe Charaktertreue und Verhaltenskohärenz, auch bei längeren Dialogen oder Musikdarbietungen
  • Optimiert für verschiedene Szenarien, darunter Präsentationen aus seitlicher Perspektive, Dialoge im Podcast-Stil und stilisierte Animationen
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ausgabeoptionen:

  • Auflösungen: 480p, 720p

Ideal für:

  • Professionelle Videowerbung und Marketinginhalte mit Avataren
  • Hochwertiges virtuelles Storytelling und ausdrucksstarke Musikdarbietungen
  • Lange Bildungs- oder Schulungsvideos, die eine konsistente Charakterpräsenz erfordern

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

API: creatify-aurora

Ein schnelles, präzises Bild-zu-Video-Lippensynchronisationsmodell, das ein Standbild passend zum bereitgestellten Audio animiert.

Eingaben:

  • Quellbild
  • Sprach-Audiodatei

Funktionen:

  • Animiert Mund und Gesichtsausdrücke im Quellbild passend zum bereitgestellten Audio
  • Erstellt hochwertige „sprechende“ Videos aus Standbildern
  • Spezialisiertes Tool für Lippensynchronisation, kein vollständiges Modell zur Videogenerierung

Ideal für:

  • Sprechende Avatare aus Standbildern erstellen
  • Charakterporträts mit Dialogen versehen
  • Professionelle Workflows für Avatar-basierte Inhalte

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Bild eine erkennbare Person enthält.

HeyGens neuestes Avatarmodell zum Erstellen hochrealistischer, ausdrucksstarker Talking-Head-Videos aus einem einzelnen Bild und einer Audioeingabe.

Eingaben:

  • Quellbild
  • Sprach-Audiodatei

Funktionen:

  • Animiert Gesichtsausdrücke und Lippenbewegungen hochpräzise passend zum bereitgestellten Audio
  • Erzeugt natürliche Kopfbewegungen und subtile Mikroausdrücke für lebensechte Ergebnisse
  • Spezialisiertes Tool für Lippensynchronisation, kein vollständiges Modell zur Videogenerierung

Ideal für:

  • Professionelle Videos mit Sprechern und Präsentierenden
  • Personalisierte Avatar-Inhalte in großem Umfang erstellen
  • Marketing- und Schulungsvideos mit konsistenter Charakterpräsenz

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Bild ein deutlich sichtbares Gesicht enthält.

Das Video-Lippensynchronisationsmodell der neuesten Generation von Sync liefert Synchronisation in Studioqualität für verschiedenste Inhaltstypen.

Eingaben für die Generierung:

  • Quellvideo
  • Sprach-Audio

Funktionen:

  • Hochpräzise Lippensynchronisation, die individuelle Gesichtsdetails, natürliche Zähne und Hauttexturen bewahrt
  • Optimiert für alle Inhaltstypen, einschließlich Realfilm, 3D-Animation und KI-generierten Videos
  • Video-zu-Video-Tool für Lippensynchronisation, kein vollständiger Videogenerator

Ideal für:

  • Professionelle Synchronisation und Lokalisierung für Film und Werbung
  • Dialoge in jedem Videoformat verbessern oder korrigieren
  • Workflows zur Übersetzung großer Mengen an Inhalten

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Video eine erkennbare Person enthält.

Ein hochmodernes Modell für die Videobearbeitung, entwickelt für Lippensynchronisation in Studioqualität, das individuelle Gesichtsdetails bewahrt und hochauflösende Ausgaben unterstützt.

Eingaben für die Generierung:

  • Quellvideo
  • Sprach-Audio

Funktionen:

  • Nutzt fortschrittliches Upscaling für 4K-Ausgabe bei scharfen, natürlichen Texturen
  • Bewahrt individuelle Gesichtsmerkmale wie natürliche Zähne, Sommersprossen, Make-up und komplexe Gesichtsbehaarung ohne Klarheitsverlust
  • Optimiert für alle Inhaltstypen, einschließlich Realfilm, 3D-Animation und KI-generierten Videos
  • Liefert sofort ausdrucksstarke, synchronisierte Ergebnisse ohne sprecherspezifisches Training oder Modell-Finetuning
  • Generieren Sie bis zu 4 Varianten gleichzeitig

Ideal für:

  • Professionelle Synchronisation und lokalisierte Inhalte für Film und hochwertige Werbung
  • Dialoge in 3D-animierten und KI-generierten Charakteren verbessern oder korrigieren
  • Hochauflösende Projekte, die pixelgenaue Konsistenz und Detailtreue im Gesicht erfordern

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Ein spezialisiertes Utility-Modell zur Erstellung außergewöhnlich realistischer, menschenähnlicher Lippensynchronisation.

Eingaben:

  • Statisches Quellbild
  • Sprach-Audiodatei

Funktionen:

  • Animiert den Mund im Quellbild passend zum bereitgestellten Audio
  • Erstellt hochwertige „sprechende“ Videos aus Standbildern
  • Spezialisiertes Tool für Lippensynchronisation, kein vollständiges Modell zur Videogenerierung

Ideal für:

  • Sprechende Avatare erstellen
  • Standbilder mit Dialogen versehen
  • Professionelle Synchronisations-Workflows

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Bild eine erkennbare Person enthält.

OmniHuman 1.5 ist in den Vereinigten Staaten nicht verfügbar.

Ein schnelles, kostengünstiges und präzises Utility-Modell, das realistische Lippensynchronisation auf Videos anwendet.

Eingaben:

  • Quellvideo
  • Neue Sprach-Audiodatei

Funktionen:

  • Animiert Mundbewegungen im Quellvideo passend zum neuen Audio neu
  • Video-zu-Video-Tool für Lippensynchronisation, kein vollständiger Videogenerator

Ideal für:

  • Kosteneffiziente Synchronisation großer Mengen
  • Inhalte übersetzen
  • Audio in Videoclips mit realistischen Ergebnissen korrigieren

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Video eine erkennbare Person enthält.

Der hochwertigere Nachfolger von Veed Lipsync für realistische Lippensynchronisation in bestehenden Videos.

Eingaben:

  • Quellvideo
  • Neue Sprach-Audiodatei

Funktionen:

  • Animiert Mundbewegungen im Quellvideo passend zum neuen Audio neu
  • Video-zu-Video-Tool für Lippensynchronisation, kein vollständiger Videogenerator
  • Stapelverarbeitung mit bis zu 4 Generierungen gleichzeitig

Ideal für:

  • Synchronisation und Übersetzung, wenn die Ausgabequalität wichtiger ist als die Kosten
  • Dialoge in fertigen Clips korrigieren

Kosten: Variieren je nach Eingabe, Einstellungen und Dauer

Die besten Ergebnisse erzielen Sie, wenn das Video eine erkennbare Person enthält.

Ein spezialisiertes Utility-Modell für Bild- und Video-Upscaling, das Auflösung und Details um bis zu das Vierfache verbessert.

Funktionen:

  • Verbesserungstool zur Verarbeitung bestehender Medien
  • Vergrößert Medien bei Erhalt natürlicher Texturen und minimalen Artefakten
  • Sehr feine Upscaling-Faktoren: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
  • Videospezifisch: Flexible Bildratensteuerung (Quelle beibehalten oder in 24, 25, 30, 48, 50 oder 60 fps konvertieren)

Ideal für:

  • Qualität generierter Medien verbessern
  • Archivmaterial oder Fotos restaurieren
  • Assets für hochauflösende Displays vorbereiten

Kosten: Variieren je nach Eingabe

Entfernt den Hintergrund aus einem Bild und gibt es mit Alpha-Transparenz zurück.

Eingaben:

  • Quellbild

Funktionen:

  • Kein Prompt erforderlich
  • Eine Ausgabe pro Durchlauf

Ideal für:

  • Produktfreisteller und Compositing
  • Motive zur Verwendung als Referenzen in anderen Generierungen vorbereiten

Kosten: Variieren je nach Eingabe

Konvertiert Videos mit Standard-Dynamikbereich in HDR.

Eingaben:

  • Quellvideo (bis zu 30 s)

Funktionen:

  • Kein Prompt erforderlich
  • Eine Ausgabe pro Durchlauf; Länge und Bildausschnitt entsprechen der Quelle

Ideal für:

  • Filmmaterial für HDR-Displays vorbereiten
  • Generierte Videos für die Auslieferung neu graden

Kosten: Variieren je nach Videodauer