Obrazy i wideo

Kompletny przewodnik po tworzeniu i edycji obrazów oraz wideo w ElevenLabs.

Omówienie

Obrazy i wideo pozwalają tworzyć wysokiej jakości materiały wizualne z prostych opisów tekstowych lub obrazów referencyjnych. Generuj statyczne obrazy lub dynamiczne wideo w dowolnym stylu, a potem dopracowuj je kolejnymi promptami, zwiększaj rozdzielczość i dodawaj synchronizację ruchu ust z audio. Gotowe materiały możesz eksportować jako osobne pliki lub importować bezpośrednio do projektów ElevenCreative Studio.

Niektóre modele Obrazy i wideo oraz funkcje przesyłania materiałów są ograniczone w Stanach Zjednoczonych ze względu na wymogi prawne lub dostawców. Sprawdź opisy poszczególnych modeli, aby poznać ich dostępność.

Użytkownicy planu darmowego mogą generować tylko obrazy i są ograniczeni do trzech próśb o obraz dziennie. Generowanie wideo wymaga płatnego planu.

Przewodnik

Wykonaj te kroki, aby utworzyć pierwszy materiał wizualny:

1

Wybierz tryb

Użyj przełącznika w prawym górnym rogu pola promptu, aby wybrać generowanie Obrazu lub Wideo.

2

Podaj prompt lub materiał referencyjny

Opisz oczekiwany wynik językiem naturalnym w polu promptu. Aby mieć większą kontrolę, przeciągnij istniejące obrazy lub wideo z kart Explore albo History do pól referencyjnych lub prześlij własne obrazy referencyjne w wielu formatach, w tym JPG, PNG, WEBP i innych.

3

Wybierz model i ustawienia

Wybierz model generatywny najlepiej pasujący do celu (np. Google Veo 3.1, Kling 2.5, Flux 1 Kontext Pro). Szczegółowe informacje o każdym modelu znajdziesz w sekcji Modele. Dostosuj ustawienia, takie jak proporcje obrazu, rozdzielczość, czas trwania (dla wideo) i liczbę generowanych wariantów.

4

Wygeneruj materiał

Kliknij przycisk Generate. Twoje materiały zostaną utworzone i wyświetlone na karcie History do sprawdzenia.

5

Ulepsz i dopracuj

Użyj narzędzi ulepszania, aby dopracować materiały. Upscale zwiększa rozdzielczość, LipSync dodaje realistyczną synchronizację ruchu ust z audio, a Recreate generuje nowy wariant z tymi samymi ustawieniami.

6

Udostępnij innym

Kliknij przycisk Share, aby utworzyć unikalny link do swojego materiału. Wyślij go członkom zespołu i współpracownikom, aby zebrać opinie.

7

Eksportuj materiał

Pobierz materiał jako osobny plik lub zaimportuj go bezpośrednio do projektu ElevenCreative Studio.

Workflow

Proces tworzenia prowadzi od inspiracji do gotowego materiału w czterech etapach:

Explore

Odkrywaj materiały społeczności, aby znaleźć inspirację, analizować skuteczne prompty lub przenosić materiały referencyjne bezpośrednio do własnej pracy.

Generate

Użyj pola promptu, aby opisać, co chcesz stworzyć, wybierz model, dopracuj ustawienia i zrealizuj swój pomysł.

History

Przeglądaj generacje na karcie History, aby je rozwijać i ulepszać. Twórz warianty ponownie, wykorzystuj prompty i stosuj ulepszenia, takie jak zwiększanie rozdzielczości czy synchronizacja ruchu ust.

Export

Pobieraj gotowe materiały w różnych formatach lub wysyłaj je bezpośrednio do ElevenCreative Studio, aby użyć ich w projektach.

Explore

Karta Explore wyświetla galerię materiałów społeczności, w której możesz szukać inspiracji i materiałów wizualnych do użycia jako referencje.

Szukaj: Użyj paska wyszukiwania, aby znajdować obrazy i wideo na podstawie słów kluczowych.

Sortuj: Przełączaj między Trending i Newest, aby zobaczyć popularne lub niedawno dodane materiały.

Przeciągnij i upuść: Przeciągnij dowolny wynik z siatki bezpośrednio do pola promptu, aby użyć go jako klatki początkowej, końcowej lub referencji stylu.

Podgląd szczegółów: Kliknij dowolny kafelek, aby zobaczyć pełny prompt i ustawienia użyte do jego utworzenia.

Generate

Interfejs promptu wideo

Pole promptu jest zakotwiczone na dole strony i zawiera wszystkie elementy sterujące do tworzenia materiałów wizualnych.

Ustaw tryb i prompt

Wybierz tryb: Użyj przełącznika w prawym górnym rogu, aby zmieniać generowanie między Obrazem a Wideo.

Napisz prompt: W głównym polu opisz językiem naturalnym, co chcesz wygenerować. Aby uzyskać najlepsze wyniki, pisz jasno i szczegółowo.

Wybierz modele i ustawienia

Wybór modeli wideo

Wybierz model: Otwórz menu modeli, aby przejrzeć dostępne opcje, takie jak Google Veo 3.1, Kling 2.5 lub Flux 1 Kontext Pro. Każdy model ma unikalne mocne strony i możliwości, które ułatwiają porównanie. Szczegółowe informacje znajdziesz w sekcji Modele.

Dostosuj ustawienia: Dopracuj generowanie za pomocą ustawień pod promptem. Różnią się one zależnie od modelu, ale często obejmują:

  • Proporcje obrazu: Kontroluj wymiary wyniku
  • Rozdzielczość: Ustaw poziom jakości
  • Czas trwania: Określ długość wideo (w trybie wideo)
  • Liczba generacji: Utwórz do 4 wariantów naraz

Użyj ustawień: W obsługiwanych modelach włącz Audio, dodaj Negative Prompt, aby wykluczyć niepożądane elementy, lub dostosuj Sound Control.

Dodaj materiały referencyjne

Interfejs referencji
wideo

Aby lepiej kontrolować wynik, dodaj referencje wizualne kierujące generowaniem. Ich dostępność zależy od wybranego modelu. Obsługujemy wiele formatów obrazów, w tym JPG, PNG, WEBP i inne.

Klatka początkowa (wideo): Ustawia pierwszy obraz wideo.

Klatka końcowa (wideo): Ustawia ostatni obraz i wpływa na przejście.

Referencje obrazów (obraz lub wideo): Dodaj jeden lub więcej obrazów, aby określić ogólny styl i wygląd.

Przeciągaj elementy bezpośrednio z kart Explore lub History do pól referencyjnych, aby przyspieszyć workflow.

Generuj

Przed generowaniem wskaźnik kosztu pokazuje łączny koszt wybranej liczby materiałów. Gdy wszystko jest gotowe, kliknij Generate. Nowe materiały pojawią się na karcie History.

History

Interfejs historii wideo

Karta History zawiera chronologiczny zapis wszystkich generacji i jest przestrzenią do dopracowywania wcześniejszych prac.

Przeglądaj: Zobacz wszystkie wcześniejsze obrazy i wideo.

Sprawdź: Kliknij dowolny materiał, aby zobaczyć oryginalny prompt, model i ustawienia użyte do jego utworzenia.

Wykorzystaj ponownie: Przeciągnij elementy z History z powrotem do pola promptu, aby użyć ich jako referencji przy nowych generacjach.

Dopracuj: Kliknij Recreate, aby ponownie użyć tego samego promptu i ustawień do utworzenia nowego wariantu, lub zmień ustawienia, aby nadać generowaniu nowy kierunek.

Udostępnij: Kliknij Share, aby utworzyć unikalny link do materiału. Wyślij go członkom zespołu i współpracownikom po opinię.

Eksportuj: Pobierz materiał jako osobny plik lub kliknij Edit in Studio, aby zaimportować go bezpośrednio do ElevenCreative Studio.

Eksport

Gdy masz generację, z której jesteś zadowolony, użyj wbudowanych narzędzi ulepszających przed eksportem.

Ulepszanie materiałów

Upscale: Użyj Topaz Upscale, aby zwiększyć rozdzielczość maksymalnie 4 razy, zachowując ostre detale.

LipSync: Dodaj realistyczną synchronizację ruchu ust do materiałów wizualnych:

  • Omnihuman 1.5: Animuj statyczny obraz za pomocą ścieżki audio
  • Veed LipSync: Zdubbinguj istniejące wideo nowym audio

Eksportowanie materiałów

Interfejs eksportu wideo

Eksportuj gotowe materiały, pobierając je lokalnie lub wysyłając bezpośrednio do ElevenCreative Studio.

Edit in Studio: Zaimportuj materiał bezpośrednio do projektu ElevenCreative Studio.

Download: Zapisz materiał na urządzeniu.

Obsługiwane formaty pobierania

Wideo:

  • MP4: Kodeki H.264, H.265. Jakość do 4K (z upscalingiem)

Obraz:

  • PNG: Wynik w wysokiej rozdzielczości, bez strat

Modele

Image & Video daje dostęp do wyspecjalizowanych modeli zoptymalizowanych pod różne zastosowania. Każdy model oferuje inne możliwości — od szybkiego iterowania po jakość gotową do produkcji.

Modele postprocessingu wymagają istniejącego wygenerowanego materiału, ale możesz też przesłać własny plik obrazu lub wideo.

Administratorzy obszarów roboczych Enterprise mogą kontrolować, które modele generowania obrazów i wideo są dostępne dla członków obszaru roboczego. Domyślnie wszystkie modele są wyłączone w obszarach roboczych Enterprise i muszą zostać wyraźnie włączone przez administratorów. Dowiedz się więcej o zatwierdzaniu modeli.

W przypadku żądań API modele ByteDance są domyślnie wyłączone i wymagają wyraźnej zgody przed użyciem. Klienci Enterprise mogą skontaktować się z pomocą techniczną, aby poprosić o dostęp.

Każdy z poniższych modeli jest dostępny w aplikacji Image & Video. Modele, które można też wywołać przez Image & Video API, mają podane model_id w sekcji API; pozostałe są dostępne tylko w aplikacji.

Ujednolicony multimodalny model wideo ze wspólnym generowaniem audio i wideo, oferujący reżyserską kontrolę nad grą aktorską, oświetleniem, cieniem i ruchem kamery, aby uzyskać ultrarealistyczne, filmowe efekty.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów
  • Referencje wideo
  • Referencje audio

Funkcje:

  • Ujednolicona architektura multimodalna, która jednocześnie generuje zsynchronizowane audio i wideo w jednym przebiegu
  • Wiodące w branży możliwości pracy z referencjami multimodalnymi i edycji, z równoczesną obsługą tekstu, obrazu, audio i wideo
  • Wyjątkowa stabilność ruchu z realizmem na poziomie filmowym, zgodnym ze standardami branżowymi
  • Reżyserska kontrola twórcza nad grą aktorską, oświetleniem, cieniem i ruchem kamery
  • Elastyczna długość generowania od 4 s do 15 s
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p, 1080p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Najlepsze do:

  • Filmowego storytellingu wymagającego zsynchronizowanego audio i obrazu
  • Treści opartej na referencjach, która ściśle trzyma się obrazów, wideo lub audio źródłowego
  • Profesjonalnych produkcji wymagających precyzyjnej kontroli oświetlenia i pracy kamery

Koszt: Zależy od wybranych ustawień i długości

API: bytedance-seedance-v2

Ustawienia można przełączać, aby dostosować zużycie kredytów.

Seedance 2.0 nie jest dostępny w Stanach Zjednoczonych.

Szybszy i tańszy wariant Seedance 2.0 z tymi samymi multimodalnymi materiałami referencyjnymi, z wyjściem ograniczonym do 720p.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów (do 9)
  • Referencje wideo (do 3, łącznie 15 s)
  • Referencje audio (do 3, łącznie 15 s)

Funkcje:

  • Ta sama obsługa referencji co w Seedance 2.0, z łącznym limitem 12 referencji na generowanie
  • Klatki i referencje wzajemnie się wykluczają: użyj pierwszej lub ostatniej klatki albo referencji, nie obu opcji
  • Elastyczna długość generowania od 4 s do 15 s
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Najlepsze do:

  • Iterowania promptów Seedance 2.0 przed renderowaniem w pełnej rozdzielczości
  • Klipów opartych na referencjach, dla których wystarcza 720p

Koszt: Zależy od wybranych ustawień i długości

API: bytedance-seedance-v2-fast

Seedance 2.0 Fast nie jest dostępny w Stanach Zjednoczonych.

Najmniejszy wariant Seedance 2.0: około dwa razy szybszy od Seedance 2.0 przy mniej więcej połowie kosztu, z tymi samymi materiałami wejściowymi i wyjściem 720p.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów (do 9)
  • Referencje wideo (do 3, łącznie 15 s)
  • Referencje audio (do 3, łącznie 15 s)

Funkcje:

  • Ta sama obsługa referencji co w Seedance 2.0, z łącznym limitem 12 referencji na generowanie
  • Klatki i referencje wzajemnie się wykluczają: użyj pierwszej lub ostatniej klatki albo referencji, nie obu opcji
  • Elastyczna długość generowania od 4 s do 15 s
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Najlepsze do:

  • Szkiców i podglądów na dużą skalę
  • Workflowów wrażliwych na koszt, które nadal wymagają audio i materiałów referencyjnych

Koszt: Zależy od wybranych ustawień i długości

API: bytedance-seedance-v2-mini

Seedance 2.0 Mini nie jest dostępny w Stanach Zjednoczonych.

Następca Seedance 2.0 z ostrzejszym realizmem, do 50 łącznych referencji obrazów, wideo i audio oraz generowaniem do 30 sekund.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów (do 30)
  • Referencje wideo (do 10, łącznie 30 s)
  • Referencje audio (do 10, łącznie 30 s)

Funkcje:

  • Brak łącznego limitu między typami referencji; referencje wyłącznie audio są akceptowane bez obrazu lub wideo
  • Klatki i referencje wzajemnie się wykluczają
  • Elastyczna długość generowania od 4 s do 30 s
  • Proporcje obrazu są pobierane z pierwszej klatki lub referencyjnego wideo, jeśli je podano
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Najlepsze do:

  • Dłuższych klipów, które muszą zachować spójność z wieloma referencjami
  • Scen dialogowych i aktorskich opartych na referencyjnym audio

Koszt: Zależy od wybranych ustawień i długości

API: bytedance-seedance-v2.5

Seedance 2.5 nie udostępnia kontroli ziarna.

Seedance 2.5 nie jest dostępny w Stanach Zjednoczonych.

Edytuje istniejące wideo na podstawie opisu zmian. Długość i proporcje obrazu wyjścia są zgodne z wejściowym wideo.

Materiały wejściowe do generowania:

  • Wideo do edycji (wymagane, do 30 s)
  • Prompt tekstowy opisujący edycję
  • Referencje obrazów (do 30)
  • Dodatkowe referencje wideo (do 10, łącznie 30 s)
  • Referencje audio (do 10, łącznie 30 s)

Funkcje:

  • Brak kontroli długości: wyjście ma długość wejściowego wideo
  • Proporcje obrazu są pobierane z wejściowego wideo
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p

Najlepsze do:

  • Zmiany stroju, rekwizytów, oświetlenia lub miejsca w istniejącym materiale
  • Transferu stylu, który zachowuje oryginalny ruch

Koszt: Zależy od wybranych ustawień i długości

Seedance 2.5 Video Edit nie jest dostępny w Stanach Zjednoczonych.

Kontynuuje istniejące wideo od miejsca, w którym się kończy, zgodnie z promptem i opcjonalnymi referencjami.

Materiały wejściowe do generowania:

  • Wideo do rozszerzenia (wymagane, do 30 s)
  • Prompt tekstowy opisujący kontynuację
  • Referencje obrazów (do 30)
  • Dodatkowe referencje wideo (do 10, łącznie 30 s)
  • Referencje audio (do 10, łącznie 30 s)

Funkcje:

  • Długość rozszerzenia od 4 s do 30 s
  • Proporcje obrazu są pobierane z wejściowego wideo
  • Natywna kontrola dźwięku — audio można włączyć lub wyłączyć dla każdego generowania
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 480p, 720p

Najlepsze do:

  • Wydłużania ujęcia, które kończy się zbyt wcześnie
  • Łączenia kilku generowań w dłuższą sekwencję

Koszt: Zależy od wybranych ustawień i długości

Seedance 2.5 Video Extend nie jest dostępny w Stanach Zjednoczonych.

Zaawansowany model wideo działający jak reżyser AI, który zachowuje wysoką spójność postaci, przedmiotów i scen przy złożonych ruchach kamery.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka

Funkcje:

  • Wierne zachowanie postaci i scen dzięki wielokątnym referencjom obrazów lub wideo
  • Natywne wspólne generowanie audio i obrazu z wielojęzycznym lip-sync oraz dźwiękami otoczenia
  • Elastyczna długość generowania od 3 s do 15 s
  • Generowanie do 4 wariantów jednocześnie
  • Lepsza obsługa tekstu, dynamiki płynów i złożonych interakcji fizycznych

Opcje wyjścia:

  • Rozdzielczości: tylko 1080p
  • Proporcje obrazu: 16:9, 1:1, 9:16

Najlepsze do:

  • Storytellingu opartego na postaciach, który wymaga ciągłości wizualnej
  • Reklam i materiałów z konkretnymi wymaganiami dotyczącymi renderowania tekstu

Koszt: Zależy od wybranych ustawień i długości

Obsługuje negatywne prompty zapewniające precyzyjną kontrolę. Dźwięk można włączyć lub wyłączyć dla każdego generowania.

Kling 3.0 nie jest dostępny w Stanach Zjednoczonych.

Model wideo o wysokiej spójności, działający jak reżyser AI i zachowujący tożsamość postaci, przedmiotów oraz scen przy złożonych ruchach kamery.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencja wideo
  • Referencja obrazu

Funkcje:

  • Zachowuje dokładną tożsamość wizualną głównych postaci i przedmiotów dzięki referencjom z wielu kątów
  • Obsługuje płynne generowanie o długości od 3 s do 15 s
  • Generowanie do 4 wariantów naraz
  • Dokładne modelowanie interakcji elementów i spójności ruchu
  • Natywna obsługa włączonego lub wyłączonego audio dla każdego generowania

Opcje wyjścia:

  • Rozdzielczości: tylko 1080p
  • Proporcje obrazu: 16:9, 1:1, 9:16

Najlepsze do:

  • Storytellingu opartego na postaciach, wymagającego ścisłej ciągłości wizualnej
  • Profesjonalnych materiałów marketingowych i brandowych ze spójnym renderowaniem przedmiotów

Koszt: Zależy od wybranych ustawień i długości

Ustawienia można przełączać, aby dostosować zużycie kredytów.

Kling O3 nie jest dostępny w Stanach Zjednoczonych.

Model do edycji wideo na wideo sterowany językiem naturalnym, oparty na architekturze O3. Umożliwia złożone transformacje wizualne — takie jak zamiana postaci i środowiska — bez ręcznego maskowania ani zmian klatka po klatce.

Materiały wejściowe do generowania:

  • Źródłowe wideo
  • Referencje obrazów (do 4 różnych elementów/kątów)
  • Opis tekstowy (instrukcje w języku naturalnym)

Funkcje:

  • Interpretuje konwersacyjne prompty, aby zastępować obiekty lub otoczenie z zachowaniem oryginalnej struktury ruchu
  • Zachowuje oryginalne kąty kamery, wzorce ruchu i relacje przestrzenne przez całą edycję
  • Łączy do 4 elementów łącznie, w tym obrazy frontalne i z wielu kątów, aby zapewnić wierną spójność postaci
  • Możliwość zachowania oryginalnego audio źródłowego lub generowania cichego wyjścia dla każdego generowania
  • Generowanie do 4 edytowanych wariantów naraz

Opcje wyjścia:

  • Rozdzielczości: zależne od źródłowego wideo
  • Proporcje obrazu: zgodne ze źródłowym wideo

Najlepsze do:

  • Wiernej zamiany postaci w istniejącym materiale z zachowaniem oryginalnych ruchów
  • Pełnej transformacji otoczenia sceny (np. zmiany dziennego miasta w futurystyczny nocny krajobraz)
  • Stosowania transferu stylu wymagającego ścisłego zachowania istniejącej dynamiki kamery

Koszt: Zależy od długości wideo i wybranych ustawień

Kling O3 Edit nie jest dostępny w Stanach Zjednoczonych.

Model klasy profesjonalnej do wysokiej jakości, filmowego generowania wideo.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów

Funkcje:

  • Doskonała jakość i kontrola twórcza dzięki negatywnym promptom
  • W pełni zintegrowane i zsynchronizowane audio
  • Realistyczne dialogi, lip-sync i efekty dźwiękowe
  • Stałe długości: 4 s, 6 s i 8 s
  • Tworzenie wsadowe — do 4 generowań naraz
  • Dedykowana kontrola dźwięku

Opcje wyjścia:

  • Rozdzielczości: 720p, 1080p
  • Proporcje obrazu: 16:9, 9:16

Najlepsze do:

  • Wysokiej jakości, filmowego generowania wideo z pełną kontrolą twórczą

Koszt: Zależy od wybranych ustawień i długości

API: veo-3.1-generate-001

Włączenie lub wyłączenie dźwięku zmienia liczbę kredytów za generowanie.

Szybki model zoptymalizowany pod błyskawiczne podglądy i generowanie, zapewniający ostrzejszy obraz przy mniejszych opóźnieniach.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka

Funkcje:

  • Zaawansowana kontrola twórcza z negatywnymi promptami i dedykowaną kontrolą dźwięku
  • Stałe długości: 4 s, 6 s i 8 s
  • Tworzenie wsadowe — do 4 generowań naraz
  • Dokładnie modeluje fizykę świata rzeczywistego, zapewniając realistyczny ruch i interakcje

Opcje wyjścia:

  • Rozdzielczości: 720p, 1080p
  • Proporcje obrazu: 16:9, 9:16

Najlepsze do:

  • Szybkiego iterowania i testowania wizualizacji A/B
  • Dynamicznego tworzenia treści do mediów społecznościowych

Koszt: Zależy od wybranych ustawień i długości

API: veo-3.1-fast-generate-001

Ekonomiczny, szybki wariant Veo 3.1 zoptymalizowany pod szybkie generowanie przy mniejszym zużyciu mocy obliczeniowej.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka

Funkcje:

  • Precyzyjna kontrola twórcza z negatywnymi promptami i dedykowaną kontrolą dźwięku
  • Stałe długości: 4 s, 6 s i 8 s
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 720p
  • Proporcje obrazu: 16:9, 9:16

Najlepsze do:

  • Tworzenia dużej liczby treści, gdy priorytetem są szybkość i oszczędność
  • Szybkiego sprawdzania koncepcji i podglądów

Koszt: Zależy od wybranych ustawień i długości

Model wideo Google uwzględniający fizykę, z natywnym audio, wyjściem do 4K oraz interpolacją klatek i generowaniem sterowanym referencjami.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Pierwsza klatka
  • Ostatnia klatka
  • Referencje obrazów (do 10)
  • Referencje wideo (do 3, każde do 10 s)

Funkcje:

  • Klatki i referencje wzajemnie się wykluczają: interpoluj między klatkami albo użyj referencji jako wskazówek
  • Stała długość od 3 s do 10 s; długość jest zgodna z referencyjnym wideo, jeśli je dołączono
  • Dobre renderowanie krótkiego tekstu i etykiet na ekranie
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 360p, 720p, 1080p, 4K
  • Proporcje obrazu: 16:9, 9:16

Najlepsze do:

  • Materiałów objaśniających i typografii kinetycznej z czytelnym tekstem
  • Ruchu opartego na fizyce ze spójnymi obiektami w różnych referencjach

Koszt: Zależy od wybranych ustawień i długości

Kontynuuje istniejące wideo od miejsca, w którym się kończy, przy użyciu Gemini Omni Flash 1.1, do łącznej długości 40 sekund.

Materiały wejściowe do generowania:

  • Wideo do rozszerzenia (wymagane, do 30 s)
  • Prompt tekstowy opisujący kontynuację

Funkcje:

  • Długość rozszerzenia od 3 s do 10 s
  • Proporcje obrazu są zgodne z wejściowym wideo
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 360p, 720p, 1080p, 4K

Najlepsze do:

  • Wydłużania generowań Gemini Omni Flash bez widocznego cięcia
  • Tworzenia sekwencji dłuższych, niż pozwala pojedyncze generowanie

Koszt: Zależy od wybranych ustawień i długości

Pierwszy model wideo Gemini Omni: ruch uwzględniający fizykę, natywne audio i najlepsze renderowanie tekstu na ekranie spośród dostępnych modeli wideo, w 720p.

Materiały wejściowe do generowania:

  • Tekst na wideo
  • Referencje obrazów (do 8)
  • Referencja wideo (1, do 10 s)

Funkcje:

  • Stała długość od 3 s do 10 s; długość jest zgodna z referencyjnym wideo, jeśli je dołączono
  • Bez pierwszej i ostatniej klatki; zamiast tego użyj referencji obrazów, aby zakotwiczyć obiekt
  • Tworzenie wsadowe — do 4 generowań naraz

Opcje wyjścia:

  • Rozdzielczości: 720p
  • Proporcje obrazu: 16:9, 9:16

Najlepsze do:

  • Krótkich podpisów, tytułów i opisów z etykietami
  • Spójności wielu obrazów w 720p

Koszt: Zależy od wybranych ustawień i długości

Ulepszony, wyspecjalizowany model do tworzenia dynamicznych sekwencji o wysokiej jakości, z lepszą stabilnością czasową i precyzyjną kontrolą przejść między klatkami kluczowymi.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa
  • Klatka końcowa

Funkcje:

  • Płynnie łączy klatki początkową i końcową w spójne sekwencje wieloujęciowe
  • Wysokiej jakości modelowanie złożonych działań i spójności otoczenia
  • Obsługuje stałe długości generowania od 4 s do 12 s
  • Generuj do 4 wariantów naraz
  • Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania

Opcje wyjściowe:

  • Rozdzielczości: 420p, 720p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Opowieści i scen akcji wymagających stabilnej fizyki między konkretnymi punktami wizualnymi
  • Filmowych przejść i profesjonalnych materiałów wideo ze ścisłymi wymaganiami dotyczącymi początku i końca

Koszt: Zależy od wybranych ustawień i długości

Seedance 1.5 Pro jest wycofywany. ByteDance wycofa model 11 listopada 2026 r. i nie jest on już oferowany do nowych generowań. Zamiast niego użyj modelu Seedance 2.0. Seedance 1.5 Pro nie jest dostępny w Stanach Zjednoczonych.

Model wideo Black Forest Labs z naturalnym ruchem, scenami wieloujęciowymi, generowanym dźwiękiem i rozszerzaniem wideo.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa
  • Klatka końcowa
  • Wideo do rozszerzenia (1, maks. 15 s)

Funkcje:

  • Rozszerzanie wideo wyklucza użycie klatek początkowej i końcowej
  • Elastyczne długości generowania od 5 s do 20 s
  • Natywna kontrola dźwięku z możliwością włączenia lub wyłączenia dla każdego generowania
  • Tworzenie wsadowe do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 720p, 1080p
  • Proporcje obrazu: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Scen wieloujęciowych z jednego promptu
  • Rozszerzania istniejącego klipu z pasującym ruchem i dźwiękiem

Koszt: Zależy od wybranych ustawień i długości

Flagowy model wideo MiniMax z multimodalnymi materiałami referencyjnymi, generowanym dźwiękiem i materiałem wyjściowym do 4K.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa
  • Klatka końcowa
  • Obrazy referencyjne (do 9)
  • Wideo referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
  • Audio referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)

Funkcje:

  • Łączny limit to 12 materiałów referencyjnych na generowanie; audio referencyjne wymaga co najmniej jednego obrazu lub wideo referencyjnego
  • Klatki i materiały referencyjne wzajemnie się wykluczają
  • Elastyczne długości generowania od 5 s do 15 s
  • Generuje zsynchronizowany dźwięk
  • Tworzenie wsadowe do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 768p, 2K, 4K (2K i 4K są skalowane w górę z 768p)
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Scen opartych na materiałach referencyjnych, wymagających dostarczenia w wysokiej rozdzielczości
  • Klipów z dialogami opartych na audio referencyjnym

Koszt: Zależy od wybranych ustawień i długości

MiniMax H3 nie jest dostępny w Stanach Zjednoczonych.

Niemal natychmiastowy wariant MiniMax H3 z tymi samymi danymi wejściowymi i dobrą estetyką, renderowany natywnie w rozdzielczości do 768p.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa
  • Klatka końcowa
  • Obrazy referencyjne (do 9)
  • Wideo referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)
  • Audio referencyjne (do 3, każde od 2 s do 15 s, łącznie 15 s)

Funkcje:

  • Łączny limit to 12 materiałów referencyjnych na generowanie; audio referencyjne wymaga co najmniej jednego obrazu lub wideo referencyjnego
  • Klatki i materiały referencyjne wzajemnie się wykluczają
  • Elastyczne długości generowania od 5 s do 15 s
  • Generuje zsynchronizowany dźwięk
  • Tworzenie wsadowe do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 768p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Szybkiego iterowania promptów i materiałów referencyjnych
  • Podglądów przed renderowaniem w MiniMax H3

Koszt: Zależy od wybranych ustawień i długości

MiniMax H3 Max nie jest dostępny w Stanach Zjednoczonych.

Zaawansowany model wideo z rozumowaniem, stworzony z myślą o doskonałym trzymaniu się promptów i złożonej symulacji świata fizycznego. Wykorzystuje zaawansowane przetwarzanie logiczne do interpretowania i wykonywania złożonych instrukcji.

Dane wejściowe generowania:

  • Tekst na wideo (opis)
  • Klatka początkowa i klatka końcowa
  • Wideo referencyjne
  • Obraz referencyjny

Funkcje:

  • Wyjątkowo dobrze interpretuje wielowarstwowe prompty i wykonuje złożone działania chronologiczne
  • Wykorzystuje obrazy i wideo jako wizualne punkty odniesienia, by zachować wysoką spójność postaci i scen
  • Doskonałe modelowanie interakcji fizycznych, zależności przyczynowo-skutkowych i dynamiki płynów
  • Obsługuje wysokiej jakości generowanie klipów 5 s i 10 s
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: zależne od danych wejściowych
  • Proporcje obrazu: 16:9, 1:1, 9:16

Idealne do:

  • Bardzo konkretnych koncepcji kreatywnych wymagających precyzyjnego trzymania się długich, szczegółowych opisów
  • Profesjonalnych opowieści, w których kluczowe są fizyczny realizm i spójność wielu materiałów referencyjnych

Koszt: Zależy od wybranych ustawień i długości

Kling O1 nie jest dostępny w Stanach Zjednoczonych.

Model do edycji wideo na wideo sterowany językiem naturalnym, który umożliwia złożone transformacje wizualne — takie jak wymiana postaci i otoczenia — bez ręcznego maskowania ani korekt klatka po klatce.

Dane wejściowe generowania:

  • Wideo źródłowe
  • Obrazy referencyjne (do 4 różnych elementów/kątów)
  • Opis tekstowy (instrukcje w języku naturalnym)

Funkcje:

  • Interpretuje konwersacyjne prompty, by zastępować obiekty lub otoczenie z zachowaniem oryginalnej struktury ruchu
  • Zachowuje oryginalne kąty kamery, wzorce ruchu i relacje przestrzenne podczas całej edycji
  • Łączy do 4 elementów łącznie (w tym obrazy frontalne i z wielu kątów), aby zapewnić wysoką spójność postaci
  • Możesz zachować oryginalny dźwięk źródłowy lub wygenerować cichy materiał wyjściowy dla każdego generowania
  • Generuj do 4 edytowanych wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: zależne od wideo źródłowego
  • Proporcje obrazu: zgodne z wideo źródłowym

Idealne do:

  • Wysokiej jakości wymiany postaci w istniejącym materiale przy zachowaniu oryginalnych ruchów
  • Pełnej transformacji otoczenia sceny (np. zmiany dziennego miasta w futurystyczny nocny krajobraz)
  • Stosowania transferu stylu wymagającego ścisłego zachowania istniejącej dynamiki kamery

Koszt: Zależy od długości wideo i wybranych ustawień

Kling O1 Edit nie jest dostępny w Stanach Zjednoczonych.

Wyspecjalizowany model do precyzyjnego transferu ruchu, który pozwala sterować obrazem postaci za pomocą referencyjnego wideo, aby odtworzyć konkretne ruchy, gesty i kąty kamery.

Dane wejściowe generowania:

  • Obraz postaci (źródło)
  • Wideo ruchu (materiał referencyjny)
  • Opis tekstowy (opcjonalnie)

Funkcje:

  • Wybierz “Match Video”, aby dokładnie odtworzyć ruch, lub “Match Image”, aby dodać postaci nowy kreatywny ruch
  • Obsługuje do 30 s w trybie Match Video i 10 s w trybie Match Image
  • Wysokiej jakości odwzorowanie ruchu człowieka z materiału referencyjnego na nieruchomą postać
  • Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: zależne od źródła
  • Proporcje obrazu: zależne od źródła

Idealne do:

  • Odtwarzania złożonej choreografii lub konkretnych ruchów na własnej postaci
  • Długich animacji postaci wymagających wiernego odwzorowania ruchu
  • Treści do mediów społecznościowych opartych na popularnych ruchach z wideo

Koszt: Zależy od wybranych ustawień i długości

Kling 2.6 Motion Control nie jest dostępny w Stanach Zjednoczonych.

Wyspecjalizowany model do precyzyjnego transferu ruchu oparty na architekturze Kling 3.0. Pozwala sterować obrazem postaci za pomocą referencyjnego wideo, aby z większą wiernością odtworzyć konkretne ruchy, gesty i kąty kamery.

Dane wejściowe generowania:

  • Obraz postaci (źródło)
  • Wideo ruchu (materiał referencyjny)
  • Opis tekstowy (opcjonalnie)

Funkcje:

  • Wybierz “Match Video”, aby dokładnie odtworzyć ruch, lub “Match Image”, aby dodać postaci nowy kreatywny ruch
  • Obsługuje do 30 s w trybie Match Video i 10 s w trybie Match Image
  • Wysokiej jakości odwzorowanie ruchu człowieka z materiału referencyjnego na nieruchomą postać
  • Natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: zależne od źródła
  • Proporcje obrazu: zależne od źródła

Idealne do:

  • Odtwarzania złożonej choreografii lub konkretnych ruchów na własnej postaci
  • Długich animacji postaci wymagających wiernego odwzorowania ruchu
  • Treści do mediów społecznościowych opartych na popularnych ruchach z wideo

Koszt: Zależy od wybranych ustawień i długości

Kling 3.0 Motion Control nie jest dostępny w Stanach Zjednoczonych.

Zoptymalizowany model generatywny zaprojektowany z myślą o większej wierności ruchu i płynniejszych przejściach, łączący szybką iterację z materiałem wizualnym o jakości produkcyjnej.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa (obraz na wideo)

Funkcje:

  • Ulepszona dynamika ruchu: znacznie płynniejszy ruch i bardziej realistyczne interakcje fizyczne
  • Elastyczna kontrola dźwięku: natywna obsługa włączania lub wyłączania dźwięku dla każdego generowania
  • Tworzenie wsadowe: generuj do 4 wariantów jednocześnie
  • Precyzyjne dopracowanie: zaawansowana kontrola kreatywna dzięki obsłudze negatywnych promptów
  • Stałe długości: obsługuje generowanie o długości 5 s i 10 s

Opcje wyjściowe:

  • Rozdzielczości: zależne od danych wejściowych
  • Proporcje obrazu: 16:9, 1:1, 9:16

Idealne do:

  • Dynamicznych klipów wymagających płynnego ruchu postaci
  • Profesjonalnych treści do mediów społecznościowych z dobrym trzymaniem się promptów

Koszt: Zależy od wybranych ustawień i długości

Kling 2.6 nie jest dostępny w Stanach Zjednoczonych.

Zrównoważony i wszechstronny model do generowania wysokiej jakości wideo w Full HD.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa

Funkcje:

  • Doskonale symuluje złożony ruch i realistyczną fizykę
  • Precyzyjnie modeluje dynamikę płynów i ekspresję
  • Stałe długości: 5 s i 10 s
  • Tworzenie wsadowe do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1080p
  • Proporcje obrazu: 16:9, 1:1, 9:16

Idealne do:

  • Realistycznych symulacji fizycznych i złożonego ruchu

Koszt: Zależy od wybranych ustawień i długości

Klatka końcowa nie jest obecnie obsługiwana. Nie można podać obrazów referencyjnych. Kontrola dźwięku jest niedostępna.

Kling 2.5 nie jest dostępny w Stanach Zjednoczonych.

Najnowocześniejsza jakość ruchu, zgodność z promptami i wierność wizualna dla filmowego, bardzo realistycznego wideo.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa (obraz na wideo)

Funkcje:

  • Wyjątkowa jakość ruchu z czołowym w branży realizmem i symulacją fizyki
  • Doskonałe trzymanie się promptów dla precyzyjnej kontroli kreatywnej nad złożonymi scenami
  • Wysoka wierność wizualna zapewniająca materiał o jakości filmowej
  • Generuj do 4 wariantów jednocześnie

Opcje wyjściowe:

  • Rozdzielczości: 720p
  • Proporcje obrazu: 16:9, 9:16

Idealne do:

  • Filmowych treści wymagających najwyższej jakości ruchu i realizmu
  • Profesjonalnych produkcji wymagających precyzyjnego trzymania się promptów
  • Wizualnego opowiadania historii w wysokiej jakości

Koszt: Zależy od wybranych ustawień i długości

Zaawansowany model wideo zaprojektowany do szybkiej iteracji i ekonomicznego tworzenia, zdolny generować wysokiej jakości wideo.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa (obraz na wideo)

Funkcje:

  • Zoptymalizowany pod kątem ultraszybkiego generowania, zapewnia wyniki nawet cztery razy szybciej niż poprzednie wersje
  • Pozwala precyzyjnie kierować ruchem postaci, kątami kamery i kompozycją scen
  • Doskonale zachowuje spójność wizualną i stabilność w dynamicznych scenach
  • Obsługuje długości generowania od 2 s do 10 s
  • Generuj do 4 wariantów jednocześnie

Opcje wyjściowe:

  • Rozdzielczości: 720p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Szybkiego prototypowania i eksperymentów kreatywnych wymagających niemal natychmiastowej informacji zwrotnej
  • Profesjonalnych projektów wymagających szybkiej realizacji materiałów marketingowych w wysokiej rozdzielczości
  • Treści filmowych ze szczególnymi wymaganiami dotyczącymi ruchu kamery

Koszt: Zależy od wybranych ustawień i długości

Najnowocześniejszy model wideo in-context do wielozadaniowego generowania wizualnego, zdolny do złożonej edycji przy zachowaniu bazowej struktury materiału źródłowego.

Dane wejściowe generowania:

  • Wideo źródłowe
  • Obraz referencyjny
  • Opis tekstowy

Funkcje:

  • Płynnie dodawaj, usuwaj lub przekształcaj obiekty i postaci w scenie z naturalnym oświetleniem, cieniami i perspektywą
  • Zmieniaj lokalizacje, pory roku i pory dnia (np. zamieniaj pochmurne nagranie w dramatyczny zachód słońca) z realistyczną aktualizacją temperatury barwowej
  • Modyfikuj wiek i wygląd aktorów albo zmieniaj tekstury ubrań i postaci za pomocą prostych promptów w języku naturalnym
  • Zastosuj konkretny ruch i ścieżkę kamery z referencyjnego wideo do statycznego obrazu, aby precyzyjnie sterować animacją
  • Generuj całkiem nowe kąty kamery, takie jak ujęcia z przeciwnej strony lub z dołu, z jednej istniejącej sekwencji wideo
  • Obejmuje precyzyjne green screenowanie (izolację z wykrywaniem krawędzi), generowanie kolejnego ujęcia dla kontynuacji historii oraz transfer stylu estetycznego
  • Generuj do 4 wariantów jednocześnie

Opcje wyjściowe:

  • Rozdzielczości: 720p
  • Proporcje obrazu: automatyczne

Idealne do:

  • Profesjonalnych efektów wizualnych, takich jak cyfrowe odmładzanie, zmiana oświetlenia i usuwanie obiektów
  • Szybkiego prototypowania filmowego i generowania alternatywnych ujęć kamery z jednego kadru
  • Kreatywnych treści marketingowych wymagających radykalnych transformacji otoczenia lub stylu

Koszt: Zależy od wybranych ustawień i długości

Model do edycji wideo Runway: przekształca istniejące wideo w kierunku docelowego wyglądu, zachowując ruch i spójność.

Dane wejściowe:

  • Wideo źródłowe (wymagane, od 2 s do 30 s)
  • Obraz docelowego wyglądu (wymagany)
  • Prompt tekstowy opisujący edycje

Funkcje:

  • Długość i kadrowanie materiału wyjściowego są zgodne z wideo źródłowym
  • Transfer stylu prowadzony przez obraz docelowego wyglądu
  • Tworzenie wsadowe do 4 generowań naraz

Idealne do:

  • Zmiany oświetlenia, stylu lub otoczenia istniejącego materiału
  • Zastosowania wyglądu obrazu referencyjnego do całego klipu

Koszt: Zależy od wybranych ustawień i długości

Wyspecjalizowany model transferu występu, który animuje postaci przez przenoszenie ruchu, mowy i mimiki z wideo sterującego na obraz postaci lub referencyjne wideo.

Dane wejściowe generowania:

  • Występ sterujący (wideo)
  • Dane postaci (obraz lub wideo)

Funkcje:

  • Przenosi subtelną mimikę, synchronizację ruchu ust i zsynchronizowany dźwięk bezpośrednio z aktora źródłowego na dowolną postać
  • Automatycznie dodaje ruch wtórny i subtelne drgania kamery do statycznych obrazów postaci, aby uzyskać bardziej naturalny efekt
  • Precyzyjny przełącznik do włączania lub wyłączania ruchów ciała i dłoni podczas używania obrazu postaci
  • Regulowane ustawienia równoważące intensywny występ emocjonalny i spójność wizualną postaci
  • Możliwość zmiany głosu postaci po generowaniu przy zachowaniu idealnego dopasowania do występu sterującego

Opcje wyjściowe:

  • Rozdzielczości: 720p
  • Proporcje obrazu: automatyczne

Idealne do:

  • Ożywiania statycznych portretów postaci realistycznym ludzkim ruchem i mową
  • Animowania nieludzkich postaci lub stylizowanych awatarów z wierną mimiką
  • Szybkiego tworzenia treści typu talking head ze zintegrowanymi gestami ciała

Koszt: Zależy od wybranych ustawień i długości

Wyspecjalizowany model do tworzenia dynamicznych sekwencji wieloujęciowych z dużą ilością ruchu i akcji.

Dane wejściowe generowania:

  • Tekst na wideo
  • Klatka początkowa
  • Klatka końcowa

Funkcje:

  • Bardzo stabilna fizyka i płynne przejścia między ujęciami
  • Stałe długości: 3 s, 4 s, 5 s, 6 s, 7 s, 8 s, 9 s, 10 s, 11 s i 12 s
  • Tworzenie wsadowe do 4 generowań naraz
  • Maksymalna swoboda twórcza dzięki licznym opcjom proporcji obrazu

Opcje wyjściowe:

  • Rozdzielczości: 480p, 720p, 1080p
  • Proporcje obrazu: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Opowieści i scen akcji wymagających stabilnej fizyki

Koszt: Zależy od wybranych ustawień i długości

Proporcje obrazu i rozdzielczość nie wpływają na kredyty generowania, ale długość już tak.

Seedance 1 Pro nie jest dostępny w Stanach Zjednoczonych.

Model bazowy oparty na DiT, zaprojektowany do generowania zsynchronizowanego wideo i audio w jednym przebiegu, zapewniając spójną mowę i realistyczny ruch.

Dane wejściowe generowania:

  • Text-to-Video
  • Image-to-Video
  • Audio-to-Video
  • Depth-to-Video

Funkcje:

  • Jednocześnie generuje dialog, ruch ust i dźwięk otoczenia, zapewniając idealne dopasowanie bez zewnętrznych narzędzi
  • Dynamiczne sceny ze stabilnym ruchem, spójną tożsamością i dużą spójnością między klatkami
  • Obsługuje wysokiej jakości zsynchronizowane generowanie do 20 sekund
  • Zaawansowane sterowanie kreatywne dzięki szczegółowej obsłudze negative promptów
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: 720p, 1080p
  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Spójnej mowy i ekspresyjnych występów postaci
  • Treści fabularnych wymagających zintegrowanego dźwięku otoczenia i spójnego timingu
  • Dynamicznych scen ze złożoną logiką ruchu uwzględniającą kamerę

Koszt: Zależy od wybranych ustawień i długości

Wysokiej jakości model generatywny zoptymalizowany pod kątem maksymalnej szczegółowości obrazu i stabilności struktury, zdolny tworzyć materiały 4K gotowe do produkcji z płynnym ruchem.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa (Image-to-Video)

Funkcje:

  • Stawia jakość i spójność obrazu ponad szybkością, zapewniając stabilne rezultaty w dłuższych sekwencjach
  • Obsługuje 25 FPS i 50 FPS, zapewniając wyjątkowo płynny, profesjonalny ruch
  • Zintegrowane generowanie audio-wideo z możliwością włączenia lub wyłączenia dźwięku
  • Obsługuje natywne materiały 1080p, 2k i 4k bez utraty detali
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: 1080p, 2k, 4k
  • Liczba klatek: 25 FPS, 50 FPS
  • Proporcje obrazu: 16:9 (domyślne)
  • Długości: 6s, 8s, 10s

Idealne do:

  • Kinowej produkcji w wysokiej rozdzielczości, wymagającej wyrazistości 4K
  • Profesjonalnych treści wymagających płynnego ruchu w 50 FPS
  • Szczegółowych sekwencji, w których kluczowe są stabilność obrazu i spójność struktury

Koszt: Zależy od wybranych ustawień i długości

Precyzyjne narzędzie AI do reżyserowania, które pozwala zmieniać dialog, emocje i akcję w istniejących ujęciach bez utraty ciągłości i ponownego generowania całej sekwencji.

Dane wejściowe generowania:

  • Źródłowe wideo
  • Opis tekstowy

Funkcje:

  • Modyfikuj wybrane fragmenty, zachowując kontekst z otaczających klatek
  • Zmieniaj wypowiadane kwestie, zachowując spójność głosu postaci, jej występu i otoczenia
  • Wiele trybów edycji: wybierz „Audio i wideo”, „Tylko audio” lub „Tylko wideo”, aby wyodrębnić i wygenerować ponownie konkretne elementy ujęcia
  • Nowa treść naturalnie dziedziczy oryginalny ruch, oświetlenie i ton, zapewniając płynne przejścia
  • Natychmiast testuj inne reakcje postaci, emocjonalne momenty lub ruchy kamery w jednym ujęciu
  • Generuj jednocześnie do 4 wariantów, aby łatwo porównać pomysły

Opcje wyjściowe:

  • Proporcje obrazu: tylko 16:9

Idealne do:

  • Dostosowywania scenariuszy i dopracowywania dialogów bez potrzeby ponownych zdjęć lub nagrań
  • Poprawiania emocjonalnych momentów lub tempa w postprodukcji
  • Testowania różnych komunikatów marki i wezwań do działania w jednym materiale marketingowym

Koszt: Zależy od wybranych ustawień i długości

Model generatywny zoptymalizowany pod kątem szybkości, stworzony do szybkich cykli feedbacku i intensywnego tworzenia treści, oferujący obraz w wysokiej rozdzielczości przy znacznie krótszym czasie renderowania.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa (Image-to-Video)

Funkcje:

  • Zaprojektowany z myślą o szybkości i szybkich iteracjach, umożliwia szybkie eksperymenty wizualne i niemal natychmiastowe podglądy
  • Obsługuje natywne materiały 1080p, 2k i 4k przy mniejszym zapotrzebowaniu na moc obliczeniową niż model Pro
  • Obsługuje 25 FPS i 50 FPS, zapewniając płynny ruch przy dużej szybkości
  • Umożliwia szybkie generowanie zsynchronizowanych treści audio-wideo o długości do 20 sekund
  • Natywna obsługa włączania i wyłączania audio dla każdego generowania
  • Generuj jednocześnie do 4 wariantów

Opcje wyjściowe:

  • Rozdzielczości: 1080p, 2k, 4k
  • Liczba klatek: 25 FPS, 50 FPS
  • Proporcje obrazu: 16:9 (domyślne)
  • Długości: 6s, 8s, 10s, 12s, 14s, 16s, 18s, 20s

Idealne do:

  • Szybkiego prototypowania i kreatywnych eksperymentów, gdy szybkość jest ważniejsza niż maksymalna szczegółowość
  • Dużej liczby treści do mediów społecznościowych wymagających szybkiej realizacji
  • Testów A/B różnych koncepcji wizualnych i stylów ruchu

Koszt: Zależy od wybranych ustawień i długości

Kinowy model wideo z referencjami obrazu, wideo i audio, generowanym audio oraz generowaniem materiałów do 30 sekund.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa
  • Klatka końcowa
  • Referencje obrazu (do 10)
  • Referencje wideo (do 5, łącznie 15s)
  • Referencje audio (do 5, łącznie 15s)

Funkcje:

  • Klatki i referencje wzajemnie się wykluczają
  • Stałe długości: 5s, 10s, 15s, 20s i 30s
  • Natywne sterowanie dźwiękiem z możliwością włączenia lub wyłączenia audio dla każdego generowania
  • Opcjonalne ulepszanie promptu
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 720p, 1080p
  • Proporcje obrazu: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Dłuższych kinowych ujęć ściśle zgodnych z promptem
  • Scen opartych na referencjach z audio

Koszt: Zależy od wybranych ustawień i długości

Wan 3.0 nie jest dostępny w Stanach Zjednoczonych.

Szybszy wariant Wan 3.0 z tymi samymi danymi wejściowymi i opcjami wyjściowymi, odpowiedni do tworzenia pomysłów.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa
  • Klatka końcowa
  • Referencje obrazu (do 10)
  • Referencje wideo (do 5, łącznie 15s)
  • Referencje audio (do 5, łącznie 15s)

Funkcje:

  • Czas generowania jest około dwukrotnie krótszy niż w Wan 3.0
  • Stałe długości: 5s, 10s, 15s, 20s i 30s
  • Natywne sterowanie dźwiękiem z możliwością włączenia lub wyłączenia audio dla każdego generowania
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 720p, 1080p
  • Proporcje obrazu: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Testowania pomysłów przed finalnym renderowaniem w Wan 3.0
  • Workflowów, w których liczy się szybka realizacja

Koszt: Zależy od wybranych ustawień i długości

Wan 3.0 Prime nie jest dostępny w Stanach Zjednoczonych.

Kinowa platforma wideo nowej generacji, która wykorzystuje zunifikowaną architekturę multimodalną do tworzenia treści 1080p gotowych do produkcji, z natywną synchronizacją audio i inteligentnym sekwencjonowaniem wielu ujęć.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa (Image-to-Video)
  • Referencja wideo (Video-to-Video)
  • Referencja audio (opcjonalne audio tła lub dialog)

Funkcje:

  • Zunifikowany system multimodalny: przetwarza tekst, obrazy, wideo i audio w jednym zintegrowanym środowisku, zapewniając spójną jakość wyników
  • Natywna synchronizacja audio: automatycznie generuje i dopasowuje dialogi, narrację oraz dźwięki otoczenia do ruchu na ekranie
  • Inteligentne sekwencjonowanie wielu ujęć: automatycznie układa połączone sekwencje wideo w spójną narrację, zachowując spójność postaci
  • Dłuższe materiały: obsługuje stabilne generowanie wysokiej jakości o stałej długości 5s, 10s i 15s
  • Zaawansowana kontrola kreatywna: obsługuje negative prompty do szczegółowego zarządzania detalami oraz wsadowe tworzenie do 4 wariantów

Opcje wyjściowe:

  • Rozdzielczości: 720p, 1080p
  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Profesjonalnego storytellingu i złożonych, kinowych sekwencji z wieloma ujęciami
  • Reklam w mediach społecznościowych i treści marketingowych wymagających zintegrowanego audio wysokiej jakości
  • Treści opartych na postaciach, wymagających ścisłej spójności obrazu i ruchu dzięki referencjom wideo

Koszt: Zależy od wybranych ustawień i długości

Wan 2.6 nie jest dostępny w Stanach Zjednoczonych.

Wszechstronny model, który zapewnia kinowy ruch i wysoką zgodność z promptem na podstawie tekstu lub obrazu początkowego.

Dane wejściowe generowania:

  • Text-to-Video
  • Klatka początkowa (Image-to-Video)

Funkcje:

  • Szczegółowa kontrola kreatywna dzięki negative promptom i osobnemu sterowaniu dźwiękiem
  • Stałe długości: 5s i 10s
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 720p, 1080p
  • Proporcje obrazu: 16:9, 1:1, 9:16

Idealne do:

  • Kinowych treści ściśle zgodnych z promptem

Koszt: Zależy od wybranych ustawień i długości

Koszt generowania zależy od wybranych ustawień.

Wan 2.5 Video nie jest dostępny w Stanach Zjednoczonych.

Gotowy do produkcji model obrazu OpenAI do bardzo szczegółowych wyników i precyzyjnej edycji.

Dane wejściowe generowania:

  • Text-to-Image
  • Referencje obrazu (do 10)

Funkcje:

  • Pięć poziomów jakości: od niskiej do maksymalnej
  • Własna rozdzielczość do 3840px na bok, przy proporcjach obrazu do 3:1
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K, 4K lub własna
  • Proporcje obrazu: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Idealne do:

  • Finalnych materiałów, gdzie detale i wierność mają największe znaczenie
  • Precyzyjnej edycji istniejących obrazów

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gpt-image-2.5-sunburst

Szybki wariant GPT Image 2.5 z tymi samymi ustawieniami co Sunburst, dostrojony do codziennego generowania na dużą skalę.

Dane wejściowe generowania:

  • Text-to-Image
  • Referencje obrazu (do 10)

Funkcje:

  • Pięć poziomów jakości: od niskiej do maksymalnej
  • Własna rozdzielczość do 3840px na bok, przy proporcjach obrazu do 3:1
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K, 4K lub własna
  • Proporcje obrazu: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Idealne do:

  • Generowania dużej liczby obrazów
  • Szybkich iteracji, które nadal wymagają 4K i własnych rozmiarów

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gpt-image-2.5-flare

Zaawansowany model AI zaprojektowany do precyzyjnego generowania obrazów, z lepszym renderowaniem tekstu i możliwością tworzenia materiałów w wysokiej rozdzielczości.

Funkcje:

  • Precyzyjna kontrola tekstu pozwalająca tworzyć obrazy z czytelną i poprawną typografią
  • Obrazy PNG w wysokiej rozdzielczości, odpowiednie do zastosowań profesjonalnych i komercyjnych
  • Obsługuje wiele referencji obrazu do sterowania stylem i kompozycją
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 3:2, 1:1, 2:3
  • Opcje jakości: niska, średnia, wysoka

Idealne do:

  • Wizualizacji marketingowych i materiałów projektowych wymagających precyzyjnego rozmieszczenia tekstu
  • Profesjonalnych treści wymagających wysokiej rozdzielczości
  • Kreatywnych projektów wymagających precyzyjnej kontroli obrazu opartej na tekście

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gpt-image-2

Zaawansowany model AI do generowania obrazów, łączący jakość gotową do produkcji z ultraszybkim przetwarzaniem, lepszą wiedzą o świecie i spójnością obiektów.

Funkcje:

  • Natywne obrazy w rozdzielczości 4K bez skalowania, z krystalicznie wyraźnymi detalami
  • Błyskawiczne generowanie obrazów już w 1–2 sekundy
  • Doskonała zgodność z promptem dzięki zaawansowanemu rozumowaniu i realizowaniu instrukcji
  • Wyraźne, poprawne renderowanie tekstu w wielu językach do makiet, oznakowania i infografik
  • Spójny styl wielu obiektów, zachowujący tożsamość postaci i przedmiotów
  • Lepsza wiedza o świecie dla dokładniejszego generowania scen
  • Obsługuje wiele referencji obrazu do sterowania generowaniem
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
  • Rozdzielczości: do 4K

Idealne do:

  • Szybkich kreatywnych workflowów wymagających iteracji w czasie rzeczywistym
  • Treści marki i storytellingu ze spójną tożsamością postaci
  • Profesjonalnych materiałów wizualnych z poprawnym tekstem i typografią

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gemini-3.1-flash-image

Szybki, tani wariant Nano Banana 2 do szybkiego generowania i edycji w 1K.

Dane wejściowe generowania:

  • Text-to-Image
  • Referencje obrazu (do 14)

Funkcje:

  • Stały wynik 1K dla przewidywalnej szybkości i kosztu
  • Taka sama obsługa 14 referencji obrazu jak w Nano Banana 2
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K
  • Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Idealne do:

  • Szybkich iteracji i wersji roboczych
  • Masowej edycji, gdy 1K wystarcza

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gemini-3.1-flash-lite-image

Wszechstronny, gotowy do produkcji model generowania obrazów od Krea AI, równoważący jakość i szybkość w szerokim zakresie kreatywnych workflowów.

Funkcje:

  • Generowanie obrazów wysokiej jakości, ściśle zgodnych z promptem
  • Obsługuje wiele referencji obrazu do sterowania generowaniem
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Profesjonalnego tworzenia treści wymagającego stałej jakości
  • Szybkich iteracji różnych kreatywnych koncepcji

Koszt: Zależy od wybranych ustawień i liczby wariantów

Flagowy model generowania obrazów Krea AI, oferujący maksymalną wierność wizualną i zaawansowaną kontrolę kreatywną dla profesjonalnych workflowów produkcyjnych.

Funkcje:

  • Wyjątkowe detale i realizm w materiałach profesjonalnej jakości
  • Zaawansowana kontrola stylu z obsługą wielu referencji obrazu
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Wysokiej klasy komercyjnej i redakcyjnej produkcji obrazów
  • Złożonych kompozycji kreatywnych wymagających maksymalnej wierności

Koszt: Zależy od wybranych ustawień i liczby wariantów

Model text-to-image skupiony na designie, oferujący dobrą kontrolę promptu i czyste kompozycje.

Dane wejściowe generowania:

  • Text-to-Image

Funkcje:

  • Wynik 2K wykorzystuje wariant modelu Pro
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K
  • Proporcje obrazu: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Idealne do:

  • Grafik opartych na układzie, ikon i plakatów
  • Czystych kompozycji tworzonych wyłącznie z tekstu

Koszt: Zależy od wybranych ustawień i liczby wariantów

Model obrazu skupiony na designie, który potrafi dopasować styl obrazów referencyjnych.

Dane wejściowe generowania:

  • Text-to-Image
  • Referencje stylu (do 10)

Funkcje:

  • Kontrola dopasowania stylu: Precise ściśle trzyma się stylu referencji, Flexible dopasowuje ogólny wygląd
  • Wynik 2K wykorzystuje wariant modelu Pro
  • Tworzenie wsadowe: do 4 generowań naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K
  • Proporcje obrazu: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Idealne do:

  • Spójnych z marką grafik na podstawie zestawu referencji stylu
  • Ilustracji i prac projektowych

Koszt: Zależy od wybranych ustawień i liczby wariantów

Lekki model obrazów od ByteDance, który szybko generuje wysokiej jakości wyniki przy mniejszym zapotrzebowaniu na moc obliczeniową.

Funkcje:

  • Szybkie generowanie dla sprawnych kreatywnych iteracji
  • Obsługuje wiele referencji obrazu do sterowania generowaniem
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Workflowów tworzenia dużej liczby obrazów, w których liczy się szybkość
  • Szybkiego odkrywania koncepcji i podglądów

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: bytedance-seedream-5-lite

Seedream 5 Lite nie jest dostępny w Stanach Zjednoczonych.

Wariant Seedream 5 o wyższej jakości, do precyzyjnej edycji, tekstu wielojęzycznego i gęstych infografik.

Dane wejściowe generowania:

  • Text-to-Image
  • Obrazy referencyjne (do 10)

Funkcje:

  • Dokładne renderowanie tekstu w wielu językach
  • Obsługuje gęste układy, takie jak infografiki i plakaty
  • Tworzenie wsadowe do 4 generacji naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K
  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Projektów z dużą ilością tekstu w wielu językach
  • Edycji wielu obrazów ze ścisłym trzymaniem się materiałów referencyjnych

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: bytedance-seedream-5-pro

Seedream 5 Pro nie jest dostępny w Stanach Zjednoczonych.

Szybki flagowy model do precyzyjnego generowania obrazów na podstawie tekstu i złożonej, nieniszczącej edycji zdjęć, która zachowuje oryginalne detale.

Funkcje:

  • Niezawodnie wprowadza wskazane zmiany, zachowując oświetlenie, kompozycję i wygląd obiektów na obrazach źródłowych
  • Obsługuje złożone zadania edycyjne, w tym dodawanie, usuwanie, łączenie i mieszanie elementów
  • Działa do 4 razy szybciej niż poprzednie wersje
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 3:2, 1:1, 2:3
  • Opcje jakości: niska, średnia, wysoka

Idealne do:

  • Praktycznych poprawek zdjęć i realistycznych wirtualnych przymiarek ubrań lub fryzur
  • Koncepcyjnych przekształceń i filtrów stylistycznych, które zachowują charakter obrazu wejściowego
  • Szybkiego iterowania pomysłów text-to-image

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gpt-image-1.5

Obrazowy model pierwszej generacji OpenAI z dobrym trzymaniem się promptów, czytelnym tekstem i szczegółową edycją.

Dane wejściowe generowania:

  • Text-to-Image
  • Obrazy referencyjne (do 5)

Funkcje:

  • Trzy poziomy jakości: niski, średni, wysoki
  • Tworzenie wsadowe do 4 generacji naraz

Opcje wyjściowe:

  • Proporcje obrazu: 3:2, 1:1, 2:3

Idealne do:

  • Workflow opartych już na wynikach GPT Image 1
  • Prostych edycji i zadań z tekstem na obrazie w standardowej rozdzielczości

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gpt-image-1

Wydajny multimodalny model bazowy, który łączy syntezę text-to-image, precyzyjną edycję obrazów i złożone kompozycje z wielu obrazów w jednym wydajnym rozwiązaniu.

Funkcje:

  • Natywna obsługa szybkiego generowania obrazów wysokiej jakości w rozdzielczości do 4K
  • Wyjątkowo dobrze zachowuje rysy twarzy, oświetlenie, ton kolorów i drobne detale podczas edycji na podstawie materiałów referencyjnych
  • Dokładnie rozpoznaje i łączy docelowe elementy z wielu obrazów wejściowych, zapewniając kontrolowane i spójne wyniki
  • Oferuje możliwości kompozycji na poziomie projektanta oraz wyraźne, dokładne renderowanie małego tekstu na plakatach i materiałach marki
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
  • Rozdzielczości: 2K, 4K

Idealne do:

  • Profesjonalnych workflow projektowania graficznego wymagających precyzyjnego układu i typografii
  • Złożonej edycji zdjęć wymagającej ścisłego zachowania tożsamości i oświetlenia z materiałów referencyjnych
  • Kreatywnych kompozycji w wysokiej rozdzielczości z użyciem wielu źródeł wizualnych

Koszt: Zależy od wybranych ustawień i liczby wariantów

Seedream 4.5 nie jest dostępny w Stanach Zjednoczonych.

Model do generowania obrazów wysokiej jakości z zaawansowanymi możliwościami rozumowania, zaprojektowany z myślą o doskonałym trzymaniu się promptów i precyzyjnej spójności wizualnej w złożonych kompozycjach.

Funkcje:

  • Wyjątkowo dobrze interpretuje i realizuje złożone, wielowarstwowe opisy tekstowe z dużą dokładnością
  • Wykorzystuje obrazy referencyjne, by zachować tożsamość obiektu, oświetlenie i styl estetyczny między generacjami
  • Zoptymalizowany pod kątem realistycznych tekstur, złożonych relacji przestrzennych i profesjonalnych efektów oświetleniowych
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
  • Rozdzielczości: 1K, 2K

Idealne do:

  • Profesjonalnych materiałów kreatywnych wymagających ścisłego trzymania się szczegółowych i technicznych promptów tekstowych
  • Edycji obrazów o wysokiej spójności i projektowania postaci na podstawie materiałów wizualnych

Koszt: Zależy od wybranych ustawień i liczby wariantów

Kling O1 Image nie jest dostępny w Stanach Zjednoczonych.

Gotowy do produkcji model do generowania i edycji obrazów, stworzony dla profesjonalnych workflow i oferujący najnowocześniejszą jakość wizualną z naciskiem na szybkość, precyzję i spójność.

Funkcje:

  • Odwołuje się jednocześnie do wielu obrazów, zapewniając wiodącą w branży spójność postaci i tożsamości w setkach materiałów
  • Zapewnia bezprecedensowy skok jakości detali, zbliżając się do prawdziwej fotografii — od faktur tkanin po elementy architektoniczne
  • Oferuje gotowe do produkcji renderowanie tekstu dla złożonej typografii, makiet UI i infografik
  • Obsługuje precyzyjne wskazywanie kolorów marki za pomocą kodów hex, bez przybliżeń
  • Zapewnia dokładne rozmieszczenie obiektów, realistyczną fizykę, spójne oświetlenie i właściwą perspektywę w złożonych scenach
  • Zoptymalizowany pod kątem lepszej dokładności i reakcji na uporządkowane, złożone instrukcje
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
  • Rozdzielczości: 720p, 1080p, 2K

Idealne do:

  • Prowadzenia kampanii ze spójnymi postaciami i dokładnego umieszczania produktów w każdym kontekście
  • Tworzenia makiet interfejsów z czytelnym tekstem i spójnymi systemami projektowania wizualnego
  • Generowania na skalę zdjęć produktów i ujęć lifestylowych w kontekście

Koszt: Zależy od wybranych ustawień i liczby wariantów

Profesjonalny, oparty na rozumowaniu model do generowania i edycji obrazów, stworzony do produkcji materiałów wysokiej jakości, zaawansowanej kontroli kreatywnej i precyzyjnego wykonywania instrukcji.

Dane wejściowe:

  • Obraz referencyjny
  • Opis tekstowy (obsługuje złożone, wielowarstwowe prompty)

Funkcje:

  • Planuje sceny przed renderowaniem, zapewniając oświetlenie zgodne z fizyką, dokładne relacje między obiektami i doskonałe trzymanie się promptów
  • Generuje ostry, czytelny tekst w wielu językach, w różnych stylach czcionek i pisma odręcznego, do wyrazistych plakatów i makiet produktów
  • Utrzymuje wysoką jakość i podobieństwo dla maksymalnie 5 osób oraz wielu obiektów w różnorodnych materiałach kreatywnych
  • Integruje Google Search, aby wzbogacać obrazy o faktyczne dane, wiedzę o świecie i informacje w czasie rzeczywistym, takie jak pogoda lub wyniki sportowe
  • Dostosowuj kąty kamery, punkty ostrości i oświetlenie sceny (np. zmieniaj dzień w noc) dzięki zaawansowanym narzędziom do lokalnej edycji
  • Doskonałe rozumienie przestrzeni pozwala generować dokładne infografiki, diagramy techniczne i slajdy prezentacji
  • Generuje do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: 1K, 2K, 4K
  • Proporcje obrazu: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Idealne do:

  • Profesjonalnych reklam, materiałów marki i wysokiej klasy zdjęć produktów dla e-commerce
  • Materiałów edukacyjnych, infografik opartych na danych i złożonej dokumentacji technicznej
  • Szybkiego prototypowania projektów wizualnych w wysokiej rozdzielczości ze spójną tożsamością postaci lub marki

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gemini-3-pro-image

Szybki model do sprawnego generowania i edycji obrazów wysokiej jakości bezpośrednio z promptów tekstowych.

Funkcje:

  • Obsługuje wiele obrazów referencyjnych, które kierują generowaniem
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Idealne do:

  • Szybkiego tworzenia i iterowania obrazów

Koszt: Zależy od wybranych ustawień i liczby wariantów

API: gemini-2.5-flash-image

Zaawansowany model bazowy do generowania obrazów wysokiej jakości, oferujący bezprecedensową kontrolę stylu i pamięć wizualną, która pomaga zachować spójność między scenami.

Funkcje:

  • Zakotwicz postacie, style lub konkretne obiekty za pomocą obrazów wejściowych, aby zachować profesjonalną spójność w wielu wynikach
  • Zoptymalizowany do interpretowania złożonych opisów w języku naturalnym, zapewniając precyzyjną kontrolę nad detalami wizualnymi, oświetleniem i emocjami
  • Potrafi generować wysokiej jakości obrazy do różnych zastosowań — od filmowych storyboardów po profesjonalne zdjęcia produktów
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
  • Rozdzielczości: 720p, 1080p

Idealne do:

  • Zapewniania, że główne postacie zachowują wygląd w różnych środowiskach i oświetleniu
  • Szybkiego tworzenia materiałów marki w wysokiej rozdzielczości, wirtualnych przymiarek i gotowych do skalowania wizualizacji produktów
  • Odkrywania różnych kierunków artystycznych przy zachowaniu głównej tożsamości wizualnej dzięki obrazom referencyjnym

Koszt: Zależy od wybranych ustawień i liczby wariantów

Zoptymalizowany pod kątem szybkości model do generowania obrazów, który daje wyniki 2,5 razy szybciej niż standardowy Gen-4 Image, przy identycznej jakości wyjściowej.

Funkcje:

  • Zoptymalizowane przetwarzanie pozwala szybko odkrywać możliwości kreatywne i generować obrazy wysokiej jakości w ułamku czasu
  • Prześlij do trzech obrazów referencyjnych, aby pomóc modelowi zrozumieć konkretne postacie, środowiska i style artystyczne
  • Rozwiązuje problem dryfu wizualnego, kodując konkretne cechy wizualne z obrazów referencyjnych, aby zachować tożsamość między wieloma generacjami
  • Z łatwością zastosuj estetykę, oświetlenie i teksturę obrazu referencyjnego do całkiem nowych obiektów i scen
  • Używaj parametrów seed, aby systematycznie badać warianty lub precyzyjnie odtwarzać konkretne wyniki
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16
  • Rozdzielczości: 720p, 1080p

Idealne do:

  • Szybkiego tworzenia na skalę obrazów zoptymalizowanych dla Instagram Stories (9:16) lub standardowych postów (1:1)
  • Utrzymywania ścisłej tożsamości wizualnej kampanii dzięki używaniu wytycznych stylu marki jako obrazów referencyjnych
  • Tworzenia spójnych póz postaci i scenografii przy zachowaniu rozpoznawalności głównego bohatera
  • Dokładnego tworzenia różnorodnych lifestylowych i sezonowych zdjęć produktów na podstawie materiałów referencyjnych

Koszt: Zależy od wybranych ustawień i liczby wariantów

Specjalistyczny model obrazowy do generowania sekwencji wielu ujęć lub scen z dużą ilością ruchu i akcji.

Funkcje:

  • Doskonale tworzy obrazy ze stabilną fizyką i spójnymi przejściami
  • Obsługuje wiele obrazów referencyjnych, które kierują generowaniem
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: auto, 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Scen akcji i dynamicznych kompozycji

Koszt: Zależy od wybranych ustawień i liczby wariantów

Seedream 4 nie jest dostępny w Stanach Zjednoczonych.

Wariant obrazowy Wan 2.5, z wysoką zgodnością z promptami i obsługą obrazów referencyjnych.

Dane wejściowe generowania:

  • Text-to-Image
  • Obrazy referencyjne (do 2)

Funkcje:

  • Kontrola negatywnego promptu i seed
  • Tworzenie wsadowe do 4 generacji naraz

Opcje wyjściowe:

  • Proporcje obrazu: 16:9, 4:3, 1:1, 3:4, 9:16

Idealne do:

  • Nieruchomych obrazów pasujących do wyglądu generacji wideo Wan
  • Obrazów koncepcyjnych zgodnych z promptem

Koszt: Zależy od wybranych ustawień i liczby wariantów

Wan 2.5 Image nie jest dostępny w Stanach Zjednoczonych.

Profesjonalny model do zaawansowanego generowania i edycji obrazów, oferujący wysoką spójność scen i kontrolę stylu.

Funkcje:

  • Kontrola stylu na podstawie obrazu, wymagająca obrazu referencyjnego do określenia estetyki wizualnej
  • Generuje do 4 obrazów naraz

Opcje wyjściowe:

  • Proporcje obrazu: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21

Idealne do:

  • Profesjonalnych materiałów z precyzyjnymi wymaganiami stylistycznymi

Koszt: Zależy od wybranych ustawień i liczby wariantów

Najnowocześniejszy model diffusion transformer (DiT), stworzony do renderowania ultrarealistycznych, reagujących awatarów sterowanych dźwiękiem i tekstem.

Dane wejściowe generowania:

  • Awatar (obraz źródłowy)
  • Mowa (plik audio)
  • Opis tekstowy (wskazówki)

Funkcje:

  • Wykracza poza podstawową synchronizację ruchu ust, uwzględniając mruganie, oddychanie i naturalną mimikę zależne od kontekstu
  • Automatycznie synchronizuje ruchy dłoni i całego ciała na podstawie tonu oraz intonacji głosu, zapewniając jakość studyjnej produkcji
  • Precyzyjnie interpretuje natężenie i wysokość głosu, by oddać emocje zgodne z wykonaniem
  • Zachowuje wysoką wierność postaci i spójność zachowania nawet w długich dialogach lub występach muzycznych
  • Zoptymalizowany pod różne ujęcia, w tym prezentacje z boku, dialogi w stylu podcastu i stylizowane animacje
  • Generuj do 4 wariantów naraz

Opcje wyjściowe:

  • Rozdzielczości: 480p, 720p

Idealny do:

  • Profesjonalnych reklam wideo z awatarami i treści marketingowych
  • Wirtualnego storytellingu wysokiej jakości i ekspresyjnych występów muzycznych
  • Długich materiałów edukacyjnych lub szkoleniowych, które wymagają stałej obecności postaci

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

API: creatify-aurora

Szybki i precyzyjny model synchronizacji ruchu ust z obrazu do wideo, który animuje nieruchomy obraz zgodnie z podanym dźwiękiem.

Dane wejściowe:

  • Obraz źródłowy
  • Plik audio z mową

Funkcje:

  • Animuje usta i mimikę na obrazie źródłowym zgodnie z podanym dźwiękiem
  • Tworzy wysokiej jakości „mówiące” wideo z nieruchomych obrazów
  • Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo

Idealny do:

  • Tworzenia mówiących awatarów z nieruchomych obrazów
  • Dodawania dialogów do portretów postaci
  • Profesjonalnych workflow z treściami opartymi na awatarach

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów obraz powinien zawierać wykrywalną postać.

Najnowszy model awatarów HeyGen do tworzenia bardzo realistycznych, ekspresyjnych filmów z mówiącą twarzą na podstawie jednego obrazu i dźwięku.

Dane wejściowe:

  • Obraz źródłowy
  • Plik audio z mową

Funkcje:

  • Animuje mimikę i ruchy ust zgodnie z podanym dźwiękiem, zachowując wysoką wierność
  • Tworzy naturalne ruchy głowy i subtelną mikroekspresję dla realistycznego efektu
  • Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo

Idealny do:

  • Profesjonalnych filmów ze spikerami i prezenterami
  • Tworzenia spersonalizowanych treści z awatarami na dużą skalę
  • Filmów marketingowych i szkoleniowych ze stałą obecnością postaci

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów obraz powinien zawierać wyraźnie widoczną twarz.

Najnowszej generacji model synchronizacji ruchu ust w wideo od Sync, zapewniający studyjną jakość synchronizacji dla wielu typów treści.

Dane wejściowe generowania:

  • Wideo źródłowe
  • Audio z mową

Funkcje:

  • Precyzyjna synchronizacja ruchu ust, która zachowuje unikalne rysy twarzy, naturalne zęby i teksturę skóry
  • Zoptymalizowany pod wszystkie typy treści, w tym nagrania aktorskie, animacje 3D i wideo generowane przez AI
  • Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo

Idealny do:

  • Profesjonalnego dubbingu i lokalizacji filmów oraz reklam
  • Ulepszania lub poprawiania dialogów w każdym formacie wideo
  • Workflow tłumaczenia dużej liczby treści

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.

Najnowocześniejszy model do edycji wideo, stworzony do studyjnej synchronizacji ruchu ust. Zachowuje unikalne rysy twarzy i obsługuje wyjścia w wysokiej rozdzielczości.

Dane wejściowe generowania:

  • Wideo źródłowe
  • Audio z mową

Funkcje:

  • Wykorzystuje zaawansowane skalowanie, by obsługiwać wyjście 4K przy zachowaniu ostrych, naturalnych tekstur
  • Chroni unikalne cechy twarzy, takie jak naturalne zęby, piegi, makijaż i złożony zarost, bez utraty wyrazistości
  • Zoptymalizowany pod wszystkie typy treści, w tym nagrania aktorskie, animacje 3D i wideo generowane przez AI
  • Od razu zapewnia ekspresyjne, zsynchronizowane efekty bez trenowania dla konkretnego mówcy ani dostrajania modelu
  • Generuj do 4 wariantów jednocześnie

Idealny do:

  • Profesjonalnego dubbingu i lokalizowanych treści dla filmu oraz reklam premium
  • Ulepszania lub poprawiania dialogów postaci w animacji 3D i wideo generowanym przez AI
  • Projektów w wysokiej rozdzielczości, wymagających spójności i szczegółów twarzy co do piksela

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Specjalny model użytkowy do tworzenia wyjątkowo realistycznej, ludzkiej synchronizacji ruchu ust.

Dane wejściowe:

  • Nieruchomy obraz źródłowy
  • Plik audio z mową

Funkcje:

  • Animuje usta na obrazie źródłowym zgodnie z podanym dźwiękiem
  • Tworzy wysokiej jakości „mówiące” wideo z nieruchomych obrazów
  • Narzędzie do synchronizacji ruchu ust, nie pełny model generowania wideo

Idealny do:

  • Tworzenia mówiących awatarów
  • Dodawania dialogów do nieruchomych obrazów
  • Profesjonalnych workflow dubbingu

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów obraz powinien zawierać wykrywalną postać.

OmniHuman 1.5 nie jest dostępny w Stanach Zjednoczonych.

Szybki, przystępny cenowo i precyzyjny model użytkowy do stosowania realistycznej synchronizacji ruchu ust w wideo.

Dane wejściowe:

  • Wideo źródłowe
  • Nowy plik audio z mową

Funkcje:

  • Ponownie animuje ruchy ust w wideo źródłowym, aby pasowały do nowego dźwięku
  • Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo

Idealny do:

  • Dubbingu dużej liczby materiałów przy niskich kosztach
  • Tłumaczenia treści
  • Poprawiania dźwięku w klipach wideo z realistycznym efektem

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.

Następca Veed Lipsync o wyższej jakości, do stosowania realistycznej synchronizacji ruchu ust w istniejących filmach.

Dane wejściowe:

  • Wideo źródłowe
  • Nowy plik audio z mową

Funkcje:

  • Ponownie animuje ruchy ust w wideo źródłowym, aby pasowały do nowego dźwięku
  • Narzędzie do synchronizacji ruchu ust wideo z wideo, nie pełny generator wideo
  • Tworzenie wsadowe: do 4 generacji naraz

Idealny do:

  • Dubbingu i tłumaczeń, gdy jakość wyniku jest ważniejsza niż koszt
  • Poprawiania dialogów w gotowych klipach

Koszt: Zależy od danych wejściowych, ustawień i czasu trwania

Dla najlepszych efektów wideo powinno zawierać wykrywalną postać.

Specjalny model użytkowy do skalowania obrazów i wideo, stworzony do zwiększania rozdzielczości i szczegółowości nawet 4x.

Funkcje:

  • Narzędzie ulepszające, które przetwarza istniejące materiały
  • Zwiększa rozmiar materiałów, zachowując naturalne tekstury i minimalizując artefakty
  • Bardzo precyzyjne współczynniki skalowania: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
  • Dla wideo: elastyczna kontrola liczby klatek (zachowaj źródłową lub zmień na 24, 25, 30, 48, 50 albo 60 fps)

Idealny do:

  • Poprawiania jakości wygenerowanych materiałów
  • Odnawiania archiwalnych nagrań lub zdjęć
  • Przygotowywania zasobów na wyświetlacze o wysokiej rozdzielczości

Koszt: Zależy od danych wejściowych

Usuwa tło z obrazu i zwraca go z przezroczystością alfa.

Dane wejściowe:

  • Obraz źródłowy

Funkcje:

  • Nie wymaga promptu
  • Jeden wynik na uruchomienie

Idealny do:

  • Wycinania produktów i komponowania obrazów
  • Przygotowywania obiektów do użycia jako referencje w innych generacjach

Koszt: Zależy od danych wejściowych

Konwertuje wideo o standardowym zakresie dynamiki na HDR.

Dane wejściowe:

  • Wideo źródłowe (do 30 s)

Funkcje:

  • Nie wymaga promptu
  • Jeden wynik na uruchomienie; długość i kadrowanie są zgodne ze źródłem

Idealny do:

  • Przygotowywania nagrań na wyświetlacze HDR
  • Ponownej korekcji kolorów wygenerowanego wideo przed publikacją

Koszt: Zależy od długości wideo

Najczęściej zadawane pytania

Image & Video pozwala tworzyć wysokiej jakości treści wizualne na podstawie prostych opisów tekstowych i opcjonalnych obrazów referencyjnych.

Możesz wybierać spośród różnych generatywnych modeli obrazów i wideo, zależnie od zastosowania. Wygenerowane treści możesz pobrać lub zaimportować bezpośrednio do projektów Studio.

W bezpłatnym planie możesz wysłać tylko trzy generacje obrazów dziennie. Generowanie wideo jest dostępne tylko w płatnych subskrypcjach.

Więcej informacji znajdziesz w naszej dokumentacji Image & Video.

Jeśli bierzesz udział w programie ElevenLabs Grants, możesz wykorzystać do 1 000 000 kredytów z grantu na Image & Video i Flows.

Koszt generacji zależy od używanego modelu i wybranych ustawień. Na przykład liczba wariantów i rozdzielczość wpływają na liczbę naliczonych kredytów. 

Przed wysłaniem generacji zobaczysz jej koszt na podstawie wybranego modelu i ustawień. 

Więcej informacji znajdziesz w naszej dokumentacji Image & Video.

W bezpłatnym planie możesz wysłać tylko trzy generacje obrazów dziennie. Generowanie wideo jest dostępne tylko w płatnych subskrypcjach.

No results