Hoppa till navigering

Bild och video

Skapa och redigera imponerande bilder och videor från textprompter och visuella referenser.

Översikt

Med Image & Video kan du skapa visuellt innehåll av hög kvalitet utifrån enkla textbeskrivningar eller referensbilder. Skapa stillbilder eller dynamiska videor i valfri stil, förfina dem stegvis med ytterligare promptar, skala upp för högupplöst resultat och lägg till läppsynk med ljud.

Vissa Image & Video-modeller och funktioner för uppladdning av indata är begränsade i USA på grund av myndighetskrav eller krav från leverantörer. Kontrollera de enskilda modellbeskrivningarna för specifik tillgänglighet.

Användare av gratisplanen kan bara skapa bilder och är begränsade till tre bildförfrågningar per dag. Video- generering kräver en betalplan. Generering via API:t kräver Pro-planen eller högre. För API- förfrågningar är ByteDance-modeller inaktiverade som standard och kräver uttryckligt godkännande före användning. Enterprise-kunder kan kontakta supporten för att begära åtkomst.

Viktiga funktioner

  • Bildgenerering: Skapa högkvalitativa bilder från textpromptar eller referensbilder med modeller optimerade för hastighet eller kvalitet
  • Videogenerering: Skapa dynamiska videor med filmiska rörelser, realistisk fysik och integrerat ljud. Videogenerering är endast tillgängligt med betalplaner
  • Stegvis förfining: Förfina genereringar med ytterligare promptar och skapa variationer
  • Förbättringsverktyg: Skala upp upplösningen med upp till 4x och använd realistisk läppsynk med ljud
  • Flera modeller: Få tillgång till specialiserade modeller för olika användningsfall, från snabb iteration till produktionsklart innehåll
  • Referensstöd: Styr genereringen med startramar, slutramar och stilreferenser. Stöder många bildfilformat, inklusive JPG, PNG, WEBP med flera
  • Flexibel export: Ladda ner som fristående filer eller importera direkt till projekt i ElevenCreative Studio

Arbetsflöde

Skapandeprocessen tar dig från inspiration till färdig tillgång i fyra steg:

Utforska: Upptäck innehåll som communityn har skapat för att hitta inspiration och studera effektiva promptar.

Generera: Använd promptrutan för att beskriva vad du vill skapa, välj en modell och finjustera inställningarna.

Iterera och förbättra: Granska genereringar, skapa variationer och använd förbättringar som uppskalning och läppsynk.

Exportera: Ladda ner färdiga tillgångar eller skicka dem direkt till ElevenCreative Studio.

Nedladdningsformat som stöds

Video:

  • MP4: Codecs H.264, H.265. Kvalitet upp till 4K (med uppskalning)

Bild:

  • PNG: Högupplöst, förlustfri utdata

Modeller

Image & Video ger tillgång till specialiserade modeller som är optimerade för olika användningsområden. Varje modell erbjuder unika funktioner, från snabb iteration till produktionsklar kvalitet.

Efterbearbetningsmodeller kräver ett befintligt genererat resultat, men du kan också ladda upp en egen bild- eller videofil.

Administratörer för Enterprise-arbetsytor kan styra vilka modeller för bild- och videogenerering som är tillgängliga för arbetsytans medlemmar. Som standard är alla modeller inaktiverade för Enterprise-arbetsytor och måste aktiveras uttryckligen av administratörer. Läs mer om modell- godkännanden.

För API-förfrågningar är ByteDance-modeller inaktiverade som standard och kräver uttryckligt godkännande före användning. Enterprise-kunder kan kontakta supporten för att begära åtkomst.

Alla modeller nedan finns i Image & Video-appen. Modeller som även kan anropas från Image & Video API listar sitt model_id under API; övriga är endast tillgängliga i appen.

En enhetlig multimodal videomodell med gemensam ljud- och videogenerering som erbjuder kontroll på regissörsnivå över prestation, ljussättning, skuggor och kamerarörelser för ultrarealistiska, filmiska resultat.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser
  • Videoreferenser
  • Ljudreferenser

Funktioner:

  • Enhetlig multimodal arkitektur som genererar synkroniserat ljud och video i ett enda steg
  • Branschledande multimodala referens- och redigeringsfunktioner som tar emot text-, bild-, ljud- och videoindata samtidigt
  • Exceptionell rörelsestabilitet med filmisk realism i linje med branschstandarder
  • Kreativ kontroll på regissörsnivå över prestation, ljussättning, skuggor och kamerarörelser
  • Flexibla genereringslängder från 4 s upp till 15 s
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p, 1080p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Filmiskt berättande som kräver synkroniserat ljud och bild
  • Referensdrivet innehåll som strikt följer källbilder, videor eller ljud
  • Professionella produktioner som kräver detaljerad kontroll över ljussättning och kamerarbete

Kostnad: Varierar beroende på valda inställningar och längd

API: bytedance-seedance-v2

Inställningar kan växlas för att justera kreditförbrukningen.

Seedance 2.0 är inte tillgänglig i USA.

En snabbare variant av Seedance 2.0 med lägre kostnad, samma multimodala referensindata och utdata begränsad till 720p.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 9)
  • Videoreferenser (upp till 3, totalt 15 s)
  • Ljudreferenser (upp till 3, totalt 15 s)

Funktioner:

  • Samma referenshantering som Seedance 2.0, med en sammanlagd gräns på 12 referenser per generering
  • Bildrutor och referenser utesluter varandra: använd en start- eller slutbildruta, eller referenser, inte båda
  • Flexibla genereringslängder från 4 s upp till 15 s
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Att iterera på Seedance 2.0-prompter före rendering i full upplösning
  • Referensdrivna klipp där 720p-utdata räcker

Kostnad: Varierar beroende på valda inställningar och längd

API: bytedance-seedance-v2-fast

Seedance 2.0 Fast är inte tillgänglig i USA.

Den minsta Seedance 2.0-varianten: ungefär dubbelt så snabb som Seedance 2.0 till omkring halva kostnaden, med samma indata och 720p-utdata.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 9)
  • Videoreferenser (upp till 3, totalt 15 s)
  • Ljudreferenser (upp till 3, totalt 15 s)

Funktioner:

  • Samma referenshantering som Seedance 2.0, med en sammanlagd gräns på 12 referenser per generering
  • Bildrutor och referenser utesluter varandra: använd en start- eller slutbildruta, eller referenser, inte båda
  • Flexibla genereringslängder från 4 s upp till 15 s
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Stora mängder utkast och förhandsvisningar
  • Kostnadskänsliga arbetsflöden som fortfarande behöver ljud- och referensindata

Kostnad: Varierar beroende på valda inställningar och längd

API: bytedance-seedance-v2-mini

Seedance 2.0 Mini är inte tillgänglig i USA.

Efterföljaren till Seedance 2.0 med skarpare realism, upp till 50 kombinerade bild-, video- och ljudreferenser samt genereringar på upp till 30 sekunder.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 30)
  • Videoreferenser (upp till 10, totalt 30 s)
  • Ljudreferenser (upp till 10, totalt 30 s)

Funktioner:

  • Ingen sammanlagd gräns mellan referenstyper; endast ljudreferenser accepteras utan bild eller video
  • Bildrutor och referenser utesluter varandra
  • Flexibla genereringslängder från 4 s upp till 30 s
  • Bildförhållandet hämtas från startbildrutan eller referensvideon när en sådan anges
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Längre klipp som behöver vara konsekventa med många referenser
  • Dialog- och prestationsscener som styrs av referensljud

Kostnad: Varierar beroende på valda inställningar och längd

API: bytedance-seedance-v2.5

Seedance 2.5 har ingen seed-kontroll.

Seedance 2.5 är inte tillgänglig i USA.

Redigerar en befintlig video genom att du beskriver ändringarna. Utdatalängd och bildförhållande följer indatavideon.

Genereringsindata:

  • Video att redigera (krävs, upp till 30 s)
  • Textprompt som beskriver redigeringarna
  • Bildreferenser (upp till 30)
  • Ytterligare videoreferenser (upp till 10, totalt 30 s)
  • Ljudreferenser (upp till 10, totalt 30 s)

Funktioner:

  • Ingen längdkontroll: utdatan matchar indatavideons längd
  • Bildförhållandet hämtas från indatavideon
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p

Passar bäst för:

  • Att ändra kläder, rekvisita, ljussättning eller miljö i befintligt material
  • Stilöverföring som bevarar originalrörelsen

Kostnad: Varierar beroende på valda inställningar och längd

Seedance 2.5 Video Edit är inte tillgänglig i USA.

Fortsätter en befintlig video där den slutar, vägledd av en prompt och valfria referenser.

Genereringsindata:

  • Video att förlänga (krävs, upp till 30 s)
  • Textprompt som beskriver fortsättningen
  • Bildreferenser (upp till 30)
  • Ytterligare videoreferenser (upp till 10, totalt 30 s)
  • Ljudreferenser (upp till 10, totalt 30 s)

Funktioner:

  • Förlängningslängd från 4 s upp till 30 s
  • Bildförhållandet hämtas från indatavideon
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat per generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 480p, 720p

Passar bäst för:

  • Att förlänga en tagning som slutar för tidigt
  • Att länka samman flera genereringar till en längre sekvens

Kostnad: Varierar beroende på valda inställningar och längd

Seedance 2.5 Video Extend är inte tillgänglig i USA.

En avancerad videomodell som fungerar som en AI-regissör och bibehåller hög konsekvens för karaktärer, objekt och scener vid komplexa kamerarörelser.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta

Funktioner:

  • Högupplöst bevarande av karaktärer och scener med bild- eller videoreferenser från flera vinklar
  • Inbyggd samgenerering av ljud och bild med flerspråkig läppsynk och omgivningsljud
  • Flexibla genereringslängder från 3 s upp till 15 s
  • Generera upp till 4 variationer samtidigt
  • Förbättrad hantering av text, vätskedynamik och komplexa fysiska interaktioner

Utdataval:

  • Upplösningar: endast 1080p
  • Bildförhållanden: 16:9, 1:1, 9:16

Passar bäst för:

  • Karaktärsdrivet berättande som kräver visuell kontinuitet
  • Reklam och material med särskilda behov av textrendering

Kostnad: Varierar beroende på valda inställningar och längd

Stöder negativa prompter för detaljerad kontroll. Ljud kan aktiveras eller inaktiveras per generering.

Kling 3.0 är inte tillgänglig i USA.

En videomodell med hög konsekvens som fungerar som en AI-regissör och bevarar identiteten hos karaktärer, objekt och scener vid komplexa kamerarörelser.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Videoreferens
  • Bildreferens

Funktioner:

  • Bibehåller exakt visuell identitet för huvudkaraktärer och objekt med referenser från flera vinklar
  • Stöder sömlösa genereringslängder från 3 s upp till 15 s
  • Generera upp till 4 variationer åt gången
  • Exakt modellering av interaktioner mellan element och rörelsekoherens
  • Inbyggt stöd för aktiverat eller inaktiverat ljud per generering

Utdataval:

  • Upplösningar: endast 1080p
  • Bildförhållanden: 16:9, 1:1, 9:16

Passar bäst för:

  • Karaktärsdrivet berättande som kräver strikt visuell kontinuitet
  • Professionellt marknadsförings- och varumärkesmaterial med konsekvent återgivning av objekt

Kostnad: Varierar beroende på valda inställningar och längd

Inställningar kan växlas för att justera kreditförbrukningen.

Kling O3 är inte tillgänglig i USA.

En videoredigeringsmodell från video till video som styrs med naturligt språk och bygger på O3-arkitekturen. Den möjliggör komplexa visuella omvandlingar—som att byta ut karaktärer och miljöer—utan manuell maskning eller justering bildruta för bildruta.

Genereringsindata:

  • Källvideo
  • Bildreferenser (upp till 4 separata element/vinklar)
  • Textbeskrivning (instruktioner på naturligt språk)

Funktioner:

  • Tolkar konversationsbaserade prompter för att ersätta motiv eller miljöer samtidigt som den ursprungliga rörelsestrukturen respekteras
  • Behåller ursprungliga kameravinklar, rörelsemönster och rumsliga relationer genom hela redigeringen
  • Kombinerar upp till 4 element totalt (inklusive bilder framifrån och från flera vinklar) för hög konsekvens hos karaktärer
  • Alternativ för att bevara ursprungligt källjud eller generera ljudlös utdata per generering
  • Generera upp till 4 redigerade variationer åt gången

Utdataval:

  • Upplösningar: Beror på källvideon
  • Bildförhållanden: Matchar källvideon

Passar bäst för:

  • Högupplöst byte av karaktärer i befintligt material samtidigt som ursprungliga rörelser bevaras
  • Fullständiga omvandlingar av scenmiljöer (t.ex. att ändra en stad på dagen till ett futuristiskt nattlandskap)
  • Att tillämpa stilöverföringar som kräver strikt följsamhet till befintlig kameradynamik

Kostnad: Varierar beroende på videolängd och valda inställningar

Kling O3 Edit är inte tillgänglig i USA.

En professionell modell för högkvalitativ, filmisk videogenerering.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser

Funktioner:

  • Utmärkt kvalitet och kreativ kontroll med negativa prompter
  • Fullständigt integrerat och synkroniserat ljud
  • Realistisk dialog, läppsynk och ljudeffekter
  • Fasta längder: 4 s, 6 s och 8 s
  • Batchskapande med upp till 4 genereringar åt gången
  • Separat ljudkontroll

Utdataval:

  • Upplösningar: 720p, 1080p
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Högkvalitativ, filmisk videogenerering med full kreativ kontroll

Kostnad: Varierar beroende på valda inställningar och längd

API: veo-3.1-generate-001

Att aktivera eller inaktivera ljud ändrar genereringskrediterna.

En höghastighetsmodell som är optimerad för snabba förhandsvisningar och genereringar, med skarpare bild och lägre latens.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta

Funktioner:

  • Avancerad kreativ kontroll med negativa prompter och separat ljudkontroll
  • Fasta längder: 4 s, 6 s och 8 s
  • Batchskapande med upp till 4 genereringar åt gången
  • Modellerar verklig fysik exakt för realistiska rörelser och interaktioner

Utdataval:

  • Upplösningar: 720p, 1080p
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Snabb iteration och A/B-testning av visuellt innehåll
  • Snabbt skapande av innehåll för sociala medier

Kostnad: Varierar beroende på valda inställningar och längd

API: veo-3.1-fast-generate-001

En kostnadseffektiv höghastighetsvariant av Veo 3.1 som är optimerad för snabb generering med lägre beräkningskapacitet.

Genereringsindata:

  • Text-till-video
  • Startbildruta

Funktioner:

  • Detaljerad kreativ kontroll med negativa prompter och separat ljudkontroll
  • Fasta längder: 4 s, 6 s och 8 s
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 720p
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Storskaligt innehållsskapande där hastighet och kostnadseffektivitet prioriteras
  • Snabb utforskning av koncept och förhandsvisningar

Kostnad: Varierar beroende på valda inställningar och längd

Googles fysikmedvetna videomodell med inbyggt ljud, utdata på upp till 4K samt både bildruteinterpolering och referensstyrd generering.

Genereringsindata:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 10)
  • Videoreferenser (upp till 3, vardera upp till 10 s)

Funktioner:

  • Bildrutor och referenser utesluter varandra: interpolera mellan bildrutor eller styr med referenser
  • Fasta längder från 3 s till 10 s; längden följer referensvideon när en sådan bifogas
  • Stark återgivning av kort text och etiketter på skärmen
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 360p, 720p, 1080p, 4K
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Förklarande videor och kinetisk typografi med läsbar text
  • Fysiskt trovärdiga rörelser med konsekventa motiv mellan referenser

Kostnad: Varierar beroende på valda inställningar och längd

Fortsätter en befintlig video där den slutar med Gemini Omni Flash 1.1, till en sammanlagd längd på upp till 40 sekunder.

Genereringsindata:

  • Video att förlänga (krävs, upp till 30 s)
  • Textprompt som beskriver fortsättningen

Funktioner:

  • Förlängningslängd från 3 s till 10 s
  • Bildförhållandet följer indatavideon
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 360p, 720p, 1080p, 4K

Passar bäst för:

  • Att förlänga Gemini Omni Flash-genereringar utan ett synligt klipp
  • Att bygga sekvenser som är längre än en enskild generering tillåter

Kostnad: Varierar beroende på valda inställningar och längd

Den första Gemini Omni-videomodellen: fysikmedvetna rörelser, inbyggt ljud och den bästa återgivningen av text på skärmen bland de tillgängliga videomodellerna, i 720p.

Genereringsindata:

  • Text-till-video
  • Bildreferenser (upp till 8)
  • Videoreferens (1, upp till 10 s)

Funktioner:

  • Fasta längder från 3 s till 10 s; längden följer referensvideon när en sådan bifogas
  • Ingen start- eller slutbildruta; använd bildreferenser för att förankra ett motiv i stället
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 720p
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Korta bildtexter, titlar och förklarande videor med etiketter
  • Konsekvens mellan flera bilder i 720p

Kostnad: Varierar beroende på valda inställningar och längd

En uppgraderad specialiserad modell för att skapa dynamiska sekvenser med hög detaljrikedom, förbättrad tidsmässig stabilitet och exakt kontroll över övergångar mellan nyckelbilder.

Indata för generering:

  • Text-till-video
  • Startbildruta
  • Slutbildruta

Funktioner:

  • Överbryggar start- och slutbildrutor sömlöst för sammanhängande sekvenser med flera tagningar
  • Modellering med hög detaljrikedom av komplexa handlingar och konsekventa miljöer
  • Stöder fasta genereringslängder från 4 s upp till 12 s
  • Generera upp till 4 variationer åt gången
  • Inbyggt stöd för att aktivera eller inaktivera ljud för varje generering

Utdataalternativ:

  • Upplösningar: 420p, 720p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Berättande och actionscener som kräver stabil fysik mellan specifika visuella riktpunkter
  • Filmiska övergångar och professionellt videomaterial med strikta krav på start och slut

Kostnad: Varierar beroende på valda inställningar och längd

Seedance 1.5 Pro är utfasad. ByteDance avvecklar modellen den 11 november 2026, och den erbjuds inte längre för nya genereringar. Använd i stället en Seedance 2.0-modell. Seedance 1.5 Pro är inte tillgänglig i USA.

Black Forest Labs videomodell med naturliga rörelser, scener med flera tagningar, genererat ljud och videoförlängning.

Indata för generering:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Video att förlänga (1, upp till 15 s)

Funktioner:

  • Videoförlängning kan inte användas tillsammans med start- och slutbildrutor
  • Flexibla genereringslängder från 5 s upp till 20 s
  • Inbyggd ljudkontroll med ljud aktiverat eller inaktiverat för varje generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 720p, 1080p
  • Bildförhållanden: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Scener med flera tagningar från en enda prompt
  • Att förlänga ett befintligt klipp med matchande rörelse och ljud

Kostnad: Varierar beroende på valda inställningar och längd

MiniMax flaggskeppsvideomodell med multimodala referenser, genererat ljud och utdata upp till 4K.

Indata för generering:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 9)
  • Videoreferenser (upp till 3, 2–15 s vardera, 15 s sammanlagt)
  • Ljudreferenser (upp till 3, 2–15 s vardera, 15 s sammanlagt)

Funktioner:

  • Sammanlagt högst 12 referenser per generering; ljudreferenser kräver minst en bild- eller videoreferens
  • Bildrutor och referenser kan inte användas tillsammans
  • Flexibla genereringslängder från 5 s upp till 15 s
  • Genererar synkroniserat ljud
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 480p, 768p, 2K, 4K (2K och 4K skalas upp från 768p)
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Referensdrivna scener som behöver levereras i hög upplösning
  • Dialogklipp som drivs av referensljud

Kostnad: Varierar beroende på valda inställningar och längd

MiniMax H3 är inte tillgänglig i USA.

En nästan omedelbar variant av MiniMax H3 med samma indata och stark estetik, renderad nativt i upp till 768p.

Indata för generering:

  • Text-till-video
  • Startbildruta
  • Slutbildruta
  • Bildreferenser (upp till 9)
  • Videoreferenser (upp till 3, 2–15 s vardera, 15 s sammanlagt)
  • Ljudreferenser (upp till 3, 2–15 s vardera, 15 s sammanlagt)

Funktioner:

  • Sammanlagt högst 12 referenser per generering; ljudreferenser kräver minst en bild- eller videoreferens
  • Bildrutor och referenser kan inte användas tillsammans
  • Flexibla genereringslängder från 5 s upp till 15 s
  • Genererar synkroniserat ljud
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 480p, 768p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Snabb iteration av prompter och referenser
  • Förhandsvisningar före rendering med MiniMax H3

Kostnad: Varierar beroende på valda inställningar och längd

MiniMax H3 Max är inte tillgänglig i USA.

En avancerad videomodell med resonemang, utformad för överlägsen följsamhet till prompter och komplex simulering av den fysiska världen. Den använder avancerad logisk bearbetning för att tolka och utföra detaljerade instruktioner.

Indata för generering:

  • Text-till-video (beskrivning)
  • Startbildruta och slutbildruta
  • Videoreferens
  • Bildreferens

Funktioner:

  • Exceptionell förmåga att tolka flerskiktade prompter och utföra komplexa handlingar i kronologisk ordning
  • Använder både bilder och videor som visuella ankare för att bibehålla hög konsekvens för karaktärer och scener
  • Överlägsen modellering av fysiska interaktioner, orsak och verkan samt vätskedynamik
  • Stöder högkvalitativ generering för klipp på 5 s och 10 s
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: Beror på indata
  • Bildförhållanden: 16:9, 1:1, 9:16

Passar bäst för:

  • Mycket specifika kreativa koncept som kräver exakt följsamhet till långa, detaljerade beskrivningar
  • Professionellt berättande där fysisk realism och konsekvens mellan flera referenser är avgörande

Kostnad: Varierar beroende på valda inställningar och längd

Kling O1 är inte tillgänglig i USA.

En video-till-videoredigeringsmodell som styrs med naturligt språk och möjliggör komplexa visuella förändringar – som att byta ut karaktärer och miljöer – utan manuell maskning eller justeringar bildruta för bildruta.

Indata för generering:

  • Källvideo
  • Bildreferenser (upp till 4 distinkta element/vinklar)
  • Textbeskrivning (instruktioner på naturligt språk)

Funktioner:

  • Tolkar konversationsbaserade prompter för att ersätta motiv eller miljöer samtidigt som den ursprungliga rörelsestrukturen bevaras
  • Behåller ursprungliga kameravinklar, rörelsemönster och rumsliga relationer genom hela redigeringen
  • Kombinerar upp till 4 element totalt, inklusive framifrån- och flervinkelbilder, för konsekventa karaktärer med hög detaljrikedom
  • Alternativ för att bevara ursprungligt källjud eller generera tyst utdata för varje generering
  • Generera upp till 4 redigerade variationer åt gången

Utdataalternativ:

  • Upplösningar: Beror på källvideon
  • Bildförhållanden: Matchar källvideon

Passar bäst för:

  • Att ersätta karaktärer med hög detaljrikedom i befintligt material samtidigt som ursprungliga rörelser behålls
  • Fullständiga förändringar av scenmiljöer, till exempel att ändra en stad i dagsljus till ett futuristiskt nattlandskap
  • Att tillämpa stilöverföringar som kräver strikt följsamhet till befintlig kameradynamik

Kostnad: Varierar beroende på videolängd och valda inställningar

Kling O1 Edit är inte tillgänglig i USA.

En specialiserad modell för exakt rörelseöverföring som låter dig styra en karaktärsbild med en referensvideo för att återskapa specifika rörelser, gester och kameravinklar.

Indata för generering:

  • Karaktärsbild (källa)
  • Rörelsevideo (referens)
  • Textbeskrivning (valfritt)

Funktioner:

  • Välj “Match Video” för exakt rörelseåtergivning eller “Match Image” för att lägga till nya kreativa rörelser till en karaktär
  • Stöder upp till 30 s i läget Match Video och 10 s i läget Match Image
  • Rörelser från referensmaterial mappas med hög detaljrikedom till en stillbild av en karaktär
  • Inbyggt stöd för att aktivera eller inaktivera ljud för varje generering
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: Beror på källan
  • Bildförhållanden: Beror på källan

Passar bäst för:

  • Att återskapa komplex koreografi eller specifika rörelser för en anpassad karaktär
  • Längre karaktärsanimationer som kräver hög rörelseprecision
  • Innehåll för sociala medier som drivs av trendande videorörelser

Kostnad: Varierar beroende på valda inställningar och längd

Kling 2.6 Motion Control är inte tillgänglig i USA.

En specialiserad modell för exakt rörelseöverföring, byggd på Kling 3.0-arkitekturen. Den låter dig styra en karaktärsbild med en referensvideo för att återskapa specifika rörelser, gester och kameravinklar med förbättrad detaljrikedom.

Indata för generering:

  • Karaktärsbild (källa)
  • Rörelsevideo (referens)
  • Textbeskrivning (valfritt)

Funktioner:

  • Välj “Match Video” för exakt rörelseåtergivning eller “Match Image” för att lägga till nya kreativa rörelser till en karaktär
  • Stöder upp till 30 s i läget Match Video och 10 s i läget Match Image
  • Rörelser från referensmaterial mappas med hög detaljrikedom till en stillbild av en karaktär
  • Inbyggt stöd för att aktivera eller inaktivera ljud för varje generering
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: Beror på källan
  • Bildförhållanden: Beror på källan

Passar bäst för:

  • Att återskapa komplex koreografi eller specifika rörelser för en anpassad karaktär
  • Längre karaktärsanimationer som kräver hög rörelseprecision
  • Innehåll för sociala medier som drivs av trendande videorörelser

Kostnad: Varierar beroende på valda inställningar och längd

Kling 3.0 Motion Control är inte tillgänglig i USA.

En optimerad generativ modell utformad för förbättrad rörelseprecision och mjukare övergångar, med en balans mellan snabb iteration och visuella resultat i produktionskvalitet.

Indata för generering:

  • Text-till-video
  • Startbildruta (bild-till-video)

Funktioner:

  • Förbättrad rörelsedynamik: Betydande förbättringar av rörelseflyt och realistiska fysikinteraktioner
  • Flexibel ljudkontroll: Inbyggt stöd för att aktivera eller inaktivera ljud för varje generering
  • Batchskapande: Generera upp till 4 variationer samtidigt
  • Detaljerad förfining: Avancerad kreativ kontroll genom stöd för negativa prompter
  • Fasta längder: Stöder genereringslängder på 5 s och 10 s

Utdataalternativ:

  • Upplösningar: Beror på indata
  • Bildförhållanden: 16:9, 1:1, 9:16

Passar bäst för:

  • Actionklipp som kräver flytande karaktärsrörelser
  • Professionellt innehåll för sociala medier med god följsamhet till prompter

Kostnad: Varierar beroende på valda inställningar och längd

Kling 2.6 är inte tillgänglig i USA.

En balanserad och mångsidig modell för högkvalitativ videogenerering i full HD.

Indata för generering:

  • Text-till-video
  • Startbildruta

Funktioner:

  • Utmärker sig i att simulera komplex rörelse och realistisk fysik
  • Modellerar vätskedynamik och uttryck exakt
  • Fasta längder: 5 s och 10 s
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1080p
  • Bildförhållanden: 16:9, 1:1, 9:16

Passar bäst för:

  • Realistiska fysiksimuleringar och komplex rörelse

Kostnad: Varierar beroende på valda inställningar och längd

Slutbildruta stöds för närvarande inte. Det går inte att ange bildreferenser. Ljudkontroll är inte tillgänglig.

Kling 2.5 är inte tillgänglig i USA.

Banbrytande rörelsekvalitet, följsamhet till prompter och visuell detaljrikedom för filmisk och mycket realistisk video.

Indata för generering:

  • Text-till-video
  • Startbildruta (bild-till-video)

Funktioner:

  • Exceptionell rörelsekvalitet med branschledande realism och fysiksimulering
  • Överlägsen följsamhet till prompter för exakt kreativ kontroll över komplexa scener
  • Hög visuell detaljrikedom som ger resultat i filmisk kvalitet
  • Generera upp till 4 variationer samtidigt

Utdataalternativ:

  • Upplösningar: 720p
  • Bildförhållanden: 16:9, 9:16

Passar bäst för:

  • Filmiskt innehåll som kräver högsta möjliga rörelsekvalitet och realism
  • Professionella produktioner som kräver exakt följsamhet till prompter
  • Visuellt berättande med hög detaljrikedom

Kostnad: Varierar beroende på valda inställningar och längd

En avancerad videomodell utformad för snabb iteration och kostnadseffektivt skapande, som kan producera högkvalitativa videor.

Indata för generering:

  • Text-till-video
  • Startbildruta (bild-till-video)

Funktioner:

  • Optimerad för ultrasnabb generering och levererar resultat upp till fyra gånger snabbare än tidigare iterationer
  • Gör det möjligt att styra karaktärsrörelser, kameravinklar och scenkompositioner exakt
  • Utmärker sig i att bibehålla visuell sammanhållning och stabilitet i dynamiska scener
  • Stöder genereringslängder från 2 s upp till 10 s
  • Generera upp till 4 variationer samtidigt

Utdataalternativ:

  • Upplösningar: 720p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Snabb prototypframtagning och kreativa experiment som kräver nästan omedelbar återkoppling
  • Professionella projekt som behöver snabba leveranser av högupplöst marknadsföringsmaterial
  • Filmiskt innehåll med specifika krav på kamerarörelser

Kostnad: Varierar beroende på valda inställningar och längd

En avancerad kontextbaserad videomodell för visuellt skapande med flera uppgifter, som kan utföra komplexa redigeringar samtidigt som källmaterialets underliggande struktur bevaras.

Indata för generering:

  • Källvideo
  • Referensbild
  • Textbeskrivning

Funktioner:

  • Lägg sömlöst till, ta bort eller omvandla objekt och motiv i en scen med naturlig belysning, skuggor och perspektiv
  • Ändra platser, årstider och tid på dagen, till exempel genom att omvandla molnigt material till en dramatisk solnedgång, med realistiska uppdateringar av färgtemperaturen
  • Ändra skådespelares ålder och utseende eller förändra texturer på kläder och motiv med enkla prompter på naturligt språk
  • Tillämpa den specifika rörelsen och kamerabanan från en referensvideo på en statisk bild för exakt animationskontroll
  • Generera helt nya kameravinklar, till exempel motbilder eller låga vinklar, från en enda befintlig videosekvens
  • Innehåller exakt greenscreening, med isolering och kantdetektering, generering av nästa tagning för att fortsätta berättelsen samt estetisk stilöverföring
  • Generera upp till 4 variationer samtidigt

Utdataalternativ:

  • Upplösningar: 720p
  • Bildförhållanden: Auto

Passar bäst för:

  • Professionella visuella effekter som digital föryngring, ombelysning och borttagning av objekt
  • Snabb filmisk prototypframtagning och alternativa kamerabilder från en enda tagning
  • Kreativt marknadsföringsinnehåll som kräver stora miljömässiga eller stilistiska förändringar

Kostnad: Varierar beroende på valda inställningar och längd

Runways videoredigeringsmodell: omvandlar en befintlig video mot ett önskat utseende samtidigt som rörelse och konsekvens bevaras.

Indata:

  • Källvideo (krävs, 2–30 s)
  • Bild med önskat utseende (krävs)
  • Textprompt som beskriver redigeringarna

Funktioner:

  • Utdatalängd och inramning följer källvideon
  • Stilöverföring vägledd av bilden med önskat utseende
  • Batchskapande med upp till 4 genereringar åt gången

Passar bäst för:

  • Att belysa om, ändra stil eller byta miljö i befintligt material
  • Att tillämpa utseendet från en referensbild på ett helt klipp

Kostnad: Varierar beroende på valda inställningar och längd

En specialiserad modell för prestationsöverföring som animerar karaktärer genom att överföra rörelse, tal och ansiktsuttryck från en styrande video till en karaktärsbild eller videoreferens.

Indata för generering:

  • Styrande prestation (video)
  • Karaktärsindata (bild eller video)

Funktioner:

  • Överför nyanserade ansiktsuttryck, läppsynk och synkroniserat ljud direkt från en källskådespelare till valfri karaktär
  • Lägger automatiskt till sekundära rörelser och subtila kameraskakningar i statiska karaktärsbilder för ett mer naturligt utseende
  • Exakt reglage för att aktivera eller inaktivera kropps- och handrörelser vid användning av en karaktärsbild
  • Justerbara inställningar för att balansera intensiv känslomässig prestation och karaktärens visuella konsekvens
  • Möjlighet att ändra karaktärens röst efter genereringen samtidigt som perfekt synkronisering med den styrande prestationen bibehålls

Utdataalternativ:

  • Upplösningar: 720p
  • Bildförhållanden: Auto

Passar bäst för:

  • Att väcka statiska karaktärsporträtt till liv med realistiska mänskliga rörelser och tal
  • Att animera icke-mänskliga karaktärer eller stiliserade avatarer med uttryck i hög detaljrikedom
  • Att snabbt producera innehåll med talande personer och integrerade kroppsgester

Kostnad: Varierar beroende på valda inställningar och längd

En specialiserad modell för att skapa dynamiska sekvenser med flera tagningar, stora rörelser och action.

Indata för generering:

  • Text-till-video
  • Startbildruta
  • Slutbildruta

Funktioner:

  • Mycket stabil fysik och sömlösa övergångar mellan tagningar
  • Fasta längder: 3 s, 4 s, 5 s, 6 s, 7 s, 8 s, 9 s, 10 s, 11 s och 12 s
  • Batchskapande med upp till 4 genereringar åt gången
  • Maximal kreativ flexibilitet med många alternativ för bildförhållande

Utdataalternativ:

  • Upplösningar: 480p, 720p, 1080p
  • Bildförhållanden: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Berättande och actionscener som kräver stabil fysik

Kostnad: Varierar beroende på valda inställningar och längd

Bildförhållande och upplösning påverkar inte genereringskrediterna, men längden gör det.

Seedance 1 Pro är inte tillgänglig i USA.

En DiT-baserad grundmodell utformad för att generera synkroniserad video och ljud i ett enda steg, vilket ger sammanhängande tal och realistiska rörelser.

Indata för generering:

  • Text-till-video
  • Bild-till-video
  • Ljud-till-video
  • Djup-till-video

Funktioner:

  • Genererar dialog, läpprörelser och bakgrundsljud samtidigt för perfekt synkronisering utan externa verktyg
  • Dynamiska scener med stabila rörelser, konsekvent identitet och stark sammanhängning mellan bildrutor
  • Stöder synkroniserad generering med hög detaljrikedom i upp till 20 sekunder
  • Avancerad kreativ styrning genom detaljerat stöd för negativa promptar
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: 720p, 1080p
  • Bildformat: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Sammanhängande tal och uttrycksfulla karaktärsprestationer
  • Berättande innehåll som kräver integrerat bakgrundsljud och konsekvent timing
  • Dynamiska scener med komplex rörelselogik som tar hänsyn till kameran

Kostnad: Varierar beroende på valda inställningar och längd

En generativ modell med hög detaljrikedom, optimerad för maximal visuell detalj och strukturell stabilitet, som kan skapa produktionsklar 4K-utdata med mjuka rörelser.

Indata för generering:

  • Text-till-video
  • Startruta (bild-till-video)

Funktioner:

  • Prioriterar visuell kvalitet och konsekvens framför hastighet, vilket ger stabila resultat i längre sekvenser
  • Stöder både 25 FPS och 50 FPS för exceptionellt mjuka och professionella rörelser
  • Integrerad audiovisuell generering med möjlighet att slå på eller av ljud
  • Utformad för att hantera inbyggd 1080p-, 2k- och 4k-utdata utan detaljförlust
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: 1080p, 2k, 4k
  • Bildfrekvenser: 25 FPS, 50 FPS
  • Bildformat: 16:9 (standard)
  • Längder: 6s, 8s, 10s

Passar bäst för:

  • Högupplöst filmproduktion som kräver 4K-skärpa
  • Professionellt innehåll som kräver mjuka rörelser i 50 FPS
  • Detaljerade sekvenser där visuell stabilitet och strukturell integritet är avgörande

Kostnad: Varierar beroende på valda inställningar och längd

Ett precisionsverktyg för AI-regi som gör det möjligt att målinriktat ändra dialog, känslor och handling i befintliga tagningar utan att bryta kontinuiteten eller generera om hela sekvensen.

Indata för generering:

  • Källvideo
  • Textbeskrivning

Funktioner:

  • Ändra specifika segment samtidigt som kontexten från omgivande bildrutor bevaras väl
  • Formulera om repliker medan karaktärens röst, prestation och miljö förblir konsekventa
  • Flera redigeringslägen: Välj mellan “Audio & Video”, “Audio only” eller “Video only” för att isolera och generera om specifika delar av tagningen
  • Nytt innehåll ärver naturligt originalets rörelser, ljussättning och ton för sömlösa övergångar
  • Experimentera direkt med alternativa karaktärsreaktioner, känslomässiga vändpunkter eller kamerarörelser i en enda tagning
  • Generera upp till 4 variationer samtidigt för kreativ jämförelse sida vid sida

Utdataalternativ:

  • Bildformat: endast 16:9

Passar bäst för:

  • Att justera manus och förfina dialog utan behov av omtagningar eller nyinspelning
  • Att åtgärda känslomässiga vändpunkter eller problem med tempo i efterproduktionen
  • Att testa flera varumärkesbudskap och uppmaningar till handling i ett enda marknadsföringsmaterial

Kostnad: Varierar beroende på valda inställningar och längd

En hastighetsoptimerad generativ modell byggd för snabba återkopplingsloopar och innehållsproduktion i högt tempo, med högupplösta bilder och betydligt kortare renderingstider.

Indata för generering:

  • Text-till-video
  • Startruta (bild-till-video)

Funktioner:

  • Konstruerad för hastighet och snabb iteration, vilket möjliggör snabba visuella experiment och nästan omedelbara förhandsvisningar
  • Stöder inbyggd 1080p-, 2k- och 4k-utdata med lägre beräkningskrav än Pro-modellen
  • Funktioner för både 25 FPS och 50 FPS för mjuka rörelser i hög hastighet
  • Möjliggör snabb generering av synkroniserat audiovisuellt innehåll med längder på upp till 20 sekunder
  • Inbyggt stöd för att aktivera eller inaktivera ljud för varje generering
  • Generera upp till 4 variationer samtidigt

Utdataalternativ:

  • Upplösningar: 1080p, 2k, 4k
  • Bildfrekvenser: 25 FPS, 50 FPS
  • Bildformat: 16:9 (standard)
  • Längder: 6s, 8s, 10s, 12s, 14s, 16s, 18s, 20s

Passar bäst för:

  • Snabb prototypframtagning och kreativ utforskning där hastighet prioriteras framför maximal detaljrikedom
  • Sociala medier-innehåll i stor volym som kräver snabba leveranser
  • A/B-testning av olika visuella koncept och rörelsestilar

Kostnad: Varierar beroende på valda inställningar och längd

En filmisk videomodell med bild-, video- och ljudreferenser, genererat ljud och genereringar på upp till 30 sekunder.

Indata för generering:

  • Text-till-video
  • Startruta
  • Slutruta
  • Bildreferenser (upp till 10)
  • Videoreferenser (upp till 5, sammanlagt 15s)
  • Ljudreferenser (upp till 5, sammanlagt 15s)

Funktioner:

  • Rutor och referenser kan inte användas tillsammans
  • Fasta längder: 5s, 10s, 15s, 20s och 30s
  • Inbyggd ljudstyrning med ljud aktiverat eller inaktiverat för varje generering
  • Valfri promptförbättring
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 480p, 720p, 1080p
  • Bildformat: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Längre filmiska tagningar med stark följsamhet till prompten
  • Referensdrivna scener med ljud

Kostnad: Varierar beroende på valda inställningar och längd

Wan 3.0 är inte tillgängligt i USA.

En snabbare variant av Wan 3.0 med samma indata och utdataalternativ, lämplig för idéarbete.

Indata för generering:

  • Text-till-video
  • Startruta
  • Slutruta
  • Bildreferenser (upp till 10)
  • Videoreferenser (upp till 5, sammanlagt 15s)
  • Ljudreferenser (upp till 5, sammanlagt 15s)

Funktioner:

  • Ungefär hälften så lång genereringstid som Wan 3.0
  • Fasta längder: 5s, 10s, 15s, 20s och 30s
  • Inbyggd ljudstyrning med ljud aktiverat eller inaktiverat för varje generering
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 480p, 720p, 1080p
  • Bildformat: Auto, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Att utforska idéer före en slutlig rendering i Wan 3.0
  • Workflow där snabb leverans är viktigt

Kostnad: Varierar beroende på valda inställningar och längd

Wan 3.0 Prime är inte tillgängligt i USA.

En nästa generations filmisk videoplattform som använder en enhetlig multimodal arkitektur för att leverera produktionsklart 1080p-innehåll med inbyggd ljudsynkronisering och intelligent sekvensering av flera tagningar.

Indata för generering:

  • Text-till-video
  • Startruta (bild-till-video)
  • Videoreferens (video-till-video)
  • Ljudreferens (valfritt bakgrundsljud eller dialog)

Funktioner:

  • Enhetligt multimodalt system: Bearbetar text, bilder, video och ljud genom ett enda integrerat ramverk för konsekvent utdatakvalitet
  • Inbyggd ljudsynkronisering: Genererar och synkroniserar automatiskt dialog, berättarröst och miljöljudeffekter med rörelser på skärmen
  • Intelligent sekvensering av flera tagningar: Organiserar automatiskt sammanhängande videosekvenser till koherenta berättelsebågar samtidigt som karaktärernas konsekvens behålls
  • Utökade längder: Stöder stabil generering av hög kvalitet för fasta längder på 5s, 10s och 15s
  • Avancerad kreativ styrning: Stöder negativa promptar för detaljerad hantering av detaljer och batchskapande av upp till 4 variationer

Utdataalternativ:

  • Upplösningar: 720p, 1080p
  • Bildformat: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Professionellt berättande och komplexa filmiska sekvenser med flera tagningar
  • Annonser i sociala medier och marknadsföringsinnehåll som kräver integrerat ljud med hög detaljrikedom
  • Karaktärsdrivet innehåll som kräver strikt visuell konsekvens och konsekventa rörelser via videoreferenser

Kostnad: Varierar beroende på valda inställningar och längd

Wan 2.6 är inte tillgängligt i USA.

En mångsidig modell som levererar filmiska rörelser och hög följsamhet till prompten från text eller en startbild.

Indata för generering:

  • Text-till-video
  • Startruta (bild-till-video)

Funktioner:

  • Detaljerad kreativ styrning med negativa promptar och särskild ljudstyrning
  • Fasta längder: 5s och 10s
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 480p, 720p, 1080p
  • Bildformat: 16:9, 1:1, 9:16

Passar bäst för:

  • Filmiskt innehåll med stark följsamhet till prompten

Kostnad: Varierar beroende på valda inställningar och längd

Genereringskostnaden varierar beroende på valda inställningar.

Wan 2.5 Video är inte tillgängligt i USA.

OpenAI:s produktionsklara bildmodell för mycket detaljerad utdata och precis redigering.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 10)

Funktioner:

  • Fem kvalitetsnivåer från låg till maximal
  • Anpassad upplösning på upp till 3840px per sida, med bildformat på upp till 3:1
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1K, 2K, 4K eller anpassad
  • Bildformat: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Passar bäst för:

  • Slutliga resurser där detaljrikedom och kvalitet är viktigast
  • Precisa redigeringar av befintliga bilder

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gpt-image-2.5-sunburst

En snabb variant av GPT Image 2.5 med samma kontroller som Sunburst, anpassad för vardaglig generering i stor volym.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 10)

Funktioner:

  • Fem kvalitetsnivåer från låg till maximal
  • Anpassad upplösning på upp till 3840px per sida, med bildformat på upp till 3:1
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1K, 2K, 4K eller anpassad
  • Bildformat: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

Passar bäst för:

  • Bildgenerering i stor volym
  • Snabba iterationer som fortfarande behöver 4K och anpassade storlekar

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gpt-image-2.5-flare

En avancerad AI-modell utformad för precis bildgenerering med förbättrad textrendering och stöd för högupplöst utdata.

Funktioner:

  • Precis textkontroll för att skapa bilder med korrekt typografi och tydlighet
  • Högupplöst PNG-utdata som passar för professionell och kommersiell användning
  • Stöder flera bildreferenser för att styra stil och komposition
  • Genererar upp till 4 bilder åt gången

Utdataalternativ:

  • Bildformat: 3:2, 1:1, 2:3
  • Kvalitetsalternativ: låg, medel, hög

Passar bäst för:

  • Marknadsföringsbilder och designresurser som kräver exakt textplacering
  • Professionellt innehåll med krav på hög upplösning
  • Kreativa projekt som behöver noggrann textbaserad bildkontroll

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gpt-image-2

En avancerad AI-modell för bildgenerering som kombinerar produktionsklar kvalitet med ultrasnabb bearbetning, förbättrad världskunskap och konsekvens för motiv.

Funktioner:

  • Inbyggd 4K-upplösning utan uppskalning för kristallklara detaljer
  • Blixtsnabb bildgenerering på så lite som 1–2 sekunder
  • Överlägsen följsamhet till promptar genom avancerat resonemang och instruktionsföljning
  • Skarp och korrekt textrendering på flera språk för mockups, skyltar och infografik
  • Konsekvent styling av flera motiv som bevarar identitet mellan flera karaktärer och objekt
  • Förbättrad världskunskap för mer exakt scengenerering
  • Stöder flera bildreferenser för att styra genereringen
  • Genererar upp till 4 bilder åt gången

Utdataalternativ:

  • Bildformat: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
  • Upplösningar: Upp till 4K

Passar bäst för:

  • Snabba kreativa workflow som kräver iteration i realtid
  • Varumärkesinnehåll och berättande med konsekvent karaktärsidentitet
  • Professionella bilder med korrekt text och typografi

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gemini-3.1-flash-image

En snabb och kostnadseffektiv variant av Nano Banana 2 för snabb generering och redigering i 1K.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 14)

Funktioner:

  • Fast 1K-utdata för konsekvent hastighet och kostnad
  • Samma kapacitet för 14 bildreferenser som Nano Banana 2
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1K
  • Bildformat: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Passar bäst för:

  • Snabb iteration och utkast
  • Massredigering där 1K räcker

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gemini-3.1-flash-lite-image

En mångsidig, produktionsklar modell för bildgenerering från Krea AI som balanserar kvalitet och hastighet för många olika kreativa workflow.

Funktioner:

  • Bildgenerering med hög detaljrikedom och stark följsamhet till promptar
  • Stöder flera bildreferenser för att styra genereringen
  • Genererar upp till 4 bilder åt gången

Utdataalternativ:

  • Bildformat: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Professionell innehållsproduktion som kräver konsekvent kvalitet
  • Snabb iteration över olika kreativa koncept

Kostnad: Varierar beroende på valda inställningar och antal variationer

Krea AI:s främsta modell för bildgenerering, som ger maximal visuell kvalitet och avancerad kreativ styrning för professionella produktionsworkflow.

Funktioner:

  • Exceptionella detaljer och realism för utdata i professionell kvalitet
  • Avancerad stilkontroll med stöd för flera bildreferenser
  • Genererar upp till 4 bilder åt gången

Utdataalternativ:

  • Bildformat: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Kommersiell och redaktionell bildproduktion med höga krav
  • Komplexa kreativa kompositioner som kräver maximal kvalitet

Kostnad: Varierar beroende på valda inställningar och antal variationer

En designfokuserad text-till-bild-modell med stark promptkontroll och ren komposition.

Indata för generering:

  • Text-till-bild

Funktioner:

  • 2K-utdata använder Pro-modellvarianten
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1K, 2K
  • Bildformat: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Passar bäst för:

  • Layoutstyrd grafik, ikoner och affischer
  • Rena kompositioner från enbart text

Kostnad: Varierar beroende på valda inställningar och antal variationer

En designfokuserad bildmodell som kan matcha stilen i referensbilder.

Indata för generering:

  • Text-till-bild
  • Stilreferenser (upp till 10)

Funktioner:

  • Kontroll av stilmatchning: Precise följer referensstilen nära, Flexible matchar det övergripande utseendet
  • 2K-utdata använder Pro-modellvarianten
  • Batchskapande med upp till 4 genereringar åt gången

Utdataalternativ:

  • Upplösningar: 1K, 2K
  • Bildformat: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

Passar bäst för:

  • Varumärkeskonsekvent grafik från en uppsättning stilreferenser
  • Illustrations- och designarbete

Kostnad: Varierar beroende på valda inställningar och antal variationer

En lättviktig bildmodell från ByteDance med snabb generering som levererar resultat av hög kvalitet med lägre beräkningskrav.

Funktioner:

  • Snabb generering för snabb kreativ iteration
  • Stöder flera bildreferenser för att styra genereringen
  • Genererar upp till 4 bilder åt gången

Utdataalternativ:

  • Bildformat: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Workflow för bildskapande i stor volym som kräver hastighet
  • Snabb konceptutforskning och förhandsvisningar

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: bytedance-seedream-5-lite

Seedream 5 Lite är inte tillgängligt i USA.

Seedream 5-varianten med högre detaljrikedom för exakt redigering, flerspråkig text och innehållsrik infografik.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 10)

Funktioner:

  • Exakt återgivning av flerspråkig text
  • Hanterar komplexa layouter som infografik och affischer
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Upplösningar: 1K, 2K
  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Textintensiva designer på flera språk
  • Redigering av flera bilder med strikt följsamhet till referenser

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: bytedance-seedream-5-pro

Seedream 5 Pro är inte tillgänglig i USA.

En snabb flaggskeppsmodell utformad för exakt textbaserad bildgenerering och komplex, icke-destruktiv fotoredigering som bevarar originaldetaljer.

Funktioner:

  • Utför pålitligt begärda ändringar samtidigt som ljussättning, komposition och motivets utseende i källbilderna bevaras
  • Stöder komplexa redigeringsuppgifter, inklusive att lägga till, ta bort, kombinera och blanda element
  • Levererar resultat upp till 4 gånger snabbare än tidigare versioner
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 3:2, 1:1, 2:3
  • Kvalitetsalternativ: låg, medel, hög

Passar bäst för:

  • Praktiska fotojusteringar och realistiska virtuella provningar av kläder eller frisyrer
  • Konceptuella omvandlingar och stilistiska filter som behåller kärnan i indatabilden
  • Snabb iteration av text-till-bild-koncept

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gpt-image-1.5

OpenAI:s förstegenerationsbildmodell med god följsamhet till promptar, läsbar text och detaljerad redigering.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 5)

Funktioner:

  • Tre kvalitetsnivåer: låg, medel, hög
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Bildförhållanden: 3:2, 1:1, 2:3

Passar bäst för:

  • Arbetsflöden som redan bygger på utdata från GPT Image 1
  • Enkla redigeringar och uppgifter med text i bild i standardupplösning

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gpt-image-1

En högpresterande multimodal grundmodell som samlar text-till-bild-syntes, exakt bildredigering och komplex komposition av flera bilder i ett enda effektivt ramverk.

Funktioner:

  • Inbyggt stöd för snabb generering av detaljrika bilder med upp till 4K-upplösning
  • Exceptionellt bevarande av ansiktsdrag, ljussättning, färgton och fina detaljer vid redigering baserad på referensindata
  • Identifierar och blandar exakt målelement från flera indatabilder för kontrollerbara och konsekventa resultat
  • Erbjuder kompositionsmöjligheter på designernivå med tydlig och exakt återgivning av liten text för affischer och varumärkesbilder
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16
  • Upplösningar: 2K, 4K

Passar bäst för:

  • Professionella arbetsflöden för grafisk design som kräver exakt layout och typografi
  • Komplex fotoredigering som kräver strikt följsamhet till referensidentitet och ljussättning
  • Kreativ kompositering i hög upplösning med flera visuella källor

Kostnad: Varierar beroende på valda inställningar och antal variationer

Seedream 4.5 är inte tillgänglig i USA.

En detaljrik bildgenereringsmodell med avancerad resonemangsförmåga, utformad för överlägsen följsamhet till promptar och exakt visuell konsekvens i komplexa kompositioner.

Funktioner:

  • Exceptionell förmåga att tolka och utföra invecklade textbeskrivningar i flera lager med hög precision
  • Använder bildreferenser för att behålla motivets identitet, ljussättning och estetiska stil mellan genereringar
  • Optimerad för realistiska texturer, komplexa rumsliga relationer och ljuseffekter i professionell kvalitet
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
  • Upplösningar: 1K, 2K

Passar bäst för:

  • Professionella kreativa resurser som kräver strikt följsamhet till detaljerade och tekniska textpromptar
  • Bildredigering med hög konsekvens och karaktärsdesign med visuella referenser

Kostnad: Varierar beroende på valda inställningar och antal variationer

Kling O1 Image är inte tillgänglig i USA.

En produktionsklar modell för bildgenerering och redigering, utformad för professionella arbetsflöden och med branschledande visuell kvalitet med fokus på hastighet, precision och konsekvens.

Funktioner:

  • Referera till flera bilder samtidigt för att uppnå branschledande konsekvens för karaktärer och identitet i hundratals resurser
  • Ger ett oöverträffat lyft i detaljkvalitet och minskar skillnaden mot verklig fotografi, från tygtexturer till arkitektoniska element
  • Levererar produktionsklar textåtergivning för komplex typografi, UI-mockups och infografik
  • Stöder exakt angivelse av varumärkesfärger via hexkoder utan approximation
  • Säkerställer korrekt objektplacering, realistisk fysik, sammanhängande ljussättning och rätt perspektiv genom komplexa scener
  • Optimerad för bättre precision och respons på strukturerade, komplexa instruktioner
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16
  • Upplösningar: 720p, 1080p, 2K

Passar bäst för:

  • Kampanjer med konsekventa karaktärer och exakt placering av produkter i alla sammanhang
  • Att skapa gränssnittsmockups med läsbar text och konsekventa visuella designsystem
  • Att generera produktfotografi i stor skala och produktbilder i miljö

Kostnad: Varierar beroende på valda inställningar och antal variationer

En professionell, resonemangsbaserad modell för bildgenerering och redigering, utformad för produktion av detaljrika resurser, avancerad kreativ kontroll och exakt följsamhet till instruktioner.

Indata:

  • Bildreferens
  • Textbeskrivning (stöder komplexa promptar i flera lager)

Funktioner:

  • Planerar scener före rendering för att ge fysikaliskt korrekt ljussättning, exakta objektrelationer och överlägsen följsamhet till promptar
  • Genererar skarp, läsbar flerspråkig text i olika typsnittsstilar och handstilar för effektfulla affischer och produktmockups
  • Behåller hög detaljrikedom och likhet för upp till 5 personer och flera objekt i olika kreativa resultat
  • Integrerar Google Search för att förbättra visuellt innehåll med faktiska data, verklig kunskap och realtidsinformation som väder eller sport
  • Justera kameravinklar, fokuspunkter och scenljussättning (t.ex. från dag till natt) med avancerade lokala redigeringsverktyg
  • Överlägsen rumsuppfattning möjliggör generering av korrekt infografik, tekniska diagram och presentationsbilder
  • Genererar upp till 4 variationer åt gången

Utdataval:

  • Upplösningar: 1K, 2K, 4K
  • Bildförhållanden: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Passar bäst för:

  • Professionell reklam, varumärkesresurser och exklusiv produktfotografi för e-handel
  • Pedagogiska förklaringar, datadriven infografik och komplex teknisk dokumentation
  • Snabb prototypframtagning av visuella designer i hög upplösning med konsekvent karaktärs- eller varumärkesidentitet

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gemini-3-pro-image

En snabb modell för snabb och högkvalitativ bildgenerering och redigering direkt från textpromptar.

Funktioner:

  • Stöder flera bildreferenser för att vägleda genereringen
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

Passar bäst för:

  • Snabb bildframtagning och iteration

Kostnad: Varierar beroende på valda inställningar och antal variationer

API: gemini-2.5-flash-image

En avancerad grundmodell utformad för detaljrik bildgenerering, med oöverträffad stilistisk kontroll och visuellt minne för att behålla konsekvens mellan scener.

Funktioner:

  • Förankra karaktärer, stilar eller specifika objekt med indatabilder för att behålla konsekvens i professionell kvalitet mellan flera resultat
  • Optimerad för att tolka komplexa beskrivningar på naturligt språk för exakt kontroll över visuella detaljer, ljussättning och känslor
  • Kan generera högkvalitativt visuellt innehåll för många användningsområden, från filmiska storyboards till professionell produktfotografi
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16
  • Upplösningar: 720p, 1080p

Passar bäst för:

  • Att säkerställa att huvudpersoner behåller sitt utseende i olika miljöer och ljussättningar
  • Att snabbt producera varumärkesresurser i hög upplösning, virtuella provningar och skalbara produktvisualiseringar
  • Att utforska olika konstnärliga riktningar samtidigt som den visuella kärnidentiteten låses med bildreferenser

Kostnad: Varierar beroende på valda inställningar och antal variationer

En optimerad bildgenereringsmodell utvecklad för hastighet som levererar resultat 2,5 gånger snabbare än vanliga Gen-4 Image, med samma utdatakvalitet.

Funktioner:

  • Optimerad bearbetning möjliggör snabb kreativ utforskning genom att generera detaljrika bilder på en bråkdel av tiden
  • Ladda upp upp till tre referensbilder för att vägleda modellens förståelse av specifika karaktärer, miljöer och konstnärliga stilar
  • Löser problemet med visuell avdrift genom att koda specifika visuella egenskaper från referensbilder för att behålla identiteten mellan flera genereringar
  • Tillämpa enkelt estetiken, ljussättningen och texturen från en referensbild på helt nya motiv och scener
  • Använd seed-parametrar för att systematiskt utforska variationer eller återskapa specifika resultat med precision
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16
  • Upplösningar: 720p, 1080p

Passar bäst för:

  • Att snabbt producera plattformsoptimerat visuellt innehåll för Instagram Stories (9:16) eller vanliga inlägg (1:1) i stor skala
  • Att behålla en strikt visuell identitet mellan kampanjer genom att använda varumärkets stilguider som referensbilder
  • Att utveckla konsekventa karaktärsposer och miljöer samtidigt som huvudpersonen förblir igenkännbar
  • Att exakt skapa varierade produktbilder i miljö och för olika säsonger med referensbaserad vägledning

Kostnad: Varierar beroende på valda inställningar och antal variationer

En specialiserad bildmodell för att generera sekvenser med flera tagningar eller scener med stora rörelser och mycket action.

Funktioner:

  • Utmärker sig vid skapande av bilder med stabil fysik och sammanhängande övergångar
  • Stöder flera bildreferenser för att vägleda genereringen
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: auto, 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Actionscener och dynamiska kompositioner

Kostnad: Varierar beroende på valda inställningar och antal variationer

Seedream 4 är inte tillgänglig i USA.

Bildvarianten av Wan 2.5, med hög följsamhet till promptar och stöd för referensbilder.

Indata för generering:

  • Text-till-bild
  • Bildreferenser (upp till 2)

Funktioner:

  • Kontroller för negativ prompt och seed
  • Batchskapande med upp till 4 genereringar åt gången

Utdataval:

  • Bildförhållanden: 16:9, 4:3, 1:1, 3:4, 9:16

Passar bäst för:

  • Stillbilder som matchar utseendet hos Wan-videogenereringar
  • Konceptbilder som följer prompten

Kostnad: Varierar beroende på valda inställningar och antal variationer

Wan 2.5 Image är inte tillgänglig i USA.

En professionell modell för avancerad bildgenerering och redigering, med stark sammanhållning i scener och stilkontroll.

Funktioner:

  • Bildbaserad stilkontroll som kräver en referensbild för att vägleda den visuella estetiken
  • Genererar upp till 4 bilder åt gången

Utdataval:

  • Bildförhållanden: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21

Passar bäst för:

  • Professionellt innehåll med exakta stilkrav

Kostnad: Varierar beroende på valda inställningar och antal variationer

En avancerad diffusion transformer-modell (DiT) utformad för att rendera ultrarealistiska, reaktiva avatarer som styrs av ljud- och textinstruktioner.

Indata för generering:

  • Avatar (källbild)
  • Tal (ljudfil)
  • Textbeskrivning (instruktion)

Funktioner:

  • Går längre än grundläggande läppsynk och inkluderar kontextmedveten blinkning, andning och naturliga ansiktsuttryck
  • Synkroniserar automatiskt hand- och helkroppsrörelser utifrån röstläge och betoning för en prestation i studiokvalitet
  • Tolkar röstintensitet och tonhöjd korrekt för att leverera känslouttryck som stämmer med prestationen
  • Bibehåller hög karaktärstrohet och beteendemässig sammanhållning även under längre dialoger eller musikframträdanden
  • Optimerad för olika upplägg, inklusive presentationer från sidan, dialoger i podcaststil och stiliserade animationer
  • Generera upp till 4 variationer åt gången

Utdataalternativ:

  • Upplösningar: 480p, 720p

Passar för:

  • Professionella videoannonser och marknadsföringsinnehåll med avatarer
  • Virtuellt berättande med hög detaljrikedom och uttrycksfulla musikframträdanden
  • Längre utbildnings- eller träningsvideor som kräver en konsekvent karaktärsnärvaro

Kostnad: Varierar beroende på indata, inställningar och längd

API: creatify-aurora

En snabb och exakt bild-till-video-modell för läppsynk som animerar en stillbild så att den matchar det angivna ljudet.

Indata:

  • Källbild
  • Talljudfil

Funktioner:

  • Animerar munnen och ansiktsuttrycken i källbilden så att de matchar det angivna ljudet
  • Skapar högkvalitativ “talande” video från stillbilder
  • Verktyg specifikt för läppsynk, inte en fullständig videogenereringsmodell

Passar för:

  • Skapa talande avatarer från stillbilder
  • Lägga till dialog i karaktärsporträtt
  • Professionella arbetsflöden för avatarbaserat innehåll

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör bilden innehålla en identifierbar person.

HeyGens senaste avatarmodell för att skapa mycket realistiska, uttrycksfulla videor med talande huvuden från en enda bild och ljudindata.

Indata:

  • Källbild
  • Talljudfil

Funktioner:

  • Animerar ansiktsuttryck och läpprörelser så att de matchar det angivna ljudet med hög detaljrikedom
  • Skapar naturliga huvudrörelser och subtila mikrouttryck för verklighetstrogna resultat
  • Verktyg specifikt för läppsynk, inte en fullständig videogenereringsmodell

Passar för:

  • Professionella videor med talespersoner och presentatörer
  • Skapa personligt avatarinnehåll i stor skala
  • Marknadsförings- och utbildningsvideor med konsekvent karaktärsnärvaro

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör bilden innehålla ett tydligt synligt ansikte.

Den senaste generationens videomodell för läppsynk från Sync, med synkronisering i studiokvalitet för många olika typer av innehåll.

Indata för generering:

  • Källvideo
  • Talljud

Funktioner:

  • Läppsynk med hög precision som bevarar unika ansiktsdetaljer, naturliga tänder och hudtextur
  • Optimerad för alla innehållstyper, inklusive live action, 3D-animation och AI-genererad video
  • Verktyg för läppsynk från video till video, inte en fullständig videogenerator

Passar för:

  • Professionell dubbning och lokalisering för film och reklam
  • Förbättra eller korrigera dialog i alla videoformat
  • Arbetsflöden för innehållsöversättning i stora volymer

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör videon innehålla en identifierbar person.

En avancerad videoredigeringsmodell utformad för läppsynk i studiokvalitet som bevarar unika ansiktsdetaljer och samtidigt kan skalas till högupplöst utdata.

Indata för generering:

  • Källvideo
  • Talljud

Funktioner:

  • Innehåller avancerad uppskalning för stöd för 4K-utdata samtidigt som skarpa, naturliga texturer behålls
  • Skyddar unika ansiktsdrag som naturliga tänder, fräknar, smink och komplex ansiktsbehåring utan att skärpan går förlorad
  • Optimerad för alla innehållstyper, inklusive live action, 3D-animation och AI-genererad video
  • Levererar uttrycksfulla, synkroniserade resultat direkt utan talarspecifik träning eller finjustering av modellen
  • Generera upp till 4 variationer samtidigt

Passar för:

  • Professionell dubbning och lokaliserat innehåll för film och exklusiv reklam
  • Förbättra eller korrigera dialog för 3D-animerade och AI-genererade karaktärer
  • Högupplösta projekt som kräver pixelperfekt konsekvens och detaljrikedom i ansiktet

Kostnad: Varierar beroende på indata, inställningar och längd

En särskild verktygsmodell för att skapa exceptionellt realistisk, människolik läppsynk.

Indata:

  • Statisk källbild
  • Talljudfil

Funktioner:

  • Animerar munnen i källbilden så att den matchar det angivna ljudet
  • Skapar högkvalitativ “talande” video från stillbilder
  • Verktyg specifikt för läppsynk, inte en fullständig videogenereringsmodell

Passar för:

  • Skapa talande avatarer
  • Lägga till dialog i stillbilder
  • Professionella arbetsflöden för dubbning

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör bilden innehålla en identifierbar person.

OmniHuman 1.5 är inte tillgängligt i USA.

En snabb, prisvärd och exakt verktygsmodell för att lägga till realistisk läppsynk i videor.

Indata:

  • Källvideo
  • Ny talljudfil

Funktioner:

  • Animerar om munrörelserna i källvideon så att de matchar det nya ljudet
  • Verktyg för läppsynk från video till video, inte en fullständig videogenerator

Passar för:

  • Kostnadseffektiv dubbning i stora volymer
  • Översätta innehåll
  • Korrigera ljud i videoklipp med realistiska resultat

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör videon innehålla en identifierbar person.

Efterföljaren till Veed Lipsync med högre kvalitet för att lägga till realistisk läppsynk i befintliga videor.

Indata:

  • Källvideo
  • Ny talljudfil

Funktioner:

  • Animerar om munrörelserna i källvideon så att de matchar det nya ljudet
  • Verktyg för läppsynk från video till video, inte en fullständig videogenerator
  • Batchskapande med upp till 4 genereringar åt gången

Passar för:

  • Dubbning och översättning där utdatakvalitet är viktigare än kostnad
  • Korrigera dialog i färdiga klipp

Kostnad: Varierar beroende på indata, inställningar och längd

För bästa resultat bör videon innehålla en identifierbar person.

En särskild verktygsmodell för uppskalning av bilder och videor, utformad för att förbättra upplösning och detaljrikedom upp till 4 gånger.

Funktioner:

  • Förbättringsverktyg som bearbetar befintligt medieinnehåll
  • Ökar mediets storlek samtidigt som naturliga texturer bevaras och artefakter minimeras
  • Mycket detaljerade uppskalningsfaktorer: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
  • Videospecifikt: Flexibel kontroll av bildfrekvens (behåll källans eller konvertera till 24, 25, 30, 48, 50 eller 60 fps)

Passar för:

  • Förbättra kvaliteten på genererat medieinnehåll
  • Återställa äldre videomaterial eller foton
  • Förbereda tillgångar för högupplösta skärmar

Kostnad: Varierar beroende på indata

Tar bort bakgrunden från en bild och returnerar den med alfatransparens.

Indata:

  • Källbild

Funktioner:

  • Ingen prompt krävs
  • En utdata per körning

Passar för:

  • Produktutklipp och kompositering
  • Förbereda motiv för användning som referenser i andra genereringar

Kostnad: Varierar beroende på indata

Konverterar video med standarddynamiskt omfång till HDR.

Indata:

  • Källvideo (upp till 30 s)

Funktioner:

  • Ingen prompt krävs
  • En utdata per körning; längd och bildutsnitt följer källan

Passar för:

  • Förbereda videomaterial för HDR-skärmar
  • Färggradera om genererad video inför leverans

Kostnad: Varierar beroende på videons längd