इमेज और वीडियो

ElevenLabs में इमेज और वीडियो बनाने व एडिट करने की पूरी गाइड।

परिचय

इमेज और वीडियो से आप साधारण टेक्स्ट विवरणों या रेफ़रेंस इमेज से उच्च-गुणवत्ता वाला विज़ुअल कंटेंट बना सकते हैं। किसी भी स्टाइल में स्टैटिक इमेज या डायनामिक वीडियो जेनरेट करें, फिर अतिरिक्त प्रॉम्प्ट्स के साथ उन्हें क्रमिक रूप से बेहतर बनाएँ, हाई-रिज़ॉल्यूशन आउटपुट के लिए अपस्केल करें और ऑडियो के साथ लिप-सिंक भी जोड़ें। तैयार एसेट्स को स्टैंडअलोन फ़ाइलों के रूप में एक्सपोर्ट करें या सीधे ElevenCreative Studio प्रोजेक्ट्स में इंपोर्ट करें।

नियामक या प्रदाता की आवश्यकताओं के कारण कुछ इमेज और वीडियो मॉडल और इनपुट अपलोड सुविधाएँ संयुक्त राज्य अमेरिका में प्रतिबंधित हैं। खास उपलब्धता के लिए हर मॉडल का विवरण देखें।

मुफ़्त प्लान के यूज़र सिर्फ़ इमेज जेनरेट कर सकते हैं और प्रतिदिन तीन इमेज रिक्वेस्ट तक सीमित हैं। वीडियो जेनरेशन के लिए पेड प्लान चाहिए।

गाइड

अपना पहला विज़ुअल एसेट बनाने के लिए ये चरण अपनाएँ:

1

अपना मोड चुनें

इमेज या वीडियो जेनरेशन में से चुनने के लिए प्रॉम्प्ट बॉक्स के ऊपरी दाएँ कोने में टॉगल का इस्तेमाल करें।

2

प्रॉम्प्ट या रेफ़रेंस दें

प्रॉम्प्ट बॉक्स में प्राकृतिक भाषा का इस्तेमाल करके अपना मनचाहा आउटपुट बताएं। ज़्यादा नियंत्रण के लिए, एक्सप्लोर या हिस्ट्री टैब से मौजूदा इमेज या वीडियो को रेफ़रेंस स्लॉट्स में ड्रैग करें, या JPG, PNG, WEBP और अन्य कई फ़ाइल फ़ॉर्मैट में अपनी रेफ़रेंस इमेज अपलोड करें।

3

मॉडल और सेटिंग्स चुनें

अपने लक्ष्य के लिए सबसे उपयुक्त जनरेटिव मॉडल चुनें (जैसे Google Veo 3.1, Kling 2.5, Flux 1 Kontext Pro)। हर मॉडल की विस्तृत जानकारी के लिए मॉडल्स सेक्शन देखें। आस्पेक्ट रेशियो, रिज़ॉल्यूशन, ड्यूरेशन (वीडियो के लिए) और जेनरेट किए जाने वाले वेरिएशंस की संख्या जैसी सेटिंग्स एडजस्ट करें।

4

अपना एसेट जेनरेट करें

जेनरेट करें बटन पर क्लिक करें। आपके एसेट्स बनाए जाएँगे और रिव्यू के लिए हिस्ट्री टैब में दिखेंगे।

5

बेहतर बनाएँ और सुधारें

अपने मीडिया को बेहतर बनाने के लिए एन्हांसमेंट टूल्स का इस्तेमाल करें। रिज़ॉल्यूशन अपस्केल करें, ऑडियो के साथ रियलिस्टिक लिपसिंक लागू करें या उन्हीं सेटिंग्स के साथ नया वेरिएशन जेनरेट करने के लिए रीक्रिएट पर क्लिक करें।

6

दूसरों के साथ शेयर करें

अपनी क्रिएशन के लिए एक यूनिक लिंक जेनरेट करने हेतु शेयर बटन पर क्लिक करें। फ़ीडबैक पाने के लिए इसे टीममेट्स और सहयोगियों को भेजें।

7

अपनी क्रिएशन एक्सपोर्ट करें

एसेट को स्टैंडअलोन फ़ाइल के रूप में डाउनलोड करें या सीधे ElevenCreative Studio प्रोजेक्ट में इंपोर्ट करें।

वर्कफ़्लो

क्रिएशन प्रोसेस आपको प्रेरणा से तैयार एसेट तक चार चरणों में ले जाती है:

एक्सप्लोर

प्रेरणा पाने, प्रभावी प्रॉम्प्ट्स का अध्ययन करने या सीधे अपने काम में रेफ़रेंसेस लेने के लिए कम्युनिटी क्रिएशंस खोजें।

जेनरेट

प्रॉम्प्ट बॉक्स में बताएँ कि आप क्या बनाना चाहते हैं, मॉडल चुनें, अपनी सेटिंग्स फ़ाइन-ट्यून करें और अपने आइडिया को साकार करें।

हिस्ट्री

दोहराने और बेहतर बनाने के लिए हिस्ट्री टैब में अपनी जेनरेशन देखें। वेरिएशंस रीक्रिएट करें, प्रॉम्प्ट्स फिर से इस्तेमाल करें और अपस्केलिंग व लिप-सिंकिंग जैसे एन्हांसमेंट लागू करें।

एक्सपोर्ट

तैयार एसेट्स को अलग-अलग फ़ॉर्मैट में डाउनलोड करें या अपने प्रोजेक्ट्स में इस्तेमाल के लिए सीधे ElevenCreative Studio पर भेजें।

एक्सप्लोर

एक्सप्लोर टैब में प्रेरणा पाने और रेफ़रेंस के तौर पर इस्तेमाल करने के लिए विज़ुअल्स ढूँढने हेतु कम्युनिटी क्रिएशंस की गैलरी दिखती है।

सर्च: कीवर्ड्स के आधार पर इमेज और वीडियो ढूँढने के लिए सर्च बार का इस्तेमाल करें।

सॉर्ट: लोकप्रिय या हाल ही में जोड़े गए कंटेंट को देखने के लिए ट्रेंडिंग और न्यूएस्ट के बीच टॉगल करें।

ड्रैग-एंड-ड्रॉप: ग्रिड से कोई भी परिणाम सीधे प्रॉम्प्ट बॉक्स में खींचकर स्टार्ट फ़्रेम, एंड फ़्रेम या स्टाइल रेफ़रेंस के रूप में इस्तेमाल करें।

डिटेल्स प्रीव्यू करें: उसे बनाने के लिए इस्तेमाल किए गए पूरे प्रॉम्प्ट और सेटिंग्स देखने के लिए किसी भी टाइल पर क्लिक करें।

जेनरेट

वीडियो प्रॉम्प्ट इंटरफ़ेस

प्रॉम्प्ट बॉक्स पेज के नीचे स्थिर रहता है और विज़ुअल कंटेंट बनाने के लिए सभी कंट्रोल्स देता है।

मोड और प्रॉम्प्ट सेट करें

मोड चुनें: इमेज और वीडियो जेनरेशन के बीच स्विच करने के लिए ऊपरी दाएँ कोने में टॉगल का इस्तेमाल करें।

अपना प्रॉम्प्ट लिखें: मुख्य फ़ील्ड में, प्राकृतिक भाषा का इस्तेमाल करके बताएँ कि आप क्या जेनरेट करना चाहते हैं। बेहतरीन नतीजों के लिए स्पष्ट और विवरणात्मक लिखें।

मॉडल और सेटिंग्स चुनें

वीडियो मॉडल चयन

मॉडल चुनें: Google Veo 3.1, Kling 2.5 या Flux 1 Kontext Pro जैसे उपलब्ध विकल्प देखने के लिए मॉडल मेनू खोलें। आसान तुलना के लिए हर मॉडल की खास खूबियाँ और क्षमताएँ दी गई हैं। विस्तृत जानकारी के लिए मॉडल्स सेक्शन देखें।

सेटिंग्स एडजस्ट करें: प्रॉम्प्ट के नीचे दिखने वाली सेटिंग्स से अपनी जेनरेशन फ़ाइन-ट्यून करें। ये मॉडल के अनुसार अलग होती हैं, लेकिन अक्सर इनमें शामिल हैं:

  • आस्पेक्ट रेशियो: अपने आउटपुट के डाइमेंशंस नियंत्रित करें
  • रिज़ॉल्यूशन: क्वालिटी लेवल सेट करें
  • ड्यूरेशन: वीडियो की लंबाई तय करें (वीडियो मोड के लिए)
  • जेनरेशंस की संख्या: एक बार में 4 वेरिएशंस तक बनाएँ

कंट्रोल्स इस्तेमाल करें: समर्थित मॉडल्स पर ऑडियो सक्षम करें, अनचाहे एलिमेंट्स हटाने के लिए नेगेटिव प्रॉम्प्ट जोड़ें या साउंड कंट्रोल एडजस्ट करें।

रेफ़रेंसेस जोड़ें

वीडियो रेफ़रेंस
इंटरफ़ेस

आउटपुट पर ज़्यादा नियंत्रण के लिए, जेनरेशन को गाइड करने हेतु विज़ुअल रेफ़रेंसेस जोड़ें। उपलब्धता चुने गए मॉडल पर निर्भर करती है। हम JPG, PNG, WEBP और अन्य कई इमेज फ़ाइल फ़ॉर्मैट्स को सपोर्ट करते हैं।

स्टार्ट फ़्रेम (वीडियो): आपके वीडियो की शुरुआती इमेज सेट करता है।

एंड फ़्रेम (वीडियो): आखिरी इमेज सेट करता है और ट्रांज़िशन को प्रभावित करता है।

इमेज रेफ़्स (इमेज या वीडियो): ओवरऑल स्टाइल और लुक को गाइड करने के लिए एक या कई इमेज दें।

तेज़ वर्कफ़्लो के लिए एक्सप्लोर या हिस्ट्री टैब से आइटम्स को सीधे रेफ़रेंस स्लॉट्स में ड्रैग और ड्रॉप करें।

जेनरेट करें

जेनरेट करने से पहले, लागत संकेतक आपके चुने गए एसेट्स की संख्या की कुल लागत दिखाता है। तैयार होने पर जेनरेट पर क्लिक करें। आपकी नई क्रिएशंस हिस्ट्री टैब में दिखेंगी।

हिस्ट्री

वीडियो हिस्ट्री इंटरफ़ेस

हिस्ट्री टैब आपकी जेनरेट की गई हर चीज़ का कालानुक्रमिक लॉग देता है और पिछले काम को बेहतर बनाने के लिए एक वर्कस्पेस के रूप में काम करता है।

ब्राउज़ करें: पिछली सभी इमेज और वीडियो देखें।

जाँचें: किसी एसेट को बनाने के लिए इस्तेमाल किए गए मूल प्रॉम्प्ट, मॉडल और सेटिंग्स देखने के लिए उस पर क्लिक करें।

दोबारा इस्तेमाल करें: नई जेनरेशन के रेफ़रेंस के रूप में इस्तेमाल करने के लिए हिस्ट्री से आइटम्स को वापस प्रॉम्प्ट बॉक्स में ड्रैग करें।

दोहराएँ: नए वेरिएशन के लिए उसी प्रॉम्प्ट और सेटिंग्स को फिर से चलाने के लिए रीक्रिएट पर क्लिक करें, या जेनरेशन को नई दिशा में गाइड करने के लिए सेटिंग्स एडजस्ट करें।

शेयर करें: अपने एसेट के लिए एक यूनिक लिंक जेनरेट करने के लिए शेयर पर क्लिक करें। फ़ीडबैक के लिए इसे टीममेट्स और सहयोगियों को भेजें।

एक्सपोर्ट करें: अपने एसेट को स्टैंडअलोन फ़ाइल के रूप में डाउनलोड करें या सीधे ElevenCreative Studio में इंपोर्ट करने के लिए स्टूडियो में एडिट करें पर क्लिक करें।

एक्सपोर्ट

जिस जेनरेशन से आप संतुष्ट हैं, उसे एक्सपोर्ट करने से पहले बिल्ट-इन एन्हांसमेंट टूल्स का इस्तेमाल करें।

अपनी क्रिएशंस बेहतर बनाएँ

अपस्केल: स्पष्ट डिटेल्स बनाए रखते हुए रिज़ॉल्यूशन को 4x तक बढ़ाने के लिए Topaz Upscale का इस्तेमाल करें।

लिपसिंक: अपने विज़ुअल्स पर रियलिस्टिक लिप-सिंकिंग लागू करें:

  • Omnihuman 1.5: ऑडियो ट्रैक से स्टैटिक इमेज को एनिमेट करें
  • Veed LipSync: नए ऑडियो से मौजूदा वीडियो डब करें

अपने एसेट्स एक्सपोर्ट करें

वीडियो एक्सपोर्ट इंटरफ़ेस

तैयार एसेट्स को लोकली डाउनलोड करके या सीधे ElevenCreative Studio पर भेजकर एक्सपोर्ट करें।

स्टूडियो में एडिट करें: एसेट को सीधे ElevenCreative Studio प्रोजेक्ट में इंपोर्ट करें।

डाउनलोड: एसेट को अपनी लोकल मशीन पर सेव करें।

समर्थित डाउनलोड फ़ॉर्मैट

वीडियो:

  • MP4: कोडेक H.264, H.265। 4K तक की क्वालिटी (अपस्केलिंग के साथ)

इमेज:

  • PNG: हाई-रिज़ॉल्यूशन, लॉसलेस आउटपुट

मॉडल्स

इमेज और वीडियो अलग-अलग उपयोग के लिए ऑप्टिमाइज़ किए गए खास मॉडल्स का एक्सेस देता है। हर मॉडल तेज़ी से बदलाव करने से लेकर प्रोडक्शन-रेडी क्वालिटी तक, अलग क्षमताएं देता है।

पोस्ट-प्रोसेसिंग मॉडल्स के लिए पहले से जनरेट किया गया आउटपुट चाहिए, हालांकि आप अपनी इमेज या वीडियो फ़ाइल भी अपलोड कर सकते हैं।

एंटरप्राइज़ वर्कस्पेस एडमिन यह नियंत्रित कर सकते हैं कि वर्कस्पेस सदस्यों के लिए कौन-से इमेज और वीडियो जनरेशन मॉडल उपलब्ध हों। डिफ़ॉल्ट रूप से, एंटरप्राइज़ वर्कस्पेस के लिए सभी मॉडल अक्षम होते हैं और एडमिन को उन्हें साफ़ तौर पर सक्षम करना होता है। मॉडल अप्रूवल्स के बारे में और जानें।

API रिक्वेस्ट के लिए, ByteDance मॉडल डिफ़ॉल्ट रूप से अक्षम रहते हैं और उपयोग से पहले साफ़ अप्रूवल की जरूरत होती है। एंटरप्राइज़ ग्राहक एक्सेस के लिए सहायता टीम से संपर्क कर सकते हैं।

नीचे दिया गया हर मॉडल इमेज और वीडियो ऐप में उपलब्ध है। जिन मॉडल्स को इमेज और वीडियो API से भी कॉल किया जा सकता है, उनमें उनका model_id API के तहत दिया है; बाकी केवल ऐप में उपलब्ध हैं।

ऑडियो-वीडियो के साथ जनरेशन वाला एक यूनिफ़ाइड मल्टीमॉडल वीडियो मॉडल, जो बेहद रियलिस्टिक, सिनेमैटिक नतीजों के लिए परफ़ॉर्मेंस, लाइटिंग, शैडो और कैमरा मूवमेंट पर डायरेक्टर-लेवल कंट्रोल देता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़
  • वीडियो रेफ़रेंसेज़
  • ऑडियो रेफ़रेंसेज़

फ़ीचर्स:

  • यूनिफ़ाइड मल्टीमॉडल आर्किटेक्चर, जो एक ही पास में सिंक्रोनाइज़्ड ऑडियो और वीडियो जनरेट करता है
  • इंडस्ट्री-लीडिंग मल्टीमॉडल रेफ़रेंस और एडिटिंग क्षमताएं, जो टेक्स्ट, इमेज, ऑडियो और वीडियो इनपुट एक साथ स्वीकार करती हैं
  • इंडस्ट्री मानकों के अनुरूप सिनेमैटिक-ग्रेड रियलिज़्म के साथ बेहतरीन मोशन स्थिरता
  • परफ़ॉर्मेंस, लाइटिंग, शैडो और कैमरा मूवमेंट पर डायरेक्टर-लेवल क्रिएटिव कंट्रोल
  • 4s से 15s तक की लचीली जनरेशन अवधि
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p, 1080p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इसके लिए आदर्श:

  • सिंक्रोनाइज़्ड ऑडियो और विज़ुअल्स वाली सिनेमैटिक स्टोरीटेलिंग
  • सोर्स इमेज, वीडियो या ऑडियो का सख्ती से पालन करने वाला रेफ़रेंस-आधारित कंटेंट
  • लाइटिंग और कैमरा वर्क पर बारीक कंट्रोल चाहने वाली प्रोफ़ेशनल प्रोडक्शंस

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: bytedance-seedance-v2

क्रेडिट खपत एडजस्ट करने के लिए सेटिंग्स को टॉगल किया जा सकता है।

Seedance 2.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Seedance 2.0 का तेज़, कम लागत वाला वेरिएंट, जिसमें वही मल्टीमॉडल रेफ़रेंस इनपुट हैं और आउटपुट 720p तक सीमित है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़ (अधिकतम 9)
  • वीडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
  • ऑडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)

फ़ीचर्स:

  • Seedance 2.0 जैसा ही रेफ़रेंस हैंडलिंग, जिसमें हर जनरेशन के लिए कुल 12 रेफ़रेंसेज़ की सीमा है
  • फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: स्टार्ट या एंड फ़्रेम, या रेफ़रेंसेज़ इस्तेमाल करें—दोनों नहीं
  • 4s से 15s तक की लचीली जनरेशन अवधि
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इसके लिए आदर्श:

  • फ़ुल-रिज़ॉल्यूशन रेंडर से पहले Seedance 2.0 प्रॉम्प्ट्स पर बदलाव करना
  • ऐसे रेफ़रेंस-आधारित क्लिप्स जिनके लिए 720p आउटपुट पर्याप्त है

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: bytedance-seedance-v2-fast

Seedance 2.0 Fast संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Seedance 2.0 का सबसे छोटा वेरिएंट: Seedance 2.0 से करीब दोगुना तेज़ और लगभग आधी लागत वाला, समान इनपुट और 720p आउटपुट के साथ।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़ (अधिकतम 9)
  • वीडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
  • ऑडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)

फ़ीचर्स:

  • Seedance 2.0 जैसा ही रेफ़रेंस हैंडलिंग, जिसमें हर जनरेशन के लिए कुल 12 रेफ़रेंसेज़ की सीमा है
  • फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: स्टार्ट या एंड फ़्रेम, या रेफ़रेंसेज़ इस्तेमाल करें—दोनों नहीं
  • 4s से 15s तक की लचीली जनरेशन अवधि
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इसके लिए आदर्श:

  • बड़ी संख्या में ड्राफ़्ट और प्रीव्यू
  • ऐसे लागत-संवेदनशील वर्कफ़्लो जिनमें फिर भी ऑडियो और रेफ़रेंस इनपुट चाहिए

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: bytedance-seedance-v2-mini

Seedance 2.0 Mini संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Seedance 2.0 का अगला वर्ज़न, जिसमें ज़्यादा शार्प रियलिज़्म, अधिकतम 50 संयुक्त इमेज, वीडियो और ऑडियो रेफ़रेंसेज़, और 30 सेकंड तक की जनरेशन मिलती है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़ (अधिकतम 30)
  • वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
  • ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)

फ़ीचर्स:

  • रेफ़रेंस प्रकारों में कोई संयुक्त सीमा नहीं; इमेज या वीडियो के बिना सिर्फ़ ऑडियो रेफ़रेंसेज़ भी स्वीकार किए जाते हैं
  • फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते
  • 4s से 30s तक की लचीली जनरेशन अवधि
  • स्टार्ट फ़्रेम या रेफ़रेंस वीडियो देने पर उसी से आस्पेक्ट रेशियो लिया जाता है
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इसके लिए आदर्श:

  • लंबे क्लिप्स, जिन्हें कई रेफ़रेंसेज़ के साथ एकरूप रहना हो
  • रेफ़रेंस ऑडियो से चलने वाले डायलॉग और परफ़ॉर्मेंस सीन

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: bytedance-seedance-v2.5

Seedance 2.5 में सीड कंट्रोल उपलब्ध नहीं है।

Seedance 2.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

बदलावों का वर्णन करके मौजूदा वीडियो को एडिट करता है। आउटपुट की लंबाई और आस्पेक्ट रेशियो इनपुट वीडियो के अनुसार होता है।

जनरेशन इनपुट:

  • एडिट करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
  • एडिट्स बताने वाला टेक्स्ट प्रॉम्प्ट
  • इमेज रेफ़रेंसेज़ (अधिकतम 30)
  • अतिरिक्त वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
  • ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)

फ़ीचर्स:

  • अवधि का कोई कंट्रोल नहीं: आउटपुट इनपुट वीडियो की लंबाई के बराबर होता है
  • आस्पेक्ट रेशियो इनपुट वीडियो से लिया जाता है
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p

इसके लिए आदर्श:

  • मौजूदा फ़ुटेज में कपड़े, प्रॉप्स, लाइटिंग या सेटिंग बदलना
  • मूल मोशन को बनाए रखने वाला स्टाइल ट्रांसफ़र

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

Seedance 2.5 वीडियो एडिट संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

प्रॉम्प्ट और वैकल्पिक रेफ़रेंसेज़ के आधार पर मौजूदा वीडियो को उसके अंत से आगे जारी रखता है।

जनरेशन इनपुट:

  • एक्सटेंड करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
  • कंटिन्यूएशन बताने वाला टेक्स्ट प्रॉम्प्ट
  • इमेज रेफ़रेंसेज़ (अधिकतम 30)
  • अतिरिक्त वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
  • ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)

फ़ीचर्स:

  • एक्सटेंशन की अवधि 4s से 30s तक
  • आस्पेक्ट रेशियो इनपुट वीडियो से लिया जाता है
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p

इसके लिए आदर्श:

  • बहुत जल्दी खत्म हो जाने वाले शॉट को लंबा करना
  • कई जनरेशन को जोड़कर लंबा सीक्वेंस बनाना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

Seedance 2.5 वीडियो एक्सटेंड संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

एक उन्नत वीडियो मॉडल जो AI डायरेक्टर की तरह काम करता है और जटिल कैमरा मूवमेंट्स में कैरेक्टर्स, आइटम्स और सीन्स के लिए उच्च एकरूपता बनाए रखता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम

फ़ीचर्स:

  • मल्टी-एंगल इमेज या वीडियो रेफ़रेंसेज़ से कैरेक्टर और सीन को उच्च-गुणवत्ता के साथ बनाए रखता है
  • मल्टीलिंगुअल लिप-सिंक और एनवायरनमेंटल साउंड के साथ नेटिव ऑडियो-विज़ुअल को-जनरेशन
  • 3s से 15s तक की लचीली जनरेशन अवधि
  • एक साथ अधिकतम 4 वेरिएशन जनरेट करें
  • टेक्स्ट, फ्लूइड डायनेमिक्स और जटिल फ़िज़िकल इंटरैक्शंस की बेहतर हैंडलिंग

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: केवल 1080p
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इसके लिए आदर्श:

  • विज़ुअल कंटिन्यूटी चाहने वाली कैरेक्टर-आधारित स्टोरीटेलिंग
  • खास टेक्स्ट-रेंडरिंग ज़रूरतों वाले विज्ञापन और एसेट्स

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

बारीक कंट्रोल के लिए नेगेटिव प्रॉम्प्ट्स समर्थित हैं। हर जनरेशन के लिए साउंड सक्षम या अक्षम किया जा सकता है।

Kling 3.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

एक उच्च-एकरूपता वीडियो मॉडल जो AI डायरेक्टर की तरह काम करता है और जटिल कैमरा मूवमेंट्स में कैरेक्टर्स, आइटम्स और सीन्स की पहचान बनाए रखता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • वीडियो रेफ़रेंस
  • इमेज रेफ़रेंस

फ़ीचर्स:

  • मल्टी-एंगल रेफ़रेंसेज़ से मुख्य कैरेक्टर्स और आइटम्स की सटीक विज़ुअल पहचान बनाए रखता है
  • 3s से 15s तक सहज जनरेशन अवधि समर्थित हैं
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें
  • एलिमेंट इंटरैक्शंस और मोशन कोहेरेंस की सटीक मॉडलिंग
  • हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव सपोर्ट

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: केवल 1080p
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इसके लिए आदर्श:

  • सख्त विज़ुअल कंटिन्यूटी चाहने वाली कैरेक्टर-आधारित स्टोरीटेलिंग
  • आइटम्स की एकरूप रेंडरिंग वाले प्रोफ़ेशनल मार्केटिंग और ब्रांड एसेट्स

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

क्रेडिट खपत एडजस्ट करने के लिए सेटिंग्स को टॉगल किया जा सकता है।

Kling O3 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

O3 आर्किटेक्चर पर आधारित एक नैचुरल लैंग्वेज-आधारित वीडियो-टू-वीडियो एडिटिंग मॉडल, जो मैन्युअल मास्किंग या फ़्रेम-दर-फ़्रेम एडजस्टमेंट के बिना कैरेक्टर बदलने और एनवायरनमेंट स्वैप जैसी जटिल विज़ुअल ट्रांसफ़ॉर्मेशन संभव बनाता है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • इमेज रेफ़रेंसेज़ (अधिकतम 4 अलग एलिमेंट्स/एंगल्स)
  • टेक्स्ट विवरण (नैचुरल लैंग्वेज निर्देश)

फ़ीचर्स:

  • मूल मोशन स्ट्रक्चर का सम्मान करते हुए सब्जेक्ट्स या सेटिंग्स बदलने के लिए कन्वर्सेशनल प्रॉम्प्ट्स को समझता है
  • पूरे एडिट में मूल कैमरा एंगल्स, मूवमेंट पैटर्न्स और स्पेशल रिलेशनशिप्स बनाए रखता है
  • उच्च-गुणवत्ता कैरेक्टर एकरूपता सुनिश्चित करने के लिए फ्रंटल और मल्टी-एंगल इमेज समेत अधिकतम 4 कुल एलिमेंट्स को मिलाता है
  • हर जनरेशन के लिए मूल सोर्स ऑडियो बनाए रखने या साइलेंट आउटपुट जनरेट करने का विकल्प
  • एक बार में अधिकतम 4 एडिटेड वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: सोर्स वीडियो पर निर्भर
  • आस्पेक्ट रेशियो: सोर्स वीडियो के अनुसार

इसके लिए आदर्श:

  • मूल मूवमेंट्स बनाए रखते हुए मौजूदा फ़ुटेज में उच्च-गुणवत्ता कैरेक्टर रिप्लेसमेंट
  • पूरे सीन एनवायरनमेंट का ट्रांसफ़ॉर्मेशन (जैसे, दिन के शहर को फ़्यूचरिस्टिक नाइटस्केप में बदलना)
  • मौजूदा कैमरा डायनेमिक्स का सख्ती से पालन चाहने वाले स्टाइल ट्रांसफ़र्स लागू करना

लागत: वीडियो अवधि और चुनी गई सेटिंग्स के आधार पर अलग-अलग

Kling O3 एडिट संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

उच्च-गुणवत्ता, सिनेमैटिक वीडियो जनरेशन के लिए एक प्रोफ़ेशनल-ग्रेड मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़

फ़ीचर्स:

  • नेगेटिव प्रॉम्प्ट्स के साथ बेहतरीन क्वालिटी और क्रिएटिव कंट्रोल
  • पूरी तरह इंटीग्रेटेड और सिंक्रोनाइज़्ड ऑडियो
  • रियलिस्टिक डायलॉग, लिप-सिंक और साउंड इफेक्ट्स
  • तय अवधियां: 4s, 6s और 8s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
  • खास साउंड कंट्रोल

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p, 1080p
  • आस्पेक्ट रेशियो: 16:9, 9:16

इसके लिए आदर्श:

  • पूरे क्रिएटिव कंट्रोल के साथ उच्च-गुणवत्ता, सिनेमैटिक वीडियो जनरेशन

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: veo-3.1-generate-001

साउंड सक्षम या अक्षम करने से जनरेशन क्रेडिट्स बदल जाएंगे।

तेज़ प्रीव्यू और जनरेशन के लिए ऑप्टिमाइज़ किया गया हाई-स्पीड मॉडल, जो कम लेटेंसी के साथ ज़्यादा शार्प विज़ुअल्स देता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम

फ़ीचर्स:

  • नेगेटिव प्रॉम्प्ट्स और खास साउंड कंट्रोल के साथ उन्नत क्रिएटिव कंट्रोल
  • तय अवधियां: 4s, 6s और 8s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
  • रियलिस्टिक मोशन और इंटरैक्शंस के लिए वास्तविक दुनिया की भौतिकी की सटीक मॉडलिंग

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p, 1080p
  • आस्पेक्ट रेशियो: 16:9, 9:16

इसके लिए आदर्श:

  • तेज़ बदलाव और A/B टेस्टिंग विज़ुअल्स
  • तेज़-रफ़्तार सोशल मीडिया कंटेंट बनाना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

API: veo-3.1-fast-generate-001

कम कंप्यूट पर तेज़ जनरेशन के लिए ऑप्टिमाइज़ किया गया Veo 3.1 का किफ़ायती, हाई-स्पीड वेरिएंट।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम

फ़ीचर्स:

  • नेगेटिव प्रॉम्प्ट्स और खास साउंड कंट्रोल के साथ बारीक क्रिएटिव कंट्रोल
  • तय अवधियां: 4s, 6s और 8s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: 16:9, 9:16

इसके लिए आदर्श:

  • तेज़ी और लागत-दक्षता को प्राथमिकता देने वाला बड़ी मात्रा में कंटेंट निर्माण
  • तेज़ कॉन्सेप्ट एक्सप्लोरेशन और प्रीव्यू

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

Google का फिज़िक्स-अवेयर वीडियो मॉडल, जिसमें नेटिव ऑडियो, 4K तक आउटपुट, और फ़्रेम इंटरपोलेशन व रेफ़रेंस-गाइडेड जनरेशन दोनों शामिल हैं।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफ़रेंसेज़ (अधिकतम 10)
  • वीडियो रेफ़रेंसेज़ (अधिकतम 3, प्रत्येक अधिकतम 10s)

फ़ीचर्स:

  • फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: फ़्रेम्स के बीच इंटरपोलेट करें या रेफ़रेंसेज़ से गाइड करें
  • तय अवधियां 3s से 10s तक; रेफ़रेंस वीडियो अटैच करने पर अवधि उसी के अनुसार होती है
  • छोटे ऑन-स्क्रीन टेक्स्ट और लेबल्स की मज़बूत रेंडरिंग
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 360p, 720p, 1080p, 4K
  • आस्पेक्ट रेशियो: 16:9, 9:16

इसके लिए आदर्श:

  • पढ़ने योग्य टेक्स्ट वाले एक्सप्लेनर्स और काइनेटिक टाइपोग्राफ़ी
  • रेफ़रेंसेज़ में एकरूप सब्जेक्ट्स के साथ भौतिक रूप से स्वाभाविक मोशन

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

Gemini Omni Flash 1.1 का इस्तेमाल करके मौजूदा वीडियो को उसके अंत से आगे जारी रखता है, जिससे कुल लंबाई 40 सेकंड तक हो सकती है।

जनरेशन इनपुट:

  • एक्सटेंड करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
  • कंटिन्यूएशन बताने वाला टेक्स्ट प्रॉम्प्ट

फ़ीचर्स:

  • एक्सटेंशन की अवधि 3s से 10s तक
  • आस्पेक्ट रेशियो इनपुट वीडियो के अनुसार होता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 360p, 720p, 1080p, 4K

इसके लिए आदर्श:

  • बिना दिखने वाले कट के Gemini Omni Flash जनरेशन को लंबा करना
  • एक जनरेशन की सीमा से लंबे सीक्वेंस बनाना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

पहला Gemini Omni वीडियो मॉडल: फिज़िक्स-अवेयर मोशन, नेटिव ऑडियो और उपलब्ध वीडियो मॉडल्स में सबसे मज़बूत ऑन-स्क्रीन टेक्स्ट रेंडरिंग, 720p पर।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • इमेज रेफ़रेंसेज़ (अधिकतम 8)
  • वीडियो रेफ़रेंस (1, अधिकतम 10s)

फ़ीचर्स:

  • तय अवधियां 3s से 10s तक; रेफ़रेंस वीडियो अटैच करने पर अवधि उसी के अनुसार होती है
  • कोई स्टार्ट या एंड फ़्रेम नहीं; इसके बजाय सब्जेक्ट को एंकर करने के लिए इमेज रेफ़रेंसेज़ इस्तेमाल करें
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: 16:9, 9:16

इसके लिए आदर्श:

  • छोटे कैप्शंस, टाइटल्स और लेबल वाले एक्सप्लेनर्स
  • 720p पर मल्टी-इमेज एकरूपता

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग

बेहतर टेम्पोरल स्थिरता और कीफ़्रेम के बीच सटीक ट्रांज़िशन नियंत्रण के साथ डायनेमिक, हाई-फिडेलिटी सीक्वेंस बनाने के लिए एक उन्नत विशेष मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम
  • आखिरी फ़्रेम

विशेषताएं:

  • एकसार, मल्टी-शॉट सीक्वेंस के लिए शुरुआती और आखिरी फ़्रेम को सहजता से जोड़ता है
  • जटिल गतिविधियों और पर्यावरण की निरंतरता की हाई-फिडेलिटी मॉडलिंग
  • 4s से 12s तक की निश्चित जनरेशन अवधि सपोर्ट करता है
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें
  • हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 420p, 720p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • विशिष्ट विज़ुअल बेंचमार्क के बीच स्थिर फिज़िक्स वाले स्टोरीटेलिंग और एक्शन सीन
  • सख्त शुरुआत/अंत आवश्यकताओं वाले सिनेमैटिक ट्रांज़िशन और प्रोफेशनल वीडियो एसेट्स

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Seedance 1.5 Pro को बंद किया जा रहा है। ByteDance इस मॉडल को 11 नवंबर, 2026 को रिटायर कर देगा और यह नई जनरेशन के लिए अब उपलब्ध नहीं है। इसके बजाय Seedance 2.0 मॉडल इस्तेमाल करें। Seedance 1.5 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Black Forest Labs का वीडियो मॉडल, जिसमें प्राकृतिक गति, मल्टी-शॉट सीन, जनरेट किया गया ऑडियो और वीडियो एक्सटेंशन शामिल है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम
  • आखिरी फ़्रेम
  • एक्सटेंशन के लिए वीडियो (1, अधिकतम 15s)

विशेषताएं:

  • वीडियो एक्सटेंशन को शुरुआती और आखिरी फ़्रेम के साथ इस्तेमाल नहीं किया जा सकता
  • 5s से 20s तक की लचीली जनरेशन अवधि
  • हर जनरेशन में ऑडियो को चालू या बंद करने के लिए नेटिव साउंड नियंत्रण
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p, 1080p
  • आस्पेक्ट रेशियो: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • एक ही प्रॉम्प्ट से मल्टी-शॉट सीन
  • मिलती-जुलती गति और ऑडियो के साथ किसी मौजूदा क्लिप को बढ़ाना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

मल्टीमॉडल रेफरेंस, जनरेट किए गए ऑडियो और 4K तक के आउटपुट वाला MiniMax का फ्लैगशिप वीडियो मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम
  • आखिरी फ़्रेम
  • इमेज रेफरेंस (अधिकतम 9)
  • वीडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
  • ऑडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)

विशेषताएं:

  • हर जनरेशन में कुल 12 रेफरेंस की सीमा; ऑडियो रेफरेंस के लिए कम से कम एक इमेज या वीडियो रेफरेंस ज़रूरी है
  • फ़्रेम और रेफरेंस को एक साथ इस्तेमाल नहीं किया जा सकता
  • 5s से 15s तक की लचीली जनरेशन अवधि
  • सिंक्रोनाइज़्ड ऑडियो जनरेट करता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 768p, 2K, 4K (2K और 4K को 768p से अपस्केल किया जाता है)
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • ऐसे रेफरेंस-आधारित सीन जिन्हें हाई-रिज़ॉल्यूशन डिलीवरी चाहिए
  • रेफरेंस ऑडियो से चलने वाली डायलॉग क्लिप्स

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

MiniMax H3 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

MiniMax H3 का लगभग तुरंत परिणाम देने वाला वेरिएंट, जिसमें वही इनपुट और मजबूत विज़ुअल स्टाइल है तथा जिसे 768p तक नेटिव रूप से रेंडर किया जाता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम
  • आखिरी फ़्रेम
  • इमेज रेफरेंस (अधिकतम 9)
  • वीडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
  • ऑडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)

विशेषताएं:

  • हर जनरेशन में कुल 12 रेफरेंस की सीमा; ऑडियो रेफरेंस के लिए कम से कम एक इमेज या वीडियो रेफरेंस ज़रूरी है
  • फ़्रेम और रेफरेंस को एक साथ इस्तेमाल नहीं किया जा सकता
  • 5s से 15s तक की लचीली जनरेशन अवधि
  • सिंक्रोनाइज़्ड ऑडियो जनरेट करता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 768p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • प्रॉम्प्ट और रेफरेंस पर तेज़ी से बदलाव करना
  • MiniMax H3 से रेंडर करने से पहले प्रीव्यू

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

MiniMax H3 Max संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

बेहतर प्रॉम्प्ट पालन और जटिल भौतिक दुनिया के सिमुलेशन के लिए बनाया गया अत्याधुनिक रीजनिंग वीडियो मॉडल, जो जटिल निर्देशों को समझने और लागू करने के लिए उन्नत लॉजिकल प्रोसेसिंग का उपयोग करता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो (विवरण)
  • शुरुआती फ़्रेम और आखिरी फ़्रेम
  • वीडियो रेफरेंस
  • इमेज रेफरेंस

विशेषताएं:

  • कई स्तरों वाले प्रॉम्प्ट समझने और जटिल क्रमिक गतिविधियां करने की असाधारण क्षमता
  • कैरेक्टर और सीन की उच्च निरंतरता बनाए रखने के लिए इमेज और वीडियो, दोनों को विज़ुअल एंकर के रूप में इस्तेमाल करता है
  • भौतिक इंटरैक्शन, कारण-और-प्रभाव और फ्लुइड डायनेमिक्स की बेहतर मॉडलिंग
  • 5s और 10s क्लिप के लिए हाई-क्वालिटी जनरेशन सपोर्ट करता है
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: इनपुट पर निर्भर
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इनके लिए आदर्श:

  • लंबे, विस्तृत विवरणों के सटीक पालन वाले अत्यधिक विशिष्ट क्रिएटिव कॉन्सेप्ट
  • प्रोफेशनल स्टोरीटेलिंग, जहां भौतिक यथार्थवाद और मल्टी-रेफरेंस निरंतरता महत्वपूर्ण हो

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Kling O1 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

नैचुरल लैंग्वेज से चलने वाला वीडियो-टू-वीडियो एडिटिंग मॉडल, जो मैनुअल मास्किंग या फ़्रेम-दर-फ़्रेम बदलाव के बिना कैरेक्टर बदलने और एनवायरनमेंट स्वैप जैसे जटिल विज़ुअल ट्रांसफॉर्मेशन करने देता है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • इमेज रेफरेंस (अधिकतम 4 अलग-अलग एलिमेंट/एंगल)
  • टेक्स्ट विवरण (नैचुरल लैंग्वेज निर्देश)

विशेषताएं:

  • मूल गति संरचना का सम्मान करते हुए विषयों या सेटिंग्स को बदलने के लिए बातचीत वाले प्रॉम्प्ट समझता है
  • एडिट के दौरान मूल कैमरा एंगल, मूवमेंट पैटर्न और स्थानिक संबंध बनाए रखता है
  • हाई-फिडेलिटी कैरेक्टर निरंतरता सुनिश्चित करने के लिए अधिकतम 4 कुल एलिमेंट (फ्रंटल और मल्टी-एंगल इमेज सहित) जोड़ता है
  • मूल सोर्स ऑडियो बनाए रखने या हर जनरेशन के लिए साइलेंट आउटपुट बनाने का विकल्प
  • एक बार में अधिकतम 4 एडिट किए गए वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: सोर्स वीडियो पर निर्भर
  • आस्पेक्ट रेशियो: सोर्स वीडियो से मेल खाता है

इनके लिए आदर्श:

  • मूल मूवमेंट बरकरार रखते हुए मौजूदा फुटेज में हाई-फिडेलिटी कैरेक्टर रिप्लेसमेंट
  • पूरे सीन के एनवायरनमेंट ट्रांसफॉर्मेशन (जैसे, दिन के शहर को भविष्य के नाइटस्केप में बदलना)
  • ऐसे स्टाइल ट्रांसफर लागू करना जिनके लिए मौजूदा कैमरा डायनेमिक्स का सख्त पालन चाहिए

लागत: वीडियो की अवधि और चुनी गई सेटिंग्स के आधार पर अलग-अलग होती है

Kling O1 Edit संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

सटीक मोशन ट्रांसफर के लिए एक विशेष मॉडल, जो आपको किसी कैरेक्टर इमेज को रेफरेंस वीडियो से चलाने और खास मूवमेंट, जेस्चर व कैमरा एंगल दोहराने देता है।

जनरेशन इनपुट:

  • कैरेक्टर इमेज (सोर्स)
  • मोशन वीडियो (रेफरेंस)
  • टेक्स्ट विवरण (वैकल्पिक)

विशेषताएं:

  • सटीक मोशन रिप्लिकेशन के लिए “Match Video” या कैरेक्टर में नई क्रिएटिव मोशन जोड़ने के लिए “Match Image” चुनें
  • Match Video मोड में 30s तक और Match Image मोड में 10s तक सपोर्ट करता है
  • रेफरेंस फुटेज से किसी स्थिर कैरेक्टर तक मानव गति की हाई-फिडेलिटी मैपिंग
  • हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: सोर्स पर निर्भर
  • आस्पेक्ट रेशियो: सोर्स पर निर्भर

इनके लिए आदर्श:

  • कस्टम कैरेक्टर पर जटिल कोरियोग्राफी या विशेष मूवमेंट दोहराना
  • उच्च मोशन फिडेलिटी की जरूरत वाला लंबे फॉर्मेट का कैरेक्टर एनीमेशन
  • ट्रेंडिंग वीडियो मूवमेंट से चलने वाला सोशल मीडिया कंटेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Kling 2.6 Motion Control संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Kling 3.0 आर्किटेक्चर पर बना सटीक मोशन ट्रांसफर का विशेष मॉडल, जो आपको किसी कैरेक्टर इमेज को रेफरेंस वीडियो से चलाने और बेहतर फिडेलिटी के साथ खास मूवमेंट, जेस्चर व कैमरा एंगल दोहराने देता है।

जनरेशन इनपुट:

  • कैरेक्टर इमेज (सोर्स)
  • मोशन वीडियो (रेफरेंस)
  • टेक्स्ट विवरण (वैकल्पिक)

विशेषताएं:

  • सटीक मोशन रिप्लिकेशन के लिए “Match Video” या कैरेक्टर में नई क्रिएटिव मोशन जोड़ने के लिए “Match Image” चुनें
  • Match Video मोड में 30s तक और Match Image मोड में 10s तक सपोर्ट करता है
  • रेफरेंस फुटेज से किसी स्थिर कैरेक्टर तक मानव गति की हाई-फिडेलिटी मैपिंग
  • हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: सोर्स पर निर्भर
  • आस्पेक्ट रेशियो: सोर्स पर निर्भर

इनके लिए आदर्श:

  • कस्टम कैरेक्टर पर जटिल कोरियोग्राफी या विशेष मूवमेंट दोहराना
  • उच्च मोशन फिडेलिटी की जरूरत वाला लंबे फॉर्मेट का कैरेक्टर एनीमेशन
  • ट्रेंडिंग वीडियो मूवमेंट से चलने वाला सोशल मीडिया कंटेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Kling 3.0 Motion Control संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

बेहतर मोशन फिडेलिटी और स्मूद ट्रांज़िशन के लिए डिज़ाइन किया गया ऑप्टिमाइज़्ड जनरेटिव मॉडल, जो तेज़ इटरेशन और प्रोडक्शन-क्वालिटी विज़ुअल आउटपुट के बीच संतुलन देता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम (इमेज-टू-वीडियो)

विशेषताएं:

  • बेहतर मोशन डायनेमिक्स: गति की फ्लुइडिटी और यथार्थवादी फिज़िक्स इंटरैक्शन में महत्वपूर्ण सुधार
  • लचीला साउंड नियंत्रण: हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
  • बैच क्रिएशन: एक साथ अधिकतम 4 वेरिएशन जनरेट करें
  • विस्तृत रिफाइनमेंट: नेगेटिव प्रॉम्प्ट सपोर्ट के जरिए उन्नत क्रिएटिव नियंत्रण
  • निश्चित अवधि: 5s और 10s की जनरेशन अवधि सपोर्ट करता है

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: इनपुट पर निर्भर
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इनके लिए आदर्श:

  • फ्लुइड कैरेक्टर मूवमेंट वाले हाई-एक्शन क्लिप
  • मजबूत प्रॉम्प्ट पालन वाला प्रोफेशनल-ग्रेड सोशल मीडिया कंटेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Kling 2.6 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

हाई-क्वालिटी, फुल-HD वीडियो जनरेशन के लिए एक संतुलित और बहुमुखी मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम

विशेषताएं:

  • जटिल गति और यथार्थवादी फिज़िक्स को सिम्युलेट करने में उत्कृष्ट
  • फ्लुइड डायनेमिक्स और एक्सप्रेशन को सटीक रूप से मॉडल करता है
  • निश्चित अवधि: 5s और 10s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1080p
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इनके लिए आदर्श:

  • यथार्थवादी फिज़िक्स सिमुलेशन और जटिल गति

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

आखिरी फ़्रेम फिलहाल सपोर्ट नहीं है। इमेज रेफरेंस नहीं दे सकते। साउंड नियंत्रण उपलब्ध नहीं है।

Kling 2.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

सिनेमैटिक, बेहद यथार्थवादी वीडियो के लिए अत्याधुनिक मोशन क्वालिटी, प्रॉम्प्ट पालन और विज़ुअल फिडेलिटी।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम (इमेज-टू-वीडियो)

विशेषताएं:

  • इंडस्ट्री-लीडिंग यथार्थवाद और फिज़िक्स सिमुलेशन के साथ असाधारण मोशन क्वालिटी
  • जटिल सीन पर सटीक क्रिएटिव नियंत्रण के लिए बेहतर प्रॉम्प्ट पालन
  • सिनेमैटिक-ग्रेड आउटपुट देने वाली उच्च विज़ुअल फिडेलिटी
  • एक साथ अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: 16:9, 9:16

इनके लिए आदर्श:

  • सबसे उच्च मोशन क्वालिटी और यथार्थवाद वाला सिनेमैटिक कंटेंट
  • सटीक प्रॉम्प्ट पालन की मांग वाली प्रोफेशनल प्रोडक्शंस
  • हाई-फिडेलिटी विज़ुअल स्टोरीटेलिंग

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

तेज़ इटरेशन और किफायती क्रिएशन के लिए डिज़ाइन किया गया उन्नत वीडियो मॉडल, जो हाई-क्वालिटी वीडियो बना सकता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम (इमेज-टू-वीडियो)

विशेषताएं:

  • बेहद तेज़ जनरेशन के लिए ऑप्टिमाइज़्ड, जो पिछले इटरेशन से चार गुना तक तेज़ परिणाम देता है
  • कैरेक्टर मूवमेंट, कैमरा एंगल और सीन कंपोज़िशन का सटीक निर्देशन देता है
  • डायनेमिक सीन में विज़ुअल एकरूपता और स्थिरता बनाए रखने में उत्कृष्ट
  • 2s से 10s तक की जनरेशन अवधि सपोर्ट करता है
  • एक साथ अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • लगभग तुरंत फीडबैक वाली तेज़ प्रोटोटाइपिंग और क्रिएटिव एक्सपेरिमेंटेशन
  • हाई-रिज़ॉल्यूशन मार्केटिंग एसेट्स के लिए तेज़ टर्नअराउंड वाले प्रोफेशनल प्रोजेक्ट्स
  • खास कैमरा मूवमेंट आवश्यकताओं वाला सिनेमैटिक कंटेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

मल्टी-टास्क विज़ुअल जनरेशन के लिए डिज़ाइन किया गया अत्याधुनिक इन-कॉन्टेक्स्ट वीडियो मॉडल, जो सोर्स फुटेज की मूल संरचना बनाए रखते हुए जटिल एडिट कर सकता है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • रेफरेंस इमेज
  • टेक्स्ट विवरण

विशेषताएं:

  • प्राकृतिक लाइटिंग, शैडो और पर्सपेक्टिव के साथ सीन में ऑब्जेक्ट और सब्जेक्ट को सहजता से जोड़ें, हटाएं या बदलें
  • यथार्थवादी कलर टेम्परेचर अपडेट के साथ लोकेशन, सीज़न और दिन का समय बदलें (जैसे, बादलों वाले फुटेज को नाटकीय सनसेट में बदलना)
  • आसान नैचुरल लैंग्वेज प्रॉम्प्ट से ऐक्टर्स की उम्र और रूप बदलें या कपड़ों व सब्जेक्ट को रीटेक्सचर करें
  • सटीक एनीमेशन नियंत्रण के लिए रेफरेंस वीडियो की खास मोशन और कैमरा पाथ को स्थिर इमेज पर लागू करें
  • एक मौजूदा वीडियो सीक्वेंस से रिवर्स शॉट या लो एंगल जैसे पूरी तरह नए कैमरा एंगल जनरेट करें
  • इसमें सटीक ग्रीन-स्क्रीनिंग (एज डिटेक्शन के साथ आइसोलेशन), कहानी जारी रखने के लिए नेक्स्ट-शॉट जनरेशन और एस्थेटिक स्टाइल ट्रांसफर शामिल हैं
  • एक साथ अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: ऑटो

इनके लिए आदर्श:

  • डिजिटल डी-एजिंग, रिलाइटिंग और ऑब्जेक्ट रिमूवल जैसे प्रोफेशनल विज़ुअल इफेक्ट्स कार्य
  • तेज़ सिनेमैटिक प्रोटोटाइपिंग और एक शॉट से वैकल्पिक कैमरा कवरेज जनरेट करना
  • बड़े एनवायरनमेंटल या स्टाइलिस्टिक ट्रांसफॉर्मेशन वाला क्रिएटिव मार्केटिंग कंटेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Runway का वीडियो एडिटिंग मॉडल: गति और निरंतरता बनाए रखते हुए किसी मौजूदा वीडियो को लक्षित लुक की ओर बदलता है।

इनपुट:

  • सोर्स वीडियो (ज़रूरी, 2s से 30s)
  • टारगेट लुक इमेज (ज़रूरी)
  • एडिट का वर्णन करने वाला टेक्स्ट प्रॉम्प्ट

विशेषताएं:

  • आउटपुट की लंबाई और फ्रेमिंग सोर्स वीडियो के अनुसार होती है
  • टारगेट लुक इमेज से निर्देशित स्टाइल ट्रांसफर
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

इनके लिए आदर्श:

  • मौजूदा फुटेज को रिलाइट करना, रीस्टाइल करना या उसकी सेटिंग बदलना
  • किसी रेफरेंस इमेज का लुक पूरी क्लिप पर लागू करना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

एक विशेष परफॉर्मेंस-ट्रांसफर मॉडल, जो ड्राइविंग वीडियो की गति, स्पीच और चेहरे के भावों को किसी कैरेक्टर इमेज या वीडियो रेफरेंस पर मैप करके कैरेक्टर को एनीमेट करता है।

जनरेशन इनपुट:

  • ड्राइविंग परफॉर्मेंस (वीडियो)
  • कैरेक्टर इनपुट (इमेज या वीडियो)

विशेषताएं:

  • किसी सोर्स ऐक्टर से बारीक चेहरे के भाव, लिप-सिंक और सिंक्रोनाइज़्ड ऑडियो सीधे किसी भी कैरेक्टर पर ट्रांसफर करता है
  • अधिक प्राकृतिक लुक के लिए स्थिर कैरेक्टर इमेज में अपने-आप सेकेंडरी मोशन और हल्के कैमरा शेक जोड़ता है
  • कैरेक्टर इमेज इस्तेमाल करते समय बॉडी और हाथ की मूवमेंट चालू या बंद करने के लिए सटीक टॉगल
  • तीव्र भावनात्मक परफॉर्मेंस और कैरेक्टर की विज़ुअल निरंतरता के बीच संतुलन बनाने के लिए एडजस्ट करने योग्य सेटिंग्स
  • ड्राइविंग परफॉर्मेंस के साथ सटीक अलाइनमेंट बनाए रखते हुए जनरेशन के बाद कैरेक्टर की आवाज़ बदलने की क्षमता

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p
  • आस्पेक्ट रेशियो: ऑटो

इनके लिए आदर्श:

  • यथार्थवादी मानव गति और स्पीच के साथ स्थिर कैरेक्टर पोर्ट्रेट को जीवंत बनाना
  • गैर-मानवीय कैरेक्टर या स्टाइलाइज़्ड अवतार को हाई-फिडेलिटी एक्सप्रेशन के साथ एनीमेट करना
  • इंटीग्रेटेड बॉडी जेस्चर के साथ टॉकिंग-हेड कंटेंट तेज़ी से बनाना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

बड़ी मूवमेंट और एक्शन वाले डायनेमिक, मल्टी-शॉट सीक्वेंस बनाने का विशेष मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • शुरुआती फ़्रेम
  • आखिरी फ़्रेम

विशेषताएं:

  • अत्यधिक स्थिर फिज़िक्स और शॉट्स के बीच सहज ट्रांज़िशन
  • निश्चित अवधि: 3s, 4s, 5s, 6s, 7s, 8s, 9s, 10s, 11s, और 12s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
  • कई आस्पेक्ट रेशियो विकल्पों के साथ अधिकतम क्रिएटिव लचीलापन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p, 1080p
  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • स्थिर फिज़िक्स वाले स्टोरीटेलिंग और एक्शन सीन

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

आस्पेक्ट रेशियो और रिज़ॉल्यूशन जनरेशन क्रेडिट को प्रभावित नहीं करते, लेकिन अवधि करती है।

Seedance 1 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

एक DiT-आधारित फाउंडेशन मॉडल, जिसे एक ही पास में सिंक्रनाइज़्ड वीडियो और ऑडियो बनाने के लिए डिज़ाइन किया गया है, जिससे सुसंगत स्पीच और वास्तविक गति सुनिश्चित होती है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • इमेज-टू-वीडियो
  • ऑडियो-टू-वीडियो
  • डेप्थ-टू-वीडियो

सुविधाएं:

  • बाहरी टूल के बिना सटीक तालमेल के लिए संवाद, होंठों की गति और परिवेशी ऑडियो एक साथ बनाता है
  • स्थिर गति, एकसमान पहचान और मजबूत फ्रेम-टू-फ्रेम सुसंगति वाले डायनामिक दृश्य
  • 20 सेकंड तक उच्च-गुणवत्ता वाली सिंक्रनाइज़्ड जनरेशन सपोर्ट करता है
  • विस्तृत नेगेटिव प्रॉम्प्ट सपोर्ट के ज़रिए उन्नत क्रिएटिव डायरेक्शन
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p, 1080p
  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • सुसंगत स्पीच और भावपूर्ण कैरेक्टर परफॉर्मेंस
  • इंटीग्रेटेड परिवेशी ऑडियो और एकसमान टाइमिंग वाले नैरेटिव कॉन्टेंट
  • जटिल कैमरा-अवेयर मोशन लॉजिक वाले डायनामिक दृश्य

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

अधिकतम विज़ुअल डिटेल और स्ट्रक्चरल स्थिरता के लिए ऑप्टिमाइज़ किया गया एक उच्च-गुणवत्ता वाला जनरेटिव मॉडल, जो सहज गति के साथ प्रोडक्शन-ग्रेड 4K आउटपुट दे सकता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम (इमेज-टू-वीडियो)

सुविधाएं:

  • गति के बजाय विज़ुअल क्वालिटी और एकरूपता को प्राथमिकता देता है, जिससे लंबे सीक्वेंस में स्थिर नतीजे मिलते हैं
  • बेहद सहज और प्रोफेशनल गति के लिए 25 FPS और 50 FPS, दोनों को सपोर्ट करता है
  • साउंड को चालू या बंद करने के टॉगल के साथ इंटीग्रेटेड ऑडियो-विज़ुअल जनरेशन
  • डिटेल की हानि के बिना नेटिव 1080p, 2k और 4k आउटपुट संभालने के लिए बनाया गया
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1080p, 2k, 4k
  • फ़्रेम रेट: 25 FPS, 50 FPS
  • आस्पेक्ट रेशियो: 16:9 (डिफ़ॉल्ट)
  • अवधि: 6s, 8s, 10s

इनके लिए आदर्श:

  • 4K स्पष्टता वाली हाई-रिज़ॉल्यूशन सिनेमैटिक प्रोडक्शन
  • सहज 50 FPS गति की ज़रूरत वाले प्रोफेशनल कॉन्टेंट
  • विस्तृत सीक्वेंस, जहां विज़ुअल स्थिरता और स्ट्रक्चरल इंटीग्रिटी अहम हो

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

एक सटीक AI डायरेक्टिंग टूल, जो कंटिन्यूटी बनाए रखते हुए या पूरे सीक्वेंस को फिर से जनरेट किए बिना मौजूदा शॉट्स में संवाद, भावना और एक्शन को लक्षित रूप से बदलने देता है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • टेक्स्ट विवरण

सुविधाएं:

  • आसपास के फ़्रेम से मजबूत कॉन्टेक्स्ट प्रिज़र्वेशन बनाए रखते हुए खास सेगमेंट में बदलाव करें
  • कैरेक्टर की वॉइस, परफॉर्मेंस और माहौल को एकसमान रखते हुए बोले गए डायलॉग बदलें
  • कई एडिट मोड: शॉट के खास एलिमेंट अलग करके फिर से जनरेट करने के लिए “ऑडियो और वीडियो,” “केवल ऑडियो,” या “केवल वीडियो” चुनें
  • सहज ट्रांज़िशन के लिए नया कॉन्टेंट मूल गति, लाइटिंग और टोन को स्वाभाविक रूप से अपनाता है
  • एक ही शॉट में कैरेक्टर की वैकल्पिक प्रतिक्रियाओं, भावनात्मक पलों या कैमरा मूवमेंट के साथ तुरंत प्रयोग करें
  • साथ-साथ क्रिएटिव तुलना के लिए एक साथ अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: केवल 16:9

इनके लिए आदर्श:

  • रीशूट या री-रिकॉर्डिंग की ज़रूरत के बिना स्क्रिप्ट में बदलाव और डायलॉग बेहतर बनाना
  • पोस्ट-प्रोडक्शन में भावनात्मक पलों या पेसिंग की समस्याओं को ठीक करना
  • एक ही मार्केटिंग एसेट में कई ब्रांड मैसेज और कॉल-टू-एक्शन टेस्ट करना

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

तेज़ फीडबैक लूप और तेज़ी से कॉन्टेंट बनाने के लिए तैयार किया गया गति-ऑप्टिमाइज़्ड जनरेटिव मॉडल, जो रेंडर समय को काफी कम करते हुए हाई-रिज़ॉल्यूशन विज़ुअल देता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम (इमेज-टू-वीडियो)

सुविधाएं:

  • स्पीड और तेज़ इटरेशन के लिए इंजीनियर किया गया, जिससे तुरंत विज़ुअल प्रयोग और लगभग तुरंत प्रीव्यू मिलते हैं
  • Pro मॉडल की तुलना में कम कंप्यूट ओवरहेड के साथ नेटिव 1080p, 2k और 4k आउटपुट सपोर्ट करता है
  • तेज़ गति पर सहज मोशन के लिए 25 FPS और 50 FPS, दोनों की क्षमता
  • 20 सेकंड तक की अवधि के लिए सिंक्रनाइज़्ड ऑडियो-विज़ुअल कॉन्टेंट की तेज़ जनरेशन सक्षम करता है
  • हर जनरेशन में ऑडियो चालू या बंद करने का नेटिव सपोर्ट
  • एक साथ अधिकतम 4 वेरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1080p, 2k, 4k
  • फ़्रेम रेट: 25 FPS, 50 FPS
  • आस्पेक्ट रेशियो: 16:9 (डिफ़ॉल्ट)
  • अवधि: 6s, 8s, 10s, 12s, 14s, 16s, 18s, 20s

इनके लिए आदर्श:

  • तेज़ प्रोटोटाइपिंग और क्रिएटिव एक्सप्लोरेशन, जहां अधिकतम डिटेल के बजाय स्पीड प्राथमिकता हो
  • तेज़ टर्नअराउंड वाले हाई-वॉल्यूम सोशल मीडिया कॉन्टेंट
  • अलग-अलग विज़ुअल कॉन्सेप्ट और मोशन स्टाइल की A/B टेस्टिंग

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

इमेज, वीडियो और ऑडियो रेफरेंस, जनरेट किए गए ऑडियो और 30 सेकंड तक की जनरेशन वाला एक सिनेमैटिक वीडियो मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफरेंस (अधिकतम 10)
  • वीडियो रेफरेंस (अधिकतम 5, कुल 15s)
  • ऑडियो रेफरेंस (अधिकतम 5, कुल 15s)

सुविधाएं:

  • फ़्रेम और रेफरेंस एक-दूसरे के साथ इस्तेमाल नहीं किए जा सकते
  • तय अवधि: 5s, 10s, 15s, 20s और 30s
  • हर जनरेशन में ऑडियो चालू या बंद करने के साथ नेटिव साउंड कंट्रोल
  • वैकल्पिक प्रॉम्प्ट एन्हांसमेंट
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p, 1080p
  • आस्पेक्ट रेशियो: ऑटो, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • प्रॉम्प्ट का अच्छी तरह पालन करने वाले लंबे सिनेमैटिक शॉट्स
  • ऑडियो के साथ रेफरेंस-आधारित दृश्य

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Wan 3.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

Wan 3.0 का तेज़ वेरिएंट, जिसमें वही इनपुट और आउटपुट विकल्प हैं और जो आइडिएशन के लिए उपयुक्त है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम
  • एंड फ़्रेम
  • इमेज रेफरेंस (अधिकतम 10)
  • वीडियो रेफरेंस (अधिकतम 5, कुल 15s)
  • ऑडियो रेफरेंस (अधिकतम 5, कुल 15s)

सुविधाएं:

  • Wan 3.0 की तुलना में लगभग आधा जनरेशन समय
  • तय अवधि: 5s, 10s, 15s, 20s और 30s
  • हर जनरेशन में ऑडियो चालू या बंद करने के साथ नेटिव साउंड कंट्रोल
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p, 1080p
  • आस्पेक्ट रेशियो: ऑटो, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • अंतिम Wan 3.0 रेंडर से पहले आइडिया एक्सप्लोर करना
  • टर्नअराउंड-सेंसिटिव वर्कफ़्लो

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Wan 3.0 Prime संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

एक नेक्स्ट-जनरेशन सिनेमैटिक वीडियो प्लेटफ़ॉर्म, जो नेटिव ऑडियो सिंक्रनाइज़ेशन और इंटेलिजेंट मल्टी-शॉट सीक्वेंसिंग के साथ प्रोडक्शन-रेडी 1080p कॉन्टेंट देने के लिए यूनिफ़ाइड मल्टीमॉडल आर्किटेक्चर का उपयोग करता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम (इमेज-टू-वीडियो)
  • वीडियो रेफरेंस (वीडियो-टू-वीडियो)
  • ऑडियो रेफरेंस (वैकल्पिक बैकग्राउंड ऑडियो या डायलॉग)

सुविधाएं:

  • यूनिफ़ाइड मल्टीमॉडल सिस्टम: एकसमान आउटपुट क्वालिटी के लिए टेक्स्ट, इमेज, वीडियो और ऑडियो को एक ही इंटीग्रेटेड फ्रेमवर्क में प्रोसेस करता है
  • नेटिव ऑडियो सिंक: स्क्रीन पर होने वाली गति के साथ डायलॉग, नैरेशन और पर्यावरणीय साउंड इफेक्ट्स को अपने-आप जनरेट और अलाइन करता है
  • इंटेलिजेंट मल्टी-शॉट सीक्वेंसिंग: कैरेक्टर की एकरूपता बनाए रखते हुए कनेक्टेड वीडियो सीक्वेंस को अपने-आप सुसंगत स्टोरी आर्क में व्यवस्थित करता है
  • विस्तृत अवधि: 5s, 10s और 15s की तय लंबाई के लिए स्थिर, उच्च-गुणवत्ता वाली जनरेशन सपोर्ट करता है
  • उन्नत क्रिएटिव कंट्रोल: विस्तृत डिटेल मैनेजमेंट के लिए नेगेटिव प्रॉम्प्ट और अधिकतम 4 वेरिएशन के बैच क्रिएशन को सपोर्ट करता है

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 720p, 1080p
  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • प्रोफेशनल नैरेटिव स्टोरीटेलिंग और जटिल मल्टी-शॉट सिनेमैटिक सीक्वेंस
  • इंटीग्रेटेड, उच्च-गुणवत्ता वाले ऑडियो की ज़रूरत वाले सोशल मीडिया विज्ञापन और मार्केटिंग कॉन्टेंट
  • वीडियो रेफरेंस के ज़रिए सख्त विज़ुअल और मोशन एकरूपता की ज़रूरत वाला कैरेक्टर-आधारित कॉन्टेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

Wan 2.6 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

एक बहुमुखी मॉडल जो टेक्स्ट या शुरुआती इमेज से सिनेमैटिक मोशन और उच्च प्रॉम्प्ट फिडेलिटी देता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-वीडियो
  • स्टार्ट फ़्रेम (इमेज-टू-वीडियो)

सुविधाएं:

  • नेगेटिव प्रॉम्प्ट और समर्पित साउंड कंट्रोल के साथ विस्तृत क्रिएटिव कंट्रोल
  • तय अवधि: 5s और 10s
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p, 1080p
  • आस्पेक्ट रेशियो: 16:9, 1:1, 9:16

इनके लिए आदर्श:

  • प्रॉम्प्ट का अच्छी तरह पालन करने वाला सिनेमैटिक कॉन्टेंट

लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है

जनरेशन की लागत चुनी गई सेटिंग्स के आधार पर अलग-अलग होती है।

Wan 2.5 Video संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

अत्यधिक विस्तृत आउटपुट और सटीक एडिटिंग के लिए OpenAI का प्रोडक्शन-ग्रेड इमेज मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 10)

सुविधाएं:

  • Low से Maximum तक पांच क्वालिटी लेवल
  • 3:1 तक के आस्पेक्ट रेशियो पर हर साइड में 3840px तक कस्टम रिज़ॉल्यूशन
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K, 4K या कस्टम
  • आस्पेक्ट रेशियो: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

इनके लिए आदर्श:

  • अंतिम एसेट्स, जहां डिटेल और फिडेलिटी सबसे अहम हो
  • मौजूदा इमेज में सटीक एडिट

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: gpt-image-2.5-sunburst

Sunburst जैसे कंट्रोल वाला तेज़ GPT Image 2.5 वेरिएंट, जिसे रोज़मर्रा की हाई-वॉल्यूम जनरेशन के लिए ट्यून किया गया है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 10)

सुविधाएं:

  • Low से Maximum तक पांच क्वालिटी लेवल
  • 3:1 तक के आस्पेक्ट रेशियो पर हर साइड में 3840px तक कस्टम रिज़ॉल्यूशन
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K, 4K या कस्टम
  • आस्पेक्ट रेशियो: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3

इनके लिए आदर्श:

  • हाई-वॉल्यूम इमेज जनरेशन
  • तेज़ इटरेशन, जिनमें फिर भी 4K और कस्टम साइज़ चाहिए

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: gpt-image-2.5-flare

बेहतर टेक्स्ट रेंडरिंग और हाई-रिज़ॉल्यूशन आउटपुट क्षमताओं के साथ सटीक इमेज जनरेशन के लिए डिज़ाइन किया गया एक उन्नत AI मॉडल।

सुविधाएं:

  • सटीक टाइपोग्राफी और स्पष्टता वाली इमेज बनाने के लिए सटीक टेक्स्ट कंट्रोल
  • प्रोफेशनल और कमर्शियल उपयोग के लिए उपयुक्त हाई-रिज़ॉल्यूशन PNG आउटपुट
  • स्टाइल और कंपोज़िशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 3:2, 1:1, 2:3
  • क्वालिटी विकल्प: low, medium, high

इनके लिए आदर्श:

  • सटीक टेक्स्ट प्लेसमेंट वाले मार्केटिंग विज़ुअल और डिज़ाइन एसेट्स
  • हाई-रिज़ॉल्यूशन की ज़रूरत वाला प्रोफेशनल कॉन्टेंट
  • सटीक टेक्स्ट-आधारित इमेज कंट्रोल की ज़रूरत वाले क्रिएटिव प्रोजेक्ट्स

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: gpt-image-2

प्रोडक्शन-रेडी क्वालिटी को बेहद तेज़ प्रोसेसिंग के साथ मिलाने वाला एक उन्नत AI इमेज जनरेशन मॉडल, जिसमें बेहतर वर्ल्ड नॉलेज और सब्जेक्ट कंसिस्टेंसी है।

सुविधाएं:

  • बिना अपस्केलिंग के क्रिस्टल-क्लियर डिटेल वाला नेटिव 4K रिज़ॉल्यूशन आउटपुट
  • केवल 1-2 सेकंड में बेहद तेज़ इमेज जनरेशन
  • उन्नत रीजनिंग और निर्देशों का पालन करके बेहतर प्रॉम्प्ट फॉलो करना
  • मॉकअप, साइनेज और इन्फोग्राफिक्स के लिए कई भाषाओं में स्पष्ट, सटीक टेक्स्ट रेंडरिंग
  • कई कैरेक्टर और ऑब्जेक्ट्स में पहचान बनाए रखने वाली एकसमान मल्टी-सब्जेक्ट स्टाइलिंग
  • अधिक सटीक दृश्य जनरेशन के लिए बेहतर वर्ल्ड नॉलेज
  • जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
  • रिज़ॉल्यूशन: 4K तक

इनके लिए आदर्श:

  • रियल-टाइम इटरेशन की ज़रूरत वाले तेज़ क्रिएटिव वर्कफ़्लो
  • एकसमान कैरेक्टर पहचान वाला ब्रांड कॉन्टेंट और स्टोरीटेलिंग
  • सटीक टेक्स्ट और टाइपोग्राफी वाले प्रोफेशनल विज़ुअल

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: gemini-3.1-flash-image

1K पर तेज़ जनरेशन और एडिटिंग के लिए Nano Banana 2 का तेज़, कम लागत वाला वेरिएंट।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 14)

सुविधाएं:

  • एकसमान स्पीड और लागत के लिए तय 1K आउटपुट
  • Nano Banana 2 जैसी ही 14-इमेज रेफरेंस क्षमता
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K
  • आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

इनके लिए आदर्श:

  • तेज़ इटरेशन और ड्राफ्ट
  • बल्क एडिट, जहां 1K पर्याप्त हो

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: gemini-3.1-flash-lite-image

Krea AI का बहुमुखी, प्रोडक्शन-रेडी इमेज जनरेशन मॉडल, जो कई तरह के क्रिएटिव वर्कफ़्लो के लिए क्वालिटी और स्पीड का संतुलन बनाता है।

सुविधाएं:

  • प्रॉम्प्ट का अच्छी तरह पालन करने वाली उच्च-गुणवत्ता इमेज जनरेशन
  • जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • एकसमान क्वालिटी की ज़रूरत वाला प्रोफेशनल कॉन्टेंट क्रिएशन
  • अलग-अलग क्रिएटिव कॉन्सेप्ट में तेज़ इटरेशन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

Krea AI का फ्लैगशिप इमेज जनरेशन मॉडल, जो प्रोफेशनल प्रोडक्शन वर्कफ़्लो के लिए अधिकतम विज़ुअल फिडेलिटी और उन्नत क्रिएटिव कंट्रोल देता है।

सुविधाएं:

  • प्रोफेशनल-ग्रेड आउटपुट के लिए असाधारण डिटेल और रियलिज़्म
  • कई इमेज रेफरेंस सपोर्ट के साथ उन्नत स्टाइल कंट्रोल
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • हाई-एंड कमर्शियल और एडिटोरियल इमेज प्रोडक्शन
  • अधिकतम फिडेलिटी की ज़रूरत वाले जटिल क्रिएटिव कंपोज़िशन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

मजबूत प्रॉम्प्ट कंट्रोल और साफ कंपोज़िशन वाला डिज़ाइन-केंद्रित टेक्स्ट-टू-इमेज मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज

सुविधाएं:

  • 2K आउटपुट में Pro मॉडल वेरिएंट का उपयोग होता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K
  • आस्पेक्ट रेशियो: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

इनके लिए आदर्श:

  • लेआउट-केंद्रित ग्राफिक्स, आइकन और पोस्टर
  • सिर्फ टेक्स्ट से साफ कंपोज़िशन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

एक डिज़ाइन-केंद्रित इमेज मॉडल, जो रेफरेंस इमेज की स्टाइल से मेल खा सकता है।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • स्टाइल रेफरेंस (अधिकतम 10)

सुविधाएं:

  • स्टाइल मैच कंट्रोल: Precise रेफरेंस स्टाइल को बारीकी से फॉलो करता है, Flexible सामान्य लुक से मेल खाता है
  • 2K आउटपुट में Pro मॉडल वेरिएंट का उपयोग होता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K
  • आस्पेक्ट रेशियो: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2

इनके लिए आदर्श:

  • स्टाइल रेफरेंस के सेट से ब्रांड के अनुरूप ग्राफिक्स
  • इलस्ट्रेशन और डिज़ाइन कार्य

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

ByteDance का हल्का, तेज़-जनरेशन इमेज मॉडल, जो कम कंप्यूट आवश्यकताओं के साथ उच्च-गुणवत्ता वाले नतीजे देता है।

सुविधाएं:

  • तेज़ क्रिएटिव इटरेशन के लिए तेज़ जनरेशन
  • जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • स्पीड की ज़रूरत वाले हाई-वॉल्यूम इमेज क्रिएशन वर्कफ़्लो
  • तेज़ कॉन्सेप्ट एक्सप्लोरेशन और प्रीव्यू

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है

API: bytedance-seedream-5-lite

Seedream 5 Lite संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

सटीक एडिटिंग, बहुभाषी टेक्स्ट और विस्तृत इन्फोग्राफ़िक्स के लिए उच्च-फिडेलिटी वाला Seedream 5 वेरिएंट।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 10)

सुविधाएं:

  • बहुभाषी टेक्स्ट का सटीक रेंडरिंग
  • इन्फोग्राफ़िक्स और पोस्टर जैसे घने लेआउट संभालता है
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K
  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • कई भाषाओं में टेक्स्ट-प्रधान डिज़ाइन
  • रेफरेंस का सख्ती से पालन करते हुए मल्टी-इमेज एडिटिंग

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

API: bytedance-seedream-5-pro

Seedream 5 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

सटीक टेक्स्ट-आधारित इमेज जनरेशन और मूल विवरण बनाए रखने वाली जटिल, नॉन-डिस्ट्रक्टिव फोटो एडिटिंग के लिए बनाया गया तेज़ फ्लैगशिप मॉडल।

सुविधाएं:

  • सोर्स इमेज में लाइटिंग, कंपोज़िशन और विषय की दिखावट को बरकरार रखते हुए मांगे गए बदलाव भरोसेमंद ढंग से करता है
  • एलिमेंट जोड़ने, हटाने, मिलाने और ब्लेंड करने सहित जटिल एडिटिंग कार्यों को सपोर्ट करता है
  • पिछले वर्ज़न की तुलना में 4 गुना तक तेज़ आउटपुट देता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 3:2, 1:1, 2:3
  • क्वालिटी विकल्प: low, medium, high

इनके लिए आदर्श:

  • कपड़ों या हेयरस्टाइल के व्यावहारिक फोटो एडजस्टमेंट और वास्तविक वर्चुअल ट्राय-ऑन
  • इनपुट इमेज के मूल भाव को बनाए रखने वाले कॉन्सेप्चुअल ट्रांसफॉर्मेशन और स्टाइलिस्टिक फ़िल्टर
  • टेक्स्ट-टू-इमेज कॉन्सेप्ट पर तेज़ी से काम करना

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

API: gpt-image-1.5

अच्छे प्रॉम्प्ट पालन, पढ़ने योग्य टेक्स्ट और विस्तृत एडिटिंग वाला OpenAI का पहली पीढ़ी का इमेज मॉडल।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 5)

सुविधाएं:

  • तीन क्वालिटी स्तर: Low, Medium, High
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 3:2, 1:1, 2:3

इनके लिए आदर्श:

  • ऐसे वर्कफ़्लो जो पहले से GPT Image 1 आउटपुट पर बने हैं
  • स्टैंडर्ड रिज़ॉल्यूशन पर साधारण एडिट और इमेज में टेक्स्ट वाले कार्य

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

API: gpt-image-1

एक उच्च-प्रदर्शन मल्टीमॉडल फाउंडेशन मॉडल, जो टेक्स्ट-टू-इमेज सिंथेसिस, सटीक इमेज एडिटिंग और जटिल मल्टी-इमेज कंपोज़िशन को एक ही प्रभावी फ्रेमवर्क में एकजुट करता है।

सुविधाएं:

  • 4K रिज़ॉल्यूशन तक की उच्च-फिडेलिटी इमेज तेज़ी से जनरेट करने का नेटिव सपोर्ट
  • रेफरेंस इनपुट पर आधारित एडिटिंग कार्यों में चेहरे की विशेषताओं, लाइटिंग, रंगों के टोन और बारीक विवरण को असाधारण रूप से बनाए रखता है
  • नियंत्रित और एक जैसे नतीजों के लिए कई इनपुट इमेज में टारगेट एलिमेंट की सटीक पहचान और ब्लेंडिंग करता है
  • पोस्टर और ब्रांड विज़ुअल के लिए छोटे टेक्स्ट का स्पष्ट, सटीक रेंडरिंग करने के साथ डिज़ाइनर-स्तर की कंपोज़िशन क्षमताएं देता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
  • रिज़ॉल्यूशन: 2K, 4K

इनके लिए आदर्श:

  • सटीक लेआउट और टाइपोग्राफी की जरूरत वाले पेशेवर ग्राफ़िक डिज़ाइन वर्कफ़्लो
  • रेफरेंस पहचान और लाइटिंग का सख्ती से पालन करने वाली जटिल फोटो एडिटिंग
  • कई विज़ुअल सोर्स का उपयोग करके हाई-रिज़ॉल्यूशन क्रिएटिव कंपोज़िटिंग

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

Seedream 4.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

उन्नत रीजनिंग क्षमताओं वाला उच्च-फिडेलिटी इमेज जनरेशन मॉडल, जिसे जटिल कंपोज़िशन में बेहतर प्रॉम्प्ट पालन और सटीक विज़ुअल एकरूपता के लिए डिज़ाइन किया गया है।

सुविधाएं:

  • जटिल, बहु-स्तरीय टेक्स्ट विवरण को उच्च सटीकता के साथ समझने और लागू करने की असाधारण क्षमता
  • जनरेशन में विषय की पहचान, लाइटिंग और एस्थेटिक स्टाइल बनाए रखने के लिए इमेज रेफरेंस का उपयोग करता है
  • वास्तविक टेक्सचर, जटिल स्थानिक संबंधों और पेशेवर स्तर के लाइटिंग इफेक्ट्स के लिए ऑप्टिमाइज़्ड
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
  • रिज़ॉल्यूशन: 1K, 2K

इनके लिए आदर्श:

  • विस्तृत और तकनीकी टेक्स्ट प्रॉम्प्ट का सख्ती से पालन करने वाली पेशेवर क्रिएटिव एसेट्स
  • विज़ुअल रेफरेंस का उपयोग करके उच्च-एकरूपता वाली इमेज एडिटिंग और कैरेक्टर डिज़ाइन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

Kling O1 Image संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

पेशेवर वर्कफ़्लो के लिए बनाया गया प्रोडक्शन-ग्रेड इमेज जनरेशन और एडिटिंग मॉडल, जो गति, सटीकता और एकरूपता पर ध्यान देते हुए अत्याधुनिक विज़ुअल क्वालिटी देता है।

सुविधाएं:

  • सैकड़ों एसेट्स में उद्योग-अग्रणी कैरेक्टर और पहचान की एकरूपता पाने के लिए एक साथ कई इमेज रेफरेंस करें
  • फैब्रिक टेक्सचर से लेकर आर्किटेक्चरल एलिमेंट तक, विवरण की क्वालिटी में अभूतपूर्व सुधार देता है और वास्तविक फोटोग्राफी से अंतर कम करता है
  • जटिल टाइपोग्राफी, UI मॉकअप और इन्फोग्राफ़िक्स के लिए प्रोडक्शन-रेडी टेक्स्ट रेंडरिंग देता है
  • बिना किसी अनुमान के hex codes के ज़रिए सटीक ब्रांड रंग निर्दिष्ट करने का सपोर्ट
  • जटिल दृश्यों में सटीक ऑब्जेक्ट पोज़िशनिंग, वास्तविक फिज़िक्स, सुसंगत लाइटिंग और सही पर्सपेक्टिव सुनिश्चित करता है
  • स्ट्रक्चर्ड, जटिल निर्देशों के लिए बेहतर सटीकता और प्रतिक्रिया के अनुसार ऑप्टिमाइज़्ड
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
  • रिज़ॉल्यूशन: 720p, 1080p, 2K

इनके लिए आदर्श:

  • एक जैसे कैरेक्टर वाले कैंपेन चलाना और किसी भी संदर्भ में प्रोडक्ट को सटीकता से रखना
  • पढ़ने योग्य टेक्स्ट और सुसंगत विज़ुअल डिज़ाइन सिस्टम के साथ इंटरफ़ेस मॉकअप बनाना
  • बड़े पैमाने पर प्रोडक्ट फोटोग्राफी और संदर्भित लाइफ़स्टाइल शॉट्स जनरेट करना

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

उच्च-फिडेलिटी एसेट प्रोडक्शन, उन्नत क्रिएटिव नियंत्रण और निर्देशों का सटीक पालन करने के लिए बनाया गया पेशेवर-स्तर का, रीजनिंग-आधारित इमेज जनरेशन और एडिटिंग मॉडल।

इनपुट:

  • इमेज रेफरेंस
  • टेक्स्ट विवरण (जटिल, बहु-स्तरीय प्रॉम्प्ट को सपोर्ट करता है)

सुविधाएं:

  • रेंडरिंग से पहले दृश्यों की योजना बनाता है, ताकि फिज़िक्स के अनुरूप लाइटिंग, सटीक ऑब्जेक्ट संबंध और बेहतर प्रॉम्प्ट पालन मिले
  • प्रभावशाली पोस्टर और प्रोडक्ट मॉकअप के लिए विभिन्न फ़ॉन्ट स्टाइल और हस्तलिपि में स्पष्ट, पढ़ने योग्य बहुभाषी टेक्स्ट जनरेट करता है
  • विभिन्न क्रिएटिव आउटपुट में अधिकतम 5 लोगों और कई ऑब्जेक्ट्स के लिए उच्च फिडेलिटी और समानता बनाए रखता है
  • वास्तविक डेटा, वास्तविक दुनिया के ज्ञान और मौसम या खेल जैसी रीयल-टाइम जानकारी से विज़ुअल बेहतर बनाने के लिए Google Search को इंटीग्रेट करता है
  • उन्नत लोकलाइज़्ड एडिटिंग टूल से कैमरा एंगल, फोकल पॉइंट और सीन लाइटिंग को समायोजित करें (जैसे दिन को रात में बदलना)
  • बेहतर स्थानिक समझ सटीक इन्फोग्राफ़िक्स, तकनीकी डायग्राम और प्रेज़ेंटेशन स्लाइड्स जनरेट करने में मदद करती है
  • एक बार में अधिकतम 4 वेरिएशन जनरेट करता है

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 1K, 2K, 4K
  • आस्पेक्ट रेशियो: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

इनके लिए आदर्श:

  • पेशेवर विज्ञापन, ब्रांड एसेट्स और उच्च-स्तरीय ई-कॉमर्स प्रोडक्ट फोटोग्राफी
  • शैक्षिक व्याख्याएं, डेटा-आधारित इन्फोग्राफ़िक्स और जटिल तकनीकी दस्तावेज़
  • कैरेक्टर या ब्रांड पहचान में एकरूपता के साथ हाई-रिज़ॉल्यूशन विज़ुअल डिज़ाइन की तेज़ प्रोटोटाइपिंग

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

API: gemini-3-pro-image

टेक्स्ट प्रॉम्प्ट से सीधे तेज़, उच्च-गुणवत्ता वाली इमेज जनरेशन और एडिटिंग के लिए एक हाई-स्पीड मॉडल।

सुविधाएं:

  • जनरेशन को निर्देशित करने के लिए कई इमेज रेफरेंस का सपोर्ट
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16

इनके लिए आदर्श:

  • तेज़ इमेज निर्माण और इटरेशन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

API: gemini-2.5-flash-image

उच्च-फिडेलिटी इमेज जनरेशन के लिए बनाया गया उन्नत बेस मॉडल, जो दृश्यों के बीच एकरूपता बनाए रखने के लिए अभूतपूर्व स्टाइलिस्टिक नियंत्रण और विज़ुअल मेमोरी देता है।

सुविधाएं:

  • कई आउटपुट में पेशेवर-स्तर की एकरूपता बनाए रखने के लिए इनपुट इमेज का उपयोग करके कैरेक्टर, स्टाइल या विशिष्ट ऑब्जेक्ट को एंकर करें
  • विज़ुअल विवरण, लाइटिंग और भावनाओं पर सटीक नियंत्रण के लिए जटिल, प्राकृतिक भाषा विवरण समझने हेतु ऑप्टिमाइज़्ड
  • सिनेमैटिक स्टोरीबोर्ड से लेकर पेशेवर प्रोडक्ट फोटोग्राफी तक, विभिन्न उपयोगों के लिए उच्च-गुणवत्ता विज़ुअल जनरेट कर सकता है
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
  • रिज़ॉल्यूशन: 720p, 1080p

इनके लिए आदर्श:

  • यह सुनिश्चित करना कि मुख्य पात्र अलग-अलग वातावरण और लाइटिंग ट्रीटमेंट में भी अपनी दिखावट बनाए रखें
  • हाई-रिज़ॉल्यूशन ब्रांड एसेट्स, वर्चुअल ट्राय-ऑन और बड़े पैमाने के लिए तैयार प्रोडक्ट विज़ुअलाइज़ेशन तेज़ी से बनाना
  • इमेज रेफरेंस के ज़रिए मुख्य विज़ुअल पहचान तय रखते हुए अलग-अलग कलात्मक दिशाओं को एक्सप्लोर करना

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

गति के लिए तैयार किया गया ऑप्टिमाइज़्ड इमेज जनरेशन मॉडल, जो समान आउटपुट क्वालिटी बनाए रखते हुए स्टैंडर्ड Gen-4 Image से 2.5 गुना तेज़ परिणाम देता है।

सुविधाएं:

  • ऑप्टिमाइज़्ड प्रोसेसिंग कम समय में उच्च-फिडेलिटी इमेज जनरेट करके तेज़ क्रिएटिव एक्सप्लोरेशन की सुविधा देती है
  • मॉडल को विशिष्ट कैरेक्टर, वातावरण और कलात्मक स्टाइल समझने में मदद करने के लिए अधिकतम तीन रेफरेंस इमेज अपलोड करें
  • कई जनरेशन में पहचान बनाए रखने के लिए रेफरेंस इमेज से विशिष्ट विज़ुअल विशेषताओं को एन्कोड करके विज़ुअल ड्रिफ्ट की चुनौती हल करता है
  • रेफरेंस इमेज की एस्थेटिक, लाइटिंग और टेक्सचर को बिल्कुल नए विषयों और दृश्यों पर आसानी से लागू करें
  • वेरिएशन को व्यवस्थित ढंग से एक्सप्लोर करने या सटीकता से विशिष्ट आउटपुट दोबारा बनाने के लिए seed पैरामीटर इस्तेमाल करें
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
  • रिज़ॉल्यूशन: 720p, 1080p

इनके लिए आदर्श:

  • Instagram Stories (9:16) या स्टैंडर्ड पोस्ट (1:1) के लिए प्लेटफ़ॉर्म-ऑप्टिमाइज़्ड विज़ुअल बड़े पैमाने पर तेज़ी से बनाना
  • ब्रांड स्टाइल गाइड को रेफरेंस इमेज के रूप में इस्तेमाल करके कैंपेन में सख्त विज़ुअल पहचान बनाए रखना
  • मुख्य पात्र की पहचान बनी रहे, यह सुनिश्चित करते हुए एक जैसे कैरेक्टर पोज़ और सेटिंग्स विकसित करना
  • रेफरेंस-आधारित मार्गदर्शन से अलग-अलग लाइफ़स्टाइल और मौसमी प्रोडक्ट शॉट्स सटीकता से बनाना

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

कई शॉट वाली सीक्वेंस या अधिक मूवमेंट और एक्शन वाले दृश्य जनरेट करने के लिए विशेष इमेज मॉडल।

सुविधाएं:

  • स्थिर फिज़िक्स और सुसंगत ट्रांज़िशन वाली इमेज बनाने में उत्कृष्ट
  • जनरेशन को निर्देशित करने के लिए कई इमेज रेफरेंस का सपोर्ट
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: auto, 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • एक्शन सीन और डायनेमिक कंपोज़िशन

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

Seedream 4 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

मज़बूत प्रॉम्प्ट फिडेलिटी और रेफरेंस इमेज सपोर्ट के साथ Wan 2.5 का इमेज वेरिएंट।

जनरेशन इनपुट:

  • टेक्स्ट-टू-इमेज
  • इमेज रेफरेंस (अधिकतम 2)

सुविधाएं:

  • नेगेटिव प्रॉम्प्ट और seed नियंत्रण
  • एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16

इनके लिए आदर्श:

  • ऐसे स्टिल्स जो Wan वीडियो जनरेशन की लुक से मेल खाते हों
  • प्रॉम्प्ट के अनुरूप कॉन्सेप्ट इमेज

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

Wan 2.5 Image संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

उन्नत इमेज जनरेशन और एडिटिंग के लिए पेशेवर मॉडल, जो मज़बूत सीन एकरूपता और स्टाइल नियंत्रण देता है।

सुविधाएं:

  • विज़ुअल एस्थेटिक को निर्देशित करने के लिए रेफरेंस इमेज की जरूरत वाला इमेज-आधारित स्टाइल नियंत्रण
  • एक बार में अधिकतम 4 इमेज जनरेट करता है

आउटपुट विकल्प:

  • आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21

इनके लिए आदर्श:

  • सटीक स्टाइल आवश्यकताओं वाला पेशेवर कंटेंट

लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग

ऑडियो और टेक्स्ट निर्देशों से संचालित बेहद वास्तविक और प्रतिक्रियाशील अवतार रेंडर करने के लिए बनाया गया अत्याधुनिक डिफ्यूज़न ट्रांसफ़ॉर्मर (DiT) मॉडल।

जनरेशन इनपुट:

  • अवतार (सोर्स इमेज)
  • स्पीच (ऑडियो फ़ाइल)
  • टेक्स्ट विवरण (गाइडेंस)

फ़ीचर्स:

  • बुनियादी लिप-सिंक से आगे बढ़कर कॉन्टेक्स्ट के अनुसार पलक झपकाना, सांस लेना और प्राकृतिक चेहरे के भाव शामिल करता है
  • स्टूडियो-स्तरीय परफ़ॉर्मेंस के लिए आवाज़ के टोन और उतार-चढ़ाव के आधार पर हाथों और पूरे शरीर की गतिविधियों को अपने-आप सिंक करता है
  • परफ़ॉर्मेंस के अनुरूप भावनात्मक अभिव्यक्तियां देने के लिए आवाज़ की तीव्रता और पिच को सटीक रूप से समझता है
  • लंबे डायलॉग या संगीत परफ़ॉर्मेंस में भी कैरेक्टर की उच्च सटीकता और व्यवहारिक एकरूपता बनाए रखता है
  • साइड-एंगल प्रेज़ेंटेशन, पॉडकास्ट-स्टाइल डायलॉग और स्टाइलाइज़्ड ऐनिमेशन सहित कई सेटअप के लिए ऑप्टिमाइज़्ड
  • एक बार में 4 तक वैरिएशन जनरेट करें

आउटपुट विकल्प:

  • रिज़ॉल्यूशन: 480p, 720p

इसके लिए आदर्श:

  • प्रोफ़ेशनल अवतार-आधारित वीडियो विज्ञापन और मार्केटिंग कंटेंट
  • उच्च-सटीकता वाली वर्चुअल स्टोरीटेलिंग और भावपूर्ण संगीत परफ़ॉर्मेंस
  • लगातार कैरेक्टर उपस्थिति वाले लंबे शैक्षिक या ट्रेनिंग वीडियो

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

API: creatify-aurora

तेज़ और सटीक इमेज-टू-वीडियो लिप-सिंक मॉडल, जो किसी स्थिर इमेज को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है।

इनपुट:

  • सोर्स इमेज
  • स्पीच ऑडियो फ़ाइल

फ़ीचर्स:

  • सोर्स इमेज में मुंह और चेहरे के भावों को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है
  • स्थिर इमेज से उच्च-सटीकता वाला “बोलता हुआ” वीडियो बनाता है
  • लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं

इसके लिए आदर्श:

  • स्थिर इमेज से बोलते हुए अवतार बनाना
  • कैरेक्टर पोर्ट्रेट में डायलॉग जोड़ना
  • प्रोफ़ेशनल अवतार-आधारित कंटेंट वर्कफ़्लो

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, इमेज में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।

एक इमेज और ऑडियो इनपुट से बेहद वास्तविक, भावपूर्ण टॉकिंग-हेड वीडियो जनरेट करने के लिए HeyGen का नवीनतम अवतार मॉडल।

इनपुट:

  • सोर्स इमेज
  • स्पीच ऑडियो फ़ाइल

फ़ीचर्स:

  • चेहरे के भावों और होंठों की गतिविधियों को दिए गए ऑडियो से उच्च सटीकता के साथ मिलाता है
  • जीवंत नतीजों के लिए प्राकृतिक सिर की गतिविधि और सूक्ष्म भाव बनाता है
  • लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं

इसके लिए आदर्श:

  • प्रोफ़ेशनल प्रवक्ता और प्रेज़ेंटर वीडियो
  • बड़े पैमाने पर पर्सनलाइज़्ड अवतार कंटेंट बनाना
  • लगातार कैरेक्टर उपस्थिति वाले मार्केटिंग और ट्रेनिंग वीडियो

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, इमेज में साफ़ दिखाई देने वाला चेहरा होना चाहिए।

Sync का नवीनतम वीडियो लिप-सिंक मॉडल, जो कई तरह के कंटेंट में स्टूडियो-क्वालिटी सिंक्रोनाइज़ेशन देता है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • स्पीच ऑडियो

फ़ीचर्स:

  • उच्च-सटीकता वाला लिप-सिंक, जो चेहरे की विशिष्ट डिटेल, प्राकृतिक दांतों और त्वचा की बनावट को बनाए रखता है
  • लाइव-ऐक्शन, 3D ऐनिमेशन और AI-जनरेटेड वीडियो समेत सभी प्रकार के कंटेंट के लिए ऑप्टिमाइज़्ड
  • वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं

इसके लिए आदर्श:

  • फ़िल्म और विज्ञापन के लिए प्रोफ़ेशनल डबिंग और लोकलाइज़ेशन
  • किसी भी वीडियो फ़ॉर्मैट में डायलॉग को बेहतर बनाना या ठीक करना
  • बड़े पैमाने पर कंटेंट ट्रांसलेशन वर्कफ़्लो

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।

एक अत्याधुनिक वीडियो एडिटिंग मॉडल, जो हाई-रिज़ॉल्यूशन आउटपुट तक स्केल करते हुए चेहरे की विशिष्ट डिटेल बनाए रखने वाली स्टूडियो-स्तरीय लिप-सिंकिंग के लिए बनाया गया है।

जनरेशन इनपुट:

  • सोर्स वीडियो
  • स्पीच ऑडियो

फ़ीचर्स:

  • स्पष्ट और प्राकृतिक टेक्स्चर बनाए रखते हुए 4K आउटपुट के लिए एडवांस्ड अपस्केलिंग शामिल करता है
  • प्राकृतिक दांत, झाइयां, मेकअप और जटिल चेहरे के बाल जैसी विशिष्ट विशेषताओं को स्पष्टता खोए बिना सुरक्षित रखता है
  • लाइव-ऐक्शन, 3D ऐनिमेशन और AI-जनरेटेड वीडियो समेत सभी प्रकार के कंटेंट के लिए ऑप्टिमाइज़्ड
  • स्पीकर-विशिष्ट ट्रेनिंग या मॉडल फाइन-ट्यूनिंग के बिना तुरंत भावपूर्ण और सिंक्रनाइज़्ड नतीजे देता है
  • एक साथ 4 तक वैरिएशन जनरेट करें

इसके लिए आदर्श:

  • फ़िल्म और प्रीमियम विज्ञापन के लिए प्रोफ़ेशनल-ग्रेड डबिंग और लोकलाइज़्ड कंटेंट
  • 3D ऐनिमेटेड और AI-जनरेटेड कैरेक्टर में डायलॉग बेहतर बनाना या ठीक करना
  • पिक्सेल-परफ़ेक्ट चेहरे की एकरूपता और डिटेल वाले हाई-रिज़ॉल्यूशन प्रोजेक्ट्स

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहद वास्तविक, इंसानों जैसी लिप-सिंक जनरेट करने के लिए एक खास यूटिलिटी मॉडल।

इनपुट:

  • स्थिर सोर्स इमेज
  • स्पीच ऑडियो फ़ाइल

फ़ीचर्स:

  • सोर्स इमेज में मुंह को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है
  • स्थिर इमेज से उच्च-सटीकता वाला “बोलता हुआ” वीडियो बनाता है
  • लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं

इसके लिए आदर्श:

  • बोलते हुए अवतार बनाना
  • स्थिर इमेज में डायलॉग जोड़ना
  • प्रोफ़ेशनल डबिंग वर्कफ़्लो

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, इमेज में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।

OmniHuman 1.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।

वीडियो पर वास्तविक लिप-सिंक लागू करने के लिए तेज़, किफ़ायती और सटीक यूटिलिटी मॉडल।

इनपुट:

  • सोर्स वीडियो
  • नई स्पीच ऑडियो फ़ाइल

फ़ीचर्स:

  • सोर्स वीडियो में मुंह की गतिविधियों को नए ऑडियो से मेल खाने के लिए फिर से ऐनिमेट करता है
  • वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं

इसके लिए आदर्श:

  • बड़े पैमाने पर किफ़ायती डबिंग
  • कंटेंट ट्रांसलेट करना
  • वास्तविक नतीजों के साथ वीडियो क्लिप में ऑडियो ठीक करना

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।

मौजूदा वीडियो पर वास्तविक लिप-सिंक लागू करने के लिए Veed Lipsync का उच्च-क्वालिटी वाला अगला संस्करण।

इनपुट:

  • सोर्स वीडियो
  • नई स्पीच ऑडियो फ़ाइल

फ़ीचर्स:

  • सोर्स वीडियो में मुंह की गतिविधियों को नए ऑडियो से मेल खाने के लिए फिर से ऐनिमेट करता है
  • वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं
  • एक बार में 4 तक जनरेशन के साथ बैच क्रिएशन

इसके लिए आदर्श:

  • डबिंग और ट्रांसलेशन, जहां लागत से ज़्यादा आउटपुट क्वालिटी अहम हो
  • तैयार क्लिप में डायलॉग ठीक करना

लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग

बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।

इमेज और वीडियो अपस्केलिंग के लिए एक खास यूटिलिटी मॉडल, जिसे रिज़ॉल्यूशन और डिटेल को 4x तक बेहतर बनाने के लिए डिज़ाइन किया गया है।

फ़ीचर्स:

  • मौजूदा मीडिया को प्रोसेस करने वाला एन्हांसमेंट टूल
  • प्राकृतिक टेक्स्चर बनाए रखते हुए और आर्टिफ़ैक्ट कम करते हुए मीडिया का आकार बढ़ाता है
  • बेहद सटीक अपस्केल फ़ैक्टर: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
  • वीडियो के लिए खास: फ़्रेम रेट का लचीला नियंत्रण (सोर्स जैसा रखें या 24, 25, 30, 48, 50 या 60 fps में बदलें)

इसके लिए आदर्श:

  • जनरेटेड मीडिया की क्वालिटी बेहतर बनाना
  • पुराने फ़ुटेज या फ़ोटो को रिस्टोर करना
  • हाई-रिज़ॉल्यूशन डिस्प्ले के लिए एसेट तैयार करना

लागत: इनपुट के अनुसार अलग-अलग

इमेज से बैकग्राउंड हटाता है और उसे अल्फ़ा ट्रांसपेरेंसी के साथ लौटाता है।

इनपुट:

  • सोर्स इमेज

फ़ीचर्स:

  • प्रॉम्प्ट की ज़रूरत नहीं
  • हर रन में एक आउटपुट

इसके लिए आदर्श:

  • प्रोडक्ट कटआउट और कंपोज़िटिंग
  • दूसरी जनरेशन में रेफ़रेंस के रूप में इस्तेमाल के लिए सब्जेक्ट तैयार करना

लागत: इनपुट के अनुसार अलग-अलग

स्टैंडर्ड डायनेमिक रेंज वीडियो को HDR में बदलता है।

इनपुट:

  • सोर्स वीडियो (30s तक)

फ़ीचर्स:

  • प्रॉम्प्ट की ज़रूरत नहीं
  • हर रन में एक आउटपुट; लंबाई और फ़्रेमिंग सोर्स के अनुसार होती है

इसके लिए आदर्श:

  • HDR डिस्प्ले के लिए फ़ुटेज तैयार करना
  • डिलीवरी के लिए जनरेटेड वीडियो को फिर से ग्रेड करना

लागत: वीडियो की अवधि के अनुसार अलग-अलग

अक्सर पूछे जाने वाले सवाल

इमेज और वीडियो की मदद से आप साधारण टेक्स्ट विवरणों और वैकल्पिक रेफरेंस इमेज से उच्च-गुणवत्ता वाला विज़ुअल कंटेंट बना सकते हैं।

अपने इस्तेमाल के हिसाब से आप अलग-अलग इमेज और वीडियो जनरेटिव मॉडल चुन सकते हैं। जनरेट किया गया आपका कंटेंट डाउनलोड किया जा सकता है या सीधे Studio प्रोजेक्ट्स में इंपोर्ट किया जा सकता है।

अगर आप हमारे मुफ़्त प्लान पर हैं, तो आप हर दिन सिर्फ़ तीन इमेज जनरेशन सबमिट कर पाएंगे। वीडियो जनरेशन सिर्फ़ हमारे पेड सब्सक्रिप्शन पर उपलब्ध है।

ज़्यादा जानकारी के लिए, हमारे इमेज और वीडियो दस्तावेज़ देखें।

अगर आप ElevenLabs Grants प्रोग्राम का हिस्सा हैं, तो आप अपने अनुदान क्रेडिट में से 1,000,000 तक का इस्तेमाल इमेज और वीडियो और Flows पर कर सकते हैं।

जनरेशन की लागत आपके इस्तेमाल किए जा रहे मॉडल और चुनी गई सेटिंग्स पर निर्भर करती है। उदाहरण के लिए, वैरिएशन्स की संख्या और रेज़ोल्यूशन से आपसे लिए जाने वाले क्रेडिट की संख्या प्रभावित होगी। 

जनरेशन सबमिट करने से पहले, आपको चुने गए मॉडल और सेटिंग्स के आधार पर लागत दिखाई जाएगी। 

ज़्यादा जानकारी के लिए हमारे Image & Video documentation. देखें

अगर आप हमारे मुफ़्त प्लान पर हैं, तो आप हर दिन सिर्फ़ तीन इमेज जनरेशन सबमिट कर पाएंगे। वीडियो जनरेशन केवल हमारे पेड सब्सक्रिप्शन पर उपलब्ध है।

No results