इमेज और वीडियो
इमेज और वीडियो
टेक्स्ट प्रॉम्प्ट और विज़ुअल रेफरेंस से शानदार इमेज और वीडियो जनरेट और एडिट करें।
परिचय
Image & Video की मदद से आप साधारण टेक्स्ट विवरणों या रेफ़रेंस इमेज से उच्च-गुणवत्ता वाला विज़ुअल कंटेंट बना सकते हैं। किसी भी स्टाइल में स्थिर इमेज या डायनेमिक वीडियो जनरेट करें, फिर अतिरिक्त प्रॉम्प्ट के साथ उन्हें बार-बार बेहतर बनाएं, हाई-रिज़ॉल्यूशन आउटपुट के लिए अपस्केल करें और ऑडियो के साथ लिप-सिंक भी जोड़ें।
नियामक या प्रोवाइडर की आवश्यकताओं के कारण कुछ Image & Video मॉडल और इनपुट अपलोड सुविधाएं संयुक्त राज्य अमेरिका में प्रतिबंधित हैं। खास उपलब्धता के लिए हर मॉडल का विवरण देखें।
मुफ़्त प्लान के यूज़र सिर्फ़ इमेज जनरेट कर सकते हैं और वे हर दिन तीन इमेज रिक्वेस्ट तक सीमित हैं। वीडियो जनरेशन के लिए पेड प्लान चाहिए। API के ज़रिए जनरेट करने के लिए Pro या उससे ऊपर का प्लान चाहिए। API रिक्वेस्ट के लिए ByteDance मॉडल डिफ़ॉल्ट रूप से बंद रहते हैं और इस्तेमाल से पहले स्पष्ट मंज़ूरी चाहिए। Enterprise ग्राहक एक्सेस का अनुरोध करने के लिए सहायता टीम से संपर्क कर सकते हैं।
मुख्य क्षमताएं
- इमेज जनरेशन: स्पीड या क्वालिटी के लिए ऑप्टिमाइज़ किए गए मॉडल के साथ टेक्स्ट प्रॉम्प्ट या रेफ़रेंस इमेज से उच्च-गुणवत्ता वाली इमेज बनाएं
- वीडियो जनरेशन: सिनेमैटिक मोशन, वास्तविक भौतिकी और इंटीग्रेटेड ऑडियो के साथ डायनेमिक वीडियो जनरेट करें। वीडियो जनरेशन सिर्फ़ पेड प्लान पर उपलब्ध है
- बार-बार सुधार: अतिरिक्त प्रॉम्प्ट के साथ जनरेशन को बेहतर बनाएं और वैरिएशन बनाएं
- एन्हांसमेंट टूल्स: रिज़ॉल्यूशन को 4x तक अपस्केल करें और ऑडियो के साथ रियलिस्टिक लिप-सिंक लगाएं
- कई मॉडल: तेज़ी से दोहराव से लेकर प्रोडक्शन-रेडी कंटेंट तक, अलग-अलग उपयोग मामलों के लिए खास मॉडल एक्सेस करें
- रेफ़रेंस सपोर्ट: स्टार्ट फ़्रेम, एंड फ़्रेम और स्टाइल रेफ़रेंस से जनरेशन को गाइड करें। JPG, PNG, WEBP और अन्य कई इमेज फ़ाइल फ़ॉर्मेट सपोर्ट करता है
- लचीला एक्सपोर्ट: स्टैंडअलोन फ़ाइलों के रूप में डाउनलोड करें या सीधे ElevenCreative Studio प्रोजेक्ट्स में इंपोर्ट करें
वर्कफ़्लो
बनाने की प्रक्रिया आपको चार चरणों में प्रेरणा से तैयार एसेट तक ले जाती है:
एक्सप्लोर करें: प्रेरणा पाने और असरदार प्रॉम्प्ट समझने के लिए कम्युनिटी क्रिएशंस देखें।
जनरेट करें: प्रॉम्प्ट बॉक्स में बताएं कि आप क्या बनाना चाहते हैं, मॉडल चुनें और सेटिंग्स को फ़ाइन-ट्यून करें।
दोहराएं और एन्हांस करें: जनरेशन की समीक्षा करें, वैरिएशन बनाएं और अपस्केलिंग व लिप-सिंकिंग जैसे एन्हांसमेंट लागू करें।
एक्सपोर्ट करें: तैयार एसेट डाउनलोड करें या उन्हें सीधे ElevenCreative Studio में भेजें।
समर्थित डाउनलोड फ़ॉर्मैट
वीडियो:
- MP4: कोडेक H.264, H.265। 4K तक की क्वालिटी (अपस्केलिंग के साथ)
इमेज:
- PNG: हाई-रिज़ॉल्यूशन, लॉसलेस आउटपुट
मॉडल
इमेज और वीडियो अलग-अलग उपयोग के लिए ऑप्टिमाइज़ किए गए खास मॉडल्स का एक्सेस देता है। हर मॉडल तेज़ी से बदलाव करने से लेकर प्रोडक्शन-रेडी क्वालिटी तक, अलग क्षमताएं देता है।
पोस्ट-प्रोसेसिंग मॉडल्स के लिए पहले से जनरेट किया गया आउटपुट चाहिए, हालांकि आप अपनी इमेज या वीडियो फ़ाइल भी अपलोड कर सकते हैं।
एंटरप्राइज़ वर्कस्पेस एडमिन यह नियंत्रित कर सकते हैं कि वर्कस्पेस सदस्यों के लिए कौन-से इमेज और वीडियो जनरेशन मॉडल उपलब्ध हों। डिफ़ॉल्ट रूप से, एंटरप्राइज़ वर्कस्पेस के लिए सभी मॉडल अक्षम होते हैं और एडमिन को उन्हें साफ़ तौर पर सक्षम करना होता है। मॉडल अप्रूवल्स के बारे में और जानें।
API रिक्वेस्ट के लिए, ByteDance मॉडल डिफ़ॉल्ट रूप से अक्षम रहते हैं और उपयोग से पहले साफ़ अप्रूवल की जरूरत होती है। एंटरप्राइज़ ग्राहक एक्सेस के लिए सहायता टीम से संपर्क कर सकते हैं।
नीचे दिया गया हर मॉडल इमेज और वीडियो ऐप में उपलब्ध है। जिन मॉडल्स को
इमेज और वीडियो API से भी कॉल किया जा सकता है, उनमें उनका model_id API के तहत दिया है;
बाकी केवल ऐप में उपलब्ध हैं।
वीडियो जनरेटिव मॉडल्स
Seedance 2.0
ऑडियो-वीडियो के साथ जनरेशन वाला एक यूनिफ़ाइड मल्टीमॉडल वीडियो मॉडल, जो बेहद रियलिस्टिक, सिनेमैटिक नतीजों के लिए परफ़ॉर्मेंस, लाइटिंग, शैडो और कैमरा मूवमेंट पर डायरेक्टर-लेवल कंट्रोल देता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़
- वीडियो रेफ़रेंसेज़
- ऑडियो रेफ़रेंसेज़
फ़ीचर्स:
- यूनिफ़ाइड मल्टीमॉडल आर्किटेक्चर, जो एक ही पास में सिंक्रोनाइज़्ड ऑडियो और वीडियो जनरेट करता है
- इंडस्ट्री-लीडिंग मल्टीमॉडल रेफ़रेंस और एडिटिंग क्षमताएं, जो टेक्स्ट, इमेज, ऑडियो और वीडियो इनपुट एक साथ स्वीकार करती हैं
- इंडस्ट्री मानकों के अनुरूप सिनेमैटिक-ग्रेड रियलिज़्म के साथ बेहतरीन मोशन स्थिरता
- परफ़ॉर्मेंस, लाइटिंग, शैडो और कैमरा मूवमेंट पर डायरेक्टर-लेवल क्रिएटिव कंट्रोल
- 4s से 15s तक की लचीली जनरेशन अवधि
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p, 1080p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इसके लिए आदर्श:
- सिंक्रोनाइज़्ड ऑडियो और विज़ुअल्स वाली सिनेमैटिक स्टोरीटेलिंग
- सोर्स इमेज, वीडियो या ऑडियो का सख्ती से पालन करने वाला रेफ़रेंस-आधारित कंटेंट
- लाइटिंग और कैमरा वर्क पर बारीक कंट्रोल चाहने वाली प्रोफ़ेशनल प्रोडक्शंस
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
क्रेडिट खपत एडजस्ट करने के लिए सेटिंग्स को टॉगल किया जा सकता है।
Seedance 2.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedance 2.0 Fast
Seedance 2.0 का तेज़, कम लागत वाला वेरिएंट, जिसमें वही मल्टीमॉडल रेफ़रेंस इनपुट हैं और आउटपुट 720p तक सीमित है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़ (अधिकतम 9)
- वीडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
- ऑडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
फ़ीचर्स:
- Seedance 2.0 जैसा ही रेफ़रेंस हैंडलिंग, जिसमें हर जनरेशन के लिए कुल 12 रेफ़रेंसेज़ की सीमा है
- फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: स्टार्ट या एंड फ़्रेम, या रेफ़रेंसेज़ इस्तेमाल करें—दोनों नहीं
- 4s से 15s तक की लचीली जनरेशन अवधि
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इसके लिए आदर्श:
- फ़ुल-रिज़ॉल्यूशन रेंडर से पहले Seedance 2.0 प्रॉम्प्ट्स पर बदलाव करना
- ऐसे रेफ़रेंस-आधारित क्लिप्स जिनके लिए 720p आउटपुट पर्याप्त है
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
API: bytedance-seedance-v2-fast
Seedance 2.0 Fast संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedance 2.0 Mini
Seedance 2.0 का सबसे छोटा वेरिएंट: Seedance 2.0 से करीब दोगुना तेज़ और लगभग आधी लागत वाला, समान इनपुट और 720p आउटपुट के साथ।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़ (अधिकतम 9)
- वीडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
- ऑडियो रेफ़रेंसेज़ (अधिकतम 3, कुल 15s)
फ़ीचर्स:
- Seedance 2.0 जैसा ही रेफ़रेंस हैंडलिंग, जिसमें हर जनरेशन के लिए कुल 12 रेफ़रेंसेज़ की सीमा है
- फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: स्टार्ट या एंड फ़्रेम, या रेफ़रेंसेज़ इस्तेमाल करें—दोनों नहीं
- 4s से 15s तक की लचीली जनरेशन अवधि
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इसके लिए आदर्श:
- बड़ी संख्या में ड्राफ़्ट और प्रीव्यू
- ऐसे लागत-संवेदनशील वर्कफ़्लो जिनमें फिर भी ऑडियो और रेफ़रेंस इनपुट चाहिए
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
API: bytedance-seedance-v2-mini
Seedance 2.0 Mini संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedance 2.5
Seedance 2.0 का अगला वर्ज़न, जिसमें ज़्यादा शार्प रियलिज़्म, अधिकतम 50 संयुक्त इमेज, वीडियो और ऑडियो रेफ़रेंसेज़, और 30 सेकंड तक की जनरेशन मिलती है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़ (अधिकतम 30)
- वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
- ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
फ़ीचर्स:
- रेफ़रेंस प्रकारों में कोई संयुक्त सीमा नहीं; इमेज या वीडियो के बिना सिर्फ़ ऑडियो रेफ़रेंसेज़ भी स्वीकार किए जाते हैं
- फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते
- 4s से 30s तक की लचीली जनरेशन अवधि
- स्टार्ट फ़्रेम या रेफ़रेंस वीडियो देने पर उसी से आस्पेक्ट रेशियो लिया जाता है
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इसके लिए आदर्श:
- लंबे क्लिप्स, जिन्हें कई रेफ़रेंसेज़ के साथ एकरूप रहना हो
- रेफ़रेंस ऑडियो से चलने वाले डायलॉग और परफ़ॉर्मेंस सीन
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Seedance 2.5 में सीड कंट्रोल उपलब्ध नहीं है।
Seedance 2.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedance 2.5 वीडियो एडिट
बदलावों का वर्णन करके मौजूदा वीडियो को एडिट करता है। आउटपुट की लंबाई और आस्पेक्ट रेशियो इनपुट वीडियो के अनुसार होता है।
जनरेशन इनपुट:
- एडिट करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
- एडिट्स बताने वाला टेक्स्ट प्रॉम्प्ट
- इमेज रेफ़रेंसेज़ (अधिकतम 30)
- अतिरिक्त वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
- ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
फ़ीचर्स:
- अवधि का कोई कंट्रोल नहीं: आउटपुट इनपुट वीडियो की लंबाई के बराबर होता है
- आस्पेक्ट रेशियो इनपुट वीडियो से लिया जाता है
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
इसके लिए आदर्श:
- मौजूदा फ़ुटेज में कपड़े, प्रॉप्स, लाइटिंग या सेटिंग बदलना
- मूल मोशन को बनाए रखने वाला स्टाइल ट्रांसफ़र
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Seedance 2.5 वीडियो एडिट संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedance 2.5 वीडियो एक्सटेंड
प्रॉम्प्ट और वैकल्पिक रेफ़रेंसेज़ के आधार पर मौजूदा वीडियो को उसके अंत से आगे जारी रखता है।
जनरेशन इनपुट:
- एक्सटेंड करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
- कंटिन्यूएशन बताने वाला टेक्स्ट प्रॉम्प्ट
- इमेज रेफ़रेंसेज़ (अधिकतम 30)
- अतिरिक्त वीडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
- ऑडियो रेफ़रेंसेज़ (अधिकतम 10, कुल 30s)
फ़ीचर्स:
- एक्सटेंशन की अवधि 4s से 30s तक
- आस्पेक्ट रेशियो इनपुट वीडियो से लिया जाता है
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
इसके लिए आदर्श:
- बहुत जल्दी खत्म हो जाने वाले शॉट को लंबा करना
- कई जनरेशन को जोड़कर लंबा सीक्वेंस बनाना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Seedance 2.5 वीडियो एक्सटेंड संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling 3.0
एक उन्नत वीडियो मॉडल जो AI डायरेक्टर की तरह काम करता है और जटिल कैमरा मूवमेंट्स में कैरेक्टर्स, आइटम्स और सीन्स के लिए उच्च एकरूपता बनाए रखता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
फ़ीचर्स:
- मल्टी-एंगल इमेज या वीडियो रेफ़रेंसेज़ से कैरेक्टर और सीन को उच्च-गुणवत्ता के साथ बनाए रखता है
- मल्टीलिंगुअल लिप-सिंक और एनवायरनमेंटल साउंड के साथ नेटिव ऑडियो-विज़ुअल को-जनरेशन
- 3s से 15s तक की लचीली जनरेशन अवधि
- एक साथ अधिकतम 4 वेरिएशन जनरेट करें
- टेक्स्ट, फ्लूइड डायनेमिक्स और जटिल फ़िज़िकल इंटरैक्शंस की बेहतर हैंडलिंग
आउटपुट विकल्प:
- रिज़ॉल्यूशन: केवल 1080p
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इसके लिए आदर्श:
- विज़ुअल कंटिन्यूटी चाहने वाली कैरेक्टर-आधारित स्टोरीटेलिंग
- खास टेक्स्ट-रेंडरिंग ज़रूरतों वाले विज्ञापन और एसेट्स
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
बारीक कंट्रोल के लिए नेगेटिव प्रॉम्प्ट्स समर्थित हैं। हर जनरेशन के लिए साउंड सक्षम या अक्षम किया जा सकता है।
Kling 3.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling O3
एक उच्च-एकरूपता वीडियो मॉडल जो AI डायरेक्टर की तरह काम करता है और जटिल कैमरा मूवमेंट्स में कैरेक्टर्स, आइटम्स और सीन्स की पहचान बनाए रखता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- वीडियो रेफ़रेंस
- इमेज रेफ़रेंस
फ़ीचर्स:
- मल्टी-एंगल रेफ़रेंसेज़ से मुख्य कैरेक्टर्स और आइटम्स की सटीक विज़ुअल पहचान बनाए रखता है
- 3s से 15s तक सहज जनरेशन अवधि समर्थित हैं
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
- एलिमेंट इंटरैक्शंस और मोशन कोहेरेंस की सटीक मॉडलिंग
- हर जनरेशन के लिए ऑडियो सक्षम या अक्षम करने का नेटिव सपोर्ट
आउटपुट विकल्प:
- रिज़ॉल्यूशन: केवल 1080p
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इसके लिए आदर्श:
- सख्त विज़ुअल कंटिन्यूटी चाहने वाली कैरेक्टर-आधारित स्टोरीटेलिंग
- आइटम्स की एकरूप रेंडरिंग वाले प्रोफ़ेशनल मार्केटिंग और ब्रांड एसेट्स
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
क्रेडिट खपत एडजस्ट करने के लिए सेटिंग्स को टॉगल किया जा सकता है।
Kling O3 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling O3 एडिट
O3 आर्किटेक्चर पर आधारित एक नैचुरल लैंग्वेज-आधारित वीडियो-टू-वीडियो एडिटिंग मॉडल, जो मैन्युअल मास्किंग या फ़्रेम-दर-फ़्रेम एडजस्टमेंट के बिना कैरेक्टर बदलने और एनवायरनमेंट स्वैप जैसी जटिल विज़ुअल ट्रांसफ़ॉर्मेशन संभव बनाता है।
जनरेशन इनपुट:
- सोर्स वीडियो
- इमेज रेफ़रेंसेज़ (अधिकतम 4 अलग एलिमेंट्स/एंगल्स)
- टेक्स्ट विवरण (नैचुरल लैंग्वेज निर्देश)
फ़ीचर्स:
- मूल मोशन स्ट्रक्चर का सम्मान करते हुए सब्जेक्ट्स या सेटिंग्स बदलने के लिए कन्वर्सेशनल प्रॉम्प्ट्स को समझता है
- पूरे एडिट में मूल कैमरा एंगल्स, मूवमेंट पैटर्न्स और स्पेशल रिलेशनशिप्स बनाए रखता है
- उच्च-गुणवत्ता कैरेक्टर एकरूपता सुनिश्चित करने के लिए फ्रंटल और मल्टी-एंगल इमेज समेत अधिकतम 4 कुल एलिमेंट्स को मिलाता है
- हर जनरेशन के लिए मूल सोर्स ऑडियो बनाए रखने या साइलेंट आउटपुट जनरेट करने का विकल्प
- एक बार में अधिकतम 4 एडिटेड वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: सोर्स वीडियो पर निर्भर
- आस्पेक्ट रेशियो: सोर्स वीडियो के अनुसार
इसके लिए आदर्श:
- मूल मूवमेंट्स बनाए रखते हुए मौजूदा फ़ुटेज में उच्च-गुणवत्ता कैरेक्टर रिप्लेसमेंट
- पूरे सीन एनवायरनमेंट का ट्रांसफ़ॉर्मेशन (जैसे, दिन के शहर को फ़्यूचरिस्टिक नाइटस्केप में बदलना)
- मौजूदा कैमरा डायनेमिक्स का सख्ती से पालन चाहने वाले स्टाइल ट्रांसफ़र्स लागू करना
लागत: वीडियो अवधि और चुनी गई सेटिंग्स के आधार पर अलग-अलग
Kling O3 एडिट संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Google Veo 3.1
उच्च-गुणवत्ता, सिनेमैटिक वीडियो जनरेशन के लिए एक प्रोफ़ेशनल-ग्रेड मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़
फ़ीचर्स:
- नेगेटिव प्रॉम्प्ट्स के साथ बेहतरीन क्वालिटी और क्रिएटिव कंट्रोल
- पूरी तरह इंटीग्रेटेड और सिंक्रोनाइज़्ड ऑडियो
- रियलिस्टिक डायलॉग, लिप-सिंक और साउंड इफेक्ट्स
- तय अवधियां: 4s, 6s और 8s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
- खास साउंड कंट्रोल
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p, 1080p
- आस्पेक्ट रेशियो: 16:9, 9:16
इसके लिए आदर्श:
- पूरे क्रिएटिव कंट्रोल के साथ उच्च-गुणवत्ता, सिनेमैटिक वीडियो जनरेशन
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
API: veo-3.1-generate-001
साउंड सक्षम या अक्षम करने से जनरेशन क्रेडिट्स बदल जाएंगे।
Google Veo 3.1 Fast
तेज़ प्रीव्यू और जनरेशन के लिए ऑप्टिमाइज़ किया गया हाई-स्पीड मॉडल, जो कम लेटेंसी के साथ ज़्यादा शार्प विज़ुअल्स देता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
फ़ीचर्स:
- नेगेटिव प्रॉम्प्ट्स और खास साउंड कंट्रोल के साथ उन्नत क्रिएटिव कंट्रोल
- तय अवधियां: 4s, 6s और 8s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
- रियलिस्टिक मोशन और इंटरैक्शंस के लिए वास्तविक दुनिया की भौतिकी की सटीक मॉडलिंग
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p, 1080p
- आस्पेक्ट रेशियो: 16:9, 9:16
इसके लिए आदर्श:
- तेज़ बदलाव और A/B टेस्टिंग विज़ुअल्स
- तेज़-रफ़्तार सोशल मीडिया कंटेंट बनाना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Google Veo 3.1 Lite
कम कंप्यूट पर तेज़ जनरेशन के लिए ऑप्टिमाइज़ किया गया Veo 3.1 का किफ़ायती, हाई-स्पीड वेरिएंट।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
फ़ीचर्स:
- नेगेटिव प्रॉम्प्ट्स और खास साउंड कंट्रोल के साथ बारीक क्रिएटिव कंट्रोल
- तय अवधियां: 4s, 6s और 8s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: 16:9, 9:16
इसके लिए आदर्श:
- तेज़ी और लागत-दक्षता को प्राथमिकता देने वाला बड़ी मात्रा में कंटेंट निर्माण
- तेज़ कॉन्सेप्ट एक्सप्लोरेशन और प्रीव्यू
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Gemini Omni Flash 1.1
Google का फिज़िक्स-अवेयर वीडियो मॉडल, जिसमें नेटिव ऑडियो, 4K तक आउटपुट, और फ़्रेम इंटरपोलेशन व रेफ़रेंस-गाइडेड जनरेशन दोनों शामिल हैं।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफ़रेंसेज़ (अधिकतम 10)
- वीडियो रेफ़रेंसेज़ (अधिकतम 3, प्रत्येक अधिकतम 10s)
फ़ीचर्स:
- फ़्रेम और रेफ़रेंसेज़ एक साथ इस्तेमाल नहीं हो सकते: फ़्रेम्स के बीच इंटरपोलेट करें या रेफ़रेंसेज़ से गाइड करें
- तय अवधियां 3s से 10s तक; रेफ़रेंस वीडियो अटैच करने पर अवधि उसी के अनुसार होती है
- छोटे ऑन-स्क्रीन टेक्स्ट और लेबल्स की मज़बूत रेंडरिंग
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 360p, 720p, 1080p, 4K
- आस्पेक्ट रेशियो: 16:9, 9:16
इसके लिए आदर्श:
- पढ़ने योग्य टेक्स्ट वाले एक्सप्लेनर्स और काइनेटिक टाइपोग्राफ़ी
- रेफ़रेंसेज़ में एकरूप सब्जेक्ट्स के साथ भौतिक रूप से स्वाभाविक मोशन
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Gemini Omni Flash 1.1 एक्सटेंड
Gemini Omni Flash 1.1 का इस्तेमाल करके मौजूदा वीडियो को उसके अंत से आगे जारी रखता है, जिससे कुल लंबाई 40 सेकंड तक हो सकती है।
जनरेशन इनपुट:
- एक्सटेंड करने के लिए वीडियो (ज़रूरी, अधिकतम 30s)
- कंटिन्यूएशन बताने वाला टेक्स्ट प्रॉम्प्ट
फ़ीचर्स:
- एक्सटेंशन की अवधि 3s से 10s तक
- आस्पेक्ट रेशियो इनपुट वीडियो के अनुसार होता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 360p, 720p, 1080p, 4K
इसके लिए आदर्श:
- बिना दिखने वाले कट के Gemini Omni Flash जनरेशन को लंबा करना
- एक जनरेशन की सीमा से लंबे सीक्वेंस बनाना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Gemini Omni Flash
पहला Gemini Omni वीडियो मॉडल: फिज़िक्स-अवेयर मोशन, नेटिव ऑडियो और उपलब्ध वीडियो मॉडल्स में सबसे मज़बूत ऑन-स्क्रीन टेक्स्ट रेंडरिंग, 720p पर।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- इमेज रेफ़रेंसेज़ (अधिकतम 8)
- वीडियो रेफ़रेंस (1, अधिकतम 10s)
फ़ीचर्स:
- तय अवधियां 3s से 10s तक; रेफ़रेंस वीडियो अटैच करने पर अवधि उसी के अनुसार होती है
- कोई स्टार्ट या एंड फ़्रेम नहीं; इसके बजाय सब्जेक्ट को एंकर करने के लिए इमेज रेफ़रेंसेज़ इस्तेमाल करें
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: 16:9, 9:16
इसके लिए आदर्श:
- छोटे कैप्शंस, टाइटल्स और लेबल वाले एक्सप्लेनर्स
- 720p पर मल्टी-इमेज एकरूपता
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग
Seedance 1.5 Pro
बेहतर टेम्पोरल स्थिरता और कीफ़्रेम के बीच सटीक ट्रांज़िशन नियंत्रण के साथ डायनेमिक, हाई-फिडेलिटी सीक्वेंस बनाने के लिए एक उन्नत विशेष मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
- आखिरी फ़्रेम
विशेषताएं:
- एकसार, मल्टी-शॉट सीक्वेंस के लिए शुरुआती और आखिरी फ़्रेम को सहजता से जोड़ता है
- जटिल गतिविधियों और पर्यावरण की निरंतरता की हाई-फिडेलिटी मॉडलिंग
- 4s से 12s तक की निश्चित जनरेशन अवधि सपोर्ट करता है
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
- हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 420p, 720p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- विशिष्ट विज़ुअल बेंचमार्क के बीच स्थिर फिज़िक्स वाले स्टोरीटेलिंग और एक्शन सीन
- सख्त शुरुआत/अंत आवश्यकताओं वाले सिनेमैटिक ट्रांज़िशन और प्रोफेशनल वीडियो एसेट्स
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Seedance 1.5 Pro को बंद किया जा रहा है। ByteDance इस मॉडल को 11 नवंबर, 2026 को रिटायर कर देगा और यह नई जनरेशन के लिए अब उपलब्ध नहीं है। इसके बजाय Seedance 2.0 मॉडल इस्तेमाल करें। Seedance 1.5 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
FLUX 3
Black Forest Labs का वीडियो मॉडल, जिसमें प्राकृतिक गति, मल्टी-शॉट सीन, जनरेट किया गया ऑडियो और वीडियो एक्सटेंशन शामिल है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
- आखिरी फ़्रेम
- एक्सटेंशन के लिए वीडियो (1, अधिकतम 15s)
विशेषताएं:
- वीडियो एक्सटेंशन को शुरुआती और आखिरी फ़्रेम के साथ इस्तेमाल नहीं किया जा सकता
- 5s से 20s तक की लचीली जनरेशन अवधि
- हर जनरेशन में ऑडियो को चालू या बंद करने के लिए नेटिव साउंड नियंत्रण
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p, 1080p
- आस्पेक्ट रेशियो: 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- एक ही प्रॉम्प्ट से मल्टी-शॉट सीन
- मिलती-जुलती गति और ऑडियो के साथ किसी मौजूदा क्लिप को बढ़ाना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
MiniMax H3
मल्टीमॉडल रेफरेंस, जनरेट किए गए ऑडियो और 4K तक के आउटपुट वाला MiniMax का फ्लैगशिप वीडियो मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
- आखिरी फ़्रेम
- इमेज रेफरेंस (अधिकतम 9)
- वीडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
- ऑडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
विशेषताएं:
- हर जनरेशन में कुल 12 रेफरेंस की सीमा; ऑडियो रेफरेंस के लिए कम से कम एक इमेज या वीडियो रेफरेंस ज़रूरी है
- फ़्रेम और रेफरेंस को एक साथ इस्तेमाल नहीं किया जा सकता
- 5s से 15s तक की लचीली जनरेशन अवधि
- सिंक्रोनाइज़्ड ऑडियो जनरेट करता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 768p, 2K, 4K (2K और 4K को 768p से अपस्केल किया जाता है)
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- ऐसे रेफरेंस-आधारित सीन जिन्हें हाई-रिज़ॉल्यूशन डिलीवरी चाहिए
- रेफरेंस ऑडियो से चलने वाली डायलॉग क्लिप्स
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
MiniMax H3 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
MiniMax H3 Max
MiniMax H3 का लगभग तुरंत परिणाम देने वाला वेरिएंट, जिसमें वही इनपुट और मजबूत विज़ुअल स्टाइल है तथा जिसे 768p तक नेटिव रूप से रेंडर किया जाता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
- आखिरी फ़्रेम
- इमेज रेफरेंस (अधिकतम 9)
- वीडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
- ऑडियो रेफरेंस (अधिकतम 3, हर एक 2s से 15s, कुल 15s)
विशेषताएं:
- हर जनरेशन में कुल 12 रेफरेंस की सीमा; ऑडियो रेफरेंस के लिए कम से कम एक इमेज या वीडियो रेफरेंस ज़रूरी है
- फ़्रेम और रेफरेंस को एक साथ इस्तेमाल नहीं किया जा सकता
- 5s से 15s तक की लचीली जनरेशन अवधि
- सिंक्रोनाइज़्ड ऑडियो जनरेट करता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 768p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- प्रॉम्प्ट और रेफरेंस पर तेज़ी से बदलाव करना
- MiniMax H3 से रेंडर करने से पहले प्रीव्यू
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
MiniMax H3 Max संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling O1
बेहतर प्रॉम्प्ट पालन और जटिल भौतिक दुनिया के सिमुलेशन के लिए बनाया गया अत्याधुनिक रीजनिंग वीडियो मॉडल, जो जटिल निर्देशों को समझने और लागू करने के लिए उन्नत लॉजिकल प्रोसेसिंग का उपयोग करता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो (विवरण)
- शुरुआती फ़्रेम और आखिरी फ़्रेम
- वीडियो रेफरेंस
- इमेज रेफरेंस
विशेषताएं:
- कई स्तरों वाले प्रॉम्प्ट समझने और जटिल क्रमिक गतिविधियां करने की असाधारण क्षमता
- कैरेक्टर और सीन की उच्च निरंतरता बनाए रखने के लिए इमेज और वीडियो, दोनों को विज़ुअल एंकर के रूप में इस्तेमाल करता है
- भौतिक इंटरैक्शन, कारण-और-प्रभाव और फ्लुइड डायनेमिक्स की बेहतर मॉडलिंग
- 5s और 10s क्लिप के लिए हाई-क्वालिटी जनरेशन सपोर्ट करता है
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: इनपुट पर निर्भर
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इनके लिए आदर्श:
- लंबे, विस्तृत विवरणों के सटीक पालन वाले अत्यधिक विशिष्ट क्रिएटिव कॉन्सेप्ट
- प्रोफेशनल स्टोरीटेलिंग, जहां भौतिक यथार्थवाद और मल्टी-रेफरेंस निरंतरता महत्वपूर्ण हो
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Kling O1 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling O1 Edit
नैचुरल लैंग्वेज से चलने वाला वीडियो-टू-वीडियो एडिटिंग मॉडल, जो मैनुअल मास्किंग या फ़्रेम-दर-फ़्रेम बदलाव के बिना कैरेक्टर बदलने और एनवायरनमेंट स्वैप जैसे जटिल विज़ुअल ट्रांसफॉर्मेशन करने देता है।
जनरेशन इनपुट:
- सोर्स वीडियो
- इमेज रेफरेंस (अधिकतम 4 अलग-अलग एलिमेंट/एंगल)
- टेक्स्ट विवरण (नैचुरल लैंग्वेज निर्देश)
विशेषताएं:
- मूल गति संरचना का सम्मान करते हुए विषयों या सेटिंग्स को बदलने के लिए बातचीत वाले प्रॉम्प्ट समझता है
- एडिट के दौरान मूल कैमरा एंगल, मूवमेंट पैटर्न और स्थानिक संबंध बनाए रखता है
- हाई-फिडेलिटी कैरेक्टर निरंतरता सुनिश्चित करने के लिए अधिकतम 4 कुल एलिमेंट (फ्रंटल और मल्टी-एंगल इमेज सहित) जोड़ता है
- मूल सोर्स ऑडियो बनाए रखने या हर जनरेशन के लिए साइलेंट आउटपुट बनाने का विकल्प
- एक बार में अधिकतम 4 एडिट किए गए वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: सोर्स वीडियो पर निर्भर
- आस्पेक्ट रेशियो: सोर्स वीडियो से मेल खाता है
इनके लिए आदर्श:
- मूल मूवमेंट बरकरार रखते हुए मौजूदा फुटेज में हाई-फिडेलिटी कैरेक्टर रिप्लेसमेंट
- पूरे सीन के एनवायरनमेंट ट्रांसफॉर्मेशन (जैसे, दिन के शहर को भविष्य के नाइटस्केप में बदलना)
- ऐसे स्टाइल ट्रांसफर लागू करना जिनके लिए मौजूदा कैमरा डायनेमिक्स का सख्त पालन चाहिए
लागत: वीडियो की अवधि और चुनी गई सेटिंग्स के आधार पर अलग-अलग होती है
Kling O1 Edit संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling 2.6 Motion Control
सटीक मोशन ट्रांसफर के लिए एक विशेष मॉडल, जो आपको किसी कैरेक्टर इमेज को रेफरेंस वीडियो से चलाने और खास मूवमेंट, जेस्चर व कैमरा एंगल दोहराने देता है।
जनरेशन इनपुट:
- कैरेक्टर इमेज (सोर्स)
- मोशन वीडियो (रेफरेंस)
- टेक्स्ट विवरण (वैकल्पिक)
विशेषताएं:
- सटीक मोशन रिप्लिकेशन के लिए “Match Video” या कैरेक्टर में नई क्रिएटिव मोशन जोड़ने के लिए “Match Image” चुनें
- Match Video मोड में 30s तक और Match Image मोड में 10s तक सपोर्ट करता है
- रेफरेंस फुटेज से किसी स्थिर कैरेक्टर तक मानव गति की हाई-फिडेलिटी मैपिंग
- हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: सोर्स पर निर्भर
- आस्पेक्ट रेशियो: सोर्स पर निर्भर
इनके लिए आदर्श:
- कस्टम कैरेक्टर पर जटिल कोरियोग्राफी या विशेष मूवमेंट दोहराना
- उच्च मोशन फिडेलिटी की जरूरत वाला लंबे फॉर्मेट का कैरेक्टर एनीमेशन
- ट्रेंडिंग वीडियो मूवमेंट से चलने वाला सोशल मीडिया कंटेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Kling 2.6 Motion Control संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling 3.0 Motion Control
Kling 3.0 आर्किटेक्चर पर बना सटीक मोशन ट्रांसफर का विशेष मॉडल, जो आपको किसी कैरेक्टर इमेज को रेफरेंस वीडियो से चलाने और बेहतर फिडेलिटी के साथ खास मूवमेंट, जेस्चर व कैमरा एंगल दोहराने देता है।
जनरेशन इनपुट:
- कैरेक्टर इमेज (सोर्स)
- मोशन वीडियो (रेफरेंस)
- टेक्स्ट विवरण (वैकल्पिक)
विशेषताएं:
- सटीक मोशन रिप्लिकेशन के लिए “Match Video” या कैरेक्टर में नई क्रिएटिव मोशन जोड़ने के लिए “Match Image” चुनें
- Match Video मोड में 30s तक और Match Image मोड में 10s तक सपोर्ट करता है
- रेफरेंस फुटेज से किसी स्थिर कैरेक्टर तक मानव गति की हाई-फिडेलिटी मैपिंग
- हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: सोर्स पर निर्भर
- आस्पेक्ट रेशियो: सोर्स पर निर्भर
इनके लिए आदर्श:
- कस्टम कैरेक्टर पर जटिल कोरियोग्राफी या विशेष मूवमेंट दोहराना
- उच्च मोशन फिडेलिटी की जरूरत वाला लंबे फॉर्मेट का कैरेक्टर एनीमेशन
- ट्रेंडिंग वीडियो मूवमेंट से चलने वाला सोशल मीडिया कंटेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Kling 3.0 Motion Control संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling 2.6
बेहतर मोशन फिडेलिटी और स्मूद ट्रांज़िशन के लिए डिज़ाइन किया गया ऑप्टिमाइज़्ड जनरेटिव मॉडल, जो तेज़ इटरेशन और प्रोडक्शन-क्वालिटी विज़ुअल आउटपुट के बीच संतुलन देता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम (इमेज-टू-वीडियो)
विशेषताएं:
- बेहतर मोशन डायनेमिक्स: गति की फ्लुइडिटी और यथार्थवादी फिज़िक्स इंटरैक्शन में महत्वपूर्ण सुधार
- लचीला साउंड नियंत्रण: हर जनरेशन में ऑडियो को चालू या बंद करने का नेटिव सपोर्ट
- बैच क्रिएशन: एक साथ अधिकतम 4 वेरिएशन जनरेट करें
- विस्तृत रिफाइनमेंट: नेगेटिव प्रॉम्प्ट सपोर्ट के जरिए उन्नत क्रिएटिव नियंत्रण
- निश्चित अवधि: 5s और 10s की जनरेशन अवधि सपोर्ट करता है
आउटपुट विकल्प:
- रिज़ॉल्यूशन: इनपुट पर निर्भर
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इनके लिए आदर्श:
- फ्लुइड कैरेक्टर मूवमेंट वाले हाई-एक्शन क्लिप
- मजबूत प्रॉम्प्ट पालन वाला प्रोफेशनल-ग्रेड सोशल मीडिया कंटेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Kling 2.6 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling 2.5
हाई-क्वालिटी, फुल-HD वीडियो जनरेशन के लिए एक संतुलित और बहुमुखी मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
विशेषताएं:
- जटिल गति और यथार्थवादी फिज़िक्स को सिम्युलेट करने में उत्कृष्ट
- फ्लुइड डायनेमिक्स और एक्सप्रेशन को सटीक रूप से मॉडल करता है
- निश्चित अवधि: 5s और 10s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1080p
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इनके लिए आदर्श:
- यथार्थवादी फिज़िक्स सिमुलेशन और जटिल गति
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
आखिरी फ़्रेम फिलहाल सपोर्ट नहीं है। इमेज रेफरेंस नहीं दे सकते। साउंड नियंत्रण उपलब्ध नहीं है।
Kling 2.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Runway Gen-4.5
सिनेमैटिक, बेहद यथार्थवादी वीडियो के लिए अत्याधुनिक मोशन क्वालिटी, प्रॉम्प्ट पालन और विज़ुअल फिडेलिटी।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम (इमेज-टू-वीडियो)
विशेषताएं:
- इंडस्ट्री-लीडिंग यथार्थवाद और फिज़िक्स सिमुलेशन के साथ असाधारण मोशन क्वालिटी
- जटिल सीन पर सटीक क्रिएटिव नियंत्रण के लिए बेहतर प्रॉम्प्ट पालन
- सिनेमैटिक-ग्रेड आउटपुट देने वाली उच्च विज़ुअल फिडेलिटी
- एक साथ अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: 16:9, 9:16
इनके लिए आदर्श:
- सबसे उच्च मोशन क्वालिटी और यथार्थवाद वाला सिनेमैटिक कंटेंट
- सटीक प्रॉम्प्ट पालन की मांग वाली प्रोफेशनल प्रोडक्शंस
- हाई-फिडेलिटी विज़ुअल स्टोरीटेलिंग
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Runway Gen-4 Turbo
तेज़ इटरेशन और किफायती क्रिएशन के लिए डिज़ाइन किया गया उन्नत वीडियो मॉडल, जो हाई-क्वालिटी वीडियो बना सकता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम (इमेज-टू-वीडियो)
विशेषताएं:
- बेहद तेज़ जनरेशन के लिए ऑप्टिमाइज़्ड, जो पिछले इटरेशन से चार गुना तक तेज़ परिणाम देता है
- कैरेक्टर मूवमेंट, कैमरा एंगल और सीन कंपोज़िशन का सटीक निर्देशन देता है
- डायनेमिक सीन में विज़ुअल एकरूपता और स्थिरता बनाए रखने में उत्कृष्ट
- 2s से 10s तक की जनरेशन अवधि सपोर्ट करता है
- एक साथ अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- लगभग तुरंत फीडबैक वाली तेज़ प्रोटोटाइपिंग और क्रिएटिव एक्सपेरिमेंटेशन
- हाई-रिज़ॉल्यूशन मार्केटिंग एसेट्स के लिए तेज़ टर्नअराउंड वाले प्रोफेशनल प्रोजेक्ट्स
- खास कैमरा मूवमेंट आवश्यकताओं वाला सिनेमैटिक कंटेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Runway Gen-4 Aleph
मल्टी-टास्क विज़ुअल जनरेशन के लिए डिज़ाइन किया गया अत्याधुनिक इन-कॉन्टेक्स्ट वीडियो मॉडल, जो सोर्स फुटेज की मूल संरचना बनाए रखते हुए जटिल एडिट कर सकता है।
जनरेशन इनपुट:
- सोर्स वीडियो
- रेफरेंस इमेज
- टेक्स्ट विवरण
विशेषताएं:
- प्राकृतिक लाइटिंग, शैडो और पर्सपेक्टिव के साथ सीन में ऑब्जेक्ट और सब्जेक्ट को सहजता से जोड़ें, हटाएं या बदलें
- यथार्थवादी कलर टेम्परेचर अपडेट के साथ लोकेशन, सीज़न और दिन का समय बदलें (जैसे, बादलों वाले फुटेज को नाटकीय सनसेट में बदलना)
- आसान नैचुरल लैंग्वेज प्रॉम्प्ट से ऐक्टर्स की उम्र और रूप बदलें या कपड़ों व सब्जेक्ट को रीटेक्सचर करें
- सटीक एनीमेशन नियंत्रण के लिए रेफरेंस वीडियो की खास मोशन और कैमरा पाथ को स्थिर इमेज पर लागू करें
- एक मौजूदा वीडियो सीक्वेंस से रिवर्स शॉट या लो एंगल जैसे पूरी तरह नए कैमरा एंगल जनरेट करें
- इसमें सटीक ग्रीन-स्क्रीनिंग (एज डिटेक्शन के साथ आइसोलेशन), कहानी जारी रखने के लिए नेक्स्ट-शॉट जनरेशन और एस्थेटिक स्टाइल ट्रांसफर शामिल हैं
- एक साथ अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: ऑटो
इनके लिए आदर्श:
- डिजिटल डी-एजिंग, रिलाइटिंग और ऑब्जेक्ट रिमूवल जैसे प्रोफेशनल विज़ुअल इफेक्ट्स कार्य
- तेज़ सिनेमैटिक प्रोटोटाइपिंग और एक शॉट से वैकल्पिक कैमरा कवरेज जनरेट करना
- बड़े एनवायरनमेंटल या स्टाइलिस्टिक ट्रांसफॉर्मेशन वाला क्रिएटिव मार्केटिंग कंटेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Runway Aleph 2.0
Runway का वीडियो एडिटिंग मॉडल: गति और निरंतरता बनाए रखते हुए किसी मौजूदा वीडियो को लक्षित लुक की ओर बदलता है।
इनपुट:
- सोर्स वीडियो (ज़रूरी, 2s से 30s)
- टारगेट लुक इमेज (ज़रूरी)
- एडिट का वर्णन करने वाला टेक्स्ट प्रॉम्प्ट
विशेषताएं:
- आउटपुट की लंबाई और फ्रेमिंग सोर्स वीडियो के अनुसार होती है
- टारगेट लुक इमेज से निर्देशित स्टाइल ट्रांसफर
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
इनके लिए आदर्श:
- मौजूदा फुटेज को रिलाइट करना, रीस्टाइल करना या उसकी सेटिंग बदलना
- किसी रेफरेंस इमेज का लुक पूरी क्लिप पर लागू करना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Runway Act-Two
एक विशेष परफॉर्मेंस-ट्रांसफर मॉडल, जो ड्राइविंग वीडियो की गति, स्पीच और चेहरे के भावों को किसी कैरेक्टर इमेज या वीडियो रेफरेंस पर मैप करके कैरेक्टर को एनीमेट करता है।
जनरेशन इनपुट:
- ड्राइविंग परफॉर्मेंस (वीडियो)
- कैरेक्टर इनपुट (इमेज या वीडियो)
विशेषताएं:
- किसी सोर्स ऐक्टर से बारीक चेहरे के भाव, लिप-सिंक और सिंक्रोनाइज़्ड ऑडियो सीधे किसी भी कैरेक्टर पर ट्रांसफर करता है
- अधिक प्राकृतिक लुक के लिए स्थिर कैरेक्टर इमेज में अपने-आप सेकेंडरी मोशन और हल्के कैमरा शेक जोड़ता है
- कैरेक्टर इमेज इस्तेमाल करते समय बॉडी और हाथ की मूवमेंट चालू या बंद करने के लिए सटीक टॉगल
- तीव्र भावनात्मक परफॉर्मेंस और कैरेक्टर की विज़ुअल निरंतरता के बीच संतुलन बनाने के लिए एडजस्ट करने योग्य सेटिंग्स
- ड्राइविंग परफॉर्मेंस के साथ सटीक अलाइनमेंट बनाए रखते हुए जनरेशन के बाद कैरेक्टर की आवाज़ बदलने की क्षमता
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p
- आस्पेक्ट रेशियो: ऑटो
इनके लिए आदर्श:
- यथार्थवादी मानव गति और स्पीच के साथ स्थिर कैरेक्टर पोर्ट्रेट को जीवंत बनाना
- गैर-मानवीय कैरेक्टर या स्टाइलाइज़्ड अवतार को हाई-फिडेलिटी एक्सप्रेशन के साथ एनीमेट करना
- इंटीग्रेटेड बॉडी जेस्चर के साथ टॉकिंग-हेड कंटेंट तेज़ी से बनाना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Seedance 1 Pro
बड़ी मूवमेंट और एक्शन वाले डायनेमिक, मल्टी-शॉट सीक्वेंस बनाने का विशेष मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- शुरुआती फ़्रेम
- आखिरी फ़्रेम
विशेषताएं:
- अत्यधिक स्थिर फिज़िक्स और शॉट्स के बीच सहज ट्रांज़िशन
- निश्चित अवधि: 3s, 4s, 5s, 6s, 7s, 8s, 9s, 10s, 11s, और 12s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
- कई आस्पेक्ट रेशियो विकल्पों के साथ अधिकतम क्रिएटिव लचीलापन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p, 1080p
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- स्थिर फिज़िक्स वाले स्टोरीटेलिंग और एक्शन सीन
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
आस्पेक्ट रेशियो और रिज़ॉल्यूशन जनरेशन क्रेडिट को प्रभावित नहीं करते, लेकिन अवधि करती है।
Seedance 1 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
LTX ऑडियो-टू-वीडियो
एक DiT-आधारित फाउंडेशन मॉडल, जिसे एक ही पास में सिंक्रनाइज़्ड वीडियो और ऑडियो बनाने के लिए डिज़ाइन किया गया है, जिससे सुसंगत स्पीच और वास्तविक गति सुनिश्चित होती है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- इमेज-टू-वीडियो
- ऑडियो-टू-वीडियो
- डेप्थ-टू-वीडियो
सुविधाएं:
- बाहरी टूल के बिना सटीक तालमेल के लिए संवाद, होंठों की गति और परिवेशी ऑडियो एक साथ बनाता है
- स्थिर गति, एकसमान पहचान और मजबूत फ्रेम-टू-फ्रेम सुसंगति वाले डायनामिक दृश्य
- 20 सेकंड तक उच्च-गुणवत्ता वाली सिंक्रनाइज़्ड जनरेशन सपोर्ट करता है
- विस्तृत नेगेटिव प्रॉम्प्ट सपोर्ट के ज़रिए उन्नत क्रिएटिव डायरेक्शन
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p, 1080p
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- सुसंगत स्पीच और भावपूर्ण कैरेक्टर परफॉर्मेंस
- इंटीग्रेटेड परिवेशी ऑडियो और एकसमान टाइमिंग वाले नैरेटिव कॉन्टेंट
- जटिल कैमरा-अवेयर मोशन लॉजिक वाले डायनामिक दृश्य
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
LTX 2 Pro
अधिकतम विज़ुअल डिटेल और स्ट्रक्चरल स्थिरता के लिए ऑप्टिमाइज़ किया गया एक उच्च-गुणवत्ता वाला जनरेटिव मॉडल, जो सहज गति के साथ प्रोडक्शन-ग्रेड 4K आउटपुट दे सकता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम (इमेज-टू-वीडियो)
सुविधाएं:
- गति के बजाय विज़ुअल क्वालिटी और एकरूपता को प्राथमिकता देता है, जिससे लंबे सीक्वेंस में स्थिर नतीजे मिलते हैं
- बेहद सहज और प्रोफेशनल गति के लिए 25 FPS और 50 FPS, दोनों को सपोर्ट करता है
- साउंड को चालू या बंद करने के टॉगल के साथ इंटीग्रेटेड ऑडियो-विज़ुअल जनरेशन
- डिटेल की हानि के बिना नेटिव 1080p, 2k और 4k आउटपुट संभालने के लिए बनाया गया
- एक बार में अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1080p, 2k, 4k
- फ़्रेम रेट: 25 FPS, 50 FPS
- आस्पेक्ट रेशियो: 16:9 (डिफ़ॉल्ट)
- अवधि: 6s, 8s, 10s
इनके लिए आदर्श:
- 4K स्पष्टता वाली हाई-रिज़ॉल्यूशन सिनेमैटिक प्रोडक्शन
- सहज 50 FPS गति की ज़रूरत वाले प्रोफेशनल कॉन्टेंट
- विस्तृत सीक्वेंस, जहां विज़ुअल स्थिरता और स्ट्रक्चरल इंटीग्रिटी अहम हो
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
LTX 2 Retake
एक सटीक AI डायरेक्टिंग टूल, जो कंटिन्यूटी बनाए रखते हुए या पूरे सीक्वेंस को फिर से जनरेट किए बिना मौजूदा शॉट्स में संवाद, भावना और एक्शन को लक्षित रूप से बदलने देता है।
जनरेशन इनपुट:
- सोर्स वीडियो
- टेक्स्ट विवरण
सुविधाएं:
- आसपास के फ़्रेम से मजबूत कॉन्टेक्स्ट प्रिज़र्वेशन बनाए रखते हुए खास सेगमेंट में बदलाव करें
- कैरेक्टर की वॉइस, परफॉर्मेंस और माहौल को एकसमान रखते हुए बोले गए डायलॉग बदलें
- कई एडिट मोड: शॉट के खास एलिमेंट अलग करके फिर से जनरेट करने के लिए “ऑडियो और वीडियो,” “केवल ऑडियो,” या “केवल वीडियो” चुनें
- सहज ट्रांज़िशन के लिए नया कॉन्टेंट मूल गति, लाइटिंग और टोन को स्वाभाविक रूप से अपनाता है
- एक ही शॉट में कैरेक्टर की वैकल्पिक प्रतिक्रियाओं, भावनात्मक पलों या कैमरा मूवमेंट के साथ तुरंत प्रयोग करें
- साथ-साथ क्रिएटिव तुलना के लिए एक साथ अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: केवल 16:9
इनके लिए आदर्श:
- रीशूट या री-रिकॉर्डिंग की ज़रूरत के बिना स्क्रिप्ट में बदलाव और डायलॉग बेहतर बनाना
- पोस्ट-प्रोडक्शन में भावनात्मक पलों या पेसिंग की समस्याओं को ठीक करना
- एक ही मार्केटिंग एसेट में कई ब्रांड मैसेज और कॉल-टू-एक्शन टेस्ट करना
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
LTX 2 Fast
तेज़ फीडबैक लूप और तेज़ी से कॉन्टेंट बनाने के लिए तैयार किया गया गति-ऑप्टिमाइज़्ड जनरेटिव मॉडल, जो रेंडर समय को काफी कम करते हुए हाई-रिज़ॉल्यूशन विज़ुअल देता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम (इमेज-टू-वीडियो)
सुविधाएं:
- स्पीड और तेज़ इटरेशन के लिए इंजीनियर किया गया, जिससे तुरंत विज़ुअल प्रयोग और लगभग तुरंत प्रीव्यू मिलते हैं
- Pro मॉडल की तुलना में कम कंप्यूट ओवरहेड के साथ नेटिव 1080p, 2k और 4k आउटपुट सपोर्ट करता है
- तेज़ गति पर सहज मोशन के लिए 25 FPS और 50 FPS, दोनों की क्षमता
- 20 सेकंड तक की अवधि के लिए सिंक्रनाइज़्ड ऑडियो-विज़ुअल कॉन्टेंट की तेज़ जनरेशन सक्षम करता है
- हर जनरेशन में ऑडियो चालू या बंद करने का नेटिव सपोर्ट
- एक साथ अधिकतम 4 वेरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1080p, 2k, 4k
- फ़्रेम रेट: 25 FPS, 50 FPS
- आस्पेक्ट रेशियो: 16:9 (डिफ़ॉल्ट)
- अवधि: 6s, 8s, 10s, 12s, 14s, 16s, 18s, 20s
इनके लिए आदर्श:
- तेज़ प्रोटोटाइपिंग और क्रिएटिव एक्सप्लोरेशन, जहां अधिकतम डिटेल के बजाय स्पीड प्राथमिकता हो
- तेज़ टर्नअराउंड वाले हाई-वॉल्यूम सोशल मीडिया कॉन्टेंट
- अलग-अलग विज़ुअल कॉन्सेप्ट और मोशन स्टाइल की A/B टेस्टिंग
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Wan 3.0
इमेज, वीडियो और ऑडियो रेफरेंस, जनरेट किए गए ऑडियो और 30 सेकंड तक की जनरेशन वाला एक सिनेमैटिक वीडियो मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफरेंस (अधिकतम 10)
- वीडियो रेफरेंस (अधिकतम 5, कुल 15s)
- ऑडियो रेफरेंस (अधिकतम 5, कुल 15s)
सुविधाएं:
- फ़्रेम और रेफरेंस एक-दूसरे के साथ इस्तेमाल नहीं किए जा सकते
- तय अवधि: 5s, 10s, 15s, 20s और 30s
- हर जनरेशन में ऑडियो चालू या बंद करने के साथ नेटिव साउंड कंट्रोल
- वैकल्पिक प्रॉम्प्ट एन्हांसमेंट
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p, 1080p
- आस्पेक्ट रेशियो: ऑटो, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- प्रॉम्प्ट का अच्छी तरह पालन करने वाले लंबे सिनेमैटिक शॉट्स
- ऑडियो के साथ रेफरेंस-आधारित दृश्य
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Wan 3.0 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Wan 3.0 Prime
Wan 3.0 का तेज़ वेरिएंट, जिसमें वही इनपुट और आउटपुट विकल्प हैं और जो आइडिएशन के लिए उपयुक्त है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम
- एंड फ़्रेम
- इमेज रेफरेंस (अधिकतम 10)
- वीडियो रेफरेंस (अधिकतम 5, कुल 15s)
- ऑडियो रेफरेंस (अधिकतम 5, कुल 15s)
सुविधाएं:
- Wan 3.0 की तुलना में लगभग आधा जनरेशन समय
- तय अवधि: 5s, 10s, 15s, 20s और 30s
- हर जनरेशन में ऑडियो चालू या बंद करने के साथ नेटिव साउंड कंट्रोल
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p, 1080p
- आस्पेक्ट रेशियो: ऑटो, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- अंतिम Wan 3.0 रेंडर से पहले आइडिया एक्सप्लोर करना
- टर्नअराउंड-सेंसिटिव वर्कफ़्लो
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Wan 3.0 Prime संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Wan 2.6
एक नेक्स्ट-जनरेशन सिनेमैटिक वीडियो प्लेटफ़ॉर्म, जो नेटिव ऑडियो सिंक्रनाइज़ेशन और इंटेलिजेंट मल्टी-शॉट सीक्वेंसिंग के साथ प्रोडक्शन-रेडी 1080p कॉन्टेंट देने के लिए यूनिफ़ाइड मल्टीमॉडल आर्किटेक्चर का उपयोग करता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम (इमेज-टू-वीडियो)
- वीडियो रेफरेंस (वीडियो-टू-वीडियो)
- ऑडियो रेफरेंस (वैकल्पिक बैकग्राउंड ऑडियो या डायलॉग)
सुविधाएं:
- यूनिफ़ाइड मल्टीमॉडल सिस्टम: एकसमान आउटपुट क्वालिटी के लिए टेक्स्ट, इमेज, वीडियो और ऑडियो को एक ही इंटीग्रेटेड फ्रेमवर्क में प्रोसेस करता है
- नेटिव ऑडियो सिंक: स्क्रीन पर होने वाली गति के साथ डायलॉग, नैरेशन और पर्यावरणीय साउंड इफेक्ट्स को अपने-आप जनरेट और अलाइन करता है
- इंटेलिजेंट मल्टी-शॉट सीक्वेंसिंग: कैरेक्टर की एकरूपता बनाए रखते हुए कनेक्टेड वीडियो सीक्वेंस को अपने-आप सुसंगत स्टोरी आर्क में व्यवस्थित करता है
- विस्तृत अवधि: 5s, 10s और 15s की तय लंबाई के लिए स्थिर, उच्च-गुणवत्ता वाली जनरेशन सपोर्ट करता है
- उन्नत क्रिएटिव कंट्रोल: विस्तृत डिटेल मैनेजमेंट के लिए नेगेटिव प्रॉम्प्ट और अधिकतम 4 वेरिएशन के बैच क्रिएशन को सपोर्ट करता है
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 720p, 1080p
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- प्रोफेशनल नैरेटिव स्टोरीटेलिंग और जटिल मल्टी-शॉट सिनेमैटिक सीक्वेंस
- इंटीग्रेटेड, उच्च-गुणवत्ता वाले ऑडियो की ज़रूरत वाले सोशल मीडिया विज्ञापन और मार्केटिंग कॉन्टेंट
- वीडियो रेफरेंस के ज़रिए सख्त विज़ुअल और मोशन एकरूपता की ज़रूरत वाला कैरेक्टर-आधारित कॉन्टेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
Wan 2.6 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Wan 2.5 Video
एक बहुमुखी मॉडल जो टेक्स्ट या शुरुआती इमेज से सिनेमैटिक मोशन और उच्च प्रॉम्प्ट फिडेलिटी देता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-वीडियो
- स्टार्ट फ़्रेम (इमेज-टू-वीडियो)
सुविधाएं:
- नेगेटिव प्रॉम्प्ट और समर्पित साउंड कंट्रोल के साथ विस्तृत क्रिएटिव कंट्रोल
- तय अवधि: 5s और 10s
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p, 1080p
- आस्पेक्ट रेशियो: 16:9, 1:1, 9:16
इनके लिए आदर्श:
- प्रॉम्प्ट का अच्छी तरह पालन करने वाला सिनेमैटिक कॉन्टेंट
लागत: चुनी गई सेटिंग्स और अवधि के आधार पर अलग-अलग होती है
जनरेशन की लागत चुनी गई सेटिंग्स के आधार पर अलग-अलग होती है।
Wan 2.5 Video संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
इमेज जनरेटिव मॉडल
GPT Image 2.5 Sunburst
अत्यधिक विस्तृत आउटपुट और सटीक एडिटिंग के लिए OpenAI का प्रोडक्शन-ग्रेड इमेज मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 10)
सुविधाएं:
- Low से Maximum तक पांच क्वालिटी लेवल
- 3:1 तक के आस्पेक्ट रेशियो पर हर साइड में 3840px तक कस्टम रिज़ॉल्यूशन
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K, 4K या कस्टम
- आस्पेक्ट रेशियो: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3
इनके लिए आदर्श:
- अंतिम एसेट्स, जहां डिटेल और फिडेलिटी सबसे अहम हो
- मौजूदा इमेज में सटीक एडिट
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
GPT Image 2.5 Flare
Sunburst जैसे कंट्रोल वाला तेज़ GPT Image 2.5 वेरिएंट, जिसे रोज़मर्रा की हाई-वॉल्यूम जनरेशन के लिए ट्यून किया गया है।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 10)
सुविधाएं:
- Low से Maximum तक पांच क्वालिटी लेवल
- 3:1 तक के आस्पेक्ट रेशियो पर हर साइड में 3840px तक कस्टम रिज़ॉल्यूशन
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K, 4K या कस्टम
- आस्पेक्ट रेशियो: 3:1, 21:9, 2:1, 16:9, 3:2, 4:3, 5:4, 1:1, 4:5, 3:4, 2:3, 9:16, 1:2, 1:3
इनके लिए आदर्श:
- हाई-वॉल्यूम इमेज जनरेशन
- तेज़ इटरेशन, जिनमें फिर भी 4K और कस्टम साइज़ चाहिए
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
API: gpt-image-2.5-flare
GPT Image 2
बेहतर टेक्स्ट रेंडरिंग और हाई-रिज़ॉल्यूशन आउटपुट क्षमताओं के साथ सटीक इमेज जनरेशन के लिए डिज़ाइन किया गया एक उन्नत AI मॉडल।
सुविधाएं:
- सटीक टाइपोग्राफी और स्पष्टता वाली इमेज बनाने के लिए सटीक टेक्स्ट कंट्रोल
- प्रोफेशनल और कमर्शियल उपयोग के लिए उपयुक्त हाई-रिज़ॉल्यूशन PNG आउटपुट
- स्टाइल और कंपोज़िशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 3:2, 1:1, 2:3
- क्वालिटी विकल्प: low, medium, high
इनके लिए आदर्श:
- सटीक टेक्स्ट प्लेसमेंट वाले मार्केटिंग विज़ुअल और डिज़ाइन एसेट्स
- हाई-रिज़ॉल्यूशन की ज़रूरत वाला प्रोफेशनल कॉन्टेंट
- सटीक टेक्स्ट-आधारित इमेज कंट्रोल की ज़रूरत वाले क्रिएटिव प्रोजेक्ट्स
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
API: gpt-image-2
Nano Banana 2
प्रोडक्शन-रेडी क्वालिटी को बेहद तेज़ प्रोसेसिंग के साथ मिलाने वाला एक उन्नत AI इमेज जनरेशन मॉडल, जिसमें बेहतर वर्ल्ड नॉलेज और सब्जेक्ट कंसिस्टेंसी है।
सुविधाएं:
- बिना अपस्केलिंग के क्रिस्टल-क्लियर डिटेल वाला नेटिव 4K रिज़ॉल्यूशन आउटपुट
- केवल 1-2 सेकंड में बेहद तेज़ इमेज जनरेशन
- उन्नत रीजनिंग और निर्देशों का पालन करके बेहतर प्रॉम्प्ट फॉलो करना
- मॉकअप, साइनेज और इन्फोग्राफिक्स के लिए कई भाषाओं में स्पष्ट, सटीक टेक्स्ट रेंडरिंग
- कई कैरेक्टर और ऑब्जेक्ट्स में पहचान बनाए रखने वाली एकसमान मल्टी-सब्जेक्ट स्टाइलिंग
- अधिक सटीक दृश्य जनरेशन के लिए बेहतर वर्ल्ड नॉलेज
- जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
- रिज़ॉल्यूशन: 4K तक
इनके लिए आदर्श:
- रियल-टाइम इटरेशन की ज़रूरत वाले तेज़ क्रिएटिव वर्कफ़्लो
- एकसमान कैरेक्टर पहचान वाला ब्रांड कॉन्टेंट और स्टोरीटेलिंग
- सटीक टेक्स्ट और टाइपोग्राफी वाले प्रोफेशनल विज़ुअल
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Nano Banana 2 Lite
1K पर तेज़ जनरेशन और एडिटिंग के लिए Nano Banana 2 का तेज़, कम लागत वाला वेरिएंट।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 14)
सुविधाएं:
- एकसमान स्पीड और लागत के लिए तय 1K आउटपुट
- Nano Banana 2 जैसी ही 14-इमेज रेफरेंस क्षमता
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K
- आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
इनके लिए आदर्श:
- तेज़ इटरेशन और ड्राफ्ट
- बल्क एडिट, जहां 1K पर्याप्त हो
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Krea 2 Medium
Krea AI का बहुमुखी, प्रोडक्शन-रेडी इमेज जनरेशन मॉडल, जो कई तरह के क्रिएटिव वर्कफ़्लो के लिए क्वालिटी और स्पीड का संतुलन बनाता है।
सुविधाएं:
- प्रॉम्प्ट का अच्छी तरह पालन करने वाली उच्च-गुणवत्ता इमेज जनरेशन
- जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- एकसमान क्वालिटी की ज़रूरत वाला प्रोफेशनल कॉन्टेंट क्रिएशन
- अलग-अलग क्रिएटिव कॉन्सेप्ट में तेज़ इटरेशन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Krea 2 Large
Krea AI का फ्लैगशिप इमेज जनरेशन मॉडल, जो प्रोफेशनल प्रोडक्शन वर्कफ़्लो के लिए अधिकतम विज़ुअल फिडेलिटी और उन्नत क्रिएटिव कंट्रोल देता है।
सुविधाएं:
- प्रोफेशनल-ग्रेड आउटपुट के लिए असाधारण डिटेल और रियलिज़्म
- कई इमेज रेफरेंस सपोर्ट के साथ उन्नत स्टाइल कंट्रोल
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- हाई-एंड कमर्शियल और एडिटोरियल इमेज प्रोडक्शन
- अधिकतम फिडेलिटी की ज़रूरत वाले जटिल क्रिएटिव कंपोज़िशन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Recraft V4.1
मजबूत प्रॉम्प्ट कंट्रोल और साफ कंपोज़िशन वाला डिज़ाइन-केंद्रित टेक्स्ट-टू-इमेज मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
सुविधाएं:
- 2K आउटपुट में Pro मॉडल वेरिएंट का उपयोग होता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K
- आस्पेक्ट रेशियो: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2
इनके लिए आदर्श:
- लेआउट-केंद्रित ग्राफिक्स, आइकन और पोस्टर
- सिर्फ टेक्स्ट से साफ कंपोज़िशन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Recraft V4
एक डिज़ाइन-केंद्रित इमेज मॉडल, जो रेफरेंस इमेज की स्टाइल से मेल खा सकता है।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- स्टाइल रेफरेंस (अधिकतम 10)
सुविधाएं:
- स्टाइल मैच कंट्रोल: Precise रेफरेंस स्टाइल को बारीकी से फॉलो करता है, Flexible सामान्य लुक से मेल खाता है
- 2K आउटपुट में Pro मॉडल वेरिएंट का उपयोग होता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच क्रिएशन
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K
- आस्पेक्ट रेशियो: 2:1, 16:9, 3:2, 14:10, 4:3, 5:4, 1:1, 4:5, 3:4, 10:14, 2:3, 6:10, 9:16, 1:2
इनके लिए आदर्श:
- स्टाइल रेफरेंस के सेट से ब्रांड के अनुरूप ग्राफिक्स
- इलस्ट्रेशन और डिज़ाइन कार्य
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
Seedream 5 Lite
ByteDance का हल्का, तेज़-जनरेशन इमेज मॉडल, जो कम कंप्यूट आवश्यकताओं के साथ उच्च-गुणवत्ता वाले नतीजे देता है।
सुविधाएं:
- तेज़ क्रिएटिव इटरेशन के लिए तेज़ जनरेशन
- जनरेशन को गाइड करने के लिए कई इमेज रेफरेंस सपोर्ट करता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- स्पीड की ज़रूरत वाले हाई-वॉल्यूम इमेज क्रिएशन वर्कफ़्लो
- तेज़ कॉन्सेप्ट एक्सप्लोरेशन और प्रीव्यू
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग होती है
API: bytedance-seedream-5-lite
Seedream 5 Lite संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Seedream 5 Pro
सटीक एडिटिंग, बहुभाषी टेक्स्ट और विस्तृत इन्फोग्राफ़िक्स के लिए उच्च-फिडेलिटी वाला Seedream 5 वेरिएंट।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 10)
सुविधाएं:
- बहुभाषी टेक्स्ट का सटीक रेंडरिंग
- इन्फोग्राफ़िक्स और पोस्टर जैसे घने लेआउट संभालता है
- एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- कई भाषाओं में टेक्स्ट-प्रधान डिज़ाइन
- रेफरेंस का सख्ती से पालन करते हुए मल्टी-इमेज एडिटिंग
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Seedream 5 Pro संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
GPT Image 1.5
सटीक टेक्स्ट-आधारित इमेज जनरेशन और मूल विवरण बनाए रखने वाली जटिल, नॉन-डिस्ट्रक्टिव फोटो एडिटिंग के लिए बनाया गया तेज़ फ्लैगशिप मॉडल।
सुविधाएं:
- सोर्स इमेज में लाइटिंग, कंपोज़िशन और विषय की दिखावट को बरकरार रखते हुए मांगे गए बदलाव भरोसेमंद ढंग से करता है
- एलिमेंट जोड़ने, हटाने, मिलाने और ब्लेंड करने सहित जटिल एडिटिंग कार्यों को सपोर्ट करता है
- पिछले वर्ज़न की तुलना में 4 गुना तक तेज़ आउटपुट देता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 3:2, 1:1, 2:3
- क्वालिटी विकल्प: low, medium, high
इनके लिए आदर्श:
- कपड़ों या हेयरस्टाइल के व्यावहारिक फोटो एडजस्टमेंट और वास्तविक वर्चुअल ट्राय-ऑन
- इनपुट इमेज के मूल भाव को बनाए रखने वाले कॉन्सेप्चुअल ट्रांसफॉर्मेशन और स्टाइलिस्टिक फ़िल्टर
- टेक्स्ट-टू-इमेज कॉन्सेप्ट पर तेज़ी से काम करना
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
API: gpt-image-1.5
GPT Image 1
अच्छे प्रॉम्प्ट पालन, पढ़ने योग्य टेक्स्ट और विस्तृत एडिटिंग वाला OpenAI का पहली पीढ़ी का इमेज मॉडल।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 5)
सुविधाएं:
- तीन क्वालिटी स्तर: Low, Medium, High
- एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 3:2, 1:1, 2:3
इनके लिए आदर्श:
- ऐसे वर्कफ़्लो जो पहले से GPT Image 1 आउटपुट पर बने हैं
- स्टैंडर्ड रिज़ॉल्यूशन पर साधारण एडिट और इमेज में टेक्स्ट वाले कार्य
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
API: gpt-image-1
Seedream 4.5
एक उच्च-प्रदर्शन मल्टीमॉडल फाउंडेशन मॉडल, जो टेक्स्ट-टू-इमेज सिंथेसिस, सटीक इमेज एडिटिंग और जटिल मल्टी-इमेज कंपोज़िशन को एक ही प्रभावी फ्रेमवर्क में एकजुट करता है।
सुविधाएं:
- 4K रिज़ॉल्यूशन तक की उच्च-फिडेलिटी इमेज तेज़ी से जनरेट करने का नेटिव सपोर्ट
- रेफरेंस इनपुट पर आधारित एडिटिंग कार्यों में चेहरे की विशेषताओं, लाइटिंग, रंगों के टोन और बारीक विवरण को असाधारण रूप से बनाए रखता है
- नियंत्रित और एक जैसे नतीजों के लिए कई इनपुट इमेज में टारगेट एलिमेंट की सटीक पहचान और ब्लेंडिंग करता है
- पोस्टर और ब्रांड विज़ुअल के लिए छोटे टेक्स्ट का स्पष्ट, सटीक रेंडरिंग करने के साथ डिज़ाइनर-स्तर की कंपोज़िशन क्षमताएं देता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
- रिज़ॉल्यूशन: 2K, 4K
इनके लिए आदर्श:
- सटीक लेआउट और टाइपोग्राफी की जरूरत वाले पेशेवर ग्राफ़िक डिज़ाइन वर्कफ़्लो
- रेफरेंस पहचान और लाइटिंग का सख्ती से पालन करने वाली जटिल फोटो एडिटिंग
- कई विज़ुअल सोर्स का उपयोग करके हाई-रिज़ॉल्यूशन क्रिएटिव कंपोज़िटिंग
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Seedream 4.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Kling O1 Image
उन्नत रीजनिंग क्षमताओं वाला उच्च-फिडेलिटी इमेज जनरेशन मॉडल, जिसे जटिल कंपोज़िशन में बेहतर प्रॉम्प्ट पालन और सटीक विज़ुअल एकरूपता के लिए डिज़ाइन किया गया है।
सुविधाएं:
- जटिल, बहु-स्तरीय टेक्स्ट विवरण को उच्च सटीकता के साथ समझने और लागू करने की असाधारण क्षमता
- जनरेशन में विषय की पहचान, लाइटिंग और एस्थेटिक स्टाइल बनाए रखने के लिए इमेज रेफरेंस का उपयोग करता है
- वास्तविक टेक्सचर, जटिल स्थानिक संबंधों और पेशेवर स्तर के लाइटिंग इफेक्ट्स के लिए ऑप्टिमाइज़्ड
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: Auto, 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9
- रिज़ॉल्यूशन: 1K, 2K
इनके लिए आदर्श:
- विस्तृत और तकनीकी टेक्स्ट प्रॉम्प्ट का सख्ती से पालन करने वाली पेशेवर क्रिएटिव एसेट्स
- विज़ुअल रेफरेंस का उपयोग करके उच्च-एकरूपता वाली इमेज एडिटिंग और कैरेक्टर डिज़ाइन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Kling O1 Image संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
FLUX.2 [Pro]
पेशेवर वर्कफ़्लो के लिए बनाया गया प्रोडक्शन-ग्रेड इमेज जनरेशन और एडिटिंग मॉडल, जो गति, सटीकता और एकरूपता पर ध्यान देते हुए अत्याधुनिक विज़ुअल क्वालिटी देता है।
सुविधाएं:
- सैकड़ों एसेट्स में उद्योग-अग्रणी कैरेक्टर और पहचान की एकरूपता पाने के लिए एक साथ कई इमेज रेफरेंस करें
- फैब्रिक टेक्सचर से लेकर आर्किटेक्चरल एलिमेंट तक, विवरण की क्वालिटी में अभूतपूर्व सुधार देता है और वास्तविक फोटोग्राफी से अंतर कम करता है
- जटिल टाइपोग्राफी, UI मॉकअप और इन्फोग्राफ़िक्स के लिए प्रोडक्शन-रेडी टेक्स्ट रेंडरिंग देता है
- बिना किसी अनुमान के hex codes के ज़रिए सटीक ब्रांड रंग निर्दिष्ट करने का सपोर्ट
- जटिल दृश्यों में सटीक ऑब्जेक्ट पोज़िशनिंग, वास्तविक फिज़िक्स, सुसंगत लाइटिंग और सही पर्सपेक्टिव सुनिश्चित करता है
- स्ट्रक्चर्ड, जटिल निर्देशों के लिए बेहतर सटीकता और प्रतिक्रिया के अनुसार ऑप्टिमाइज़्ड
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
- रिज़ॉल्यूशन: 720p, 1080p, 2K
इनके लिए आदर्श:
- एक जैसे कैरेक्टर वाले कैंपेन चलाना और किसी भी संदर्भ में प्रोडक्ट को सटीकता से रखना
- पढ़ने योग्य टेक्स्ट और सुसंगत विज़ुअल डिज़ाइन सिस्टम के साथ इंटरफ़ेस मॉकअप बनाना
- बड़े पैमाने पर प्रोडक्ट फोटोग्राफी और संदर्भित लाइफ़स्टाइल शॉट्स जनरेट करना
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Nano Banana Pro
उच्च-फिडेलिटी एसेट प्रोडक्शन, उन्नत क्रिएटिव नियंत्रण और निर्देशों का सटीक पालन करने के लिए बनाया गया पेशेवर-स्तर का, रीजनिंग-आधारित इमेज जनरेशन और एडिटिंग मॉडल।
इनपुट:
- इमेज रेफरेंस
- टेक्स्ट विवरण (जटिल, बहु-स्तरीय प्रॉम्प्ट को सपोर्ट करता है)
सुविधाएं:
- रेंडरिंग से पहले दृश्यों की योजना बनाता है, ताकि फिज़िक्स के अनुरूप लाइटिंग, सटीक ऑब्जेक्ट संबंध और बेहतर प्रॉम्प्ट पालन मिले
- प्रभावशाली पोस्टर और प्रोडक्ट मॉकअप के लिए विभिन्न फ़ॉन्ट स्टाइल और हस्तलिपि में स्पष्ट, पढ़ने योग्य बहुभाषी टेक्स्ट जनरेट करता है
- विभिन्न क्रिएटिव आउटपुट में अधिकतम 5 लोगों और कई ऑब्जेक्ट्स के लिए उच्च फिडेलिटी और समानता बनाए रखता है
- वास्तविक डेटा, वास्तविक दुनिया के ज्ञान और मौसम या खेल जैसी रीयल-टाइम जानकारी से विज़ुअल बेहतर बनाने के लिए Google Search को इंटीग्रेट करता है
- उन्नत लोकलाइज़्ड एडिटिंग टूल से कैमरा एंगल, फोकल पॉइंट और सीन लाइटिंग को समायोजित करें (जैसे दिन को रात में बदलना)
- बेहतर स्थानिक समझ सटीक इन्फोग्राफ़िक्स, तकनीकी डायग्राम और प्रेज़ेंटेशन स्लाइड्स जनरेट करने में मदद करती है
- एक बार में अधिकतम 4 वेरिएशन जनरेट करता है
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 1K, 2K, 4K
- आस्पेक्ट रेशियो: Auto, 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
इनके लिए आदर्श:
- पेशेवर विज्ञापन, ब्रांड एसेट्स और उच्च-स्तरीय ई-कॉमर्स प्रोडक्ट फोटोग्राफी
- शैक्षिक व्याख्याएं, डेटा-आधारित इन्फोग्राफ़िक्स और जटिल तकनीकी दस्तावेज़
- कैरेक्टर या ब्रांड पहचान में एकरूपता के साथ हाई-रिज़ॉल्यूशन विज़ुअल डिज़ाइन की तेज़ प्रोटोटाइपिंग
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
API: gemini-3-pro-image
Nano Banana
टेक्स्ट प्रॉम्प्ट से सीधे तेज़, उच्च-गुणवत्ता वाली इमेज जनरेशन और एडिटिंग के लिए एक हाई-स्पीड मॉडल।
सुविधाएं:
- जनरेशन को निर्देशित करने के लिए कई इमेज रेफरेंस का सपोर्ट
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 21:9, 16:9, 5:4, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16
इनके लिए आदर्श:
- तेज़ इमेज निर्माण और इटरेशन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Runway Gen-4 Image
उच्च-फिडेलिटी इमेज जनरेशन के लिए बनाया गया उन्नत बेस मॉडल, जो दृश्यों के बीच एकरूपता बनाए रखने के लिए अभूतपूर्व स्टाइलिस्टिक नियंत्रण और विज़ुअल मेमोरी देता है।
सुविधाएं:
- कई आउटपुट में पेशेवर-स्तर की एकरूपता बनाए रखने के लिए इनपुट इमेज का उपयोग करके कैरेक्टर, स्टाइल या विशिष्ट ऑब्जेक्ट को एंकर करें
- विज़ुअल विवरण, लाइटिंग और भावनाओं पर सटीक नियंत्रण के लिए जटिल, प्राकृतिक भाषा विवरण समझने हेतु ऑप्टिमाइज़्ड
- सिनेमैटिक स्टोरीबोर्ड से लेकर पेशेवर प्रोडक्ट फोटोग्राफी तक, विभिन्न उपयोगों के लिए उच्च-गुणवत्ता विज़ुअल जनरेट कर सकता है
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
- रिज़ॉल्यूशन: 720p, 1080p
इनके लिए आदर्श:
- यह सुनिश्चित करना कि मुख्य पात्र अलग-अलग वातावरण और लाइटिंग ट्रीटमेंट में भी अपनी दिखावट बनाए रखें
- हाई-रिज़ॉल्यूशन ब्रांड एसेट्स, वर्चुअल ट्राय-ऑन और बड़े पैमाने के लिए तैयार प्रोडक्ट विज़ुअलाइज़ेशन तेज़ी से बनाना
- इमेज रेफरेंस के ज़रिए मुख्य विज़ुअल पहचान तय रखते हुए अलग-अलग कलात्मक दिशाओं को एक्सप्लोर करना
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Runway Gen-4 Image Turbo
गति के लिए तैयार किया गया ऑप्टिमाइज़्ड इमेज जनरेशन मॉडल, जो समान आउटपुट क्वालिटी बनाए रखते हुए स्टैंडर्ड Gen-4 Image से 2.5 गुना तेज़ परिणाम देता है।
सुविधाएं:
- ऑप्टिमाइज़्ड प्रोसेसिंग कम समय में उच्च-फिडेलिटी इमेज जनरेट करके तेज़ क्रिएटिव एक्सप्लोरेशन की सुविधा देती है
- मॉडल को विशिष्ट कैरेक्टर, वातावरण और कलात्मक स्टाइल समझने में मदद करने के लिए अधिकतम तीन रेफरेंस इमेज अपलोड करें
- कई जनरेशन में पहचान बनाए रखने के लिए रेफरेंस इमेज से विशिष्ट विज़ुअल विशेषताओं को एन्कोड करके विज़ुअल ड्रिफ्ट की चुनौती हल करता है
- रेफरेंस इमेज की एस्थेटिक, लाइटिंग और टेक्सचर को बिल्कुल नए विषयों और दृश्यों पर आसानी से लागू करें
- वेरिएशन को व्यवस्थित ढंग से एक्सप्लोर करने या सटीकता से विशिष्ट आउटपुट दोबारा बनाने के लिए seed पैरामीटर इस्तेमाल करें
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
- रिज़ॉल्यूशन: 720p, 1080p
इनके लिए आदर्श:
- Instagram Stories (9:16) या स्टैंडर्ड पोस्ट (1:1) के लिए प्लेटफ़ॉर्म-ऑप्टिमाइज़्ड विज़ुअल बड़े पैमाने पर तेज़ी से बनाना
- ब्रांड स्टाइल गाइड को रेफरेंस इमेज के रूप में इस्तेमाल करके कैंपेन में सख्त विज़ुअल पहचान बनाए रखना
- मुख्य पात्र की पहचान बनी रहे, यह सुनिश्चित करते हुए एक जैसे कैरेक्टर पोज़ और सेटिंग्स विकसित करना
- रेफरेंस-आधारित मार्गदर्शन से अलग-अलग लाइफ़स्टाइल और मौसमी प्रोडक्ट शॉट्स सटीकता से बनाना
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Seedream 4
कई शॉट वाली सीक्वेंस या अधिक मूवमेंट और एक्शन वाले दृश्य जनरेट करने के लिए विशेष इमेज मॉडल।
सुविधाएं:
- स्थिर फिज़िक्स और सुसंगत ट्रांज़िशन वाली इमेज बनाने में उत्कृष्ट
- जनरेशन को निर्देशित करने के लिए कई इमेज रेफरेंस का सपोर्ट
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: auto, 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- एक्शन सीन और डायनेमिक कंपोज़िशन
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Seedream 4 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Wan 2.5 Image
मज़बूत प्रॉम्प्ट फिडेलिटी और रेफरेंस इमेज सपोर्ट के साथ Wan 2.5 का इमेज वेरिएंट।
जनरेशन इनपुट:
- टेक्स्ट-टू-इमेज
- इमेज रेफरेंस (अधिकतम 2)
सुविधाएं:
- नेगेटिव प्रॉम्प्ट और seed नियंत्रण
- एक बार में अधिकतम 4 जनरेशन के साथ बैच निर्माण
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 16:9, 4:3, 1:1, 3:4, 9:16
इनके लिए आदर्श:
- ऐसे स्टिल्स जो Wan वीडियो जनरेशन की लुक से मेल खाते हों
- प्रॉम्प्ट के अनुरूप कॉन्सेप्ट इमेज
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
Wan 2.5 Image संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
FLUX.1 Kontext [Pro]
उन्नत इमेज जनरेशन और एडिटिंग के लिए पेशेवर मॉडल, जो मज़बूत सीन एकरूपता और स्टाइल नियंत्रण देता है।
सुविधाएं:
- विज़ुअल एस्थेटिक को निर्देशित करने के लिए रेफरेंस इमेज की जरूरत वाला इमेज-आधारित स्टाइल नियंत्रण
- एक बार में अधिकतम 4 इमेज जनरेट करता है
आउटपुट विकल्प:
- आस्पेक्ट रेशियो: 21:9, 16:9, 4:3, 3:2, 1:1, 2:3, 3:4, 4:5, 9:16, 9:21
इनके लिए आदर्श:
- सटीक स्टाइल आवश्यकताओं वाला पेशेवर कंटेंट
लागत: चुनी गई सेटिंग्स और वेरिएशन की संख्या के आधार पर अलग-अलग
लिप-सिंक मॉडल
Creatify Aurora
ऑडियो और टेक्स्ट निर्देशों से संचालित बेहद वास्तविक और प्रतिक्रियाशील अवतार रेंडर करने के लिए बनाया गया अत्याधुनिक डिफ्यूज़न ट्रांसफ़ॉर्मर (DiT) मॉडल।
जनरेशन इनपुट:
- अवतार (सोर्स इमेज)
- स्पीच (ऑडियो फ़ाइल)
- टेक्स्ट विवरण (गाइडेंस)
फ़ीचर्स:
- बुनियादी लिप-सिंक से आगे बढ़कर कॉन्टेक्स्ट के अनुसार पलक झपकाना, सांस लेना और प्राकृतिक चेहरे के भाव शामिल करता है
- स्टूडियो-स्तरीय परफ़ॉर्मेंस के लिए आवाज़ के टोन और उतार-चढ़ाव के आधार पर हाथों और पूरे शरीर की गतिविधियों को अपने-आप सिंक करता है
- परफ़ॉर्मेंस के अनुरूप भावनात्मक अभिव्यक्तियां देने के लिए आवाज़ की तीव्रता और पिच को सटीक रूप से समझता है
- लंबे डायलॉग या संगीत परफ़ॉर्मेंस में भी कैरेक्टर की उच्च सटीकता और व्यवहारिक एकरूपता बनाए रखता है
- साइड-एंगल प्रेज़ेंटेशन, पॉडकास्ट-स्टाइल डायलॉग और स्टाइलाइज़्ड ऐनिमेशन सहित कई सेटअप के लिए ऑप्टिमाइज़्ड
- एक बार में 4 तक वैरिएशन जनरेट करें
आउटपुट विकल्प:
- रिज़ॉल्यूशन: 480p, 720p
इसके लिए आदर्श:
- प्रोफ़ेशनल अवतार-आधारित वीडियो विज्ञापन और मार्केटिंग कंटेंट
- उच्च-सटीकता वाली वर्चुअल स्टोरीटेलिंग और भावपूर्ण संगीत परफ़ॉर्मेंस
- लगातार कैरेक्टर उपस्थिति वाले लंबे शैक्षिक या ट्रेनिंग वीडियो
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
API: creatify-aurora
Veed Fabric
तेज़ और सटीक इमेज-टू-वीडियो लिप-सिंक मॉडल, जो किसी स्थिर इमेज को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है।
इनपुट:
- सोर्स इमेज
- स्पीच ऑडियो फ़ाइल
फ़ीचर्स:
- सोर्स इमेज में मुंह और चेहरे के भावों को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है
- स्थिर इमेज से उच्च-सटीकता वाला “बोलता हुआ” वीडियो बनाता है
- लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं
इसके लिए आदर्श:
- स्थिर इमेज से बोलते हुए अवतार बनाना
- कैरेक्टर पोर्ट्रेट में डायलॉग जोड़ना
- प्रोफ़ेशनल अवतार-आधारित कंटेंट वर्कफ़्लो
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, इमेज में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।
HeyGen Avatar 4
एक इमेज और ऑडियो इनपुट से बेहद वास्तविक, भावपूर्ण टॉकिंग-हेड वीडियो जनरेट करने के लिए HeyGen का नवीनतम अवतार मॉडल।
इनपुट:
- सोर्स इमेज
- स्पीच ऑडियो फ़ाइल
फ़ीचर्स:
- चेहरे के भावों और होंठों की गतिविधियों को दिए गए ऑडियो से उच्च सटीकता के साथ मिलाता है
- जीवंत नतीजों के लिए प्राकृतिक सिर की गतिविधि और सूक्ष्म भाव बनाता है
- लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं
इसके लिए आदर्श:
- प्रोफ़ेशनल प्रवक्ता और प्रेज़ेंटर वीडियो
- बड़े पैमाने पर पर्सनलाइज़्ड अवतार कंटेंट बनाना
- लगातार कैरेक्टर उपस्थिति वाले मार्केटिंग और ट्रेनिंग वीडियो
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, इमेज में साफ़ दिखाई देने वाला चेहरा होना चाहिए।
Sync 3
Sync का नवीनतम वीडियो लिप-सिंक मॉडल, जो कई तरह के कंटेंट में स्टूडियो-क्वालिटी सिंक्रोनाइज़ेशन देता है।
जनरेशन इनपुट:
- सोर्स वीडियो
- स्पीच ऑडियो
फ़ीचर्स:
- उच्च-सटीकता वाला लिप-सिंक, जो चेहरे की विशिष्ट डिटेल, प्राकृतिक दांतों और त्वचा की बनावट को बनाए रखता है
- लाइव-ऐक्शन, 3D ऐनिमेशन और AI-जनरेटेड वीडियो समेत सभी प्रकार के कंटेंट के लिए ऑप्टिमाइज़्ड
- वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं
इसके लिए आदर्श:
- फ़िल्म और विज्ञापन के लिए प्रोफ़ेशनल डबिंग और लोकलाइज़ेशन
- किसी भी वीडियो फ़ॉर्मैट में डायलॉग को बेहतर बनाना या ठीक करना
- बड़े पैमाने पर कंटेंट ट्रांसलेशन वर्कफ़्लो
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।
Sync Lipsync 2 Pro
एक अत्याधुनिक वीडियो एडिटिंग मॉडल, जो हाई-रिज़ॉल्यूशन आउटपुट तक स्केल करते हुए चेहरे की विशिष्ट डिटेल बनाए रखने वाली स्टूडियो-स्तरीय लिप-सिंकिंग के लिए बनाया गया है।
जनरेशन इनपुट:
- सोर्स वीडियो
- स्पीच ऑडियो
फ़ीचर्स:
- स्पष्ट और प्राकृतिक टेक्स्चर बनाए रखते हुए 4K आउटपुट के लिए एडवांस्ड अपस्केलिंग शामिल करता है
- प्राकृतिक दांत, झाइयां, मेकअप और जटिल चेहरे के बाल जैसी विशिष्ट विशेषताओं को स्पष्टता खोए बिना सुरक्षित रखता है
- लाइव-ऐक्शन, 3D ऐनिमेशन और AI-जनरेटेड वीडियो समेत सभी प्रकार के कंटेंट के लिए ऑप्टिमाइज़्ड
- स्पीकर-विशिष्ट ट्रेनिंग या मॉडल फाइन-ट्यूनिंग के बिना तुरंत भावपूर्ण और सिंक्रनाइज़्ड नतीजे देता है
- एक साथ 4 तक वैरिएशन जनरेट करें
इसके लिए आदर्श:
- फ़िल्म और प्रीमियम विज्ञापन के लिए प्रोफ़ेशनल-ग्रेड डबिंग और लोकलाइज़्ड कंटेंट
- 3D ऐनिमेटेड और AI-जनरेटेड कैरेक्टर में डायलॉग बेहतर बनाना या ठीक करना
- पिक्सेल-परफ़ेक्ट चेहरे की एकरूपता और डिटेल वाले हाई-रिज़ॉल्यूशन प्रोजेक्ट्स
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
OmniHuman 1.5
बेहद वास्तविक, इंसानों जैसी लिप-सिंक जनरेट करने के लिए एक खास यूटिलिटी मॉडल।
इनपुट:
- स्थिर सोर्स इमेज
- स्पीच ऑडियो फ़ाइल
फ़ीचर्स:
- सोर्स इमेज में मुंह को दिए गए ऑडियो से मेल खाने के लिए ऐनिमेट करता है
- स्थिर इमेज से उच्च-सटीकता वाला “बोलता हुआ” वीडियो बनाता है
- लिप-सिंक के लिए खास टूल है, पूरा वीडियो जनरेशन मॉडल नहीं
इसके लिए आदर्श:
- बोलते हुए अवतार बनाना
- स्थिर इमेज में डायलॉग जोड़ना
- प्रोफ़ेशनल डबिंग वर्कफ़्लो
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, इमेज में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।
OmniHuman 1.5 संयुक्त राज्य अमेरिका में उपलब्ध नहीं है।
Veed Lipsync
वीडियो पर वास्तविक लिप-सिंक लागू करने के लिए तेज़, किफ़ायती और सटीक यूटिलिटी मॉडल।
इनपुट:
- सोर्स वीडियो
- नई स्पीच ऑडियो फ़ाइल
फ़ीचर्स:
- सोर्स वीडियो में मुंह की गतिविधियों को नए ऑडियो से मेल खाने के लिए फिर से ऐनिमेट करता है
- वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं
इसके लिए आदर्श:
- बड़े पैमाने पर किफ़ायती डबिंग
- कंटेंट ट्रांसलेट करना
- वास्तविक नतीजों के साथ वीडियो क्लिप में ऑडियो ठीक करना
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।
Veed Lipsync 2.0
मौजूदा वीडियो पर वास्तविक लिप-सिंक लागू करने के लिए Veed Lipsync का उच्च-क्वालिटी वाला अगला संस्करण।
इनपुट:
- सोर्स वीडियो
- नई स्पीच ऑडियो फ़ाइल
फ़ीचर्स:
- सोर्स वीडियो में मुंह की गतिविधियों को नए ऑडियो से मेल खाने के लिए फिर से ऐनिमेट करता है
- वीडियो-टू-वीडियो लिप-सिंक टूल है, पूरा वीडियो जनरेटर नहीं
- एक बार में 4 तक जनरेशन के साथ बैच क्रिएशन
इसके लिए आदर्श:
- डबिंग और ट्रांसलेशन, जहां लागत से ज़्यादा आउटपुट क्वालिटी अहम हो
- तैयार क्लिप में डायलॉग ठीक करना
लागत: इनपुट, सेटिंग्स और अवधि के अनुसार अलग-अलग
बेहतरीन नतीजों के लिए, वीडियो में कोई पहचाना जा सकने वाला व्यक्ति होना चाहिए।
यूटिलिटी मॉडल
Topaz Upscale
इमेज और वीडियो अपस्केलिंग के लिए एक खास यूटिलिटी मॉडल, जिसे रिज़ॉल्यूशन और डिटेल को 4x तक बेहतर बनाने के लिए डिज़ाइन किया गया है।
फ़ीचर्स:
- मौजूदा मीडिया को प्रोसेस करने वाला एन्हांसमेंट टूल
- प्राकृतिक टेक्स्चर बनाए रखते हुए और आर्टिफ़ैक्ट कम करते हुए मीडिया का आकार बढ़ाता है
- बेहद सटीक अपस्केल फ़ैक्टर: 1x, 1.25x, 1.5x, 1.75x, 2x, 3x, 4x
- वीडियो के लिए खास: फ़्रेम रेट का लचीला नियंत्रण (सोर्स जैसा रखें या 24, 25, 30, 48, 50 या 60 fps में बदलें)
इसके लिए आदर्श:
- जनरेटेड मीडिया की क्वालिटी बेहतर बनाना
- पुराने फ़ुटेज या फ़ोटो को रिस्टोर करना
- हाई-रिज़ॉल्यूशन डिस्प्ले के लिए एसेट तैयार करना
लागत: इनपुट के अनुसार अलग-अलग
बैकग्राउंड रिमूवल
इमेज से बैकग्राउंड हटाता है और उसे अल्फ़ा ट्रांसपेरेंसी के साथ लौटाता है।
इनपुट:
- सोर्स इमेज
फ़ीचर्स:
- प्रॉम्प्ट की ज़रूरत नहीं
- हर रन में एक आउटपुट
इसके लिए आदर्श:
- प्रोडक्ट कटआउट और कंपोज़िटिंग
- दूसरी जनरेशन में रेफ़रेंस के रूप में इस्तेमाल के लिए सब्जेक्ट तैयार करना
लागत: इनपुट के अनुसार अलग-अलग
Runway Ruby
स्टैंडर्ड डायनेमिक रेंज वीडियो को HDR में बदलता है।
इनपुट:
- सोर्स वीडियो (30s तक)
फ़ीचर्स:
- प्रॉम्प्ट की ज़रूरत नहीं
- हर रन में एक आउटपुट; लंबाई और फ़्रेमिंग सोर्स के अनुसार होती है
इसके लिए आदर्श:
- HDR डिस्प्ले के लिए फ़ुटेज तैयार करना
- डिलीवरी के लिए जनरेटेड वीडियो को फिर से ग्रेड करना
लागत: वीडियो की अवधि के अनुसार अलग-अलग