画像&ビデオ

テキストプロンプトと視覚的な参照画像から、美しい画像やビデオを生成・編集します。

概要

画像&ビデオでは、簡単なテキスト説明や参照画像から高品質なビジュアルコンテンツを作成できます。あらゆるスタイルの静止画やダイナミックなビデオを生成し、追加プロンプトで繰り返し調整したり、高解像度出力用にアップスケールしたり、オーディオに合わせたリップシンクを追加したりできます。

一部の画像&ビデオモデルおよび入力アップロード機能は、規制またはプロバイダーの要件により、米国では利用が制限されています。具体的な 利用可否については、各モデルの説明をご確認ください。

無料プランのユーザーは画像のみ生成でき、1日あたりの画像リクエストは3件までです。ビデオ 生成には有料プランが必要です。APIでの生成にはプロプラン以上が必要です。API リクエストでは、ByteDanceモデルはデフォルトで無効になっており、使用には明示的な承認が必要です。 エンタープライズのお客様は、サポートにお問い合わせのうえアクセスをリクエストできます。

主な機能

  • 画像生成:速度または品質に最適化されたモデルを使用して、テキストプロンプトや参照画像から高品質な画像を作成
  • ビデオ生成:映画のような動き、リアルな物理表現、統合オーディオを備えたダイナミックなビデオを生成。ビデオ生成は有料プランでのみ利用できます
  • 反復的な調整:追加のプロンプトで生成結果を調整し、バリエーションを作成
  • 強化ツール:解像度を最大4倍までアップスケールし、オーディオに合わせたリアルなリップシンクを適用
  • 複数モデル:迅速な反復から本番向けコンテンツまで、さまざまなユースケースに特化したモデルを利用
  • 参照のサポート:開始フレーム、終了フレーム、スタイル参照で生成を誘導。JPG、PNG、WEBPなど、幅広い画像ファイル形式に対応
  • 柔軟なエクスポート:単体ファイルとしてダウンロードするか、ElevenCreative Studioプロジェクトに直接インポート

ワークフロー

作成プロセスは、着想から完成したアセットまでを4つのステップで進めます。

探索: コミュニティの作品を見つけてインスピレーションを得たり、効果的なプロンプトを学んだりできます。

生成: プロンプトボックスに作成したい内容を記述し、モデルを選択して設定を微調整します。

反復と強化: 生成結果を確認し、バリエーションを作成して、アップスケーリングやリップシンクなどの強化を適用します。

エクスポート: 完成したアセットをダウンロードするか、ElevenCreative Studioに直接送信します。

対応ダウンロード形式

ビデオ:

  • MP4:コーデックH.264、H.265。最大4K品質(アップスケーリング使用時)

画像:

  • PNG:高解像度、ロスレス出力

モデル

画像&ビデオでは、さまざまな用途に最適化された専用モデルを利用できます。各モデルは、迅速な反復から本番品質まで、それぞれ独自の機能を提供します。

後処理モデルには既存の生成出力が必要ですが、独自の画像またはビデオファイルをアップロードすることもできます。

エンタープライズワークスペースの管理者は、ワークスペースメンバーが利用できる画像・ビデオ生成モデルを管理できます。 デフォルトでは、エンタープライズワークスペースではすべてのモデルが無効になっており、管理者が明示的に有効化する必要があります。詳細はモデルの 承認をご覧ください。

APIリクエストでは、ByteDanceモデルはデフォルトで無効になっており、使用前に明示的な承認が必要です。 エンタープライズのお客様は、サポートにお問い合わせいただくことでアクセスを申請できます。

以下のすべてのモデルは画像&ビデオアプリで利用できます。画像&ビデオAPIからも 呼び出せるモデルには、APIの下にmodel_idが記載されています。その他はアプリ専用です。

オーディオとビデオを同時生成する統合マルチモーダルビデオモデルです。演技、照明、影、カメラワークを監督レベルで制御でき、極めてリアルで映画のような結果を実現します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス
  • ビデオリファレンス
  • オーディオリファレンス

機能:

  • 同期されたオーディオとビデオを1回の処理で同時生成する統合マルチモーダルアーキテクチャ
  • テキスト、画像、オーディオ、ビデオ入力を同時に受け付ける、業界トップクラスのマルチモーダルリファレンス・編集機能
  • 業界標準に沿った映画品質のリアリズムを備える、優れたモーション安定性
  • 演技、照明、影、カメラワークに対する監督レベルのクリエイティブ制御
  • 4秒から15秒までの柔軟な生成時間
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p、1080p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 同期したオーディオと映像が必要な映画的ストーリーテリング
  • 元画像、ビデオ、オーディオへの厳密な準拠が求められるリファレンス主導コンテンツ
  • 照明とカメラワークの細かな制御が必要なプロダクション

**料金:**選択した設定と時間により異なります

API:bytedance-seedance-v2

設定を切り替えることで、クレジット消費量を調整できます。

Seedance 2.0は米国では利用できません。

Seedance 2.0と同じマルチモーダルリファレンス入力を備え、出力を720pに制限した、より高速かつ低コストのバリアントです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大9件)
  • ビデオリファレンス(最大3件、合計15秒)
  • オーディオリファレンス(最大3件、合計15秒)

機能:

  • Seedance 2.0と同じリファレンス処理。生成あたりのリファレンス合計上限は12件
  • フレームとリファレンスは排他的です。開始・終了フレームまたはリファレンスのいずれかを使用し、両方は使用できません
  • 4秒から15秒までの柔軟な生成時間
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • フル解像度でレンダリングする前のSeedance 2.0プロンプトの反復
  • 720p出力で十分なリファレンス主導クリップ

**料金:**選択した設定と時間により異なります

API:bytedance-seedance-v2-fast

Seedance 2.0 Fastは米国では利用できません。

最小のSeedance 2.0バリアントです。Seedance 2.0の約2倍の速度、約半分のコストで、同じ入力と720p出力を提供します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大9件)
  • ビデオリファレンス(最大3件、合計15秒)
  • オーディオリファレンス(最大3件、合計15秒)

機能:

  • Seedance 2.0と同じリファレンス処理。生成あたりのリファレンス合計上限は12件
  • フレームとリファレンスは排他的です。開始・終了フレームまたはリファレンスのいずれかを使用し、両方は使用できません
  • 4秒から15秒までの柔軟な生成時間
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 大量のドラフトとプレビュー
  • オーディオとリファレンス入力を必要としながら、コストを重視するワークフロー

**料金:**選択した設定と時間により異なります

API:bytedance-seedance-v2-mini

Seedance 2.0 Miniは米国では利用できません。

より鮮明なリアリズム、画像・ビデオ・オーディオを合わせて最大50件のリファレンス、最長30秒の生成を提供するSeedance 2.0の後継モデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大30件)
  • ビデオリファレンス(最大10件、合計30秒)
  • オーディオリファレンス(最大10件、合計30秒)

機能:

  • リファレンスの種類をまたぐ合計上限はありません。画像やビデオなしで、オーディオのみのリファレンスも使用できます
  • フレームとリファレンスは排他的です
  • 4秒から30秒までの柔軟な生成時間
  • 開始フレームまたはリファレンスビデオを指定した場合、アスペクト比はそれに基づきます
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 多数のリファレンスとの一貫性を維持する必要がある長尺クリップ
  • リファレンスオーディオを基にした会話・演技シーン

**料金:**選択した設定と時間により異なります

API:bytedance-seedance-v2.5

Seedance 2.5ではシード制御を利用できません。

Seedance 2.5は米国では利用できません。

変更内容を説明して既存のビデオを編集します。出力の長さとアスペクト比は入力ビデオに従います。

生成入力:

  • 編集するビデオ(必須、最大30秒)
  • 編集内容を説明するテキストプロンプト
  • 画像リファレンス(最大30件)
  • 追加のビデオリファレンス(最大10件、合計30秒)
  • オーディオリファレンス(最大10件、合計30秒)

機能:

  • 時間の制御はありません。出力は入力ビデオの長さと一致します
  • アスペクト比は入力ビデオに基づきます
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p

最適な用途:

  • 既存の映像における衣装、小道具、照明、場所の変更
  • 元の動きを維持するスタイル転写

**料金:**選択した設定と時間により異なります

Seedance 2.5 Video Editは米国では利用できません。

プロンプトと任意のリファレンスに基づき、既存ビデオの終了位置から続きを生成します。

生成入力:

  • 延長するビデオ(必須、最大30秒)
  • 続きを説明するテキストプロンプト
  • 画像リファレンス(最大30件)
  • 追加のビデオリファレンス(最大10件、合計30秒)
  • オーディオリファレンス(最大10件、合計30秒)

機能:

  • 延長時間は4秒から30秒
  • アスペクト比は入力ビデオに基づきます
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p

最適な用途:

  • 早く終わってしまうショットの延長
  • 複数の生成をつなげた長いシーケンスの作成

**料金:**選択した設定と時間により異なります

Seedance 2.5 Video Extendは米国では利用できません。

AIディレクターのように機能し、複雑なカメラ移動中もキャラクター、アイテム、シーンの高い一貫性を維持する高度なビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム

機能:

  • 複数アングルの画像またはビデオリファレンスによる、高精度なキャラクター・シーン保持
  • 多言語リップシンクと環境音を備えたネイティブのオーディオビジュアル同時生成
  • 3秒から15秒までの柔軟な生成時間
  • 同時に最大4つのバリエーションを生成
  • テキスト、流体力学、複雑な物理的相互作用の処理を強化

出力オプション:

  • 解像度:1080pのみ
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • ビジュアルの連続性が必要なキャラクター主導のストーリーテリング
  • 特定のテキストレンダリングが必要な広告・アセット

**料金:**選択した設定と時間により異なります

細かな制御のためにネガティブプロンプトをサポートしています。生成ごとにサウンドを有効・無効にできます。

Kling 3.0は米国では利用できません。

AIディレクターのように機能し、複雑なカメラ移動中もキャラクター、アイテム、シーンのアイデンティティを維持する、高一貫性のビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • ビデオリファレンス
  • 画像リファレンス

機能:

  • 複数アングルのリファレンスを使用して、主なキャラクターとアイテムの正確な視覚的アイデンティティを維持
  • 3秒から15秒までのシームレスな生成時間をサポート
  • 一度に最大4つのバリエーションを生成
  • 要素間の相互作用と動きの一貫性を正確にモデル化
  • 生成ごとのオーディオ有効・無効をネイティブでサポート

出力オプション:

  • 解像度:1080pのみ
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • 厳密なビジュアル連続性が必要なキャラクター主導のストーリーテリング
  • 一貫したアイテム描写が必要なプロフェッショナルなマーケティング・ブランドアセット

**料金:**選択した設定と時間により異なります

設定を切り替えることで、クレジット消費量を調整できます。

Kling O3は米国では利用できません。

O3アーキテクチャに基づく自然言語主導のビデオtoビデオ編集モデルです。手動マスキングやフレームごとの調整なしに、キャラクター置換や環境の入れ替えなど、複雑なビジュアル変換を行えます。

生成入力:

  • ソースビデオ
  • 画像リファレンス(最大4つの異なる要素・アングル)
  • テキスト説明(自然言語による指示)

機能:

  • 元のモーション構造を尊重しながら、会話形式のプロンプトを解釈して被写体や設定を置き換えます
  • 編集全体で、元のカメラアングル、動きのパターン、空間的関係を維持
  • 正面・複数アングル画像を含む最大4要素を組み合わせ、高精度なキャラクター一貫性を実現
  • 元のソースオーディオを維持するか、生成ごとに無音出力を生成するかを選択可能
  • 一度に最大4つの編集バリエーションを生成

出力オプション:

  • 解像度:ソースビデオに依存
  • アスペクト比:ソースビデオと一致

最適な用途:

  • 元の動きを保ちながら行う既存映像内の高精度なキャラクター置換
  • シーン環境の完全な変換(例:昼間の都市を未来的な夜景へ変更)
  • 既存のカメラダイナミクスへの厳密な準拠が必要なスタイル転写

**料金:**ビデオ時間と選択した設定により異なります

Kling O3 Editは米国では利用できません。

高品質で映画的なビデオ生成向けのプロフェッショナルグレードモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス

機能:

  • ネガティブプロンプトによる優れた品質とクリエイティブ制御
  • 完全に統合・同期されたオーディオ
  • リアルな会話、リップシンク、サウンドエフェクト
  • 固定時間:4秒、6秒、8秒
  • 一度に最大4件の生成を行うバッチ作成
  • 専用のサウンド制御

出力オプション:

  • 解像度:720p、1080p
  • アスペクト比:16:9、9:16

最適な用途:

  • 完全なクリエイティブ制御による高品質で映画的なビデオ生成

**料金:**選択した設定と時間により異なります

API:veo-3.1-generate-001

サウンドの有効・無効を切り替えると、生成クレジットが変わります。

高速プレビューと生成向けに最適化された高速モデルで、低レイテンシーでより鮮明な映像を提供します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム

機能:

  • ネガティブプロンプトと専用サウンド制御による高度なクリエイティブ制御
  • 固定時間:4秒、6秒、8秒
  • 一度に最大4件の生成を行うバッチ作成
  • 現実世界の物理法則を正確にモデル化し、リアルな動きと相互作用を実現

出力オプション:

  • 解像度:720p、1080p
  • アスペクト比:16:9、9:16

最適な用途:

  • 迅速な反復とA/Bテスト用ビジュアル
  • ペースの速いSNSコンテンツ制作

**料金:**選択した設定と時間により異なります

API:veo-3.1-fast-generate-001

計算量を抑えた迅速な生成向けに最適化された、コスト効率の高い高速版Veo 3.1です。

生成入力:

  • テキストtoビデオ
  • 開始フレーム

機能:

  • ネガティブプロンプトと専用サウンド制御による細かなクリエイティブ制御
  • 固定時間:4秒、6秒、8秒
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:720p
  • アスペクト比:16:9、9:16

最適な用途:

  • 速度とコスト効率を優先する大量コンテンツ制作
  • 迅速なコンセプト探索とプレビュー

**料金:**選択した設定と時間により異なります

ネイティブオーディオ、最大4K出力、フレーム補間とリファレンス誘導生成の両方を備えた、Googleの物理法則を考慮するビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大10件)
  • ビデオリファレンス(最大3件、各最大10秒)

機能:

  • フレームとリファレンスは排他的です。フレーム間の補間、またはリファレンスによる誘導のいずれかを使用します
  • 固定時間は3秒から10秒。リファレンスビデオを添付した場合は、その時間に従います
  • 画面上の短いテキストやラベルを強力にレンダリング
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:360p、720p、1080p、4K
  • アスペクト比:16:9、9:16

最適な用途:

  • 読みやすいテキストを含む解説動画やキネティックタイポグラフィ
  • リファレンス全体で被写体の一貫性を保つ、物理的に自然な動き

**料金:**選択した設定と時間により異なります

Gemini Omni Flash 1.1を使用して既存ビデオの終了位置から続きを生成し、合計で最長40秒にできます。

生成入力:

  • 延長するビデオ(必須、最大30秒)
  • 続きを説明するテキストプロンプト

機能:

  • 延長時間は3秒から10秒
  • アスペクト比は入力ビデオに従います
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:360p、720p、1080p、4K

最適な用途:

  • 目立つカットなしでGemini Omni Flashの生成を延長
  • 1回の生成で可能な長さを超えるシーケンスの構築

**料金:**選択した設定と時間により異なります

初代Gemini Omniビデオモデルです。物理法則を考慮した動き、ネイティブオーディオ、利用可能なビデオモデルの中で最も優れた画面上テキストのレンダリングを720pで提供します。

生成入力:

  • テキストtoビデオ
  • 画像リファレンス(最大8件)
  • ビデオリファレンス(1件、最大10秒)

機能:

  • 固定時間は3秒から10秒。リファレンスビデオを添付した場合は、その時間に従います
  • 開始・終了フレームはありません。代わりに画像リファレンスで被写体を固定します
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:720p
  • アスペクト比:16:9、9:16

最適な用途:

  • 短いキャプション、タイトル、ラベル付き解説コンテンツ
  • 720pでの複数画像の一貫性

**料金:**選択した設定と時間により異なります

時間的安定性を強化し、キーフレーム間の遷移を正確に制御できる、ダイナミックで高精度なシーケンス作成向けのアップグレードされた専用モデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム

機能:

  • 開始・終了フレームをシームレスにつなぎ、一貫性のあるマルチショットシーケンスを実現
  • 複雑なアクションと環境の一貫性を高精度にモデル化
  • 4秒から12秒までの固定生成時間をサポート
  • 一度に最大4つのバリエーションを生成
  • 生成ごとのオーディオ有効・無効をネイティブでサポート

出力オプション:

  • 解像度:420p、720p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 特定の視覚的基準間で安定した物理表現が必要なストーリーテリングやアクションシーン
  • 厳密な開始・終了要件がある映画的トランジションとプロフェッショナルなビデオアセット

**料金:**選択した設定と時間により異なります

Seedance 1.5 Proは非推奨です。ByteDanceは2026年11月11日にこのモデルを終了するため、 新規生成では提供されなくなりました。代わりにSeedance 2.0モデルを使用してください。Seedance 1.5 Proは 米国では利用できません。

自然な動き、マルチショットシーン、生成オーディオ、ビデオ延長を備えたBlack Forest Labsのビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 延長するビデオ(1件、最大15秒)

機能:

  • ビデオ延長は開始・終了フレームと排他的です
  • 5秒から20秒までの柔軟な生成時間
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:720p、1080p
  • アスペクト比:21:9、2:1、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 1つのプロンプトから作成するマルチショットシーン
  • 動きとオーディオを合わせて既存クリップを延長

**料金:**選択した設定と時間により異なります

マルチモーダルリファレンス、生成オーディオ、最大4K出力を備えたMiniMaxのフラッグシップビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大9件)
  • ビデオリファレンス(最大3件、各2秒から15秒、合計15秒)
  • オーディオリファレンス(最大3件、各2秒から15秒、合計15秒)

機能:

  • 生成あたりのリファレンス合計上限は12件。オーディオリファレンスには少なくとも1つの画像またはビデオリファレンスが必要です
  • フレームとリファレンスは排他的です
  • 5秒から15秒までの柔軟な生成時間
  • 同期されたオーディオを生成
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、768p、2K、4K(2Kと4Kは768pからアップスケールされます)
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 高解像度での納品が必要なリファレンス主導シーン
  • リファレンスオーディオを基にした会話クリップ

**料金:**選択した設定と時間により異なります

MiniMax H3は米国では利用できません。

MiniMax H3と同じ入力と優れた美的品質を備え、最大768pでネイティブレンダリングする、ほぼ瞬時のバリアントです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大9件)
  • ビデオリファレンス(最大3件、各2秒から15秒、合計15秒)
  • オーディオリファレンス(最大3件、各2秒から15秒、合計15秒)

機能:

  • 生成あたりのリファレンス合計上限は12件。オーディオリファレンスには少なくとも1つの画像またはビデオリファレンスが必要です
  • フレームとリファレンスは排他的です
  • 5秒から15秒までの柔軟な生成時間
  • 同期されたオーディオを生成
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、768p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • プロンプトとリファレンスの迅速な反復
  • MiniMax H3でレンダリングする前のプレビュー

**料金:**選択した設定と時間により異なります

MiniMax H3 Maxは米国では利用できません。

高度な論理処理で複雑な指示を解釈・実行し、優れたプロンプト準拠と複雑な物理世界シミュレーションを実現する、最先端の推論ビデオモデルです。

生成入力:

  • テキストtoビデオ(説明)
  • 開始フレーム&終了フレーム
  • ビデオリファレンス
  • 画像リファレンス

機能:

  • 多層的なプロンプトを解釈し、複雑な時系列アクションを実行する優れた能力
  • 画像とビデオの両方を視覚的アンカーとして利用し、高いキャラクター・シーン一貫性を維持
  • 物理的相互作用、因果関係、流体力学を優れてモデル化
  • 5秒・10秒クリップの高品質生成をサポート
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:入力に依存
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • 長く詳細な説明への正確な準拠が必要な、非常に具体的なクリエイティブコンセプト
  • 物理的リアリズムと複数リファレンスの一貫性が重要なプロフェッショナルなストーリーテリング

**料金:**選択した設定と時間により異なります

Kling O1は米国では利用できません。

手動マスキングやフレームごとの調整なしに、キャラクター置換や環境の入れ替えなど複雑なビジュアル変換を可能にする、自然言語主導のビデオtoビデオ編集モデルです。

生成入力:

  • ソースビデオ
  • 画像リファレンス(最大4つの異なる要素・アングル)
  • テキスト説明(自然言語による指示)

機能:

  • 元のモーション構造を尊重しながら、会話形式のプロンプトを解釈して被写体や設定を置き換えます
  • 編集全体で、元のカメラアングル、動きのパターン、空間的関係を維持
  • 正面・複数アングル画像を含む最大4要素を組み合わせ、高精度なキャラクター一貫性を実現
  • 元のソースオーディオを維持するか、生成ごとに無音出力を生成するかを選択可能
  • 一度に最大4つの編集バリエーションを生成

出力オプション:

  • 解像度:ソースビデオに依存
  • アスペクト比:ソースビデオと一致

最適な用途:

  • 元の動きを保ちながら行う既存映像内の高精度なキャラクター置換
  • シーン環境の完全な変換(例:昼間の都市を未来的な夜景へ変更)
  • 既存のカメラダイナミクスへの厳密な準拠が必要なスタイル転写

**料金:**ビデオ時間と選択した設定により異なります

Kling O1 Editは米国では利用できません。

リファレンスビデオでキャラクター画像を動かし、特定の動き、ジェスチャー、カメラアングルを再現できる、正確なモーション転写向け専用モデルです。

生成入力:

  • キャラクター画像(ソース)
  • モーションビデオ(リファレンス)
  • テキスト説明(任意)

機能:

  • 正確な動きの再現には「Match Video」、キャラクターに新しいクリエイティブな動きを加えるには「Match Image」を選択
  • Match Videoモードでは最大30秒、Match Imageモードでは最大10秒をサポート
  • リファレンス映像の人物の動きを静止キャラクターへ高精度にマッピング
  • 生成ごとのオーディオ有効・無効をネイティブでサポート
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:ソースに依存
  • アスペクト比:ソースに依存

最適な用途:

  • カスタムキャラクター上で複雑な振り付けや特定の動きを再現
  • 高いモーション忠実度が必要な長尺キャラクターアニメーション
  • トレンドのビデオ動作を活用したSNSコンテンツ

**料金:**選択した設定と時間により異なります

Kling 2.6 Motion Controlは米国では利用できません。

Kling 3.0アーキテクチャに基づく正確なモーション転写向け専用モデルです。リファレンスビデオでキャラクター画像を動かし、特定の動き、ジェスチャー、カメラアングルをより高い忠実度で再現できます。

生成入力:

  • キャラクター画像(ソース)
  • モーションビデオ(リファレンス)
  • テキスト説明(任意)

機能:

  • 正確な動きの再現には「Match Video」、キャラクターに新しいクリエイティブな動きを加えるには「Match Image」を選択
  • Match Videoモードでは最大30秒、Match Imageモードでは最大10秒をサポート
  • リファレンス映像の人物の動きを静止キャラクターへ高精度にマッピング
  • 生成ごとのオーディオ有効・無効をネイティブでサポート
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:ソースに依存
  • アスペクト比:ソースに依存

最適な用途:

  • カスタムキャラクター上で複雑な振り付けや特定の動きを再現
  • 高いモーション忠実度が必要な長尺キャラクターアニメーション
  • トレンドのビデオ動作を活用したSNSコンテンツ

**料金:**選択した設定と時間により異なります

Kling 3.0 Motion Controlは米国では利用できません。

モーションの忠実度と遷移の滑らかさを高めるよう最適化された生成モデルです。高速な反復とプロダクション品質のビジュアル出力のバランスを提供します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • 強化されたモーションダイナミクス:動きの流動性とリアルな物理的相互作用を大幅に改善
  • 柔軟なサウンド制御:生成ごとのオーディオ有効・無効をネイティブでサポート
  • バッチ作成:同時に最大4つのバリエーションを生成
  • 細かな調整:ネガティブプロンプト対応による高度なクリエイティブ制御
  • 固定時間:5秒と10秒の生成をサポート

出力オプション:

  • 解像度:入力に依存
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • 流動的なキャラクター動作が必要なアクション性の高いクリップ
  • プロンプト準拠の高いプロフェッショナル品質のSNSコンテンツ

**料金:**選択した設定と時間により異なります

Kling 2.6は米国では利用できません。

高品質なフルHDビデオ生成向けの、バランスに優れた汎用モデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム

機能:

  • 複雑な動きとリアルな物理表現のシミュレーションに優れる
  • 流体力学と表情を正確にモデル化
  • 固定時間:5秒、10秒
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1080p
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • リアルな物理シミュレーションと複雑な動き

**料金:**選択した設定と時間により異なります

現在、終了フレームはサポートされていません。画像リファレンスは指定できません。サウンド制御は利用できません。

Kling 2.5は米国では利用できません。

映画的で非常にリアルなビデオのための、最先端のモーション品質、プロンプト準拠、ビジュアル忠実度を提供します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • 業界トップクラスのリアリズムと物理シミュレーションによる卓越したモーション品質
  • 複雑なシーンを正確にクリエイティブ制御するための優れたプロンプト準拠
  • 映画品質の出力を実現する高いビジュアル忠実度
  • 同時に最大4つのバリエーションを生成

出力オプション:

  • 解像度:720p
  • アスペクト比:16:9、9:16

最適な用途:

  • 最高のモーション品質とリアリズムが必要な映画的コンテンツ
  • 正確なプロンプト準拠が求められるプロフェッショナル制作
  • 高忠実度のビジュアルストーリーテリング

**料金:**選択した設定と時間により異なります

迅速な反復とコスト効率の高い制作向けに設計された、高品質ビデオを作成できる高度なビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • 超高速生成向けに最適化され、以前のバージョンより最大4倍高速に結果を提供
  • キャラクターの動き、カメラアングル、シーン構成を正確に指示可能
  • ダイナミックなシーン全体でビジュアルの一貫性と安定性を維持することに優れる
  • 2秒から10秒までの生成時間をサポート
  • 同時に最大4つのバリエーションを生成

出力オプション:

  • 解像度:720p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • ほぼ即時のフィードバックが必要な迅速なプロトタイピングとクリエイティブ実験
  • 高解像度マーケティングアセットを短納期で必要とするプロフェッショナルプロジェクト
  • 特定のカメラ移動要件がある映画的コンテンツ

**料金:**選択した設定と時間により異なります

ソース映像の基礎構造を維持しながら複雑な編集を行える、マルチタスクビジュアル生成向けの最先端インコンテキストビデオモデルです。

生成入力:

  • ソースビデオ
  • リファレンス画像
  • テキスト説明

機能:

  • 自然な照明、影、遠近感を維持しながら、シーン内のオブジェクトや被写体をシームレスに追加、削除、変換
  • 現実的な色温度の更新により、場所、季節、時間帯を変更(例:曇天の映像をドラマチックな夕景に変換)
  • シンプルな自然言語プロンプトで、俳優の年齢や外見を変更したり、衣服や被写体のテクスチャを変更
  • リファレンスビデオの特定の動きとカメラパスを静止画に適用し、正確なアニメーション制御を実現
  • 単一の既存ビデオシーケンスから、リバースショットやローアングルなどのまったく新しいカメラアングルを生成
  • 正確なグリーンスクリーン処理(エッジ検出による切り抜き)、ストーリー継続のための次ショット生成、美的スタイル転写を含む
  • 同時に最大4つのバリエーションを生成

出力オプション:

  • 解像度:720p
  • アスペクト比:自動

最適な用途:

  • デジタル若返り、再ライティング、オブジェクト削除などのプロフェッショナルなVFXタスク
  • 迅速な映画的プロトタイピングと、1ショットからの代替カメラカバレッジ生成
  • 大規模な環境・スタイル変換が必要なクリエイティブマーケティングコンテンツ

**料金:**選択した設定と時間により異なります

Runwayのビデオ編集モデルです。動きと一貫性を維持しながら、既存ビデオを目標のルックへ変換します。

入力:

  • ソースビデオ(必須、2秒から30秒)
  • 目標ルック画像(必須)
  • 編集内容を説明するテキストプロンプト

機能:

  • 出力の長さとフレーミングはソースビデオに従います
  • 目標ルック画像に基づくスタイル転写
  • 一度に最大4件の生成を行うバッチ作成

最適な用途:

  • 既存映像の再ライティング、スタイル変更、設定変更
  • リファレンス画像のルックをクリップ全体に適用

**料金:**選択した設定と時間により異なります

動作ビデオのモーション、発話、表情をキャラクター画像またはビデオリファレンスにマッピングしてキャラクターをアニメーション化する、専用のパフォーマンス転写モデルです。

生成入力:

  • 動作パフォーマンス(ビデオ)
  • キャラクター入力(画像またはビデオ)

機能:

  • ソース俳優の繊細な表情、リップシンク、同期オーディオを任意のキャラクターに直接転写
  • 静止キャラクター画像に二次的な動きと繊細なカメラ揺れを自動追加し、より自然な見た目を実現
  • キャラクター画像使用時の体と手の動きの有効・無効を正確に切り替え可能
  • 強い感情表現とキャラクターのビジュアル一貫性のバランスを調整できる設定
  • 動作パフォーマンスとの完璧なアラインメントを維持したまま、生成後にキャラクターの声を変更可能

出力オプション:

  • 解像度:720p
  • アスペクト比:自動

最適な用途:

  • リアルな人間の動きと発話で静止キャラクターポートレートに命を吹き込む
  • 非人間キャラクターやスタイライズドアバターを高忠実度の表情でアニメーション化
  • 体のジェスチャーを統合したトーキングヘッドコンテンツを迅速に制作

**料金:**選択した設定と時間により異なります

大きな動きやアクションを含むダイナミックなマルチショットシーケンスを作成する専用モデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム

機能:

  • 非常に安定した物理表現とショット間のシームレスな遷移
  • 固定時間:3秒、4秒、5秒、6秒、7秒、8秒、9秒、10秒、11秒、12秒
  • 一度に最大4件の生成を行うバッチ作成
  • 多数のアスペクト比オプションによる最大限のクリエイティブ柔軟性

出力オプション:

  • 解像度:480p、720p、1080p
  • アスペクト比:21:9、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 安定した物理表現が必要なストーリーテリングやアクションシーン

**料金:**選択した設定と時間により異なります

アスペクト比と解像度は生成クレジットに影響しませんが、時間は影響します。

Seedance 1 Proは米国では利用できません。

一貫した発話とリアルな動きを確保しながら、同期したビデオとオーディオを1回の処理で生成するよう設計された、DiTベースの基盤モデルです。

生成入力:

  • テキストtoビデオ
  • 画像toビデオ
  • オーディオtoビデオ
  • 深度toビデオ

機能:

  • 外部ツールなしで完璧にアラインメントした会話、唇の動き、環境オーディオを同時生成
  • 安定した動き、一貫したアイデンティティ、強いフレーム間一貫性を備えたダイナミックシーン
  • 最大20秒の高忠実度な同期生成をサポート
  • 細かなネガティブプロンプト対応による高度なクリエイティブ指示
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:720p、1080p
  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 一貫した発話と表現力豊かなキャラクターパフォーマンス
  • 環境オーディオの統合と一貫したタイミングが必要なナラティブコンテンツ
  • 複雑なカメラ認識モーションロジックを備えたダイナミックシーン

**料金:**選択した設定と時間により異なります

最大限のビジュアルディテールと構造的安定性に最適化された高忠実度生成モデルです。流動的な動きによるプロダクション品質の4K出力を作成できます。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • 速度よりビジュアル品質と一貫性を優先し、長いシーケンスでも安定した結果を実現
  • 非常に滑らかでプロフェッショナルなモーションのために25 FPSと50 FPSの両方をサポート
  • サウンドのオン・オフを切り替えられる統合オーディオビジュアル生成
  • ディテールを損なわず、ネイティブ1080p、2k、4k出力に対応
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:1080p、2k、4k
  • フレームレート:25 FPS、50 FPS
  • アスペクト比:16:9(デフォルト)
  • 時間:6秒、8秒、10秒

最適な用途:

  • 4Kの鮮明さが必要な高解像度の映画的制作
  • 滑らかな50 FPSモーションが必要なプロフェッショナルコンテンツ
  • ビジュアル安定性と構造的完全性が重要な詳細シーケンス

**料金:**選択した設定と時間により異なります

連続性を損なったりシーケンス全体を再生成したりせずに、既存ショット内の会話、感情、アクションを対象を絞って再演出できる高精度AI演出ツールです。

生成入力:

  • ソースビデオ
  • テキスト説明

機能:

  • 周囲のフレームからの強力なコンテキスト保持を維持しながら、特定のセグメントを変更
  • キャラクターの声、演技、環境の一貫性を維持したまま、発話を言い換え
  • 複数の編集モード:「Audio & Video」、「Audio only」、「Video only」から選択し、ショットの特定要素を分離・再生成
  • 新しいコンテンツは元の動き、照明、トーンを自然に継承し、シームレスに遷移
  • 1つのショット内で、キャラクターの別の反応、感情のビート、カメラ移動を即座に試行
  • 横並びでクリエイティブ比較を行うため、同時に最大4つのバリエーションを生成

出力オプション:

  • アスペクト比:16:9のみ

最適な用途:

  • 再撮影や再録音なしで行う台本調整と会話の改善
  • ポストプロダクションでの感情表現やペーシングの問題修正
  • 1つのマーケティングアセット内で複数のブランドメッセージとCTAをテスト

**料金:**選択した設定と時間により異なります

短いフィードバックループと高速コンテンツ制作向けに構築された速度最適化生成モデルです。レンダリング時間を大幅に短縮し、高解像度のビジュアルを提供します。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • 速度と迅速な反復向けに設計され、素早いビジュアル実験とほぼ即時のプレビューが可能
  • Proモデルより少ない計算オーバーヘッドで、ネイティブ1080p、2k、4k出力をサポート
  • 高速でも滑らかな動きを実現する25 FPSと50 FPSの両方に対応
  • 最大20秒の同期オーディオビジュアルコンテンツを迅速に生成
  • 生成ごとのオーディオ有効・無効をネイティブでサポート
  • 同時に最大4つのバリエーションを生成

出力オプション:

  • 解像度:1080p、2k、4k
  • フレームレート:25 FPS、50 FPS
  • アスペクト比:16:9(デフォルト)
  • 時間:6秒、8秒、10秒、12秒、14秒、16秒、18秒、20秒

最適な用途:

  • 最大ディテールより速度を優先する迅速なプロトタイピングとクリエイティブ探索
  • 短納期が必要な大量SNSコンテンツ
  • さまざまなビジュアルコンセプトやモーションスタイルのA/Bテスト

**料金:**選択した設定と時間により異なります

画像・ビデオ・オーディオリファレンス、生成オーディオ、最長30秒の生成を備えた映画的ビデオモデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大10件)
  • ビデオリファレンス(最大5件、合計15秒)
  • オーディオリファレンス(最大5件、合計15秒)

機能:

  • フレームとリファレンスは排他的です
  • 固定時間:5秒、10秒、15秒、20秒、30秒
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 任意のプロンプト強化
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p、1080p
  • アスペクト比:自動、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 高いプロンプト準拠が必要な長い映画的ショット
  • オーディオを含むリファレンス主導シーン

**料金:**選択した設定と時間により異なります

Wan 3.0は米国では利用できません。

Wan 3.0と同じ入力・出力オプションを備え、アイデア出しに適した高速バリアントです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム
  • 終了フレーム
  • 画像リファレンス(最大10件)
  • ビデオリファレンス(最大5件、合計15秒)
  • オーディオリファレンス(最大5件、合計15秒)

機能:

  • Wan 3.0のおよそ半分の生成時間
  • 固定時間:5秒、10秒、15秒、20秒、30秒
  • 生成ごとにオーディオの有効・無効を設定できるネイティブサウンド制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p、1080p
  • アスペクト比:自動、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 最終的なWan 3.0レンダリング前のアイデア探索
  • ターンアラウンド時間に敏感なワークフロー

**料金:**選択した設定と時間により異なります

Wan 3.0 Primeは米国では利用できません。

統合マルチモーダルアーキテクチャを活用し、ネイティブオーディオ同期とインテリジェントなマルチショットシーケンスにより、本番対応の1080pコンテンツを提供する次世代の映画的ビデオプラットフォームです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)
  • ビデオリファレンス(ビデオtoビデオ)
  • オーディオリファレンス(任意のバックグラウンドオーディオまたは会話)

機能:

  • 統合マルチモーダルシステム:テキスト、画像、ビデオ、オーディオを単一の統合フレームワークで処理し、一貫した出力品質を実現
  • ネイティブオーディオ同期:会話、ナレーション、環境サウンドエフェクトを画面上の動きに自動生成・アラインメント
  • インテリジェントなマルチショットシーケンス:キャラクターの一貫性を維持しながら、接続されたビデオシーケンスを一貫したストーリーアークに自動整理
  • 拡張時間:5秒、10秒、15秒の固定時間で安定した高品質生成をサポート
  • 高度なクリエイティブ制御:細かなディテール管理のネガティブプロンプトと、最大4つのバリエーションのバッチ作成をサポート

出力オプション:

  • 解像度:720p、1080p
  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • プロフェッショナルなナラティブストーリーテリングと複雑なマルチショット映画的シーケンス
  • 統合された高忠実度オーディオが必要なSNS広告とマーケティングコンテンツ
  • ビデオリファレンスを通じた厳密なビジュアル・モーション一貫性が必要なキャラクター主導コンテンツ

**料金:**選択した設定と時間により異なります

Wan 2.6は米国では利用できません。

テキストまたは開始画像から、映画的な動きと高いプロンプト忠実度を提供する汎用モデルです。

生成入力:

  • テキストtoビデオ
  • 開始フレーム(画像toビデオ)

機能:

  • ネガティブプロンプトと専用サウンド制御による細かなクリエイティブ制御
  • 固定時間:5秒、10秒
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:480p、720p、1080p
  • アスペクト比:16:9、1:1、9:16

最適な用途:

  • 高いプロンプト準拠を備えた映画的コンテンツ

**料金:**選択した設定と時間により異なります

生成コストは選択した設定により異なります。

Wan 2.5 Videoは米国では利用できません。

高精細な出力と正確な編集を実現する、OpenAIのプロダクション品質画像モデルです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大10件)

機能:

  • LowからMaximumまでの5つの品質レベル
  • 最大3:1のアスペクト比で、各辺最大3840pxのカスタム解像度
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K、2K、4K、またはカスタム
  • アスペクト比:3:1、21:9、2:1、16:9、3:2、4:3、5:4、1:1、4:5、3:4、2:3、9:16、1:2、1:3

最適な用途:

  • ディテールと忠実度が最重要となる最終アセット
  • 既存画像への正確な編集

**料金:**選択した設定とバリエーション数により異なります

API:gpt-image-2.5-sunburst

Sunburstと同じ制御機能を備え、日常的な大量生成向けに調整された高速GPT Image 2.5バリアントです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大10件)

機能:

  • LowからMaximumまでの5つの品質レベル
  • 最大3:1のアスペクト比で、各辺最大3840pxのカスタム解像度
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K、2K、4K、またはカスタム
  • アスペクト比:3:1、21:9、2:1、16:9、3:2、4:3、5:4、1:1、4:5、3:4、2:3、9:16、1:2、1:3

最適な用途:

  • 大量画像生成
  • 4Kとカスタムサイズが必要な迅速な反復

**料金:**選択した設定とバリエーション数により異なります

API:gpt-image-2.5-flare

テキストレンダリングを強化し、高解像度出力機能を備えた、正確な画像生成向けの高度なAIモデルです。

機能:

  • 正確なタイポグラフィと明瞭さを備えた画像を作成するための精密なテキスト制御
  • プロフェッショナル・商用利用に適した高解像度PNG出力
  • スタイルと構成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:3:2、1:1、2:3
  • 品質オプション:low、medium、high

最適な用途:

  • 正確なテキスト配置が必要なマーケティングビジュアルとデザインアセット
  • 高解像度要件のあるプロフェッショナルコンテンツ
  • 正確なテキストベース画像制御が必要なクリエイティブプロジェクト

**料金:**選択した設定とバリエーション数により異なります

API:gpt-image-2

本番対応品質と超高速処理を組み合わせ、世界知識と被写体一貫性を向上させた高度なAI画像生成モデルです。

機能:

  • アップスケーリングなしのネイティブ4K解像度出力による、非常に鮮明なディテール
  • 最短1〜2秒の超高速画像生成
  • 高度な推論と指示追従による優れたプロンプト準拠
  • モックアップ、看板、インフォグラフィック向けの、複数言語で鮮明かつ正確なテキストレンダリング
  • 複数のキャラクターやオブジェクト間でアイデンティティを維持する、一貫した複数被写体スタイリング
  • より正確なシーン生成のための世界知識の向上
  • 生成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16
  • 解像度:最大4K

最適な用途:

  • リアルタイム反復が必要な迅速なクリエイティブワークフロー
  • 一貫したキャラクターアイデンティティを備えたブランドコンテンツとストーリーテリング
  • 正確なテキストとタイポグラフィを含むプロフェッショナルビジュアル

**料金:**選択した設定とバリエーション数により異なります

API:gemini-3.1-flash-image

1Kでの迅速な生成と編集向けに設計された、Nano Banana 2の高速・低コストバリアントです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大14件)

機能:

  • 一貫した速度とコストのための固定1K出力
  • Nano Banana 2と同じ14枚の画像リファレンス容量
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K
  • アスペクト比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16

最適な用途:

  • 迅速な反復とドラフト
  • 1Kで十分な一括編集

**料金:**選択した設定とバリエーション数により異なります

API:gemini-3.1-flash-lite-image

幅広いクリエイティブワークフローに向け、品質と速度のバランスを取ったKrea AIの汎用的な本番対応画像生成モデルです。

機能:

  • 高いプロンプト準拠を備えた高忠実度画像生成
  • 生成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 一貫した品質が必要なプロフェッショナルコンテンツ制作
  • 多様なクリエイティブコンセプトでの迅速な反復

**料金:**選択した設定とバリエーション数により異なります

プロフェッショナル制作ワークフロー向けに、最大のビジュアル忠実度と高度なクリエイティブ制御を提供するKrea AIのフラッグシップ画像生成モデルです。

機能:

  • プロフェッショナル品質の出力のための卓越したディテールとリアリズム
  • 複数の画像リファレンスをサポートする高度なスタイル制御
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 高品質な商用・編集用画像制作
  • 最大の忠実度が必要な複雑なクリエイティブ構成

**料金:**選択した設定とバリエーション数により異なります

強力なプロンプト制御とクリーンな構成を備えた、デザイン重視のテキストto画像モデルです。

生成入力:

  • テキストto画像

機能:

  • 2K出力ではProモデルバリアントを使用
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K、2K
  • アスペクト比:2:1、16:9、3:2、14:10、4:3、5:4、1:1、4:5、3:4、10:14、2:3、6:10、9:16、1:2

最適な用途:

  • レイアウト重視のグラフィック、アイコン、ポスター
  • テキストのみからのクリーンな構成

**料金:**選択した設定とバリエーション数により異なります

リファレンス画像のスタイルに合わせられるデザイン重視の画像モデルです。

生成入力:

  • テキストto画像
  • スタイルリファレンス(最大10件)

機能:

  • スタイル一致制御:Preciseはリファレンススタイルに厳密に従い、Flexibleは全体的なルックに合わせます
  • 2K出力ではProモデルバリアントを使用
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K、2K
  • アスペクト比:2:1、16:9、3:2、14:10、4:3、5:4、1:1、4:5、3:4、10:14、2:3、6:10、9:16、1:2

最適な用途:

  • 一連のスタイルリファレンスに基づく、ブランドと一貫性のあるグラフィック
  • イラストレーションとデザイン作業

**料金:**選択した設定とバリエーション数により異なります

計算要件を抑えながら高品質な結果を提供する、ByteDanceの軽量・高速生成画像モデルです。

機能:

  • 迅速なクリエイティブ反復のための高速生成
  • 生成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 速度が必要な大量画像作成ワークフロー
  • 迅速なコンセプト探索とプレビュー

**料金:**選択した設定とバリエーション数により異なります

API:bytedance-seedream-5-lite

Seedream 5 Liteは米国では利用できません。

正確な編集、多言語テキスト、高密度インフォグラフィック向けの、高忠実度Seedream 5バリアントです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大10件)

機能:

  • 正確な多言語テキストレンダリング
  • インフォグラフィックやポスターなどの高密度レイアウトに対応
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • 解像度:1K、2K
  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • 複数言語でのテキスト量の多いデザイン
  • リファレンスへの厳密な準拠が必要な複数画像編集

**料金:**選択した設定とバリエーション数により異なります

API:bytedance-seedream-5-pro

Seedream 5 Proは米国では利用できません。

正確なテキストベース画像生成と、元のディテールを保つ複雑な非破壊フォト編集向けに設計された高速フラッグシップモデルです。

機能:

  • ソース画像内の照明、構成、被写体の見た目の完全性を維持しながら、要求された変更を確実に実行
  • 要素の追加、削除、結合、ブレンドを含む複雑な編集タスクをサポート
  • 前世代より最大4倍高速に出力を提供
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:3:2、1:1、2:3
  • 品質オプション:low、medium、high

最適な用途:

  • 実用的な写真調整、衣服やヘアスタイルのリアルなバーチャル試着
  • 入力画像の本質を保つコンセプチュアル変換とスタイルフィルター
  • テキストto画像コンセプトの迅速な反復

**料金:**選択した設定とバリエーション数により異なります

API:gpt-image-1.5

優れたプロンプト準拠、読みやすいテキスト、詳細な編集機能を備えたOpenAIの第1世代画像モデルです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大5件)

機能:

  • 3つの品質レベル:Low、Medium、High
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • アスペクト比:3:2、1:1、2:3

最適な用途:

  • GPT Image 1出力を中心に構築済みのワークフロー
  • 標準解像度でのシンプルな編集と画像内テキストタスク

**料金:**選択した設定とバリエーション数により異なります

API:gpt-image-1

テキストto画像合成、正確な画像編集、複雑な複数画像構成を単一の効率的なフレームワークに統合する、高性能マルチモーダル基盤モデルです。

機能:

  • 最大4K解像度の高忠実度画像を高速生成するネイティブサポート
  • リファレンス入力に基づく編集タスク中、顔の特徴、照明、色調、細部を卓越して保持
  • 複数の入力画像にわたってターゲット要素を正確に識別・ブレンドし、制御可能で一貫した結果を実現
  • ポスターやブランドビジュアル向けに小さなテキストを鮮明かつ正確にレンダリングする、デザイナーレベルの構成機能
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16
  • 解像度:2K、4K

最適な用途:

  • 正確なレイアウトとタイポグラフィが必要なプロフェッショナルグラフィックデザインワークフロー
  • リファレンスのアイデンティティと照明への厳密な準拠が必要な複雑なフォト編集
  • 複数のビジュアルソースを使用する高解像度クリエイティブ合成

**料金:**選択した設定とバリエーション数により異なります

Seedream 4.5は米国では利用できません。

高度な推論機能を備え、複雑な構成でも優れたプロンプト準拠と正確なビジュアル一貫性を実現する高忠実度画像生成モデルです。

機能:

  • 複雑で多層的なテキスト説明を高精度に解釈・実行する卓越した能力
  • 画像リファレンスを利用し、生成全体で被写体アイデンティティ、照明、美的スタイルを維持
  • リアルなテクスチャ、複雑な空間関係、プロフェッショナル品質の照明効果向けに最適化
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:自動、16:9、9:16、1:1、4:3、3:4、3:2、2:3、21:9
  • 解像度:1K、2K

最適な用途:

  • 詳細かつ技術的なテキストプロンプトへの厳密な準拠が必要なプロフェッショナルクリエイティブアセット
  • ビジュアルリファレンスを使用した高一貫性の画像編集とキャラクターデザイン

**料金:**選択した設定とバリエーション数により異なります

Kling O1 Imageは米国では利用できません。

速度、精度、一貫性に重点を置き、最先端のビジュアル品質を提供する、プロフェッショナルワークフロー向け本番品質の画像生成・編集モデルです。

機能:

  • 複数の画像を同時にリファレンスし、数百のアセットにわたり業界トップクラスのキャラクター・アイデンティティ一貫性を実現
  • 布地テクスチャから建築要素まで、実写との隔たりを縮める前例のないディテール品質を提供
  • 複雑なタイポグラフィ、UIモックアップ、インフォグラフィック向けの本番対応テキストレンダリング
  • 近似なしで、16進コードによる正確なブランドカラー指定をサポート
  • 複雑なシーン全体で、正確なオブジェクト配置、リアルな物理表現、一貫した照明、適切な遠近感を確保
  • 構造化された複雑な指示に対する精度と応答性を向上するよう最適化
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16
  • 解像度:720p、1080p、2K

最適な用途:

  • キャラクターの一貫性を維持するキャンペーンの展開と、あらゆる文脈への正確な商品配置
  • 読みやすいテキストと一貫したビジュアルデザインシステムを備えたインターフェースモックアップの作成
  • 大規模な商品写真生成とコンテキストに沿ったライフスタイルショット

**料金:**選択した設定とバリエーション数により異なります

高忠実度アセット制作、高度なクリエイティブ制御、正確な指示追従向けに設計された、プロフェッショナル品質の推論ベース画像生成・編集モデルです。

入力:

  • 画像リファレンス
  • テキスト説明(複雑で多層的なプロンプトをサポート)

機能:

  • レンダリング前にシーンを計画し、物理法則に正確な照明、正確なオブジェクト関係、優れたプロンプト準拠を実現
  • インパクトのあるポスターと商品モックアップ向けに、さまざまなフォントスタイル・手書き文字で鮮明かつ読みやすい多言語テキストを生成
  • 多様なクリエイティブ出力にわたり、最大5人と複数オブジェクトの高い忠実度と類似性を維持
  • Google Searchを統合し、実際のデータ、現実世界の知識、天気やスポーツなどのリアルタイム情報でビジュアルを強化
  • 高度なローカル編集ツールで、カメラアングル、焦点、シーン照明(例:昼から夜への変換)を調整
  • 優れた空間理解により、正確なインフォグラフィック、技術図、プレゼンテーションスライドを生成
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:1K、2K、4K
  • アスペクト比:自動、21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16

最適な用途:

  • プロフェッショナル広告、ブランドアセット、高品質eコマース商品写真
  • 教育用解説、データ主導インフォグラフィック、複雑な技術ドキュメント
  • 一貫したキャラクターまたはブランドアイデンティティによる高解像度ビジュアルデザインの迅速なプロトタイピング

**料金:**選択した設定とバリエーション数により異なります

API:gemini-3-pro-image

テキストプロンプトから直接、高速で高品質な画像生成・編集を行うモデルです。

機能:

  • 生成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:21:9、16:9、5:4、4:3、3:2、1:1、2:3、3:4、4:5、9:16

最適な用途:

  • 迅速な画像作成と反復

**料金:**選択した設定とバリエーション数により異なります

API:gemini-2.5-flash-image

高忠実度画像生成向けに設計された高度なベースモデルです。シーン間の一貫性を維持するための前例のないスタイル制御とビジュアルメモリを提供します。

機能:

  • 入力画像を使用してキャラクター、スタイル、特定のオブジェクトを固定し、複数出力にわたるプロフェッショナル品質の一貫性を維持
  • 複雑な自然言語説明を解釈し、ビジュアルディテール、照明、感情を正確に制御するよう最適化
  • 映画的なストーリーボードからプロフェッショナル商品写真まで、多様なユースケース向けの高品質ビジュアルを生成可能
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16
  • 解像度:720p、1080p

最適な用途:

  • 主人公が異なる環境や照明処理でも外見を維持することの確保
  • 高解像度のブランドアセット、バーチャル試着、スケール可能な商品ビジュアライゼーションの迅速な制作
  • 画像リファレンスでコアのビジュアルアイデンティティを固定しながら、多様な芸術的方向性を探索

**料金:**選択した設定とバリエーション数により異なります

標準のGen-4 Imageより2.5倍高速でありながら同一の出力品質を維持するよう、速度に特化して設計された最適化画像生成モデルです。

機能:

  • 最適化処理により迅速なクリエイティブ探索が可能になり、短時間で高忠実度画像を生成
  • 最大3枚のリファレンス画像をアップロードし、特定のキャラクター、環境、芸術スタイルに対するモデルの理解を誘導
  • リファレンス画像から特定の視覚的特性をエンコードして複数生成にわたるアイデンティティを維持し、ビジュアルドリフトの課題を解決
  • リファレンス画像の美的スタイル、照明、テクスチャを、まったく新しい被写体やシーンに簡単に適用
  • シードパラメータを活用し、バリエーションを体系的に探索、または特定の出力を正確に再現
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16
  • 解像度:720p、1080p

最適な用途:

  • Instagram Stories(9:16)や標準投稿(1:1)に最適化されたビジュアルを大規模に迅速制作
  • ブランドスタイルガイドをリファレンス画像として使用し、キャンペーン全体で厳格なビジュアルアイデンティティを維持
  • 主人公の認識可能性を保ちながら、一貫したキャラクターポーズと設定を開発
  • リファレンスベースのガイダンスにより、多様なライフスタイル・季節の商品ショットを正確に作成

**料金:**選択した設定とバリエーション数により異なります

大きな動きやアクションを含むマルチショットシーケンスまたはシーンを生成する専用画像モデルです。

機能:

  • 安定した物理表現と一貫した遷移を備えた画像作成に優れる
  • 生成を誘導する複数の画像リファレンスをサポート
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:自動、16:9、4:3、1:1、3:4、9:16

最適な用途:

  • アクションシーンとダイナミックな構成

**料金:**選択した設定とバリエーション数により異なります

Seedream 4は米国では利用できません。

高いプロンプト忠実度とリファレンス画像対応を備えたWan 2.5の画像バリアントです。

生成入力:

  • テキストto画像
  • 画像リファレンス(最大2件)

機能:

  • ネガティブプロンプトとシード制御
  • 一度に最大4件の生成を行うバッチ作成

出力オプション:

  • アスペクト比:16:9、4:3、1:1、3:4、9:16

最適な用途:

  • Wanビデオ生成のルックに合わせた静止画
  • プロンプトに忠実なコンセプト画像

**料金:**選択した設定とバリエーション数により異なります

Wan 2.5 Imageは米国では利用できません。

強力なシーン一貫性とスタイル制御を提供する、高度な画像生成・編集向けプロフェッショナルモデルです。

機能:

  • ビジュアルの美的スタイルを誘導するリファレンス画像を必要とする画像ベースのスタイル制御
  • 一度に最大4枚の画像を生成

出力オプション:

  • アスペクト比:21:9、16:9、4:3、3:2、1:1、2:3、3:4、4:5、9:16、9:21

最適な用途:

  • 正確なスタイル要件があるプロフェッショナルコンテンツ

**料金:**選択した設定とバリエーション数により異なります

オーディオとテキストのガイダンスにより駆動される、極めてリアルで反応的なアバターをレンダリングするよう設計された最先端の拡散トランスフォーマー(DiT)モデルです。

生成入力:

  • アバター(ソース画像)
  • スピーチ(オーディオファイル)
  • テキスト説明(ガイダンス)

機能:

  • 基本的なリップシンクを超え、コンテキストを考慮したまばたき、呼吸、自然な表情を実現
  • 声のトーンと抑揚に基づいて、手や全身の動きを自動同期し、スタジオ品質のパフォーマンスを実現
  • 声の強さとピッチを正確に解釈し、演技に忠実な感情表現を提供
  • 長い会話や音楽パフォーマンスでも、高いキャラクター忠実度と行動の一貫性を維持
  • 横向きプレゼンテーション、ポッドキャスト形式の会話、スタイライズドアニメーションなど、さまざまなセットアップに最適化
  • 一度に最大4つのバリエーションを生成

出力オプション:

  • 解像度:480p、720p

最適な用途:

  • プロフェッショナルなアバターベースのビデオ広告・マーケティングコンテンツ
  • 高忠実度のバーチャルストーリーテリングと表現力豊かな音楽パフォーマンス
  • 一貫したキャラクターの存在感が必要な長尺教育・トレーニングビデオ

**料金:**入力、設定、時間により異なります

API:creatify-aurora

静止画像を指定したオーディオに合わせてアニメーション化する、高速かつ正確な画像toビデオのリップシンクモデルです。

入力:

  • ソース画像
  • スピーチオーディオファイル

機能:

  • 指定したオーディオに合わせて、ソース画像の口と表情をアニメーション化
  • 静止画像から高忠実度の「話す」ビデオを作成
  • フルビデオ生成モデルではなく、リップシンク専用ツール

最適な用途:

  • 静止画像からトーキングアバターを作成
  • キャラクターポートレートへの会話追加
  • プロフェッショナルなアバター主導コンテンツワークフロー

**料金:**入力、設定、時間により異なります

最良の結果を得るには、画像に検出可能な人物が含まれている必要があります。

1枚の画像とオーディオ入力から、非常にリアルで表現力豊かなトーキングヘッドビデオを生成するHeyGenの最新アバターモデルです。

入力:

  • ソース画像
  • スピーチオーディオファイル

機能:

  • 指定したオーディオに合わせて、表情と唇の動きを高忠実度でアニメーション化
  • 自然な頭部の動きと繊細なマイクロ表情により、生き生きとした結果を作成
  • フルビデオ生成モデルではなく、リップシンク専用ツール

最適な用途:

  • プロフェッショナルなスポークスパーソン・プレゼンタービデオ
  • パーソナライズされたアバターコンテンツの大規模作成
  • 一貫したキャラクターの存在感を備えたマーケティング・トレーニングビデオ

**料金:**入力、設定、時間により異なります

最良の結果を得るには、画像に明瞭に見える顔が含まれている必要があります。

幅広いコンテンツタイプでスタジオ品質の同期を実現する、Syncの最新世代ビデオリップシンクモデルです。

生成入力:

  • ソースビデオ
  • スピーチオーディオ

機能:

  • 個々の顔のディテール、自然な歯、肌のテクスチャを維持する高精度リップシンク
  • 実写、3Dアニメーション、AI生成ビデオを含むすべてのコンテンツタイプに最適化
  • フルビデオジェネレーターではなく、ビデオtoビデオのリップシンクツール

最適な用途:

  • 映画・広告向けのプロフェッショナルな吹き替えとローカライゼーション
  • あらゆるビデオ形式での会話の強化・修正
  • 大量コンテンツ翻訳ワークフロー

**料金:**入力、設定、時間により異なります

最良の結果を得るには、ビデオに検出可能な人物が含まれている必要があります。

個々の顔のディテールを維持しつつ高解像度出力へスケールできる、スタジオ品質のリップシンク向けに設計された最先端ビデオ編集モデルです。

生成入力:

  • ソースビデオ
  • スピーチオーディオ

機能:

  • 高度なアップスケーリングを組み込み、鮮明で自然なテクスチャを維持しながら4K出力をサポート
  • 自然な歯、そばかす、メイク、複雑なひげなどの固有の顔特徴を、明瞭さを損なわずに保護
  • 実写、3Dアニメーション、AI生成ビデオを含むすべてのコンテンツタイプで機能するよう最適化
  • 話者固有のトレーニングやモデルの微調整なしに、表現力豊かで同期した結果を即座に提供
  • 同時に最大4つのバリエーションを生成

最適な用途:

  • 映画や高品質広告向けのプロフェッショナル品質の吹き替え・ローカライズコンテンツ
  • 3DアニメーションおよびAI生成キャラクターの会話の強化・修正
  • ピクセル単位で完璧な顔の一貫性とディテールが必要な高解像度プロジェクト

**料金:**入力、設定、時間により異なります

非常にリアルで人間らしいリップシンクを生成する専用ユーティリティモデルです。

入力:

  • 静止ソース画像
  • スピーチオーディオファイル

機能:

  • 指定したオーディオに合わせて、ソース画像の口をアニメーション化
  • 静止画像から高忠実度の「話す」ビデオを作成
  • フルビデオ生成モデルではなく、リップシンク専用ツール

最適な用途:

  • トーキングアバターの作成
  • 静止画像への会話追加
  • プロフェッショナルな吹き替えワークフロー

**料金:**入力、設定、時間により異なります

最良の結果を得るには、画像に検出可能な人物が含まれている必要があります。

OmniHuman 1.5は米国では利用できません。

ビデオにリアルなリップシンクを適用するための、高速で手頃かつ正確なユーティリティモデルです。

入力:

  • ソースビデオ
  • 新しいスピーチオーディオファイル

機能:

  • 新しいオーディオに合わせて、ソースビデオの口の動きを再アニメーション化
  • フルビデオジェネレーターではなく、ビデオtoビデオのリップシンクツール

最適な用途:

  • 大量かつコスト効率の高い吹き替え
  • コンテンツの翻訳
  • リアルな結果によるビデオクリップ内オーディオの修正

**料金:**入力、設定、時間により異なります

最良の結果を得るには、ビデオに検出可能な人物が含まれている必要があります。

既存ビデオにリアルなリップシンクを適用するための、Veed Lipsyncの高品質な後継モデルです。

入力:

  • ソースビデオ
  • 新しいスピーチオーディオファイル

機能:

  • 新しいオーディオに合わせて、ソースビデオの口の動きを再アニメーション化
  • フルビデオジェネレーターではなく、ビデオtoビデオのリップシンクツール
  • 一度に最大4件の生成を行うバッチ作成

最適な用途:

  • コストより出力品質が重要な吹き替え・翻訳
  • 完成済みクリップの会話修正

**料金:**入力、設定、時間により異なります

最良の結果を得るには、ビデオに検出可能な人物が含まれている必要があります。

解像度とディテールを最大4倍まで強化するよう設計された、画像・ビデオアップスケーリング向け専用ユーティリティモデルです。

機能:

  • 既存メディアを処理する強化ツール
  • 自然なテクスチャを維持し、アーティファクトを最小限に抑えながらメディアサイズを拡大
  • 非常に細かなアップスケール倍率:1x、1.25x、1.5x、1.75x、2x、3x、4x
  • ビデオ専用:柔軟なフレームレート制御(ソースを維持、または24、25、30、48、50、60 fpsへ変換)

最適な用途:

  • 生成メディアの品質向上
  • 旧来の映像や写真の復元
  • 高解像度ディスプレイ向けアセットの準備

**料金:**入力により異なります

画像から背景を削除し、アルファ透過付きで返します。

入力:

  • ソース画像

機能:

  • プロンプト不要
  • 実行あたり1つの出力

最適な用途:

  • 商品の切り抜きと合成
  • 他の生成でリファレンスとして使用する被写体の準備

**料金:**入力により異なります

標準ダイナミックレンジビデオをHDRへ変換します。

入力:

  • ソースビデオ(最大30秒)

機能:

  • プロンプト不要
  • 実行あたり1つの出力。長さとフレーミングはソースに従います

最適な用途:

  • HDRディスプレイ向け映像の準備
  • 納品向けに生成ビデオを再グレーディング

**料金:**ビデオ時間により異なります