最近の技術記事では、ERNIE-Imageによるテキストから画像への生成と、InfiniteTalkによる無限長動画の作成を統合したエンドツーエンドパイプラインが、国産DCU(Deep Computing Unit)ハードウェア上にデプロイされています。このパイプラインは、画像生成からオーディオ同期、デジタルヒューマン動画作成までの全ワークフローをカバーし、完全なコードが提供されています。これは、国産AIハードウェアエコシステムの成熟を示しており、以前は外国のGPUに依存していた複雑なマルチモーダルタスクを可能にします。DCU上でのこれらのモデルの統合は、中国のAIハードウェアが動画生成における最先端の研究や商用アプリケーションにとって実行可能なプラットフォームになりつつあることを示唆しています。コードは提供されていますが、本当のシグナルは、そのようなパイプラインを国産インフラ上で実行できる可能性であり、これはAIの主権とコスト削減に影響を与えます。
この記事では、ERNIE-Imageによるテキストから画像への生成と、InfiniteTalkによる無限長動画への拡張を組み合わせたフルパイプラインを、国産DCUハードウェア上にデプロイしたものを紹介します。同期オーディオとデジタルヒューマン動画を生成するための完全なコードが含まれています。これは、複雑なマルチモーダルタスクに対する国産AIハードウェアエコシステムの能力が成長していることを示しています。