具身リアルタイム駆動
テキストをもとに3Dデジタルヒューマンの音声、表情、視線、ジェスチャー、身体動作をリアルタイムで生成し、対話をより実在の会話に近づけます。
魔珐星云は、開発者向けの3D具身智能デジタルヒューマン開放プラットフォームであり、リアルタイム駆動、動画生成、音声合成という3つのコア機能を中心に、アプリがテキスト、音声、動作を対話型デジタルヒューマン体験へ統合できるよう支援します。公式サイトでは基盤プラットフォームとして位置づけられ、APIを通じてデジタルヒューマンAIエージェントアプリを迅速に構築できることを強調しています。
公開ページを見ると、このプラットフォームはリアルタイム対話、動画コンテンツ生成、音声出力という3種類の一般的なデジタルヒューマンワークフローをカバーしています。リアルタイム駆動機能はテキストを音声、表情、動作へ変換でき、動画機能はテキストまたはPPTに基づいて3Dデジタルヒューマン動画を生成し、音声合成は自然で人間らしい音声出力を必要とする端末やアプリケーション向けです。
また、プラットフォームはマルチ端末対応と低い導入ハードルも強調しており、ページではWeb、App、スマートフォン、車載端末、Pad、PC、テレビ、大型ディスプレイなどの環境に適応できることに触れています。Android、iOS、HarmonyOS など主要システムにも対応。料金ページではポイント課金、同時実行数の制限、商用ライセンスの説明が補足されており、呼び出し可能な技術プラットフォームであると同時に、明確な利用範囲を持つことが示されています。
テキストをもとに3Dデジタルヒューマンの音声、表情、視線、ジェスチャー、身体動作をリアルタイムで生成し、対話をより実在の会話に近づけます。
テキストまたはPPTから3Dデジタルヒューマン動画をワンクリックで生成し、台本から完成映像までの自動化フローをカバーします。
テキストを自然な音声へリアルタイム変換し、多言語、多音色、多感情の制御を提供します。
音声クローン機能を提供し、短い音声をもとに専用の音声スタイルをカスタマイズできます。
シーン、キャラクター、音色、動作、カメラなどの動画要素を編集でき、より細かな内容制御に役立ちます。
Web、App などの複数端末への展開をサポートし、Android、iOS、HarmonyOS など主要システムとの互換性にも触れています。
カスタマーサポート、案内、Q&A系アプリで、デジタルヒューマンを純粋なテキスト会話欄の代わりに使い、回答、表情、ジェスチャーをまとめてユーザーに提示します。
商品紹介、研修コース、知識解説、PPT内容を3Dデジタルヒューマン動画に変換し、コンテンツ素材をまとめて制作するのに使えます。
ライブ配信、音声アシスタント、車載システム、アクセシビリティ支援などで、テキストを自然な音声へリアルタイム変換し、安定した音声出力を提供します。
面接官、伴走型キャラクター、教育アシスタント、バーチャルIPなど、リアルタイム対話が必要な場面で使い、感情表現と動作フィードバックを強化します。
プラットフォーム事業者、SIer、端末メーカー向けに、デジタルヒューマン機能を既存製品へ組み込み、差別化された人間と機械の対話層として活用します。
星云は、デジタルヒューマンのリアルタイム駆動、動画生成、音声合成という3つのコア機能を提供しており、テキストを対話型デジタルヒューマン体験に変換したい開発チームに適しています。公式サイトではAPI連携方式を案内していますが、SDK、認証、デプロイ手順の詳細は公開ページに記載されていません。
ページ情報を見る限り、機能はリアルタイム対話、テキストからの動画生成、音声出力の各シーンに利用できます。動画機能はテキストまたはPPTから3Dデジタルヒューマン動画の生成に対応し、リアルタイム駆動はテキストに基づく音声、表情、動作の生成に対応し、音声合成はテキストを自然な音声に変換します。
料金ページによると、プラットフォームはポイント課金制で、機能やオプションごとに消費ポイントが異なります。リアルタイム駆動は対話時間に応じて課金され、動画生成は解像度や複雑さなどの要素でポイントを消費し、音声合成は音声の長さに応じて課金されます。
料金ページでは、プラットフォーム関連サービスは書面による許可がない限り、個人学習、試用体験、コードデバッグなどの非商用目的に限られると明記されています。商用利用には事前の許可が必要です。
公式サイトでは、開発者、企業向けアプリケーション、システムインテグレーター、端末メーカー、コンテンツツールベンダーなど、さまざまな利用者タイプが挙げられていますが、公開ページでは詳細なチーム協業、権限管理、複数アカウントのワークフローは示されていません。
Wallieは、画面を見てチャットを聞き、設定したペルソナでライブ解説を生成するオープンソースAI streamer。自分のキーでローカル実行でき、顔出しなし配信や自律配信、リアルタイム反応に最適です。
VIDEOAI.MEは、台本からスポークスパーソン風動画、広告、解説、SNS向けコンテンツを生成できるAI動画生成ツール。撮影なしで作成できます。
HeyGen Developersの公式APIドキュメント。AIアバター動画、翻訳、lipsync、インタラクティブ動画エージェントの開発に対応。API、MCP、CLIで利用可能。
BeFreedは、本や知識ソースをナレーション付きの音声学習体験に変えるパーソナライズ音声学習アプリ。オンデマンド学習、音声選択、学習ツールを搭載。
艺映AIは、テキスト・画像・既存動画から生成できる無料のAI動画制作ツール。短尺SNS動画、プロモーション映像、スタイル化AI動画に対応。
Artflowは、写真・テンプレート・プロンプトから人物ベースの画像と動画を生成するAIフォトスタジオ。再利用できるアイデンティティ、シーン違い、編集出力を作成できます。