テキストから世界を生成
Genie 3 は、シンプルなテキスト説明をリアルタイムで探索できるフォトリアルな環境に変換する汎用ワールドモデルとして紹介されています。
Genie 3は、テキストや画像から対話可能なフォトリアル世界を生成するGoogle DeepMindのワールドモデルです。Project Genie経由で利用できます。
Genie 3 は、シンプルなテキスト記述から対話可能なフォトリアル環境を生成するための、Google DeepMind の汎用ワールドモデルです。このページでは、物理シミュレーション、制御可能な対話、視覚的一貫性に重点を置いた、探索可能な世界を作るためのリアルタイムシステムとして位置づけられています。
この製品は、実験的な研究プロトタイプである Project Genie と、世界に入る前にその形を整える方法を説明する prompt guide を通じて提供されています。DeepMind は Genie 3 を、物理世界のモデリング、自然のシミュレーション、アニメーションやフィクション風のシーン生成に有用であり、複雑な環境で推論して行動できるより高性能な AI エージェントへの一歩でもあると位置づけています。
Genie 3 は、シンプルなテキスト説明をリアルタイムで探索できるフォトリアルな環境に変換する汎用ワールドモデルとして紹介されています。
ページでは、Genie 3 は 20〜24 fps の滑らかな対話をサポートし、ユーザーやエージェントがアクションの合間に長く待たずに生成された世界を移動できると説明しています。
モデルは 720p 解像度で出力をレンダリングし、生成されたシーンに探索用途やエージェント訓練シナリオに十分な視覚的詳細を与えます。
ホームページでは、以前見た詳細は再訪時に想起され、環境は劣化しにくいまま対話を維持できると説明されています。
Genie は Google Maps の Street View データを基盤としており、サイトでは、現実に根ざしながらも意外な組み合わせを可能にするのに役立つと説明されています。
prompt guide では、テキストや画像で世界を作成し、その後、世界に入る前に環境、キャラクター、プレビューを調整できると説明しています。
風景、キャラクター、移動パターンを指定して、対話的な探索や試作テストのための制御可能な世界を作成します。
モデルのリアルタイムかつフォトリアルな出力を使って、砂漠、海、天候、その他の物理環境をシミュレーション風にモデル化します。
動物の行動、植物、環境の細部を探ることが目的のときに、活気のある生態系や自然をテーマにしたシーンを生成します。
フィクションやアニメーション指向の実験向けに、想像上の設定、幻想的なシナリオ、表現豊かなアニメーションキャラクターを作成します。
prompt guide に従って、世界に入る前にスケッチ、アップロード、リミックスを行い、シーンのコンセプトや参照画像の反復に役立てます。
Genie 3は、世界を作成して探索するための実験的な研究プロトタイプとして説明されている Project Genie 経由で利用できます。ホームページには、プロンプトの使い方を学ぶための prompt guide へのリンクもあります。
prompt guide によると、Genie 3 はテキストまたは画像でプロンプトできます。プロンプトには3つの要素があり、環境、キャラクター、そして Nano Banana Pro によって生成される world sketch のプレビューです。これらはユーザーがアップロードした画像で調整することもできます。
ホームページでは、Genie 3 がリアルタイムで探索できるフォトリアルな環境を生成すると説明されています。prompt guide には、world sketching、画像のアップロード、world remixing を含むワークフローが追加で案内されています。
ソースでは、Genie 3 はリアルタイムの対話、720p 出力、20〜24 fps を備えた汎用ワールドモデルとして説明されています。公開されているプランを持つ一般消費者向け製品ではなく、研究モデルとして紹介されています。
ソースでは、リアルタイムの対話、フォトリアルな出力、世界の一貫性、Street View データによる基盤づけが強みとして挙げられています。一方で、製品の制限、オンボーディング手順、チーム向け機能の完全な公開一覧は示されていません。
紫东太初は、中国科学院自動化研究所と武漢人工知能研究院が開発した多モーダル大規模モデルです。多輪QA、文章作成、画像生成、3D理解、信号解析に対応し、図文音や三次元・信号データの処理に適しています。
AIペインティングジェネレーターは、ユーザーが入力したテキストの説明に基づいて自動的にアートを生成するオンラインAIソフトウェアです。
画像、動画、音声、ライティング、チャットのツールを統合したオールインワンAIプラットフォームで、創造性とコラボレーションを高めます。
Slidesgoは、Google Slides、PowerPoint、Canva向けのプレゼンテーションテンプレート集。無料・Premiumテンプレートに加え、AIによる資料作成やチーム向けアクセスにも対応。
Wyseraは、コンテンツのPostWyseとCRM・収益業務のOpsWyseをWyse AIでつないだAIビジネスプラットフォーム。公開前承認を重視し、配信、リードフォロー、業務運用を一元化します。
GrokはxAIによって開発された無料のAIアシスタントであり、真実性と客観性を優先するように設計されており、リアルタイム情報アクセスや画像生成などの高度な機能を提供します。