18言語にわたるネイティブなコードスイッチング
リリース記事によると、このモデルは18言語にわたるコードスイッチングにネイティブ対応しており、別途言語判定を挟まずに、実際に話された言語に沿って文字起こしできます。
Universal-3.5 Proは、AssemblyAIの録音済み音声・動画向けの旗艦的な非同期音声認識モデルです。Pre-recorded Speech-to-Text APIの一部であり、対応言語や実世界の難しい音声に対して最高精度のモデルとして位置づけられています。
リリース記事では、18言語にわたるネイティブなコードスイッチング、改善された話者分離、文脈プロンプトという3つの主要機能が強調されています。料金ページでは、送信された音声1時間あたりの基本料金が$0.21で、話者分離、医療モード、キーワードプロンプト、一般的なプロンプトなどの機能にはオプションのアドオンがあると記載されています。
実際には、このモデルは音声が不明瞭だったり、多言語だったり、話者が多かったりする文字起こし用途を想定しています。会議、コンタクトセンターの録音、字幕、検索可能なアーカイブなど、リアルタイムの遅延よりも精度と話者属性が重要な録音済みワークフローに適しています。
リリース記事によると、このモデルは18言語にわたるコードスイッチングにネイティブ対応しており、別途言語判定を挟まずに、実際に話された言語に沿って文字起こしできます。
AssemblyAIは、このリリースをこれまでで最も高精度な話者分離として説明しており、雑音の多い会話やクロストークの中でも、文字起こしと話者属性の対応を保つよう設計されています。
文脈プロンプトを使うと、ドメイン知識や事前コンテキストを入力して文字起こし結果に反映させられるため、専門用語や曖昧な音声での精度向上に役立ちます。
料金ページでは、Universal-3.5 Pro向けのキーワードプロンプトが最大1,000語まで対応しており、プロジェクト固有の語彙に認識を寄せる手段を提供します。
Universal-3.5 Proは、AssemblyAIの音声認識ラインナップにおける非同期の録音済みモデルで、送信された音声1時間あたり$0.21で提供されています。
料金ページでは、このモデルに対して医療モードや話者分離などのオプションアドオンが用意されており、ベースの文字起こし料金に追加できます。
1つの会話に複数の言語が含まれ、各時点で話された言語を文字起こしに反映させたい場合に、Universal-3.5 Proを使用します。
短い応答、割り込み、重なる発話によって話者属性の判定が難しい会議メモや社内ディスカッションで使用します。
正確な話者ラベル付けが下流の分析や品質保証に影響するコンタクトセンター通話や、その他の顧客対応で使用します。
プロジェクト名、ドメイン用語、聞き間違えやすい語彙を含む専門的な議論を文字起こしする際に、文脈プロンプトやキーワードプロンプトを使用します。
音声がすでに録音済みで、遅延よりも文字起こし品質を優先できる場合に、アーカイブ、字幕、データセット準備に非同期APIを使用します。
Universal-3.5 Proは、AssemblyAIの非同期の録音済み音声テキスト変換モデルです。ライブ配信の文字起こしではなく、録音済みの音声・動画向けに設計されています。
リリース記事では、18言語にわたるネイティブなコードスイッチングに対応しているとされています。製品ページでは、対応言語における録音済みモデルとして最高精度であると説明されています。
リリース記事では文脈プロンプトが強調されており、料金ページでは一般的なプロンプトがUniversal-3.5 Pro向けの有料非同期アドオンとして利用できると示されています。
料金ページでは、Universal-3.5 Pro向けの非同期話者分離が、有料アドオンとして標準版と実験版の両方で掲載されています。リリース記事では、話者分離はモデルの主要な改善点の1つとして位置づけられています。
料金ページでは、Universal-3.5 Proの録音済み音声は1時間あたり$0.21と記載されています。話者分離、医療モード、キーワードプロンプト、一般的なプロンプトなどのアドオンは別料金です。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。
Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。
Pewbeamは、説教を聞き取り、聖書箇所をリアルタイムで検出して、該当箇所を画面に表示する教会向けプレゼンテーションアプリです。牧師、映写チーム、教会メディア担当に最適です。
Dictatoは、Mac向けの音声入力アプリ。オンデバイスのオフライン処理で、どのアプリでも音声をその場でテキスト化。複数の文字起こしエンジン、校正・翻訳、買い切りライセンスに対応。
Voicenotesは、会話を文字起こしし、要約やアクション項目を生成し、Ask AIで過去の録音を検索できるAIメモ・会議録音アプリです。音声入力や多言語文字起こしにも対応。