Universal-3.5 Pro icon

Universal-3.5 Pro

Universal-3.5 Proは、録音済みの音声・動画向けAssemblyAIの非同期音声認識モデルです。ネイティブなコードスイッチング、話者分離、文脈プロンプトを搭載し、音声1時間あたり$0.21から利用できます。

Universal-3.5 Pro

概要

Universal-3.5 Proは、AssemblyAIの録音済み音声・動画向けの旗艦的な非同期音声認識モデルです。Pre-recorded Speech-to-Text APIの一部であり、対応言語や実世界の難しい音声に対して最高精度のモデルとして位置づけられています。

リリース記事では、18言語にわたるネイティブなコードスイッチング、改善された話者分離、文脈プロンプトという3つの主要機能が強調されています。料金ページでは、送信された音声1時間あたりの基本料金が$0.21で、話者分離、医療モード、キーワードプロンプト、一般的なプロンプトなどの機能にはオプションのアドオンがあると記載されています。

実際には、このモデルは音声が不明瞭だったり、多言語だったり、話者が多かったりする文字起こし用途を想定しています。会議、コンタクトセンターの録音、字幕、検索可能なアーカイブなど、リアルタイムの遅延よりも精度と話者属性が重要な録音済みワークフローに適しています。

主な機能

18言語にわたるネイティブなコードスイッチング

リリース記事によると、このモデルは18言語にわたるコードスイッチングにネイティブ対応しており、別途言語判定を挟まずに、実際に話された言語に沿って文字起こしできます。

重複発話に強い改善された話者分離

AssemblyAIは、このリリースをこれまでで最も高精度な話者分離として説明しており、雑音の多い会話やクロストークの中でも、文字起こしと話者属性の対応を保つよう設計されています。

文脈プロンプト

文脈プロンプトを使うと、ドメイン知識や事前コンテキストを入力して文字起こし結果に反映させられるため、専門用語や曖昧な音声での精度向上に役立ちます。

カスタム語彙向けのキーワードプロンプト

料金ページでは、Universal-3.5 Pro向けのキーワードプロンプトが最大1,000語まで対応しており、プロジェクト固有の語彙に認識を寄せる手段を提供します。

録音済み文字起こしモデル

Universal-3.5 Proは、AssemblyAIの音声認識ラインナップにおける非同期の録音済みモデルで、送信された音声1時間あたり$0.21で提供されています。

専門的なワークフロー向けのアドオンサポート

料金ページでは、このモデルに対して医療モードや話者分離などのオプションアドオンが用意されており、ベースの文字起こし料金に追加できます。

主な使用例

  • 多言語の録音会話

    1つの会話に複数の言語が含まれ、各時点で話された言語を文字起こしに反映させたい場合に、Universal-3.5 Proを使用します。

  • 話者が重なる会議

    短い応答、割り込み、重なる発話によって話者属性の判定が難しい会議メモや社内ディスカッションで使用します。

  • コンタクトセンターの録音

    正確な話者ラベル付けが下流の分析や品質保証に影響するコンタクトセンター通話や、その他の顧客対応で使用します。

  • 特定分野向けの文字起こし

    プロジェクト名、ドメイン用語、聞き間違えやすい語彙を含む専門的な議論を文字起こしする際に、文脈プロンプトやキーワードプロンプトを使用します。

  • 録音メディアのバッチ文字起こし

    音声がすでに録音済みで、遅延よりも文字起こし品質を優先できる場合に、アーカイブ、字幕、データセット準備に非同期APIを使用します。

Pros and Cons

Pros

  • 18言語にわたるネイティブなコードスイッチングに対応しており、会話が文中や通話中に言語をまたぐ場合に便利です。
  • 文脈プロンプトとキーワードプロンプトを追加し、専門分野の語彙に合わせて文字起こしを誘導できます。
  • クロストーク、割り込み、短い発話がある会話での話者分離が改善されています。
  • リアルタイムモデルとは別料金で、料金ページに明確な非同期レートが示されています。
  • 会議、コンタクトセンター音声、メディア、アーカイブなど、幅広い録音音声ワークフローに適しています。

Cons

  • 非同期モデルのため、ストリーミング出力が必要なライブ文字起こし用途には適していません。
  • 複数の高度な機能は、基本の文字起こし料金に含まれず、アドオンとして別課金されます。
  • ソース資料には、対応言語、出力形式、モデル自体の設定手順に関する完全な一覧は記載されていません。

FAQ

Universal-3.5 Proはどのような文字起こしワークフロー向けですか?

Universal-3.5 Proは、AssemblyAIの非同期の録音済み音声テキスト変換モデルです。ライブ配信の文字起こしではなく、録音済みの音声・動画向けに設計されています。

どのような言語サポートがありますか?

リリース記事では、18言語にわたるネイティブなコードスイッチングに対応しているとされています。製品ページでは、対応言語における録音済みモデルとして最高精度であると説明されています。

追加の文脈でモデルを誘導できますか?

リリース記事では文脈プロンプトが強調されており、料金ページでは一般的なプロンプトがUniversal-3.5 Pro向けの有料非同期アドオンとして利用できると示されています。

話者分離に対応していますか?

料金ページでは、Universal-3.5 Pro向けの非同期話者分離が、有料アドオンとして標準版と実験版の両方で掲載されています。リリース記事では、話者分離はモデルの主要な改善点の1つとして位置づけられています。

Universal-3.5 Proの料金はどのようになっていますか?

料金ページでは、Universal-3.5 Proの録音済み音声は1時間あたり$0.21と記載されています。話者分離、医療モード、キーワードプロンプト、一般的なプロンプトなどのアドオンは別料金です。

Quick Facts

カテゴリ
録音済み音声テキスト変換API
プラットフォーム
AssemblyAI Cloudおよびセルフホスト型Voice AIインフラストラクチャ
主な利用者
録音済みの音声・動画向け文字起こしワークフローを構築する開発者
基本料金
録音済み音声の送信1時間あたり$0.21
モデルAPI値
universal-3-pro
ソースドメイン
assemblyai.com

Universal-3.5 Proの代替品

QuickQuill icon

QuickQuill

QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。

Speech to Text Converter icon

Speech to Text Converter

Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。

Realtime and audio icon

Realtime and audio

Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。

Pewbeam icon

Pewbeam

Pewbeamは、説教を聞き取り、聖書箇所をリアルタイムで検出して、該当箇所を画面に表示する教会向けプレゼンテーションアプリです。牧師、映写チーム、教会メディア担当に最適です。

Dictato icon

Dictato

Dictatoは、Mac向けの音声入力アプリ。オンデバイスのオフライン処理で、どのアプリでも音声をその場でテキスト化。複数の文字起こしエンジン、校正・翻訳、買い切りライセンスに対応。

Voicenotes icon

Voicenotes

Voicenotesは、会話を文字起こしし、要約やアクション項目を生成し、Ask AIで過去の録音を検索できるAIメモ・会議録音アプリです。音声入力や多言語文字起こしにも対応。