話者分離
Voxtral Mini Transcribe V2 は、話者ラベル付きの文字起こしと正確な開始・終了時刻を生成するため、誰が何をいつ話したかを把握したい場合に役立ちます。
Voxtral Transcribe 2は、文字起こし向けの次世代モデル2種として紹介された、Mistral AI の音声認識サービスです。Voxtral Mini Transcribe V2 はバッチ文字起こし向け、Voxtral Realtime はライブアプリケーション向けです。この発表では、より広い会話プラットフォームやエージェントプラットフォームではなく、文字起こし品質、話者分離、低レイテンシ、対応言語の幅に重点が置かれています。
製品ページでは、Voxtral Mini Transcribe V2 が 13言語で、話者分離、コンテキストバイアス、単語レベルのタイムスタンプを備えた最先端の文字起こしを提供すると説明されています。一方、Voxtral Realtime はサブ200msまで設定可能なレイテンシでストリーミング音声向けに設計されています。Mistral はまた、Realtime モデルが Apache 2.0 のオープンウェイトであること、さらに Mistral Studio の音声プレイグラウンドで API 実装前に話者分離とタイムスタンプ付きの文字起こしを試せることも案内しています。
ソースでは、会議の文字起こし、音声エージェント、コンタクトセンターの自動化、メディアの字幕生成、コンプライアンス文書化などの用途が示されています。記事内の価格情報によれば、両モデルは API で利用でき、Mini Transcribe V2 は1分あたり $0.003、Realtime は1分あたり $0.006 で、Realtime には Hugging Face でのオープンウェイト版もあります。
Voxtral Mini Transcribe V2 は、話者ラベル付きの文字起こしと正確な開始・終了時刻を生成するため、誰が何をいつ話したかを把握したい場合に役立ちます。
最大100語またはフレーズを指定して、名前、専門用語、その他の標準的な文字起こしシステムで取りこぼしやすい語彙に対してモデルを誘導できます。
モデルは各単語のタイムスタンプを返せるため、字幕作成、検索可能なアーカイブ、時間同期されたコンテンツワークフローを支援します。
両モデルは13言語に対応しています。英語、中国語、ヒンディー語、スペイン語、アラビア語、フランス語、ポルトガル語、ロシア語、ドイツ語、日本語、韓国語、イタリア語、オランダ語です。
Voxtral Realtime はライブ音声向けに設計され、200ms未満まで設定可能な低レイテンシをサポートし、Mini Transcribe V2 はバッチ文字起こし向けです。
製品説明では、話者分離、タイムスタンプ、音声ファイルのアップロードをすぐに試せる Mistral Studio の音声プレイグラウンドが強調されています。
定例会議を話者ラベルとタイムスタンプ付きで文字起こしし、通話後にチームが決定事項、担当、議論の流れを確認できるようにします。
音声のやり取りを応答性の高い状態に保つのに十分低い文字起こしレイテンシが必要な会話型エージェントやアシスタント体験を支えます。
サポートや営業の通話を発生中に処理し、話者分離で担当者と顧客の発話を分けて、後の分析や CRM 入力に活用します。
低レイテンシと単語単位のタイミングが音声と画面上の字幕の同期に役立つ、多言語メディア向けのライブまたは準ライブ字幕を生成します。
規制対象または機密性の高い会話を話者分離とタイムスタンプ付きで記録し、レビューや文書化のための監査証跡を明確にします。
Voxtral Transcribe 2は、2つのモデル विकल्पを備えた音声認識製品ファミリーです。バッチ文字起こし向けの Voxtral Mini Transcribe V2 と、ライブ用途向けの Voxtral Realtime があります。記事では、文字起こしを直接試せる Mistral Studio の音声プレイグラウンドについても触れています。
ソースでは、Voxtral Mini Transcribe V2 はバッチ文字起こしモデルとして、Voxtral Realtime は低レイテンシが重要なライブ用途向けのストリーミングモデルとして説明されています。記事には、これらの製品名と Mistral Studio のプレイグラウンド以外の完全な API や SDK のワークフローは記載されていません。
ソースによると、Mistral Studio の音声プレイグラウンドでは最大10個の音声ファイルをアップロードでき、話者分離の切り替え、タイムスタンプ粒度の選択、コンテキストバイアス用語の追加が可能です。対応形式は .mp3、.wav、.m4a、.flac、.ogg で、各ファイルは最大1GBです。
記事では、Voxtral Mini Transcribe V2 は API 経由で 1分あたり $0.003、Voxtral Realtime は API 経由で 1分あたり $0.006、さらに Hugging Face 上でオープンウェイトとして利用できるとされています。料金ページでは Mistral が API 利用と Studio ダッシュボードを提供していることも確認されていますが、Voxtral 固有のパッケージ詳細は追加されていません。
ソースによると、Voxtral Realtime は Apache 2.0 ライセンスのオープンウェイトとして提供され、エッジデバイスにデプロイできます。また、両モデルは GDPR および HIPAA に準拠した導入向けに、オンプレミスまたはプライベートクラウドの安全な構成をサポートするとされていますが、記事には実装手順は記載されていません。
QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。
Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。
Dictatoは、Mac向けの音声入力アプリ。オンデバイスのオフライン処理で、どのアプリでも音声をその場でテキスト化。複数の文字起こしエンジン、校正・翻訳、買い切りライセンスに対応。
Sanotaは、話した思い出や振り返り、インタビューを分かりやすい文章の物語に変えるアプリ。家族史や共有の記憶づくりを、ガイド付きプロンプトと月額・年額プランで支援します。
Carbon Voiceは、チームと個人向けの非同期音声メッセージアプリ。文字起こし、AI要約、端末間アクセスで、通話なしのコミュニケーションを実現します。
Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。