Voxtral Transcribe 2 icon

Voxtral Transcribe 2

Voxtral Transcribe 2は、バッチとライブの文字起こしに対応したMistral AIの音声認識ファミリーです。話者分離、タイムスタンプ、多言語対応、Mistral Studioの音声プレイグラウンドでの事前テストを備えています。

Voxtral Transcribe 2

概要

Voxtral Transcribe 2は、文字起こし向けの次世代モデル2種として紹介された、Mistral AI の音声認識サービスです。Voxtral Mini Transcribe V2 はバッチ文字起こし向け、Voxtral Realtime はライブアプリケーション向けです。この発表では、より広い会話プラットフォームやエージェントプラットフォームではなく、文字起こし品質、話者分離、低レイテンシ、対応言語の幅に重点が置かれています。

製品ページでは、Voxtral Mini Transcribe V2 が 13言語で、話者分離、コンテキストバイアス、単語レベルのタイムスタンプを備えた最先端の文字起こしを提供すると説明されています。一方、Voxtral Realtime はサブ200msまで設定可能なレイテンシでストリーミング音声向けに設計されています。Mistral はまた、Realtime モデルが Apache 2.0 のオープンウェイトであること、さらに Mistral Studio の音声プレイグラウンドで API 実装前に話者分離とタイムスタンプ付きの文字起こしを試せることも案内しています。

ソースでは、会議の文字起こし、音声エージェント、コンタクトセンターの自動化、メディアの字幕生成、コンプライアンス文書化などの用途が示されています。記事内の価格情報によれば、両モデルは API で利用でき、Mini Transcribe V2 は1分あたり $0.003、Realtime は1分あたり $0.006 で、Realtime には Hugging Face でのオープンウェイト版もあります。

主な機能

話者分離

Voxtral Mini Transcribe V2 は、話者ラベル付きの文字起こしと正確な開始・終了時刻を生成するため、誰が何をいつ話したかを把握したい場合に役立ちます。

コンテキストバイアス

最大100語またはフレーズを指定して、名前、専門用語、その他の標準的な文字起こしシステムで取りこぼしやすい語彙に対してモデルを誘導できます。

単語レベルのタイムスタンプ

モデルは各単語のタイムスタンプを返せるため、字幕作成、検索可能なアーカイブ、時間同期されたコンテンツワークフローを支援します。

多言語対応の拡充

両モデルは13言語に対応しています。英語、中国語、ヒンディー語、スペイン語、アラビア語、フランス語、ポルトガル語、ロシア語、ドイツ語、日本語、韓国語、イタリア語、オランダ語です。

バッチとライブの両モード

Voxtral Realtime はライブ音声向けに設計され、200ms未満まで設定可能な低レイテンシをサポートし、Mini Transcribe V2 はバッチ文字起こし向けです。

Studio 内の音声プレイグラウンド

製品説明では、話者分離、タイムスタンプ、音声ファイルのアップロードをすぐに試せる Mistral Studio の音声プレイグラウンドが強調されています。

一般的なユースケース

  • 会議メモと要約

    定例会議を話者ラベルとタイムスタンプ付きで文字起こしし、通話後にチームが決定事項、担当、議論の流れを確認できるようにします。

  • 音声エージェントとアシスタント

    音声のやり取りを応答性の高い状態に保つのに十分低い文字起こしレイテンシが必要な会話型エージェントやアシスタント体験を支えます。

  • コンタクトセンターのワークフロー

    サポートや営業の通話を発生中に処理し、話者分離で担当者と顧客の発話を分けて、後の分析や CRM 入力に活用します。

  • メディアと字幕

    低レイテンシと単語単位のタイミングが音声と画面上の字幕の同期に役立つ、多言語メディア向けのライブまたは準ライブ字幕を生成します。

  • コンプライアンスと監査記録

    規制対象または機密性の高い会話を話者分離とタイムスタンプ付きで記録し、レビューや文書化のための監査証跡を明確にします。

Pros and Cons

Pros

  • 1つの製品ファミリーで、バッチと低レイテンシの両方の文字起こし विकल्पを提供します。
  • 話者分離と単語レベルのタイムスタンプを備え、より構造化された文字起こしを実現します。
  • ヨーロッパとアジアの主要言語を含む13言語に対応しています。
  • 統合前の迅速なテスト用に、Mistral Studio の音声プレイグラウンドを利用できます。
  • Voxtral Realtime は Apache 2.0 のオープンウェイトとして提供され、エッジまたはプライベート環境への展開シナリオに対応します。

Cons

  • 公開ソースは発表記事のため、セットアップ手順、SDK の詳細、デプロイ例は限られています。
  • コンテキストバイアスは英語向けに最適化されていると説明されており、他言語のサポートは実験的とされています。
  • 記事では、重なり合う発話がある場合、通常は1人の話者を文字起こしするため、密な複数人音声では制約になる可能性があると述べています。

FAQ

Voxtral Transcribe 2とは何ですか?

Voxtral Transcribe 2は、2つのモデル विकल्पを備えた音声認識製品ファミリーです。バッチ文字起こし向けの Voxtral Mini Transcribe V2 と、ライブ用途向けの Voxtral Realtime があります。記事では、文字起こしを直接試せる Mistral Studio の音声プレイグラウンドについても触れています。

2つのモデルはどう違いますか?

ソースでは、Voxtral Mini Transcribe V2 はバッチ文字起こしモデルとして、Voxtral Realtime は低レイテンシが重要なライブ用途向けのストリーミングモデルとして説明されています。記事には、これらの製品名と Mistral Studio のプレイグラウンド以外の完全な API や SDK のワークフローは記載されていません。

Mistral Studio で試せますか?

ソースによると、Mistral Studio の音声プレイグラウンドでは最大10個の音声ファイルをアップロードでき、話者分離の切り替え、タイムスタンプ粒度の選択、コンテキストバイアス用語の追加が可能です。対応形式は .mp3、.wav、.m4a、.flac、.ogg で、各ファイルは最大1GBです。

Voxtral Transcribe 2の価格はいくらですか?

記事では、Voxtral Mini Transcribe V2 は API 経由で 1分あたり $0.003、Voxtral Realtime は API 経由で 1分あたり $0.006、さらに Hugging Face 上でオープンウェイトとして利用できるとされています。料金ページでは Mistral が API 利用と Studio ダッシュボードを提供していることも確認されていますが、Voxtral 固有のパッケージ詳細は追加されていません。

Voxtral をセルフホストまたはプライベート環境にデプロイできますか?

ソースによると、Voxtral Realtime は Apache 2.0 ライセンスのオープンウェイトとして提供され、エッジデバイスにデプロイできます。また、両モデルは GDPR および HIPAA に準拠した導入向けに、オンプレミスまたはプライベートクラウドの安全な構成をサポートするとされていますが、記事には実装手順は記載されていません。

Quick Facts

カテゴリ
音声認識
製品ファミリー
Voxtral Mini Transcribe V2 と Voxtral Realtime
主なワークフロー
バッチ文字起こしとライブ文字起こし
対応言語
13言語
Studio アクセス
Mistral Studio の音声プレイグラウンド
価格の目安
API 利用は発表記事に記載。Mini Transcribe V2 は1分あたり $0.003、Realtime は1分あたり $0.006

Voxtral Transcribe 2の代替品

QuickQuill icon

QuickQuill

QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。

Speech to Text Converter icon

Speech to Text Converter

Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。

Dictato icon

Dictato

Dictatoは、Mac向けの音声入力アプリ。オンデバイスのオフライン処理で、どのアプリでも音声をその場でテキスト化。複数の文字起こしエンジン、校正・翻訳、買い切りライセンスに対応。

Sanota icon

Sanota

Sanotaは、話した思い出や振り返り、インタビューを分かりやすい文章の物語に変えるアプリ。家族史や共有の記憶づくりを、ガイド付きプロンプトと月額・年額プランで支援します。

Carbon Voice icon

Carbon Voice

Carbon Voiceは、チームと個人向けの非同期音声メッセージアプリ。文字起こし、AI要約、端末間アクセスで、通話なしのコミュニケーションを実現します。

Realtime and audio icon

Realtime and audio

Realtime and audio は、ライブ音声の翻訳、文字起こし、音声生成、音声対応チャットに最適な speech architecture を選ぶための OpenAI API ガイドです。各用途に合う session type、endpoint、接続方法を案内します。