Gemini 3.5 Transcribe icon

Gemini 3.5 Transcribe

Gemini 3.5 Transcribeは、リアルタイム音声と録音音声を文字起こしするGoogleのspeech-to-textモデルです。多言語対応、タイムスタンプ、話者識別で整ったテキスト化を支援します。

Gemini 3.5 Transcribe

概要

Gemini 3.5 Transcribe は、インテリジェントな文字起こしのための Google の speech-to-text モデルです。この発表では、リアルタイムの音声対話や録音音声を整った形式のテキストに変換するための、より高精度な選択肢として位置づけられています。

このモデルは、背景ノイズ、専門用語、言い淀み、文中の修正といった一般的な文字起こしの課題に対応するよう設計されています。Google AI Studio と Gemini Enterprise Agent Platform の Gemini API を通じて利用でき、macOS 版 Gemini アプリや Android 版 Rambler など Google 製品の音声機能も支えています。

主な機能

インテリジェントなリアルタイム文字起こし

音声にノイズ、専門用語、自己修正が含まれていても、洗練されたテキストへ文字起こしできるよう設計されています。

Live API による低遅延ストリーミング

Live API は、対話型音声アプリ向けにサブ秒レイテンシーで継続的な双方向ストリーミングをサポートします。

録音音声の処理

Interactions API は録音音声、会議、通話ログを処理し、話者識別と単語単位のタイムスタンプを返すことができます。

多言語の自動判定

このモデルは、地域のアクセントや方言を含む 85 を超える言語を自動的に検出して文字起こしし、ライブでの言語切り替えにも対応できます。

カスタム語彙のサポート

ユーザーが提供するカスタム語彙を通じて、専門用語や独自の表記を認識します。

音声対応の関数呼び出し

このモデルは、画像生成やファイル分析などのタスクを関数呼び出しで委任でき、現在は Gemini macOS アプリで利用できます。

実用的なユースケース

  • 対話型音声アプリケーション

    低遅延の継続的な音声-to-テキストと双方向ストリーミングを必要とする音声エージェントや対話型アプリを構築します。

  • 会議および通話の文字起こし

    会議、通話録音、音声ログを文字起こしし、話者識別とタイムスタンプを使って、何が誰によって話されたかを確認します。

  • ライブ字幕

    音声を収集中でも文字起こし結果が必要な、リアルタイムの字幕作成ツールを構築します。

  • 音声主導の生産性向上

    macOS 版 Gemini アプリまたは Android のワークフローで音声コマンドを使い、口述、編集、要約、または音声を整ったテキストに整形します。

  • 通話後分析

    正確な整形済みテキストが後続分析に必要な、通話後分析パイプライン向けに録音音声を処理します。

Pros and Cons

Pros

  • リアルタイムのストリーミングと録音済み文字起こしの両方のワークフローをサポートします。
  • 録音音声向けに話者識別と単語単位のタイムスタンプを備えています。
  • 85 を超える言語を自動的に検出して文字起こしします。
  • 背景ノイズ、専門用語、フィラーワード、自己修正に対応します。
  • Google AI Studio と Gemini Enterprise Agent Platform を通じて開発者が利用できます。

Cons

  • ソースページでは価格が公開されていません。
  • 一部のコンシューマー向け機能は限定的にしか利用できません。たとえば、Android 版 Rambler は一部の国と言語のみ、Chrome は近日提供予定、3 人以上の話者サポートは実験的として示されています。

FAQ

開発者は Gemini 3.5 Transcribe にどうアクセスできますか?

開発者は、Google AI Studio と Gemini Enterprise Agent Platform を通じて Gemini API で Gemini 3.5 Transcribe にアクセスできます。発表では、開発者向けのパブリックプレビューであるとも説明されています。

どのような文字起こしワークフローをサポートしていますか?

ページでは 2 つの API パスが紹介されています。1 つはサブ秒レイテンシーでリアルタイム配信を行う Live API、もう 1 つは話者識別と単語単位のタイムスタンプに対応した録音音声向けの Interactions API です。

どのような文字起こしの課題に対応するよう設計されていますか?

背景ノイズ、複雑な専門用語、フィラーの整理、カスタム語彙、そして地域のアクセントや方言を含む 85 を超える言語に対応するよう設計されています。

Gemini 3.5 Transcribe は Google 製品のどこで利用できますか?

発表によると、このモデルは macOS 版 Gemini アプリでは英語で、Android 版 Rambler では一部の国と言語で利用でき、Chrome でも近日提供予定です。

Gemini 3.5 Transcribe の価格は公開されていますか?

ソースには公開価格の詳細は記載されていません。開発者向けおよびエンタープライズ向けの各アクセスポイントでパブリックプレビューであるとだけ説明されています。

Quick Facts

カテゴリ
speech-to-text / 文字起こし
主な利用者
開発者、企業、コンシューマーアプリのユーザー
アクセス
Google AI Studio の Gemini API;Gemini Enterprise Agent Platform;macOS 版 Gemini アプリ;Android 版 Rambler
API モード
リアルタイムストリーミング用の Live API;録音音声用の Interactions API
言語
85 以上の言語、地域のアクセントと方言に対応
ソースドメイン
blog.google

Gemini 3.5 Transcribeの代替品

SpeakoFlow icon

SpeakoFlow

SpeakoFlowは、Windows、macOS、Linux対応の無料・オープンソースのデスクトップ音声入力アプリ。あらゆるアプリに дикationでき、Flow、要約整理、翻訳、画面認識アシスタントにも対応。

QuickQuill icon

QuickQuill

QuickQuillは、macOSで使えるローカル動作の音声入力・文字起こしアプリです。会議の録音、書き起こし、要約、ノート書き出しをクラウドなしで行えます。

Zen Whisper icon

Zen Whisper

Zen Whisperは、Apple Silicon搭載MacのmacOS 14以降向けローカルファーストの音声入力・文字起こしアプリ。ほとんどのMacテキスト欄へ入力でき、メディアや対応公開リンクも文字起こし可能。110言語に対応。

Speech to Text Converter icon

Speech to Text Converter

Speech to Text Converter は、ブラウザで使える文字起こしツールです。ライブ音声入力や音声・動画ファイルのアップロードに対応し、短い作業向けの無料プランと、無制限の文字起こし、AI要約、翻訳、話者識別、詳細な書き出し機能を備えたProプランがあります。

Sanota icon

Sanota

Sanotaは、話した思い出や振り返り、インタビューを分かりやすい文章の物語に変えるアプリ。家族史や共有の記憶づくりを、ガイド付きプロンプトと月額・年額プランで支援します。

Carbon Voice icon

Carbon Voice

Carbon Voiceは、チームと個人向けの非同期音声メッセージアプリ。文字起こし、AI要約、端末間アクセスで、通話なしのコミュニケーションを実現します。