TADA icon

TADA

TADAはHume AIのオープンソース音声言語モデル。テキストと音声を1対1で整合し、より高速で信頼性の高い音声システムの構築に最適。

TADA

同期したテキストと音声によるオープンソース音声生成

TADA(Text-Acoustic Dual Alignmentの略)は、テキストと音声を1対1で同期させながら音声を生成する、Hume AIのオープンソース音声言語モデルです。このモデルは、LLMベースのテキスト読み上げシステムにおける一般的な制約、つまり音声系列はテキスト系列よりはるかに密度が高く、そのため生成が遅く不安定になりやすいという問題への対応として位置づけられています。

Humeによると、TADAは音響表現をテキストトークンに直接整合させる新しいトークナイゼーション方式でこの不一致に対処します。投稿では、これにより高速な音声生成、競争力のある音質、事実上ゼロの内容幻覚が実現し、さらにオンデバイス展開にも十分軽量なフットプリントが保たれると説明されています。リリースにはコード、事前学習済みモデル、完全なトークナイザーとデコーダーが含まれており、現在のモデルは英語に加えて7つの追加言語をカバーしています。

主な機能

テキストと音声の1対1整合

各テキストトークンを対応する音響ベクトルに対応付けるテキスト・音響デュアルアライメント方式を使用し、音声とテキストを同期させます。

組み込みの内容信頼性

設計上、内容の欠落や幻覚語を避けるよう作られており、1,000件以上のLibriTTSRテストサンプルで幻覚ゼロと評価されています。

高速な音声生成

Humeの評価ではリアルタイム係数0.09で動作し、投稿では同等クラスのLLMベースTTSシステムより5倍以上高速だと説明されています。

オンデバイス向けの軽量設計

モバイル端末やエッジデバイスへのオンデバイス展開に十分小さいと投稿で説明されている軽量アーキテクチャを採用しています。

Speech Free Guidance対応

音声生成とテキスト生成が音声と同時に生成される際の差を縮めるためのSpeech Free Guidance手法を備えています。

オープンソースモデルの公開

1Bおよび3BパラメータのLlamaベースモデルとして、音声トークナイザーとデコーダーとともに公開されており、実験や拡張を可能にします。

実用例

  • 信頼性の高いテキスト読み上げパイプライン

    テキストと音声の同期を保ち、内容の飛びや幻覚的な語を避けるよう設計されているため、より高い内容忠実度が必要なTTSシステムを構築するチームに有用です。

  • モバイルおよびエッジへの展開

    Humeはこのアーキテクチャをモバイル端末やエッジデバイスに十分軽量だと説明しているため、低レイテンシのオンデバイス音声が必要な製品に適しています。

  • 長文の音声体験

    従来の手法よりも優れたコンテキスト効率が投稿で強調されているため、長文ナレーションや会話型音声体験に取り組む開発者に役立ちます。

  • 機微な本番環境

    投稿では本番運用での信頼性と、管理すべきエッジケースが少ない点が強調されているため、医療、金融、教育などの規制対象または機微性の高い環境に関連します。

  • 研究およびファインチューニングのワークフロー

    Humeがモデル、トークナイザー、デコーダーを公開し、新しいモダリティや用途へのさらなる取り組みを呼びかけているため、音声モデルを拡張する研究者や開発者に適しています。

Pros and Cons

Pros

  • 1対1の整合により、テキストの飛びや幻覚的な内容を減らすよう設計されています。
  • Humeは、1,000件超のLibriTTSR評価セットで幻覚ゼロを報告しています。
  • このモデルは、従来のLLMベースTTSシステムよりも高速で、コンテキスト効率が高いと説明されています。
  • フットプリントはモバイルやエッジへの展開に十分軽量だと説明されています。
  • コード、事前学習済みモデル、トークナイザー/デコーダーが、オープンソースライセンスのもとで現在利用可能です。

Cons

  • 投稿によると、このモデルは音声継続用に事前学習されているため、アシスタント用途には追加のファインチューニングが必要です。
  • Humeは、リジェクションサンプリング戦略でこの問題を軽減しているものの、長い生成時には時折スピーカードリフトが発生すると述べています。
  • 現在のリリースは英語と7つの追加言語をカバーしているため、より広範な多言語システムと比べると対応言語はまだ限定的です。

FAQ

TADAとは何ですか?

TADAはHume AIのオープンソース音声言語モデルです。ソースによると、現在のリリースには1Bおよび3BパラメータのLlamaベースモデルに加え、完全な音声トークナイザーとデコーダーが含まれています。

TADAはそのままアシスタント用途に使えますか?

投稿によると、TADAは音声継続用に学習されており、アシスタント用途には追加のファインチューニングが必要です。Humeは、音声モデルに取り組む開発者に対し、ファインチューニングデータについて連絡するよう呼びかけています。

このリリースはどの言語をサポートしていますか?

Humeによると、現在のリリースは英語と7つの追加言語をカバーしています。

モデルとコードにはどうやってアクセスできますか?

ブログでは、TADAはオープンソースライセンスのもとで利用でき、コードと事前学習済みモデルがHugging Face、GitHub、arXivの論文リンクを通じて現在入手可能だと説明されています。

投稿で指摘されている主な制限は何ですか?

投稿では長文生成に関する制限が指摘されています。モデルは10分を超えるコンテキストをサポートしますが、Humeは長い生成時にスピーカードリフトが起こる場合があると観測しており、回避策としてコンテキストのリセットを提案しています。

Quick Facts

カテゴリ
オープンソース音声言語モデル
企業
Hume AI
コアワークフロー
音声生成のためのテキスト・音響デュアルアライメント
リリース形式
1Bおよび3BのLlamaベースモデル、トークナイザーとデコーダー付き
アクセス
オープンソースライセンス;コードと事前学習済みモデルが現在利用可能
対応範囲
英語と7つの追加言語