SKI 是一款適用於 Mac 與 Windows 的桌面應用程式,讓開發者可與 AI coding agents 對話並以語音聽取回覆。主語音流程可在本機離線運作,並支援可選的會議轉錄與 agent 輔助通話功能。
Chariot 是一款 AI 文字轉語音產品,可將文字轉成英語、印地語與 Hinglish 語音,支援低延遲串流與開發者 API,適合語音代理、應用音訊與自然語音工作流程。
gstack 將 Garry Tan 的開源專家角色帶入即時會議,化身語音機器人;支援 Google Meet,亦提及 Zoom 與 Teams,採用本機 coding-agent 工作流程。
PodcastorAI 是 AI Podcast 工作室,可將內容轉成 Podcast 腳本、音訊集數與影片 Podcast。從主題、文件、URL、筆記或錄音快速產出可發布節目,免傳統錄音室。
VocalVia 是文件轉 Podcast 工具,可將 PDF、文章、筆記、Markdown 與網頁來源轉成可編輯的 Podcast 草稿與音訊,先審閱大綱與腳本再輸出成品。
SpeechifyAI 是一個語音 AI 平台,提供語音生成、聲音複製與語音代理建置。適合開發者透過單一 API 實作文字轉語音、多語音訊與通話流程。
Alvoff Inference 是相容 OpenAI 的 API,提供語音轉文字、文字轉語音、embeddings 與聊天/程式碼生成;可直接替換 base URL,沿用熟悉 SDK,按次計費。
speech-core 是一套用於裝置端語音編排的 C++17 函式庫,支援 VAD、串流與批次 STT、說話人分離、TTS 與語音代理流程;可本機執行,並可選用 ONNX Runtime 或 LiteRT 進行模型推論。
Voiser AI 文字轉語音配音工具,支援多語言聲音選擇與風格控制,適合快速製作旁白。提供網頁工作流程,並有免費、付費與企業方案。
Tico 是一款適用於 Windows 的 AI 助理,會跟隨游標、理解螢幕內容並以語音引導操作。提供每日限額的免費使用與可增加次數、優先支援的付費方案。
Yeta AI 是一款瀏覽器版工具,能以 AI 聲音即時翻譯並配音公開 YouTube 影片,適合以超過 10 種語言觀看教學、講座與長影片,不必依賴字幕。
Morph 是一個網頁式閱讀平台,收錄公版經典作品,整合文字、同步朗讀與 AI 助理。可在閱讀與聆聽間自由切換,瀏覽精選書庫,並在頁面內取得書籍專屬協助。
FlowSpeech 是一款具情境感知的文字轉語音工作室,可將腳本與上傳檔案轉為自然擬真音訊。提供多種生成模式、停頓與情緒控制,並有免費方案與付費方案。
xAI 的 Grok Speech to Text and Text to Speech APIs,透過 REST 與 WebSocket 端點為應用加入轉錄與語音生成,支援多語 STT、表達豐富的 TTS 與按用量計費。
Gemini 3.1 Flash TTS 是 Google 的預覽版文字轉語音模型,可生成富有表現力的 AI 語音,並細緻控制風格與呈現方式。支援 Gemini API、Google AI Studio、Vertex AI 與 Google Vids。
Guardrails 2.0 是 ElevenLabs 為 ElevenAgents 提供的控制層,可讓 AI 語音代理保持主題一致、符合政策,並更安全地部署於正式環境。適用於支援、銷售、行銷、接待與內部流程團隊。
HeyGen Developers 官方 API 文件,支援 AI 虛擬人影片、翻譯、口型同步與互動式 video-agent 工作流程,提供 API、MCP 與 CLI 介接方式。
Smallest.ai Lightning TTS 是一款文字轉語音 API,可將文字快速轉為語音音訊,支援低延遲、多語言與快速聲音克隆,適合開發者與產品團隊打造語音代理、旁白內容與生產級語音流程。
Voxtral TTS 是 Mistral 的文字轉語音模型,支援多語言、擬真語音與低延遲輸出,適用於語音代理與企業語音流程,並可透過 Mistral Studio、Le Chat、API 與 Hugging Face 開放權重使用。
Gemini 3.1 Flash Live 是 Google 的即時語音模型,支援自然對話,適用於開發、企業與消費者場景;目前於 Google AI Studio 提供開發者預覽,並支援 Gemini Live 與 Search Live。