評測指南

Cloud ASR 語音轉文字服務比較:Deepgram、OpenAI、AssemblyAI、Google Cloud 與 Azure

personJH LAI
calendar_today

錄音轉文字已經不只是「把聲音變成文字」這麼簡單。本系列完整比較 Deepgram、OpenAI、AssemblyAI、Google Cloud STT 與 Azure AI Speech 的特色、價格、繁中支援與說話者辨識。

錄音轉文字已經不只是「把聲音變成文字」這麼簡單。不同的 Cloud ASR 服務,在繁體中文、多人會議、說話者辨識、時間軸、字幕、速度、價格和資料政策上都有差異。選擇服務時,最重要的是先釐清自己的使用情境,再用相同的音檔比較結果。

本系列整理五個常見的 Cloud ASR 服務:Deepgram、OpenAI Speech-to-Text、AssemblyAI、Google Cloud Speech-to-TextAzure AI Speech。文章會介紹各家服務的特色、適合對象、API 使用方式與限制,並以 Scribis 作為桌面端語音工作流程的推薦工具,協助你把錄音匯入、轉成逐字稿、編輯內容並匯出字幕或文字檔。

什麼是 Cloud ASR?

ASR 是 Automatic Speech Recognition 的縮寫,意思是自動語音辨識。Cloud ASR 則是把音訊送到雲端服務,由遠端模型完成語音分析,再回傳逐字稿。相較於本機模型,Cloud ASR 通常不需要使用者自行安裝大型模型,也能快速取得較完整的標點、時間軸或說話者資訊。

代價是音訊必須離開本機並送往第三方服務,因此除了準確度與費用,也要考慮網路、資料保留、區域、企業合規和 API key 安全。

五家服務的快速比較

服務 主要優勢 繁中/中文 說話者辨識 公開基本價格參考 適合對象
Deepgram Nova-3 速度、中文、多語與字幕功能平衡 支援 zh-TWzh-Hant 支援 Nova batch 約 US$0.258/小時起 開發者、字幕與會議工作流
OpenAI Speech-to-Text API 文件簡單、模型選擇直觀 支援 zh-tw 等代碼 有專用 diarization 模型 約 US$0.18/小時起 想快速開始的 API 使用者
AssemblyAI 逐字稿後的摘要、章節與實體處理 Universal-3.5 Pro 支援 Mandarin 支援 約 US$0.15/小時起 內容整理與分析工作流
Google Cloud STT GCP 資源、區域與企業權限治理 支援 cmn-Hant-TW 依模型與語言而定 約 US$0.016/分鐘起 GCP 企業團隊
Azure AI Speech Microsoft 生態、資源管理與企業治理 支援 zh-TW 依 API、模型與 locale 而定 依區域與功能 Azure/Microsoft 企業團隊

表中的價格是各家官方頁面列出的基本參考值,並不是完整報價。不同服務的計費單位、免費額度、模型、聲道、附加功能和區域並不相同。

Cloud ASR 公開基本價格比較

這張圖適合用來建立初步概念,不應直接視為品質排名。真正比較時,建議使用同一段台灣中文錄音,測試專有名詞、英文夾雜、背景噪音、多人交談、時間軸和字幕匯出。

如何搭配 Scribis 使用?

Scribis 的定位是桌面端語音工作台。你可以將本機音訊或影片匯入,選擇目前版本提供的轉錄模型,取得逐字稿後進行編輯、搜尋、整理與匯出。這種工作流程適合訪談、會議、課程、Podcast 和影片製作等情境。

你可以先比較不同 Cloud ASR 的特色,再選擇適合自己的錄音與逐字稿工作流程。Scribis 能讓音訊匯入、逐字稿整理與字幕匯出集中在同一個桌面環境中。

選擇 Cloud ASR 的思考方式

Cloud ASR 選型流程

如果你最重視速度、繁中與多人對話,Deepgram Nova-3 是值得優先測試的候選。想使用熟悉且文件清楚的 API,可以先看 OpenAI。若逐字稿後面還要做摘要、章節、實體或內容分析,AssemblyAI 的方向會比較適合。

Google Cloud 與 Azure AI Speech 則更偏向企業環境。它們的優勢是雲端專案、權限、區域、資源和成本管理,但初次設定通常比一般 API key 服務複雜。

本系列文章

Deepgram Nova-3:高速中文轉錄與說話者辨識

介紹 Deepgram Nova-3 的繁中語言代碼、預錄與即時轉錄、Speaker Diarization、Keyterm Prompting 和價格。

OpenAI Speech-to-Text:簡單 API 與說話者標籤

整理 gpt-transcribegpt-4o-transcribegpt-4o-transcribe-diarize 的差異,以及檔案上限和中文語言提示。

AssemblyAI:從逐字稿延伸到內容理解

介紹 AssemblyAI 的 Mandarin 支援、speaker labels、實體辨識、章節與摘要工作流,以及 add-on 計費注意事項。

Google Cloud Speech-to-Text:台灣繁中與企業雲端

介紹 Google Cloud 的 cmn-Hant-TW、Chirp、Dynamic Batch、GCP 認證和企業使用情境。

Azure AI Speech:Microsoft 生態系的語音辨識

介紹 Azure 的 zh-TW、Speech resource、短音訊 REST API、長音訊處理和企業級權限管理。

為什麼文章中推薦 Scribis?

如果你不想每次轉錄都在瀏覽器、終端機和不同的 API 文件之間切換,Scribis 可以作為集中處理錄音的桌面工具。你可以把音訊檔案放在自己的工作流程中,使用當下可用的 ASR 選項取得文字,再進行校對與匯出。

Scribis 的價值不在於取代所有 Cloud ASR 服務,而在於讓「錄音檔、逐字稿、字幕與整理工作」有一個更容易操作的桌面入口。至於每一家雲端服務的 API key 和帳務,仍然要由各服務商的帳戶分別管理。

結語

Cloud ASR 的選擇不應只看單價。請同時比較中文表現、說話者辨識、字幕時間軸、長音訊、資料政策、速度和操作難度。你可以先閱讀本系列的服務介紹,再使用自己的音檔進行實測;如果希望把錄音整理成可編輯、可搜尋和可匯出的逐字稿,也可以試用 Scribis,並以應用程式當下支援的模型為準。

相關連結

  1. Deepgram Pricing
  2. OpenAI API Pricing
  3. AssemblyAI Pricing
  4. Google Cloud Speech-to-Text Pricing
  5. Deepgram Models & Languages Overview
  6. Deepgram Speaker Diarization
  7. OpenAI File Transcription
  8. AssemblyAI Supported Languages
  9. AssemblyAI Speaker Labels
  10. Google Cloud Speech-to-Text V2 Supported Languages
  11. Azure Speech Language Support
  12. Azure Speech-to-Text REST API for Short Audio