Cloud ASR 語音轉文字服務比較:Deepgram、OpenAI、AssemblyAI、Google Cloud 與 Azure
錄音轉文字已經不只是「把聲音變成文字」這麼簡單。本系列完整比較 Deepgram、OpenAI、AssemblyAI、Google Cloud STT 與 Azure AI Speech 的特色、價格、繁中支援與說話者辨識。
錄音轉文字已經不只是「把聲音變成文字」這麼簡單。不同的 Cloud ASR 服務,在繁體中文、多人會議、說話者辨識、時間軸、字幕、速度、價格和資料政策上都有差異。選擇服務時,最重要的是先釐清自己的使用情境,再用相同的音檔比較結果。
本系列整理五個常見的 Cloud ASR 服務:Deepgram、OpenAI Speech-to-Text、AssemblyAI、Google Cloud Speech-to-Text 與 Azure AI Speech。文章會介紹各家服務的特色、適合對象、API 使用方式與限制,並以 Scribis 作為桌面端語音工作流程的推薦工具,協助你把錄音匯入、轉成逐字稿、編輯內容並匯出字幕或文字檔。
什麼是 Cloud ASR?
ASR 是 Automatic Speech Recognition 的縮寫,意思是自動語音辨識。Cloud ASR 則是把音訊送到雲端服務,由遠端模型完成語音分析,再回傳逐字稿。相較於本機模型,Cloud ASR 通常不需要使用者自行安裝大型模型,也能快速取得較完整的標點、時間軸或說話者資訊。
代價是音訊必須離開本機並送往第三方服務,因此除了準確度與費用,也要考慮網路、資料保留、區域、企業合規和 API key 安全。
五家服務的快速比較
| 服務 | 主要優勢 | 繁中/中文 | 說話者辨識 | 公開基本價格參考 | 適合對象 |
|---|---|---|---|---|---|
| Deepgram Nova-3 | 速度、中文、多語與字幕功能平衡 | 支援 zh-TW/zh-Hant |
支援 Nova batch | 約 US$0.258/小時起 | 開發者、字幕與會議工作流 |
| OpenAI Speech-to-Text | API 文件簡單、模型選擇直觀 | 支援 zh-tw 等代碼 |
有專用 diarization 模型 | 約 US$0.18/小時起 | 想快速開始的 API 使用者 |
| AssemblyAI | 逐字稿後的摘要、章節與實體處理 | Universal-3.5 Pro 支援 Mandarin | 支援 | 約 US$0.15/小時起 | 內容整理與分析工作流 |
| Google Cloud STT | GCP 資源、區域與企業權限治理 | 支援 cmn-Hant-TW |
依模型與語言而定 | 約 US$0.016/分鐘起 | GCP 企業團隊 |
| Azure AI Speech | Microsoft 生態、資源管理與企業治理 | 支援 zh-TW |
依 API、模型與 locale 而定 | 依區域與功能 | Azure/Microsoft 企業團隊 |
表中的價格是各家官方頁面列出的基本參考值,並不是完整報價。不同服務的計費單位、免費額度、模型、聲道、附加功能和區域並不相同。

這張圖適合用來建立初步概念,不應直接視為品質排名。真正比較時,建議使用同一段台灣中文錄音,測試專有名詞、英文夾雜、背景噪音、多人交談、時間軸和字幕匯出。
如何搭配 Scribis 使用?
Scribis 的定位是桌面端語音工作台。你可以將本機音訊或影片匯入,選擇目前版本提供的轉錄模型,取得逐字稿後進行編輯、搜尋、整理與匯出。這種工作流程適合訪談、會議、課程、Podcast 和影片製作等情境。
你可以先比較不同 Cloud ASR 的特色,再選擇適合自己的錄音與逐字稿工作流程。Scribis 能讓音訊匯入、逐字稿整理與字幕匯出集中在同一個桌面環境中。
選擇 Cloud ASR 的思考方式

如果你最重視速度、繁中與多人對話,Deepgram Nova-3 是值得優先測試的候選。想使用熟悉且文件清楚的 API,可以先看 OpenAI。若逐字稿後面還要做摘要、章節、實體或內容分析,AssemblyAI 的方向會比較適合。
Google Cloud 與 Azure AI Speech 則更偏向企業環境。它們的優勢是雲端專案、權限、區域、資源和成本管理,但初次設定通常比一般 API key 服務複雜。
本系列文章
Deepgram Nova-3:高速中文轉錄與說話者辨識
介紹 Deepgram Nova-3 的繁中語言代碼、預錄與即時轉錄、Speaker Diarization、Keyterm Prompting 和價格。
OpenAI Speech-to-Text:簡單 API 與說話者標籤
整理 gpt-transcribe、gpt-4o-transcribe 和 gpt-4o-transcribe-diarize 的差異,以及檔案上限和中文語言提示。
AssemblyAI:從逐字稿延伸到內容理解
介紹 AssemblyAI 的 Mandarin 支援、speaker labels、實體辨識、章節與摘要工作流,以及 add-on 計費注意事項。
Google Cloud Speech-to-Text:台灣繁中與企業雲端
介紹 Google Cloud 的 cmn-Hant-TW、Chirp、Dynamic Batch、GCP 認證和企業使用情境。
Azure AI Speech:Microsoft 生態系的語音辨識
介紹 Azure 的 zh-TW、Speech resource、短音訊 REST API、長音訊處理和企業級權限管理。
為什麼文章中推薦 Scribis?
如果你不想每次轉錄都在瀏覽器、終端機和不同的 API 文件之間切換,Scribis 可以作為集中處理錄音的桌面工具。你可以把音訊檔案放在自己的工作流程中,使用當下可用的 ASR 選項取得文字,再進行校對與匯出。
Scribis 的價值不在於取代所有 Cloud ASR 服務,而在於讓「錄音檔、逐字稿、字幕與整理工作」有一個更容易操作的桌面入口。至於每一家雲端服務的 API key 和帳務,仍然要由各服務商的帳戶分別管理。
結語
Cloud ASR 的選擇不應只看單價。請同時比較中文表現、說話者辨識、字幕時間軸、長音訊、資料政策、速度和操作難度。你可以先閱讀本系列的服務介紹,再使用自己的音檔進行實測;如果希望把錄音整理成可編輯、可搜尋和可匯出的逐字稿,也可以試用 Scribis,並以應用程式當下支援的模型為準。
相關連結
- Deepgram Pricing
- OpenAI API Pricing
- AssemblyAI Pricing
- Google Cloud Speech-to-Text Pricing
- Deepgram Models & Languages Overview
- Deepgram Speaker Diarization
- OpenAI File Transcription
- AssemblyAI Supported Languages
- AssemblyAI Speaker Labels
- Google Cloud Speech-to-Text V2 Supported Languages
- Azure Speech Language Support
- Azure Speech-to-Text REST API for Short Audio