評測指南

Deepgram Nova-3 語音轉文字介紹:高速繁中轉錄與說話者辨識

personJH LAI
calendar_today

探索 Deepgram Nova-3 的核心特色、繁體中文代碼(zh-TW)、說話者辨識(diarization)、Keyterm Prompting 與官方 API 測試,並了解如何搭配 Scribis 進行語音工作流。

如果你正在尋找速度快、支援中文且能處理多人對話的 Cloud ASR,Deepgram Nova-3 是值得列入測試清單的服務。Deepgram 官方將 Nova-3 定位為高效能的一般用途語音辨識模型,支援預錄音訊與即時串流,並提供 Smart Formatting、Keyterm Prompting、Entity Detection 和 Speaker Diarization 等功能。

本篇會介紹 Deepgram Nova-3 的特色、適合的使用情境、API 測試方法和費用,並說明如何把 Scribis 放進完整的錄音工作流程。

Deepgram Nova-3 適合哪些情境?

Deepgram 適合訪談、會議、課程、Podcast、影片字幕和即時字幕等工作。它的價值不只是回傳一段純文字,也能提供時間軸、標點、段落和說話者資訊,方便後續整理與字幕製作。

Deepgram 目前的模型與語言文件列出中文普通話以及台灣繁中語系代碼,包括 zh-TWzh-Hant。如果內容包含中文與英文術語,可以比較 multilingual 模型;若錄音主要只有一種語言,則可先指定主要語言測試。

功能 適合用途
預錄轉錄 訪談、課程、會議、Podcast 與影片
即時串流 直播字幕與即時語音應用
zh-TWzh-Hant 台灣繁中與繁體中文錄音
Speaker Diarization 將不同說話者標記為 Speaker 0、Speaker 1 等
Smart Formatting 改善標點、日期、數字和文字可讀性
Keyterm Prompting 提示品牌、人名、產品名和專業術語

Deepgram 的核心特色

繁體中文與多語內容

若音訊主要是台灣中文,可以先指定 language=zh-TW。如果內容有中英夾雜,則應比較 monolingual 與 multilingual 設定,觀察英文品牌、技術名詞、縮寫和數字是否被正確保留。

說話者辨識

Deepgram 的 Speaker Diarization 會在轉錄結果的 word 物件中加入 speaker 編號、開始時間、結束時間與信心分數。預錄音訊可使用 diarize_model=latest;官方建議新整合優先使用 latest,讓服務採用最新的正式 diarizer。

Deepgram 官方文件也指出,diarization 與 Nova batch models 相容,但不支援 Deepgram Whisper model。因此,若你的工作流程需要 Speaker 標籤,必須確認選用的是相容的 Nova 模型。

專有名詞提示

Deepgram 的 Keyterm Prompting 適合品牌、產品、人名、醫療或技術詞彙。它是提供模型的辨識提示,不是把沒有說出的字硬塞進逐字稿。正式使用前,建議用實際音檔測試提示是否真的改善結果。

用官方 API 測試 Deepgram

若想在導入任何桌面工具前先確認 Deepgram 的辨識品質,可以直接使用官方 API。Deepgram 的預錄轉錄 endpoint 是:

https://api.deepgram.com/v1/listen

先設定環境變數:

export DEEPGRAM_API_KEY='YOUR_DEEPGRAM_API_KEY'

基本繁中轉錄

curl --request POST \
  --header "Authorization: Token ${DEEPGRAM_API_KEY}" \
  --header 'Content-Type: audio/m4a' \
  --data-binary @sample.m4a \
  --url 'https://api.deepgram.com/v1/listen?model=nova-3&language=zh-TW&punctuate=true&smart_format=true'

加入說話者辨識與段落

curl --request POST \
  --header "Authorization: Token ${DEEPGRAM_API_KEY}" \
  --header 'Content-Type: audio/m4a' \
  --data-binary @meeting.m4a \
  --url 'https://api.deepgram.com/v1/listen?model=nova-3&language=zh-TW&punctuate=true&smart_format=true&utterances=true&diarize_model=latest'

請將檔案路徑和 API key 換成自己的值。公開文章、GitHub 和教學截圖都不應出現真實 key。

費用參考

Deepgram 官方價格頁目前列出 Pay-as-you-go 的 Nova-3 預錄價格約為 US$0.0043/分鐘(monolingual)和 US$0.0052/分鐘(multilingual)。Keyterm Prompting、Entity Detection、Redaction 等功能可能另外計費;實際方案和免費額度以 Deepgram Console 為準。

Cloud ASR 公開基本價格比較

Deepgram 的費用與 ElevenLabs credits、Groq API 額度和其他 Cloud ASR 帳單完全分開。若你用不同服務比較同一段音訊,請分別查看各自的用量頁面。

如何把 Scribis 放進錄音工作流程?

Scribis 可以作為桌面端的錄音整理工具:匯入本機音訊或影片、取得逐字稿、編輯文字、搜尋內容,再匯出字幕或文字檔。這種工作方式很適合在比較不同 Cloud ASR 之後,集中整理最後採用的逐字稿。

常見問題

Deepgram 能辨識台灣繁中嗎?

官方模型與語言文件列出台灣繁中相關語系代碼。建議使用 zh-TWzh-Hant 做實際錄音測試,並檢查台灣用語、英文術語和人名。

為什麼沒有 Speaker 標籤?

請確認使用的是相容的 Nova batch model,並且在 API 請求中加入 diarize_model=latest。Deepgram Whisper 不支援 diarization;若使用桌面工具,也要確認該工具有解析 speaker metadata。

diarize=truediarize_model=latest 要一起使用嗎?

不需要。Deepgram 目前建議使用 diarize_model,不要同時傳送兩個參數,以免請求被拒絕。

結語

Deepgram Nova-3 很適合用來測試高速、多語和多人會議轉錄。它支援台灣繁中、說話者辨識、時間軸和專有名詞提示,對字幕與會議整理尤其有吸引力。

你可以先用 Deepgram 官方 API 取得一份結果,再使用 Scribis 把錄音與逐字稿集中整理、校對和匯出。這樣可以各自發揮 Cloud ASR 與桌面工作工具的優勢,也不會把兩個不同服務的功能與帳務混在一起。

相關連結

  1. Deepgram Models & Languages Overview
  2. Deepgram Speaker Diarization
  3. Deepgram Pricing