評測指南

Azure AI Speech 語音轉文字介紹:Microsoft 生態系的企業級選擇

personJH LAI
calendar_today

深入介紹 Azure AI Speech 服務的 zh-TW 語言設定、短音訊 REST API、Fast & Batch Transcription 與 Microsoft 企業級認證,並說明如何搭配 Scribis 進行語音工作流。

如果你的工作環境已經使用 Microsoft Azure、Microsoft Entra ID 或其他 Microsoft 企業服務,Azure AI Speech 是值得評估的 Cloud ASR。它提供即時轉錄、快速轉錄、批次轉錄與多種語言支援,也能配合 Azure 的 resource、region、權限與成本管理。

和 Groq、OpenAI 或其他單純 API key 服務相比,Azure 的優勢在於企業治理與 Microsoft 生態系;相對地,建立 resource、處理認證和選擇正確的轉錄 API 也比較複雜。本篇會介紹 Azure AI Speech 的特色、台灣繁中、短音訊 REST API、長音訊工作流程和費用注意事項,並以 Scribis 作為桌面端逐字稿整理工具的推薦情境。

Azure AI Speech 適合哪些人?

Azure AI Speech 適合企業內部會議、客服錄音、Microsoft 365 周邊工作流,以及需要 Azure 區域和權限管理的團隊。對個人使用者而言,Deepgram、OpenAI 或 Groq 通常比較容易開始;Azure 的強項則是企業 resource、IAM、區域和成本治理。

Azure 官方語言支援頁指出,Speech-to-Text 的語言支援會依功能與 locale 而變化。台灣繁中可使用 zh-TW,但快速轉錄、批次轉錄、即時轉錄和 post-stream refinement 的支援狀況必須逐項查看官方表格。

項目 Azure AI Speech
台灣繁中 zh-TW
主要工作模式 即時、快速、批次與 post-stream refinement,依功能而定
認證 Speech resource key、Bearer token 或 Microsoft Entra ID
長音訊 建議使用 Speech SDK、Fast Transcription 或 Batch Transcription
適合對象 Azure/Microsoft 企業環境與需要治理的團隊
價格 依區域、層級、模型與功能計算

Azure 的價格不能用一個固定的每分鐘數字概括。使用前請查看 Azure Speech 定價頁 和自己的 region 設定。

台灣繁中的語言代碼

Azure Speech 使用 BCP-47 locale。台灣繁中可使用:

zh-TW

Azure 官方語言支援頁列出 zh-TW 為 Chinese (Taiwanese Mandarin, Traditional),但不同功能的可用性可能不同。因此,在啟用 automatic punctuation、speaker 功能、custom speech 或 post-stream refinement 之前,請先查看該功能在 zh-TW 是否顯示支援。

如果錄音是中英混合,先用 zh-TW 做基準測試,再比較 Azure 的 multilingual 或 language identification 功能。不同 Cloud ASR 的語言代碼不能直接互換;Google Cloud 的 cmn-Hant-TW 就不能直接當成 Azure 的值。

建立 Azure Speech resource

前往 Azure Portal,建立一個 Speech resource。建立時需要選擇訂用帳戶、resource group、region 和 pricing tier。建議為語音轉文字建立獨立 resource,方便查看用量、設定預算和撤銷 key。

建立完成後,開啟該 Speech resource 的 Keys and Endpoint,你會看到 resource key 和服務 endpoint。這組 key 具有服務存取權限,請使用密碼管理器保存,不要放在文章、GitHub、螢幕截圖或公開影片中。

如果公司使用 Microsoft Entra ID,也可以使用 Entra authentication 取得 bearer token,而不是把長期 subscription key 放在應用程式設定中。這種方式需要角色指派與 token 管理,適合由熟悉 Azure IAM 的管理員設定。

用短音訊 REST API 做第一次測試

Azure 的 Speech-to-text REST API for short audio 適合無法使用 Speech SDK 或 fast transcription API 的短錄音。官方文件指出,直接傳送的音訊不能超過 60 秒,只會回傳 final result,不提供 partial result;它也不支援 batch transcription 或 custom speech。

短音訊 REST API 的常見輸入格式是 16 kHz、單聲道的 WAV PCM 或 OGG OPUS。請求必須指定 language,例如 zh-TW;認證可以使用 Ocp-Apim-Subscription-Key 或 bearer token。

curl --request POST \
  --url 'https://YOUR_RESOURCE_NAME.cognitiveservices.azure.com/stt/speech/recognition/conversation/cognitiveservices/v1?language=zh-TW&format=detailed' \
  --header 'Accept: application/json' \
  --header 'Content-Type: audio/wav; codecs=audio/pcm; samplerate=16000' \
  --header 'Ocp-Apim-Subscription-Key: YOUR_SPEECH_RESOURCE_KEY' \
  --data-binary '@sample.wav'

請將 resource name、key 和檔案路徑換成自己的值。這個 endpoint 只適合短音訊驗證,不應拿來處理一小時的會議錄音。

長音訊與批次轉錄

對課程、訪談、Podcast 或長時間會議,應使用 Azure Speech SDK、Fast Transcription 或 Batch Transcription,而不是 short audio REST API。長音訊流程通常需要使用檔案 URL、Azure Storage 或其他受支援的輸入方式提交,並等待工作完成。

這也是 Azure 與單純 multipart upload 服務的主要差異:企業工作流需要處理 resource、region、job status、storage 和結果下載。使用者得到的好處是資源管理較完整,但第一次設定的步驟較多。

說話者與進階語音功能

Azure Speech 的功能支援會隨 API、locale、模型和處理模式變化。官方語言支援頁將即時轉錄、快速轉錄、批次轉錄與 post-stream refinement 分開列出,因此不能只看到 zh-TW 就推論所有進階功能都可用。

如果你需要字幕,請確認 API response 是否包含時間偏移或 word time offsets,並測試轉成 SRT 或 VTT 後的時間軸。如果需要說話者辨識,也要確認該功能是否同時支援你的 locale、模型和工作模式。

如何搭配 Scribis 整理錄音?

Scribis 可以作為桌面端語音工作台:匯入本機音訊或影片、取得逐字稿、編輯文字、搜尋內容,再匯出字幕或文字檔。若你使用 Azure 官方 API 取得結果,Scribis 也可以用來整理和校對最後的文字內容。

完成 Azure Speech 轉錄後,可以使用 Scribis 進行逐字稿校對、搜尋、整理與字幕匯出。

費用與安全

Azure Speech 的費用取決於語音轉文字的處理方式、region、pricing tier、模型和附加功能。官方定價頁會以 Speech-to-Text、Custom、Enhanced add-on 等不同類別列出價格,因此不宜用單一數字代表所有 Azure 帳戶。

Cloud ASR 公開基本價格比較

上圖只比較具有清楚公開基本費率的其他 Cloud ASR,不包含 Azure,因為 Azure 的費用需要依 resource、region、層級與功能查詢。正式使用前,請在 Azure Portal 的 Cost Management 設定預算和提醒。

不要把 Azure resource key、service principal secret 或 credentials JSON 寫入公開程式碼。若只做短期測試,建議使用獨立 resource,測試結束後撤銷 key 或刪除不再需要的權限。

常見問題

Azure 可以只用 API key,不建立 resource 嗎?

不行。Azure Speech key 是附屬於 Speech resource 的憑證,通常還需要 resource endpoint 或 region。請先建立 Speech resource,再依官方 API 要求設定。

為什麼一分鐘檔案仍然無法使用 short audio REST API?

官方文件寫的是不超過 60 秒;如果檔案略超過 60 秒,或音訊格式不是支援的 WAV PCM/OGG OPUS,請求都可能被拒絕。對較長檔案,請改用 SDK、Fast Transcription 或 Batch Transcription。

zh-TWcmn-Hant-TW 可以互換嗎?

不能直接互換。Azure 使用 zh-TW,Google Cloud Speech-to-Text V2 語言表使用 cmn-Hant-TW;請根據各服務官方文件使用正確 locale。

結語

Azure AI Speech 是以企業治理與 Microsoft 生態系為優先的 Cloud ASR。它支援台灣繁中 zh-TW,也提供多種轉錄處理方式,但 API 認證、resource、region 和長音訊工作流程都比一般 API key 服務複雜。

如果你已經在 Azure 上管理公司資源,Azure Speech 會是合理的語音辨識選項;如果你只想快速完成個人逐字稿,則可以先比較 Deepgram、OpenAI 或 Groq,再依資料治理和企業需求導入 Azure。無論選擇哪個服務,都可以使用 Scribis 作為桌面端的逐字稿整理與字幕工作台,實際 Cloud ASR 選項則以 Scribis 目前版本為準。

相關連結

  1. Azure Speech Language Support
  2. Azure Speech Pricing
  3. Azure Speech-to-Text REST API for Short Audio