評測指南

AssemblyAI 語音轉文字介紹:從逐字稿延伸到內容理解

personJH LAI
calendar_today

深入了解 AssemblyAI 的 Universal-3.5 Pro 與 Universal-2 模型、預錄音訊 API、speaker labels、實體辨識與摘要功能,並說明如何搭配 Scribis 進行語音工作流。

一般語音轉文字服務的工作,是把錄音變成文字;AssemblyAI 的特色,則是可以在逐字稿之上加入更多 Speech Understanding 功能,例如說話者辨識、實體、章節、摘要、情緒和關鍵片語。

如果你處理的是訪談、會議、客服錄音、Podcast 或研究資料,AssemblyAI 很適合拿來評估「轉錄完成後,還能不能繼續整理內容」。本篇會介紹它的模型、費用、預錄音訊 API 和常見限制,並以 Scribis 作為桌面端逐字稿整理工具的推薦情境。

AssemblyAI 的主要特色

AssemblyAI 的預錄 API 通常以非同步工作方式處理音訊:提交檔案後建立 transcript job,再等待結果完成。這種模式適合已經錄好的會議、課程和訪談,也方便把轉錄和後續內容分析分成不同步驟。

官方支援語言文件列出 Universal-3.5 Pro 支援 Mandarin zh,Universal-2 則支援更廣的語言範圍。台灣繁中使用者應該用自己的錄音測試中文用詞、口音、中英混合和專有名詞,不要只依賴語言清單判斷實際品質。

功能 典型用途
Pre-recorded transcription 訪談、會議、課程、Podcast
Speaker identification 顯示不同說話者的段落
Keyterm prompting 改善品牌、產品和專業術語辨識
Entity detection 找出人名、組織、地點和日期
Custom formatting 統一文字格式和輸出樣式
Translation 將逐字稿轉成其他語言
摘要與章節 依目前模型與官方政策提供的進階工作流

Universal-3.5 Pro 與 Universal-2

Universal-3.5 Pro 適合想要使用較新的預錄模型和 Mandarin 轉錄的情境;Universal-2 則支援更廣的語言範圍。不同模型的功能和附加費並不相同,應依照實際需求選擇。

一般可以先用 Universal-2 建立基準稿,再以 Universal-3.5 Pro 比較中文專有名詞、標點、多人交談和長錄音的結果。若需要 speaker labels,也要確認所選模型與該功能相容。

用官方 API 測試 AssemblyAI

前往 AssemblyAI Dashboard 建立 API key。API key 是秘密憑證,請放在密碼管理器中,不要放進部落格、GitHub 或公開截圖。

AssemblyAI 預錄 API 常見流程是先上傳檔案,再使用回傳的音訊 URL 建立 transcript:

export ASSEMBLYAI_API_KEY='YOUR_ASSEMBLYAI_API_KEY'

curl --request POST \
  --url 'https://api.assemblyai.com/v2/upload' \
  --header "authorization: ${ASSEMBLYAI_API_KEY}" \
  --header 'content-type: application/octet-stream' \
  --data-binary @sample.m4a

上傳成功後,使用回傳的 URL 建立轉錄工作:

curl --request POST \
  --url 'https://api.assemblyai.com/v2/transcript' \
  --header "authorization: ${ASSEMBLYAI_API_KEY}" \
  --header 'content-type: application/json' \
  --data '{
    "audio_url": "https://cdn.assemblyai.com/upload/your-file-id",
    "speech_models": ["universal-3-5-pro"],
    "language_code": "zh",
    "speaker_labels": true
  }'

AssemblyAI 的參數與模型 ID 可能隨 API 版本更新;正式使用前請以官方文件為準。這段範例可以幫助讀者理解 AssemblyAI 的預錄工作流程。

Speaker Labels 與多聲道

訪談和會議錄音可以使用 speaker labels,讓逐字稿區分不同說話者。不過背景噪音、多人同時說話、短暫發言和聲音相似,都可能造成標籤需要人工校對。

多聲道錄音也會影響費用。AssemblyAI 官方定價說明指出,多聲道音訊按聲道計費;一小時、兩聲道檔案可能按兩個可計費音訊小時計算。如果不需要分離聲道,可以先混音成單聲道再上傳。

章節、摘要與實體辨識

AssemblyAI 的吸引力,在於可以從「逐字稿」延伸到「內容整理」。例如,長篇訪談可以再處理成主題章節、摘要、關鍵片語或實體清單。不過這些功能不是每個模型都免費或都可用,官方目前也對部分模型的 Auto Chapters 和 Summarization 標示棄用或建議改用 LLM Gateway,因此正式使用前請重新查看當下文件與方案。

進階功能 可能的輸出 注意事項
Speaker Identification Speaker A、Speaker B 需要校對重疊與短句
Entity Detection 人名、組織、地點、日期 依模型與方案而定
Auto Chapters 主題章節 依模型與官方政策而定
Summarization 摘要與重點 依模型與官方政策而定
Translation 翻譯文字 可能是附加功能

費用參考

AssemblyAI 官方定價頁目前列出預錄 Universal-2 約 US$0.15/小時,Universal-3.5 Pro 約 US$0.21/小時,並提供新帳戶免費 credits。Speaker、translation、entity 或其他 Speech Understanding 功能可能另外計費。

Cloud ASR 公開基本價格比較

AssemblyAI 的費用與 OpenAI、Groq、ElevenLabs 和 Scribis 分開管理。使用 AssemblyAI 不會消耗 ElevenLabs credits,也不會扣 Groq API 額度。

如何搭配 Scribis 整理逐字稿?

如果你想把不同來源的錄音集中在桌面端整理,可以使用 Scribis 匯入本機音訊或影片,依當下支援的模型取得逐字稿,再進行校對、搜尋、分段和字幕匯出。

完成 AssemblyAI 轉錄後,可以使用 Scribis 作為較集中、較容易操作的桌面端逐字稿工作區,進行校對、搜尋、分段和字幕匯出。

常見問題

AssemblyAI 支援台灣繁中嗎?

官方語言表以 Mandarin zh 列出支援。台灣使用者應以實際音檔測試用詞、口音與專有名詞,必要時比較不同模型。

為什麼 speaker labels 沒有完全正確?

說話者辨識是推測發言者的分段,重疊說話、背景音、短句和相似聲線都可能造成錯誤。完成轉錄後仍應人工確認重要段落。

為什麼 AssemblyAI 的費用會高於基本轉錄價格?

speaker、entity、translation、章節和摘要等功能可能以 add-on 方式疊加,多聲道音訊也可能按聲道計費。

結語

如果你只需要一份純文字逐字稿,Groq、OpenAI 或其他 Whisper provider 可能已經足夠;如果你希望轉錄後繼續處理說話者、實體、章節和摘要,AssemblyAI 值得深入評估。

你可以先用官方 API 對同一段繁中訪談做測試,再使用 Scribis 進行桌面端的校對、整理和匯出。這樣能清楚區分 Cloud ASR 服務和逐字稿工作工具各自負責的部分,也更容易建立穩定的內容工作流。

相關連結

  1. AssemblyAI Pricing
  2. AssemblyAI Supported Languages
  3. AssemblyAI Speaker Labels