教學指南

Scribis 整合 Groq API:使用 Whisper 快速完成語音轉文字

personJH LAI
calendar_today

想在 Scribis 中使用超高速雲端語音辨識?本文完整介紹如何建立與配置 Groq API Key、挑選 Whisper 模型(whisper-large-v3 與 whisper-large-v3-turbo)、檔案限制與進階設定,助你快速完成音訊及影片轉錄。

如果你想在 Scribis 中使用速度快、價格透明且具成本效益的雲端語音辨識服務,Groq API 是一個高效的選擇。Groq 提供與 OpenAI 相容的語音轉文字(Speech-to-Text)API,底層運行 Whisper 系列模型,能以極高推論速度將音訊或影片轉換為精準逐字稿。

本文將完整介紹如何在 Scribis 中建立並綁定 Groq API key、挑選合適的 Whisper 模型,並整理檔案規格限制、費用計算、專有名詞提示及常見問題排除方式。


Groq Whisper 核心優勢與適用情境

Groq 透過自研 LPU 架構提供極速的 Whisper 推論,特別適合處理已錄製完成、追求高速交付逐字稿的長短影音(如訪談、線上課程、Podcast、會議記錄與 YouTube 影片)。

Groq 目前主要提供兩大多語言語音辨識模型:

  • whisper-large-v3-turbo:極致速度與性價比導向,適合日常大量逐字稿生成與快速內容擷取。
  • whisper-large-v3:高準確度導向,適合背景噪音多、口音重、專業術語密集或具高精準度需求的正式場合。
模型名稱 適用情境 官方計費標準 翻譯 API 支援
whisper-large-v3-turbo 高速日常轉錄、大量音訊處理、注重成本效益 US$0.04/小時 僅轉錄(不支援獨立翻譯 endpoint)
whisper-large-v3 複雜聲學環境、多方談話、專業術語校對 US$0.111/小時 支援轉錄與翻譯

所有用量與計費皆由 Groq Console 統一管理,依實際音訊處理秒數計算。


前置準備

在開始設定前,請確認具備以下項目:

準備項目 說明與用途
Scribis 應用程式 前往 Scribis 官方發布頁 下載安裝 macOS 或 Windows 版本
Groq 帳號 用於建立 API Key 及監控用量與額度
Groq API Key 授權 Scribis 調用 Groq 雲端語音轉文字服務的憑證
測試音訊/影片 建議先準備 1–2 分鐘的短音檔確認連線正常

安全提示:API Key 屬於機密金鑰,請妥善存放於密碼管理器或安全環境中。切勿將金鑰上傳至公開 GitHub 專案、文章或截圖中。


一、建立 Groq API Key

  1. 登入 Groq Console
    前往 Groq Console 登入帳號(若無帳號請先註冊)。
  2. 前往 API Keys 頁面
    進入 Groq API Keys 管理介面。
  3. 建立新金鑰
    點選 Create API Key,將名稱設定為好辨識的名稱(例如 Scribis-Whisper)。
  4. 保存 Key
    建立完成後,立即複製完整的 API Key。金鑰僅會完整顯示一次,關閉視窗後將無法再次檢視。若不慎遺失或疑似外洩,請直接刪除該金鑰並重新建立。

二、在 Scribis 中配置 Groq API

  1. 填入 API Key
    開啟 Scribis,點擊 Settings → API,在 Groq API Key 欄位貼上剛才複製的金鑰並儲存。
  2. 切換為 Cloud ASR 模式
    回到 Scribis 轉錄主畫面,在 Model Settings關閉「Use Local ASR」(開啟狀態會使用本機硬體運算,不會呼叫 Groq API)。
  3. 選擇 Groq 模型
    展開 Cloud ASR Model 下拉選單,即可看到 Groq 提供的模型選項:
    • whisper-large-v3-turbo (Groq)
    • whisper-large-v3 (Groq)

若儲存金鑰後選單未出現 Groq 模型,請重新啟動 Scribis 確保設定檔重新載入。


三、Scribis 語音辨識模型比對

模式/模型 運算架構 核心優勢 資源消耗
whisper-large-v3-turbo (Groq) 雲端 Groq LPU 辨識極速、價格極低($0.04/hr) 不佔用本機運算資源
whisper-large-v3 (Groq) 雲端 Groq LPU 降噪能力與專有名詞準確度最高 不佔用本機運算資源
Local ASR (Whisper 本機模型) 本機 CPU/GPU 離線可用、完全免費、資料不出本機 需消耗本機記憶體與硬體效能

四、執行轉錄流程

  1. 載入檔案:在 Scribis 轉錄頁面點擊 Local File 匯入音訊或影片。
  2. 語言設定
    • 預設可使用 Auto Detect(自動判斷語言)。
    • 若音訊語言明確,手動指定語言(如中文、英文)能有效降低辨識延遲並提升首句識別率。
  3. 啟動轉錄:確認模型選定為 Groq Whisper 後,點選 Start Transcription。Scribis 會將音檔傳送至 Groq API 處理,並在幾秒內串流回傳逐字稿與時間戳記。

五、檔案格式與音訊限制

  • 支援格式flacmp3mp4mpegmpgam4aoggwavwebm
  • 單檔大小限制:Groq Free tier 單檔上傳上限為 25 MB,Dev tier 為 100 MB
  • 計費時長底限:每次 API 請求的最低計費長度為 10 秒(小於 10 秒仍以 10 秒計)。
  • 多音軌注意事項:若影片內含多國語言或多條音軌,Groq API 預設僅會轉錄第一條音軌。上傳前請確認音軌配置。

音訊預處理與壓縮建議

若檔案超出大小限制,建議轉檔為 16 kHz、單聲道(Mono)的 FLAC 格式,兼顧體積與語音辨識品質。

使用 FFmpeg 轉檔指令範例:

ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a flac output.flac

六、進階參數配置

1. ISO 語言代碼對應

手動指定語言時,Groq 採用 ISO-639-1 標準:

  • 中文(繁/簡)zh
  • 英文en
  • 日文ja
  • 韓文ko
  • 西班牙文es

2. 專有名詞提示詞(Prompt)

Groq Whisper 支援最高 224 tokens 的 prompt 參數,可用於注入上下文、人名或特殊專有名詞以防止模型幻覺。

若 Scribis 版本提供 Prompt 設定欄位,可加入關鍵字列表:

Scribis, Groq, Whisper Large v3 Turbo, Speech-to-Text, API

3. 時間戳記與字幕匯出

Groq API 回傳完整的 segment 與 word-level 時間戳記。完成轉錄後,可直接透過 Scribis 匯出為 SRTVTT 或純文字檔案。


七、使用 curl 獨立驗證 Groq API

若於 Scribis 中遇到連線問題,可開啟終端機執行下列指令,確認 API Key 與 Groq 端點是否運作正常:

export GROQ_API_KEY='你的_GROQ_API_KEY'

curl "https://api.groq.com/openai/v1/audio/transcriptions" \
  -H "Authorization: Bearer ${GROQ_API_KEY}" \
  -F "file=@test_audio.mp3" \
  -F "model=whisper-large-v3-turbo" \
  -F "language=zh" \
  -F "response_format=verbose_json"

若 curl 能正常回傳 JSON 逐字稿,代表 API Key 有效,問題通常為 Scribis 設定路徑未存檔或 Local ASR 未關閉。


常見問題排除

Q1:轉錄時出現 HTTP 401 或 403 錯誤?

此為身分驗證失敗,通常代表 API Key 填寫錯誤、金鑰已於後台刪除,或 Groq 帳戶欠費受限。請前往 Groq API Keys 重新產生金鑰並貼回 Scribis。

Q2:多聲道或雙語音軌影片轉錄內容缺漏?

Groq API 目前僅處理音訊串流中的第一軌道。若為多音軌錄音,請先以轉檔工具提取出目標人聲音軌後再行上傳。

Q3:Groq Whisper 是否支援說話者分離(Diarization)?

Groq Whisper 標準轉錄端點主要輸出文字與時間戳記,原生請求參數中不包含獨立的 Speaker Diarization 設定。若需說話者標註,需仰賴 Scribis 後處理演算法或輔助外掛分析。


相關連結