評測指南

OpenAI Speech-to-Text 語音轉文字介紹:從中文轉錄到說話者標籤

personJH LAI
calendar_today

深入介紹 OpenAI Speech-to-Text API 模型(gpt-transcribe、gpt-4o-transcribe-diarize 等)、25MB 檔案限制、Prompt 提示詞與計費方式,並說明如何配合 Scribis 整理逐字稿。

如果你已經在使用 OpenAI API,或想找一個文件清楚、模型命名容易理解的 Cloud ASR,OpenAI Speech-to-Text 是值得測試的選項。它提供錄音檔轉錄、中文語言提示、專有名詞 context,也有專門處理說話者標籤的 diarization 模型。

本篇會介紹 OpenAI 的檔案轉錄 API、模型差異、檔案限制與費用,並說明 Scribis 如何作為桌面端的逐字稿整理工具。

OpenAI Speech-to-Text 的模型選擇

OpenAI 官方目前將 gpt-transcribe 作為錄音檔原語言轉錄的建議起點;需要說話者標籤時,可以使用 gpt-4o-transcribe-diarize。如果需要降低大量轉錄的成本,則可以測試 gpt-4o-mini-transcribe

模型 適合情境 官方估算價格
gpt-transcribe 一般錄音檔轉錄與多語內容 約 US$0.0045/分鐘
gpt-4o-mini-transcribe 大量處理與成本優先 約 US$0.003/分鐘
gpt-4o-transcribe 較高品質的一般轉錄 約 US$0.006/分鐘
gpt-4o-transcribe-diarize 需要說話者標籤 約 US$0.006/分鐘
whisper-1 舊版 Whisper 相容流程與部分時間戳記需求 約 US$0.006/分鐘

這些是 OpenAI 官方定價頁列出的轉錄估算值,實際費用可能因模型更新、帳戶方案或使用方式而不同。

OpenAI 的主要優勢

API 與 SDK 容易理解

OpenAI 的檔案轉錄流程很直觀:把完成錄製的音訊送到 /v1/audio/transcriptions,指定模型後取得文字結果。官方文件也提供 Python SDK、curl 和完整的參數說明,適合第一次接觸 Cloud ASR 的開發者。

支援中文語言提示

官方文件支援中文區域代碼,例如 zh-cnzh-twzh-hk。如果知道錄音的主要語言,提供正確提示通常比完全依賴自動判斷更容易維持穩定結果。

提供專用說話者辨識模型

需要訪談或會議的 Speaker 標籤時,可以測試 gpt-4o-transcribe-diarize。它會回傳含有 speakerstartend 的 segments;超過 30 秒的音訊,官方文件要求設定 chunking_strategy="auto" 或適合的 VAD 設定。

用官方 API 測試 OpenAI

先在 OpenAI API Platform 建立 API key。API key 是秘密憑證,請放在密碼管理器或環境變數中,不要出現在公開文章、GitHub、螢幕截圖或影片裡。

export OPENAI_API_KEY='YOUR_OPENAI_API_KEY'

一般中文轉錄

curl 'https://api.openai.com/v1/audio/transcriptions' \
  -H "Authorization: Bearer ${OPENAI_API_KEY}" \
  -F '[email protected]' \
  -F 'model=gpt-transcribe'

取得說話者標籤

curl 'https://api.openai.com/v1/audio/transcriptions' \
  -H "Authorization: Bearer ${OPENAI_API_KEY}" \
  -F '[email protected]' \
  -F 'model=gpt-4o-transcribe-diarize' \
  -F 'response_format=diarized_json' \
  -F 'chunking_strategy=auto'

完成轉錄後,可以把音檔與逐字稿交由 Scribis 進行校對、搜尋、分段與字幕匯出。

檔案格式與 25 MB 限制

OpenAI 檔案轉錄 API 目前接受的單一檔案上限為 25 MB,支援 mp3mp4mpegmpgam4awavwebm

長時間會議或影片通常容易超過這個限制。可以先抽出音訊、降低位元率,或將檔案切成數個小於 25 MB 的片段。切割時盡量不要在句子中間截斷,並在後處理時檢查段落是否重複或遺失。

Prompt、keywords 與專有名詞

OpenAI 的轉錄 API 支援 promptkeywordslanguages 等 context 設定,協助模型處理產品名稱、帳號代碼或中英混合內容。官方特別提醒,keywords 是提示而不是強制輸出;如果加入不相關的詞,可能讓結果出現沒有說出的內容。

概念上的 Python 寫法如下:

from openai import OpenAI

client = OpenAI()

with open("meeting.wav", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="gpt-transcribe",
        file=audio_file,
        prompt="討論 Scribis、OpenAI Speech-to-Text 與 Cloud ASR 的產品會議。",
        extra_body={
            "keywords": ["Scribis", "Cloud ASR", "Speech-to-Text"],
            "languages": ["zh-tw", "en"],
        },
    )

print(transcript.text)

這些進階欄位是否能由第三方桌面工具直接設定,取決於該工具的功能。若介面沒有 prompt 或 keywords 欄位,就不能假設它會自動讀取你的字典或筆記。

時間戳記與字幕

如果你要製作字幕或對齊影片,不能只看轉錄文字,也要確認回應中是否包含可用的時間戳記。OpenAI 官方文件特別列出 whisper-1 搭配 verbose_jsontimestamp_granularities[] 的做法;不同模型的時間戳記支援並不完全相同。

取得結果後,可以使用 Scribis 之類的桌面工具進行文字校對、時間軸檢查和字幕匯出。這樣的分工是「OpenAI 負責語音辨識,Scribis 負責桌面端的逐字稿整理」,不需要把兩者誤寫成同一個整合服務。

費用與資料使用

OpenAI 的轉錄費用以 API 帳戶計算,與 Scribis、ElevenLabs credits 和 Groq API 額度分開。以官方估算價格計算,60 分鐘音訊使用 gpt-4o-mini-transcribe 約為 US$0.18,使用 gpt-transcribe 約為 US$0.27,使用 gpt-4o-transcribe 或 diarization 模型約為 US$0.36。

音訊會送往 OpenAI 的服務端處理。上傳訪談、會議或含有個資的錄音前,請查看 OpenAI API 的資料使用與保留政策,並確認參與者同意和組織設定符合需求。

常見問題

OpenAI、Groq 和 ElevenLabs 的額度可以共用嗎?

不可以。三者的 API key、計費、免費額度和資料政策分開管理。使用 OpenAI 轉錄不會扣 Groq 用量,也不會扣 ElevenLabs 的 Scribe credits。

為什麼 API key 正確,工具卻不能使用?

先用 curl 確認 API key、billing 和 model ID。如果官方 API 成功,但桌面工具沒有結果,通常是該工具尚未支援這個模型、尚未解析 response format,或模型清單仍未更新。

gpt-4o-transcribe-diarize 是否一定會在所有工具中顯示說話者?

不一定。模型本身可以回傳 speaker segments,但第三方工具必須解析 diarized_jsonspeakerstartend 欄位,才能把標籤顯示在畫面上。

結語

OpenAI Speech-to-Text 的優點是 API 清楚、模型選擇直觀,也提供說話者辨識與專有名詞提示。一般轉錄可以從 gpt-transcribe 開始;需要 Speaker 標籤時,再測試 gpt-4o-transcribe-diarize

如果你希望把 API 產生的文字集中校對、整理和匯出,可以試用 Scribis 作為桌面端工作台;但實際可使用的 Cloud ASR 模型,仍然要以 Scribis 當下版本的模型清單為準。

相關連結

  1. OpenAI File Transcription
  2. OpenAI API Pricing