OpenAI Speech-to-Text 語音轉文字介紹:從中文轉錄到說話者標籤
深入介紹 OpenAI Speech-to-Text API 模型(gpt-transcribe、gpt-4o-transcribe-diarize 等)、25MB 檔案限制、Prompt 提示詞與計費方式,並說明如何配合 Scribis 整理逐字稿。
如果你已經在使用 OpenAI API,或想找一個文件清楚、模型命名容易理解的 Cloud ASR,OpenAI Speech-to-Text 是值得測試的選項。它提供錄音檔轉錄、中文語言提示、專有名詞 context,也有專門處理說話者標籤的 diarization 模型。
本篇會介紹 OpenAI 的檔案轉錄 API、模型差異、檔案限制與費用,並說明 Scribis 如何作為桌面端的逐字稿整理工具。
OpenAI Speech-to-Text 的模型選擇
OpenAI 官方目前將 gpt-transcribe 作為錄音檔原語言轉錄的建議起點;需要說話者標籤時,可以使用 gpt-4o-transcribe-diarize。如果需要降低大量轉錄的成本,則可以測試 gpt-4o-mini-transcribe。
| 模型 | 適合情境 | 官方估算價格 |
|---|---|---|
gpt-transcribe |
一般錄音檔轉錄與多語內容 | 約 US$0.0045/分鐘 |
gpt-4o-mini-transcribe |
大量處理與成本優先 | 約 US$0.003/分鐘 |
gpt-4o-transcribe |
較高品質的一般轉錄 | 約 US$0.006/分鐘 |
gpt-4o-transcribe-diarize |
需要說話者標籤 | 約 US$0.006/分鐘 |
whisper-1 |
舊版 Whisper 相容流程與部分時間戳記需求 | 約 US$0.006/分鐘 |
這些是 OpenAI 官方定價頁列出的轉錄估算值,實際費用可能因模型更新、帳戶方案或使用方式而不同。
OpenAI 的主要優勢
API 與 SDK 容易理解
OpenAI 的檔案轉錄流程很直觀:把完成錄製的音訊送到 /v1/audio/transcriptions,指定模型後取得文字結果。官方文件也提供 Python SDK、curl 和完整的參數說明,適合第一次接觸 Cloud ASR 的開發者。
支援中文語言提示
官方文件支援中文區域代碼,例如 zh-cn、zh-tw 和 zh-hk。如果知道錄音的主要語言,提供正確提示通常比完全依賴自動判斷更容易維持穩定結果。
提供專用說話者辨識模型
需要訪談或會議的 Speaker 標籤時,可以測試 gpt-4o-transcribe-diarize。它會回傳含有 speaker、start 和 end 的 segments;超過 30 秒的音訊,官方文件要求設定 chunking_strategy="auto" 或適合的 VAD 設定。
用官方 API 測試 OpenAI
先在 OpenAI API Platform 建立 API key。API key 是秘密憑證,請放在密碼管理器或環境變數中,不要出現在公開文章、GitHub、螢幕截圖或影片裡。
export OPENAI_API_KEY='YOUR_OPENAI_API_KEY'
一般中文轉錄
curl 'https://api.openai.com/v1/audio/transcriptions' \
-H "Authorization: Bearer ${OPENAI_API_KEY}" \
-F '[email protected]' \
-F 'model=gpt-transcribe'
取得說話者標籤
curl 'https://api.openai.com/v1/audio/transcriptions' \
-H "Authorization: Bearer ${OPENAI_API_KEY}" \
-F '[email protected]' \
-F 'model=gpt-4o-transcribe-diarize' \
-F 'response_format=diarized_json' \
-F 'chunking_strategy=auto'
完成轉錄後,可以把音檔與逐字稿交由 Scribis 進行校對、搜尋、分段與字幕匯出。
檔案格式與 25 MB 限制
OpenAI 檔案轉錄 API 目前接受的單一檔案上限為 25 MB,支援 mp3、mp4、mpeg、mpga、m4a、wav 和 webm。
長時間會議或影片通常容易超過這個限制。可以先抽出音訊、降低位元率,或將檔案切成數個小於 25 MB 的片段。切割時盡量不要在句子中間截斷,並在後處理時檢查段落是否重複或遺失。
Prompt、keywords 與專有名詞
OpenAI 的轉錄 API 支援 prompt、keywords 和 languages 等 context 設定,協助模型處理產品名稱、帳號代碼或中英混合內容。官方特別提醒,keywords 是提示而不是強制輸出;如果加入不相關的詞,可能讓結果出現沒有說出的內容。
概念上的 Python 寫法如下:
from openai import OpenAI
client = OpenAI()
with open("meeting.wav", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
prompt="討論 Scribis、OpenAI Speech-to-Text 與 Cloud ASR 的產品會議。",
extra_body={
"keywords": ["Scribis", "Cloud ASR", "Speech-to-Text"],
"languages": ["zh-tw", "en"],
},
)
print(transcript.text)
這些進階欄位是否能由第三方桌面工具直接設定,取決於該工具的功能。若介面沒有 prompt 或 keywords 欄位,就不能假設它會自動讀取你的字典或筆記。
時間戳記與字幕
如果你要製作字幕或對齊影片,不能只看轉錄文字,也要確認回應中是否包含可用的時間戳記。OpenAI 官方文件特別列出 whisper-1 搭配 verbose_json 與 timestamp_granularities[] 的做法;不同模型的時間戳記支援並不完全相同。
取得結果後,可以使用 Scribis 之類的桌面工具進行文字校對、時間軸檢查和字幕匯出。這樣的分工是「OpenAI 負責語音辨識,Scribis 負責桌面端的逐字稿整理」,不需要把兩者誤寫成同一個整合服務。
費用與資料使用
OpenAI 的轉錄費用以 API 帳戶計算,與 Scribis、ElevenLabs credits 和 Groq API 額度分開。以官方估算價格計算,60 分鐘音訊使用 gpt-4o-mini-transcribe 約為 US$0.18,使用 gpt-transcribe 約為 US$0.27,使用 gpt-4o-transcribe 或 diarization 模型約為 US$0.36。
音訊會送往 OpenAI 的服務端處理。上傳訪談、會議或含有個資的錄音前,請查看 OpenAI API 的資料使用與保留政策,並確認參與者同意和組織設定符合需求。
常見問題
OpenAI、Groq 和 ElevenLabs 的額度可以共用嗎?
不可以。三者的 API key、計費、免費額度和資料政策分開管理。使用 OpenAI 轉錄不會扣 Groq 用量,也不會扣 ElevenLabs 的 Scribe credits。
為什麼 API key 正確,工具卻不能使用?
先用 curl 確認 API key、billing 和 model ID。如果官方 API 成功,但桌面工具沒有結果,通常是該工具尚未支援這個模型、尚未解析 response format,或模型清單仍未更新。
gpt-4o-transcribe-diarize 是否一定會在所有工具中顯示說話者?
不一定。模型本身可以回傳 speaker segments,但第三方工具必須解析 diarized_json、speaker、start 和 end 欄位,才能把標籤顯示在畫面上。
結語
OpenAI Speech-to-Text 的優點是 API 清楚、模型選擇直觀,也提供說話者辨識與專有名詞提示。一般轉錄可以從 gpt-transcribe 開始;需要 Speaker 標籤時,再測試 gpt-4o-transcribe-diarize。
如果你希望把 API 產生的文字集中校對、整理和匯出,可以試用 Scribis 作為桌面端工作台;但實際可使用的 Cloud ASR 模型,仍然要以 Scribis 當下版本的模型清單為準。