用 ElevenLabs Scribe v2 強化 Scribis 語音轉文字:API 設定與使用教學
本教學詳細介紹如何在 Scribis 中設定與使用 ElevenLabs Scribe v2 批次語音轉文字模型,包括 API key 建立、權限設定、隱私保護與 credit 費用估算。
如果你平常使用 Scribis 整理訪談、課程、Podcast 或影片內容,可以透過 ElevenLabs 的 Scribe v2 取得更完整的雲端語音轉文字能力。本篇會從建立 API key 開始,帶你完成 Scribis 的設定,並說明如何選擇 Scribe v2、如何處理隱私選項,以及 credits 應該怎麼估算。
本篇使用的是 Scribe v2 批次轉錄模型。也就是先準備好音訊或影片檔案,再交由 ElevenLabs 完成轉錄;它不是需要透過 WebSocket 持續串流的 scribe_v2_realtime 即時模型。
Scribe v2 適合哪些情境?
Scribe v2 適合處理已經錄製完成的音訊,例如訪談錄音、Podcast、線上課程、會議錄影和 YouTube 影片。模型支援 90 多種語言,並可提供逐字稿、時間戳記、說話者辨識、音訊事件標記,以及協助辨識專有名詞的 keyterm prompting。
如果你的需求是邊說話邊取得即時字幕,則應使用 ElevenLabs 另一個產品 Scribe v2 Realtime。本篇的 Scribis 設定流程則是使用 scribe_v2 批次 API。
開始前需要準備什麼?
開始之前,請先準備好以下項目:
| 項目 | 說明 |
|---|---|
| ElevenLabs 帳號 | 用來建立 API key 與管理 credits |
| Scribis | 請從 Scribis 官方網站 下載 macOS 或 Windows 版本 |
| 音訊或影片檔案 | 用來測試 Scribe v2 的轉錄效果 |
| API key | 讓 Scribis 可以呼叫 ElevenLabs Speech to Text API |
API key 等同於帳號的密碼,請不要貼到公開文章、GitHub、聊天群組或螢幕錄影中。若 key 不慎外洩,應立即回到 ElevenLabs 後台停用或刪除,再重新建立一組新的 key。
一、在 ElevenLabs 建立 API key
1. 開啟 ElevenLabs 的 API Keys 頁面
前往 ElevenLabs 並登入帳號。登入後,從左側的 API Keys 進入 API key 管理頁面。不同版本的後台介面可能將它放在 Configure 或 Developers 區域;如果首頁沒有看到,可以前往 Developers 設定頁尋找。

進入 API Keys 頁面後,點選右上角的 Create Key。


2. 設定 API key 的名稱與權限
你可以將 key 命名為 Scribis-Scribe-v2,之後就能很容易分辨這把 key 的用途。若畫面提供有效期限,建議設定一個合理的期限;只有在確定需要長期使用時,才選擇 Never。
接著請設定 API key 的端點權限。由於 Scribis 要使用的是 ElevenLabs 的語音轉文字服務,最重要的是開啟 Speech to Text → Access。
| API 端點 | 建議設定 |
|---|---|
| Speech to Text | Access,Scribe v2 必要權限 |
| Text to Speech | No Access;除非你也要用 ElevenLabs 產生語音 |
| Speech to Speech | No Access |
| Sound Effects | No Access |
| Audio Isolation | No Access |
| Music Generation | No Access |
| Image & Video Generation | No Access |
你可能會看到建立 API key 的畫面預設選中了 Text to Speech。這不是 Scribe v2 所需要的權限,請改為開啟 Speech to Text,否則 Scribis 可能無法呼叫 /v1/speech-to-text。

如果畫面提供 Usage Limits,也可以為這把 key 設定 credits 上限。這樣即使 API key 意外外洩,也能降低額外消耗的風險。設定完成後,按下 Create Key。
3. 複製 API key
建立完成後,ElevenLabs 通常只會在這個視窗完整顯示一次 API key。請立即按下複製按鈕,並將它放在密碼管理器或其他安全位置。
不要將真實 key 寫入教學文章、程式碼儲存庫或公開截圖中。

二、關閉資料用於模型改善的選項
如果你不希望新的資料被用於改善 ElevenLabs 的模型,可以檢查帳號中的資料使用設定。
在 ElevenLabs 右上角點選個人頭像,進入 Terms and privacy → Data use,找到 Improve the models for everyone。將它關閉後,按下 Update your choice 儲存設定。
ElevenLabs 官方說明指出,關閉這項設定後,之後提交的新資料不會被用於訓練模型。這項設定和免費或付費方案是分開的;即使使用免費 API 額度,也可以依帳號設定選擇是否分享新的資料來改善模型。


不過,關閉模型改善選項不等於 Zero Retention。一般 API 請求仍可能依服務政策被保存,用於提供服務、除錯、安全防護、濫用偵測或法規遵循。Zero Retention Mode 是另一項主要提供給 Enterprise 客戶的資料保留功能。
三、在 Scribis 設定 ElevenLabs API
1. 開啟 Scribis 的 API 設定
開啟 Scribis,進入 Settings → API,找到 ElevenLabs API Key 欄位,貼上剛才複製的 API key,並依照 Scribis 目前版本的提示完成儲存。

請確認貼上的確實是 ElevenLabs API key,而不是 OpenAI、Google Gemini、OpenRouter 或其他服務的 key。
2. 關閉 Local ASR,選擇 Cloud ASR
回到 Scribis 的轉錄頁面,在 Model Settings 中確認沒有使用 Use Local ASR。
如果開啟 Local ASR,音訊會由電腦本機的語音辨識模型處理,不會呼叫 ElevenLabs 的 Scribe v2。要使用剛才設定的 API key,請改用雲端 ASR 模式。
在模型選單中尋找:
scribe_v2 (ElevenLabs Scribe v2)
請選擇 scribe_v2,不要選成 scribe_v2_realtime。前者是本篇使用的批次檔案轉錄模型,後者是即時串流模型。

3. 將 Scribe v2 加入最愛
部分 Scribis 版本會將雲端 ASR 模型集中在 Cloud ASR Model 選單中。展開選單後,選擇 scribe_v2 (ElevenLabs Scribe v2)。如果畫面提供星號或收藏按鈕,也可以將它加入最愛,方便日後快速選取。

如果找不到 Scribe v2,請依序檢查以下設定:API key 是否已儲存、API key 是否開啟 Speech to Text 權限、Scribis 是否仍處於 Local ASR 模式,以及是否需要重新啟動 Scribis。
四、使用 Scribe v2 轉錄音訊
在 Scribis 的轉錄頁面選擇 Local File,再上傳要處理的音訊或影片。Scribis 也提供字幕檔案載入與稿件比對等功能,可以依照你的工作流程選擇使用。
在 Language Settings 中,你可以保留 Auto Detect,讓模型自動判斷語言;如果你確定整段音訊使用單一語言,也可以指定優先語言。對於中英文混合或多語言內容,Auto Detect 通常會比較方便。
確認模型設定為 scribe_v2 後,按下 Start Transcription。Scribis 會將完整檔案送到 ElevenLabs,再等待批次轉錄結果回傳,因此這個流程不是即時字幕串流。
五、ASR Dictionary 與 keyterms 怎麼使用?
如果音訊中包含產品名稱、人名、公司名稱或技術術語,適當使用專有名詞提示可以改善辨識結果。不過,如果只是一般語音轉文字,建議先讓 Scribis 的 ASR Dictionary 保持空白。
ElevenLabs API 的 keyterms 參數預設為空陣列 []。只有當 Scribis 將 ASR Dictionary 的內容轉換成 keyterms 並送給 ElevenLabs 時,這些詞才會真正影響 Scribe v2 的辨識提示;是否會自動映射,則要看 Scribis 目前版本的實作方式。
使用 keyterms 時,ElevenLabs 官方 API 文件標示基礎轉錄成本會增加約 20%。因此,建議只加入真正需要強化的專有名詞,不必把整篇稿件都放進字典中。
六、Scribe v2 credits 怎麼算?
在 Scribis 使用 scribe_v2 批次轉錄時,我以一分鐘左右的音訊測試,實際觀察到約 80 credits 的消耗。換算下來,大約是每小時 4,000 credits,使用 10,000 credits 約可處理 125 分鐘左右的音訊。
| 項目 | 實測估算 |
|---|---|
| 約 1 分鐘音訊 | 約 80 credits |
| 約 10 分鐘音訊 | 約 800 credits |
| 10,000 credits | 約 125 分鐘 |
這個數字適合拿來規劃自己的使用量,但實際扣款仍會依音訊的實際長度與請求設定而變化。ElevenLabs 是依送入轉錄的音訊 duration 計費,不是依逐字稿的字數計費。例如,一個標示為「一分鐘」的檔案,如果實際長度是 62 秒或 65 秒,扣款就可能與整整 60 秒的檔案不同。
另外,ElevenLabs 網頁版 Creative 介面與 ElevenAPI 是不同的使用入口,定價頁上的數字不能直接互相套用。Scribis 使用 API key 呼叫的是 API 端點,因此最可靠的方式是到 ElevenLabs 的 Usage Analytics 查看自己的實際用量。
可能增加 credits 的設定
下列功能會在基礎轉錄成本上增加額外費用:
| 功能 | 官方文件列示的附加費 |
|---|---|
keyterms |
約 +20% |
entity_detection 或 entity_redaction |
約 +30% |
detect_speaker_roles |
約 +10% |
| 多聲道轉錄 | 每個 channel 以完整音訊長度獨立計費 |
如果你只是想取得一般逐字稿,建議先使用單聲道、不要加入 keyterms,也不要啟用不需要的 entity 或 speaker role 功能。
七、如何確認實際使用的 credits?
要確認自己的 67 credits 是否穩定,可以在 ElevenLabs 後台進入 Developers → Usage 或 Usage Analytics,再查看 API request 紀錄。測試時最好使用幾個長度明確的檔案,例如 30 秒、60 秒和 120 秒,並記錄下列資訊:
| 要確認的項目 | 內容 |
|---|---|
| Model ID | scribe_v2,不是 scribe_v2_realtime |
| 使用入口 | Scribis 的 Cloud ASR |
| 音訊長度 | 檔案的實際秒數 |
keyterms |
沒有使用時應為空陣列 [] |
| Entity 功能 | 是否啟用 entity_detection 或 entity_redaction |
| Speaker roles | 是否啟用 detect_speaker_roles |
| Channel | 是否啟用多聲道模式 |
| Credits | 該筆 API request 的實際扣款 |
若要獨立測試 ElevenLabs 的批次 Scribe v2 API,也可以使用以下指令。請將 API key 放在環境變數中,不要直接寫進指令或文章:
export ELEVENLABS_API_KEY='YOUR_API_KEY'
curl -X POST 'https://api.elevenlabs.io/v1/speech-to-text' \
-H "xi-api-key: ${ELEVENLABS_API_KEY}" \
-F '[email protected]' \
-F 'model_id=scribe_v2'
這個範例只使用基本的單聲道批次轉錄,不會主動加入 keyterms、entity detection、speaker roles 或多聲道設定。ElevenLabs 官方 API 端點為 POST /v1/speech-to-text,而批次模型的 model_id 為 scribe_v2。
八、常見問題
為什麼 Scribis 裡看不到 Scribe v2?
最常見的原因是 Local ASR 仍然開啟、API key 尚未儲存,或 API key 沒有開啟 Speech to Text 權限。請先確認這三個地方,再重新啟動 Scribis。
為什麼一分鐘音訊有時不是 67 credits?
播放器顯示的一分鐘不一定代表檔案剛好是 60 秒。檔案可能實際長度稍長,也可能啟用了 keyterms、entity detection、speaker roles 或多聲道模式。請以 ElevenLabs Usage Analytics 中的 request 紀錄為準。
我只想使用語音轉文字,為什麼要開 Speech to Text 而不是 Text to Speech?
因為 Scribe v2 是 Speech to Text 模型。Text to Speech 是將文字轉成語音,與本篇的轉錄流程不同;只開啟 Text to Speech,並不能讓 Scribis 呼叫 Scribe v2。
使用免費 API 額度時,資料會被拿去訓練嗎?
免費額度與資料使用設定是分開的。若在 ElevenLabs 的 Terms and privacy → Data use 中關閉 Improve the models for everyone,官方表示之後提交的新資料不會被用於訓練模型。
這並不代表一般 API 具備 Zero Retention。若音訊包含高度敏感或機密內容,請先進行去識別化,或確認帳戶是否具備符合需求的資料保留方案。
結語
透過 API key 將 ElevenLabs Scribe v2 接到 Scribis,設定流程其實很簡單:先建立一把只開啟 Speech to Text 的 API key,再到 Scribis 的 Settings → API 貼上 key,最後在 Cloud ASR 中選擇 scribe_v2。
以目前的實測結果來看,一分鐘音訊約消耗 80 credits,10,000 credits 約可處理 125 分鐘。不過,實際用量仍會受到音訊長度與附加功能影響,因此建議定期查看 Usage Analytics,並為不同用途建立權限分開的 API key。這樣既能控制 credits,也能降低 API key 外洩所造成的風險。