Gemini 3.5 Transcribe:Google 最新語音轉文字模型介紹與使用教學
Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。
Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型。它以 Gemini 的音訊理解能力為基礎,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。
正式模型名稱是:
gemini-3.5-transcribe
Google 官方更新紀錄顯示,Gemini 3.5 Transcribe 已於 2026 年 8 月 26 日正式 GA(Generally Available)。另外還有一個獨立的即時串流模型 gemini-3.5-transcribe-live,適合透過 WebSocket 處理麥克風或即時音訊;本篇主要介紹上傳音訊檔案的非即時版本。
Gemini 3.5 Transcribe 有什麼特色?
Gemini 3.5 Transcribe 不只是把聲音轉成一段純文字。它可以辨識 85 種以上的語言,處理對話中的多語言切換,區分不同說話者,並輸出每個單字的開始與結束時間。
對訪談、會議、課程、Podcast 和影片字幕而言,這些功能相當實用。你可以先取得原始逐字稿,再依需要加入說話者、時間軸、自訂詞彙或智慧格式化。
| 功能 | 說明 |
|---|---|
| 自動語言偵測 | 自動判斷音訊中的語言,不一定需要手動設定 |
| 多語言切換 | 支援句子內與句子之間的語言切換 |
| 說話者辨識 | 將不同發言者分成不同標籤 |
| 單字級時間戳記 | 回傳每個單字的開始與結束時間 |
| 自訂詞彙 | 提升品牌、人名、專業術語和縮寫的辨識率 |
| Smart Transcription | 清除贅詞、重複與部分口語不順,並改善格式 |
| 文字正規化 | 將口語數字或金額轉成較容易閱讀的形式 |
音訊長度與功能限制
Gemini 3.5 Transcribe 一般每次請求最多可以處理 1 小時音訊。不過,如果啟用說話者辨識或單字級時間戳記,官方文件將音訊檔案處理上限列為 30 分鐘。
說話者辨識最多支援 8 位說話者;當錄音中有 3 位以上說話者時,官方將辨識結果標示為實驗性功能。因此,重要會議或正式發表前仍然需要人工檢查。
| 使用方式 | 建議處理方式 |
|---|---|
| 一小時內的一般逐字稿 | 可以直接送出音訊檔案 |
| 需要說話者辨識 | 先將音訊切成 30 分鐘以內 |
| 需要單字級時間戳記 | 先將音訊切成 30 分鐘以內 |
| 長時間會議 | 依時間切割,合併後再校對 |
| 即時麥克風轉錄 | 使用獨立的 gemini-3.5-transcribe-live |
切割長音訊時,建議在片段交界保留少量上下文,最後合併逐字稿時再檢查重複或遺漏的句子。
建立 Gemini API key
前往 Google AI Studio API Keys,登入 Google 帳戶後建立或查看 Gemini API key。Google 官方文件建議使用 GEMINI_API_KEY 或 GOOGLE_API_KEY 環境變數,不要把 key 直接寫入程式碼。
export GEMINI_API_KEY='YOUR_GEMINI_API_KEY'
Google 的 API key 文件指出,AI Studio 新建立的 key 會使用 authorization key;標準 key 的使用規則也正在 2026 年進行調整。建立 key 後,請依照 AI Studio 或 Google Cloud 顯示的限制與遷移說明設定。
API key 等同密碼。不要把真實 key 放在文章、GitHub、公開截圖、影片或提供給一般使用者下載的應用程式中。
使用 Python 轉錄音訊
先安裝 Google GenAI SDK:
pip install google-genai
Google 官方轉錄指南建議先上傳音訊檔案,再將檔案 URI 傳給 Interactions API。最基本的 Python 範例如下:
from google import genai
client = genai.Client()
audio_file = client.files.upload(file="sample.mp3")
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[
{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}
],
)
print(interaction.output_text)
如果已經設定 GEMINI_API_KEY,SDK 可以從環境變數讀取 key,不需要把秘密直接寫入 Python 檔案。
自動偵測語言與指定語言
預設情況下,模型會自動判斷音訊中的語言,也能在對話進行中偵測語言切換。如果你不確定錄音語言,直接省略 language_codes 或傳入空陣列即可。
如果你知道音訊主要語言,也可以傳入 BCP-47 語言代碼。例如,英文可以使用 en-US,繁體中文可以依官方支援語言表選擇相應代碼,西班牙文可以使用 es-ES。
generation_config = {
"transcription_config": {
"language_codes": ["en-US"],
}
}
如果是中英混合或多語訪談,可以分別測試自動偵測和手動指定語言。不要只用一段乾淨錄音判斷效果,最好加入不同口音、專有名詞和多人對話。
自訂詞彙:改善人名與專業術語
Gemini 3.5 Transcribe 支援自訂詞彙,可以提示模型注意不常見的字詞、產品名稱、品牌、人名、縮寫和專業術語。官方文件允許最多 1,000 個詞組,但通常建議先控制在 100 個以內,比較容易得到穩定效果。
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[
{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}
],
generation_config={
"transcription_config": {
"custom_vocabulary": [
"Gemini",
"Kubernetes",
"BigQuery",
"Scribis",
],
}
},
)
自訂詞彙是辨識提示,不是要求模型強行輸出沒有說過的內容。建議比較「有自訂詞彙」和「沒有自訂詞彙」的結果,確認是否真的改善專有名詞,而不是增加錯誤字詞。
Smart Transcription 智慧轉錄
Smart Transcription 會清除部分贅詞、重複和口語不順,並改善大小寫、標點、段落與數字格式。
這對會議筆記、訪談文章和內容整理很方便,但它不一定等同於逐字記錄。如果你要保留每一個口語停頓、重複或語氣,應該保留原始結果,並將智慧格式化版本視為適合閱讀的編輯稿。
說話者辨識與時間戳記
音訊檔案轉錄支援說話者辨識和單字級時間戳記。這讓 Gemini 3.5 Transcribe 適合訪談、座談、會議和字幕工作。
但啟用其中一項功能後,音訊檔案處理上限會降為 30 分鐘。處理長會議時,可以先依時間切割檔案,再將各段結果合併;合併後要特別檢查說話者切換、句子交界和時間軸是否連續。
費用與免費方案的資料使用
Google 目前的 Gemini Developer API 定價頁列出以下 gemini-3.5-transcribe 參考價格:
| 方案 | 音訊輸入 | 文字輸出 | 資料使用說明 |
|---|---|---|---|
| Free | 免費 | 免費 | 內容會用於改善 Google 產品 |
| Paid Standard | US$2.00/每 100 萬 audio tokens,估算約 US$0.003/分鐘 | US$12.00/每 100 萬 text tokens,估算約 US$0.002/分鐘 | 內容不會用於改善 Google 產品 |
Google 以每秒 25 個 audio tokens 和每分鐘 175 個 text tokens 估算,整體有效價格約為 US$0.005/分鐘。
需要注意的是,免費方案不只是付費方案的「零元版本」。官方定價頁明確將免費方案標示為「內容會用於改善 Google 產品」,而付費方案則標示為「內容不會用於改善 Google 產品」。如果錄音包含訪談、內部會議、客戶資料或其他敏感內容,請先閱讀當下的服務條款與資料政策。
Artificial Analysis 第三方評測數據
除了官方標示的規格外,獨立 AI 評測機構 Artificial Analysis 也在其 Speech-to-Text 基準測試中對 Gemini 3.5 Transcribe 進行了實測。
評測綜合考量了字詞錯誤率(AA-WER v2,涵蓋真實對話、議事錄音與多種口音條件)、處理速度因子(Speed Factor)與每 1,000 分鐘的轉錄費用:
| 模型與服務商 | AA-WER 錯誤率(越低越好) | 速度因子 (Speed Factor,越高越快) | 每 1,000 分鐘費用 (USD) |
|---|---|---|---|
| Gemini 3.5 Transcribe (Google) | 2.6% | 79.6x | $5.00 |
| Scribe v2 (ElevenLabs) | 2.2% | 53.9x | $3.67 |
| MAI-Transcribe-1.5 (Microsoft Azure) | 2.4% | 191.5x | $6.00 |
| GPT Transcribe (OpenAI) | 3.3% | 40.8x | $4.50 |
| Nova-3 (Deepgram) | 5.2% | 540.2x | $4.30 |
| Whisper Large v3 Turbo (Groq) | 4.6% | 165.4x | $0.67 |
數據顯示,Gemini 3.5 Transcribe 在精確度方面表現優異,AA-WER 僅有 2.6%,名列整體評測前茅(超越 OpenAI GPT Transcribe 的 3.3% 與 Deepgram Nova-3 的 5.2%)。在速度方面,達到 79.6x 的實時轉錄倍速,在精準度、處理速度與價格之間取得了極佳平衡。
與 Scribis 搭配的逐字稿工作流程
Cloud ASR 負責將語音轉成文字,但轉錄完成後通常還有很多工作,例如修正人名、搜尋重要句子、拆分段落、比對音訊、製作字幕或整理筆記。
Scribis 可以作為桌面端的逐字稿整理工具,將錄音與文字工作集中在同一個工作流程中。完成轉錄後,你可以使用 Scribis 進行校對、編輯、搜尋、分段和字幕匯出。

這樣的分工很清楚:Gemini 3.5 Transcribe 負責語音辨識,Scribis 則協助把轉錄結果整理成更容易閱讀和使用的文字內容。
Gemini 3.5 Transcribe 與 Transcribe Live 的差異
兩個模型的用途不同:
| 模型 | 輸入方式 | 適合情境 |
|---|---|---|
gemini-3.5-transcribe |
上傳音訊檔案 | 會議、訪談、課程、Podcast 和字幕 |
gemini-3.5-transcribe-live |
透過 WebSocket 雙向串流音訊 | 麥克風輸入、即時字幕和即時應用程式 |
不要把 Live 模型的串流限制或價格套用到音訊檔案轉錄。Google 將兩者列為不同的模型 endpoint,請依使用情境選擇。
常見問題
Gemini 3.5 Transcribe 支援哪些語言?
官方文件列出 85 種以上的支援語言與 BCP-47 代碼,並支援對話中的多語言切換。實際使用時,仍應以自己的錄音測試口音、背景噪音、專有名詞和多人對話。
一小時會議可以直接開啟說話者辨識嗎?
不能直接把一小時檔案連同說話者辨識一起送出。官方文件將啟用 diarization 或 word-level timestamps 時的檔案處理上限列為 30 分鐘,因此需要先切割音訊。
免費方案是否適合處理敏感錄音?
目前定價頁將免費方案標示為內容會用於改善 Google 產品;因此不要把免費方案視為零保留或完全不使用資料的方案。
gemini-3.5-transcribe 是即時轉錄模型嗎?
它是上傳音訊檔案的非串流模型。需要透過 WebSocket 處理即時麥克風或直播音訊時,應查看獨立的 gemini-3.5-transcribe-live 文件。
結語
Gemini 3.5 Transcribe 是一個功能完整的 Cloud ASR 模型,適合中文、英文和多語言錄音。它支援自動語言偵測、多語切換、說話者辨識、單字級時間戳記、自訂詞彙和智慧格式化。
建議先用一般音訊檔案請求測試,再依需要加入語言提示、自訂詞彙、時間戳記或說話者辨識。取得逐字稿後,可以使用 Scribis 進行校對、編輯、搜尋、整理和字幕匯出,將原始轉錄結果轉成真正可使用的內容。