模型新訊

Gemini 3.5 Transcribe:Google 最新語音轉文字模型介紹與使用教學

personJH LAI
calendar_today

Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。

Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型。它以 Gemini 的音訊理解能力為基礎,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。

正式模型名稱是:

gemini-3.5-transcribe

Google 官方更新紀錄顯示,Gemini 3.5 Transcribe 已於 2026 年 8 月 26 日正式 GA(Generally Available)。另外還有一個獨立的即時串流模型 gemini-3.5-transcribe-live,適合透過 WebSocket 處理麥克風或即時音訊;本篇主要介紹上傳音訊檔案的非即時版本。

Gemini 3.5 Transcribe 有什麼特色?

Gemini 3.5 Transcribe 不只是把聲音轉成一段純文字。它可以辨識 85 種以上的語言,處理對話中的多語言切換,區分不同說話者,並輸出每個單字的開始與結束時間。

對訪談、會議、課程、Podcast 和影片字幕而言,這些功能相當實用。你可以先取得原始逐字稿,再依需要加入說話者、時間軸、自訂詞彙或智慧格式化。

功能 說明
自動語言偵測 自動判斷音訊中的語言,不一定需要手動設定
多語言切換 支援句子內與句子之間的語言切換
說話者辨識 將不同發言者分成不同標籤
單字級時間戳記 回傳每個單字的開始與結束時間
自訂詞彙 提升品牌、人名、專業術語和縮寫的辨識率
Smart Transcription 清除贅詞、重複與部分口語不順,並改善格式
文字正規化 將口語數字或金額轉成較容易閱讀的形式

音訊長度與功能限制

Gemini 3.5 Transcribe 一般每次請求最多可以處理 1 小時音訊。不過,如果啟用說話者辨識或單字級時間戳記,官方文件將音訊檔案處理上限列為 30 分鐘

說話者辨識最多支援 8 位說話者;當錄音中有 3 位以上說話者時,官方將辨識結果標示為實驗性功能。因此,重要會議或正式發表前仍然需要人工檢查。

使用方式 建議處理方式
一小時內的一般逐字稿 可以直接送出音訊檔案
需要說話者辨識 先將音訊切成 30 分鐘以內
需要單字級時間戳記 先將音訊切成 30 分鐘以內
長時間會議 依時間切割,合併後再校對
即時麥克風轉錄 使用獨立的 gemini-3.5-transcribe-live

切割長音訊時,建議在片段交界保留少量上下文,最後合併逐字稿時再檢查重複或遺漏的句子。

建立 Gemini API key

前往 Google AI Studio API Keys,登入 Google 帳戶後建立或查看 Gemini API key。Google 官方文件建議使用 GEMINI_API_KEYGOOGLE_API_KEY 環境變數,不要把 key 直接寫入程式碼。

export GEMINI_API_KEY='YOUR_GEMINI_API_KEY'

Google 的 API key 文件指出,AI Studio 新建立的 key 會使用 authorization key;標準 key 的使用規則也正在 2026 年進行調整。建立 key 後,請依照 AI Studio 或 Google Cloud 顯示的限制與遷移說明設定。

API key 等同密碼。不要把真實 key 放在文章、GitHub、公開截圖、影片或提供給一般使用者下載的應用程式中。

使用 Python 轉錄音訊

先安裝 Google GenAI SDK:

pip install google-genai

Google 官方轉錄指南建議先上傳音訊檔案,再將檔案 URI 傳給 Interactions API。最基本的 Python 範例如下:

from google import genai

client = genai.Client()

audio_file = client.files.upload(file="sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
)

print(interaction.output_text)

如果已經設定 GEMINI_API_KEY,SDK 可以從環境變數讀取 key,不需要把秘密直接寫入 Python 檔案。

自動偵測語言與指定語言

預設情況下,模型會自動判斷音訊中的語言,也能在對話進行中偵測語言切換。如果你不確定錄音語言,直接省略 language_codes 或傳入空陣列即可。

如果你知道音訊主要語言,也可以傳入 BCP-47 語言代碼。例如,英文可以使用 en-US,繁體中文可以依官方支援語言表選擇相應代碼,西班牙文可以使用 es-ES

generation_config = {
    "transcription_config": {
        "language_codes": ["en-US"],
    }
}

如果是中英混合或多語訪談,可以分別測試自動偵測和手動指定語言。不要只用一段乾淨錄音判斷效果,最好加入不同口音、專有名詞和多人對話。

自訂詞彙:改善人名與專業術語

Gemini 3.5 Transcribe 支援自訂詞彙,可以提示模型注意不常見的字詞、產品名稱、品牌、人名、縮寫和專業術語。官方文件允許最多 1,000 個詞組,但通常建議先控制在 100 個以內,比較容易得到穩定效果。

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
    generation_config={
        "transcription_config": {
            "custom_vocabulary": [
                "Gemini",
                "Kubernetes",
                "BigQuery",
                "Scribis",
            ],
        }
    },
)

自訂詞彙是辨識提示,不是要求模型強行輸出沒有說過的內容。建議比較「有自訂詞彙」和「沒有自訂詞彙」的結果,確認是否真的改善專有名詞,而不是增加錯誤字詞。

Smart Transcription 智慧轉錄

Smart Transcription 會清除部分贅詞、重複和口語不順,並改善大小寫、標點、段落與數字格式。

這對會議筆記、訪談文章和內容整理很方便,但它不一定等同於逐字記錄。如果你要保留每一個口語停頓、重複或語氣,應該保留原始結果,並將智慧格式化版本視為適合閱讀的編輯稿。

說話者辨識與時間戳記

音訊檔案轉錄支援說話者辨識和單字級時間戳記。這讓 Gemini 3.5 Transcribe 適合訪談、座談、會議和字幕工作。

但啟用其中一項功能後,音訊檔案處理上限會降為 30 分鐘。處理長會議時,可以先依時間切割檔案,再將各段結果合併;合併後要特別檢查說話者切換、句子交界和時間軸是否連續。

費用與免費方案的資料使用

Google 目前的 Gemini Developer API 定價頁列出以下 gemini-3.5-transcribe 參考價格:

方案 音訊輸入 文字輸出 資料使用說明
Free 免費 免費 內容會用於改善 Google 產品
Paid Standard US$2.00/每 100 萬 audio tokens,估算約 US$0.003/分鐘 US$12.00/每 100 萬 text tokens,估算約 US$0.002/分鐘 內容不會用於改善 Google 產品

Google 以每秒 25 個 audio tokens 和每分鐘 175 個 text tokens 估算,整體有效價格約為 US$0.005/分鐘

需要注意的是,免費方案不只是付費方案的「零元版本」。官方定價頁明確將免費方案標示為「內容會用於改善 Google 產品」,而付費方案則標示為「內容不會用於改善 Google 產品」。如果錄音包含訪談、內部會議、客戶資料或其他敏感內容,請先閱讀當下的服務條款與資料政策。

Artificial Analysis 第三方評測數據

除了官方標示的規格外,獨立 AI 評測機構 Artificial Analysis 也在其 Speech-to-Text 基準測試中對 Gemini 3.5 Transcribe 進行了實測。

評測綜合考量了字詞錯誤率(AA-WER v2,涵蓋真實對話、議事錄音與多種口音條件)、處理速度因子(Speed Factor)與每 1,000 分鐘的轉錄費用:

模型與服務商 AA-WER 錯誤率(越低越好) 速度因子 (Speed Factor,越高越快) 每 1,000 分鐘費用 (USD)
Gemini 3.5 Transcribe (Google) 2.6% 79.6x $5.00
Scribe v2 (ElevenLabs) 2.2% 53.9x $3.67
MAI-Transcribe-1.5 (Microsoft Azure) 2.4% 191.5x $6.00
GPT Transcribe (OpenAI) 3.3% 40.8x $4.50
Nova-3 (Deepgram) 5.2% 540.2x $4.30
Whisper Large v3 Turbo (Groq) 4.6% 165.4x $0.67

數據顯示,Gemini 3.5 Transcribe 在精確度方面表現優異,AA-WER 僅有 2.6%,名列整體評測前茅(超越 OpenAI GPT Transcribe 的 3.3% 與 Deepgram Nova-3 的 5.2%)。在速度方面,達到 79.6x 的實時轉錄倍速,在精準度、處理速度與價格之間取得了極佳平衡。

與 Scribis 搭配的逐字稿工作流程

Cloud ASR 負責將語音轉成文字,但轉錄完成後通常還有很多工作,例如修正人名、搜尋重要句子、拆分段落、比對音訊、製作字幕或整理筆記。

Scribis 可以作為桌面端的逐字稿整理工具,將錄音與文字工作集中在同一個工作流程中。完成轉錄後,你可以使用 Scribis 進行校對、編輯、搜尋、分段和字幕匯出。

Gemini Transcribe 與桌面端逐字稿工作流程

這樣的分工很清楚:Gemini 3.5 Transcribe 負責語音辨識,Scribis 則協助把轉錄結果整理成更容易閱讀和使用的文字內容。

Gemini 3.5 Transcribe 與 Transcribe Live 的差異

兩個模型的用途不同:

模型 輸入方式 適合情境
gemini-3.5-transcribe 上傳音訊檔案 會議、訪談、課程、Podcast 和字幕
gemini-3.5-transcribe-live 透過 WebSocket 雙向串流音訊 麥克風輸入、即時字幕和即時應用程式

不要把 Live 模型的串流限制或價格套用到音訊檔案轉錄。Google 將兩者列為不同的模型 endpoint,請依使用情境選擇。

常見問題

Gemini 3.5 Transcribe 支援哪些語言?

官方文件列出 85 種以上的支援語言與 BCP-47 代碼,並支援對話中的多語言切換。實際使用時,仍應以自己的錄音測試口音、背景噪音、專有名詞和多人對話。

一小時會議可以直接開啟說話者辨識嗎?

不能直接把一小時檔案連同說話者辨識一起送出。官方文件將啟用 diarization 或 word-level timestamps 時的檔案處理上限列為 30 分鐘,因此需要先切割音訊。

免費方案是否適合處理敏感錄音?

目前定價頁將免費方案標示為內容會用於改善 Google 產品;因此不要把免費方案視為零保留或完全不使用資料的方案。

gemini-3.5-transcribe 是即時轉錄模型嗎?

它是上傳音訊檔案的非串流模型。需要透過 WebSocket 處理即時麥克風或直播音訊時,應查看獨立的 gemini-3.5-transcribe-live 文件。

結語

Gemini 3.5 Transcribe 是一個功能完整的 Cloud ASR 模型,適合中文、英文和多語言錄音。它支援自動語言偵測、多語切換、說話者辨識、單字級時間戳記、自訂詞彙和智慧格式化。

建議先用一般音訊檔案請求測試,再依需要加入語言提示、自訂詞彙、時間戳記或說話者辨識。取得逐字稿後,可以使用 Scribis 進行校對、編輯、搜尋、整理和字幕匯出,將原始轉錄結果轉成真正可使用的內容。

相關連結

  1. Gemini 3.5 Transcribe 模型頁面
  2. Artificial Analysis Speech to Text Leaderboard