Whisper Large-v3 vs Breeze-ASR-25:台灣中文與中英混用 ASR 怎麼選?
比較 Scribis 已整合的 Whisper Large-v3 與 Breeze-ASR-25,解析台灣中文、繁體中文、中英 code-switching、字幕時間戳與 benchmark,找出適合影片轉錄的模型。
文章定位: Whisper Large-v3 與 Breeze-ASR-25 都已整合到 Scribis。本文比較兩者在台灣中文、中英混用、字幕時間戳與一般多語轉錄上的差異,也會說明 Breeze 相關論文中的 Twister 不等同 Breeze-ASR-25 本身。
先講結論:Whisper 是通用基線,Breeze 更聚焦台灣中文
Whisper Large-v3 是 OpenAI 推出的多語言語音辨識模型,具備成熟工具鏈和廣泛的本地部署經驗;Breeze-ASR-25 則是 MediaTek Research 基於 Whisper-large-v2 微調的模型,專門強化繁體中文、台灣中文、中英混用與時間戳對齊。
如果你處理的是英文、多語影片或想要一個廣泛驗證過的基線,Whisper Large-v3 很適合;如果內容主要是台灣中文、訪談、課程、Podcast,且常出現英文品牌、技術詞或句內中英切換,Breeze-ASR-25 值得優先測試。兩者都已整合到 Scribis,因此可以在同一個影音工作流中比較逐字稿、字幕節奏和人工校對時間。
Breeze-ASR-25 解決什麼問題?
Breeze-ASR-25 的官方模型卡指出,它以 Whisper-large-v2 為基礎,針對台灣 Mandarin、繁體中文、中英 code-switching 和自動字幕的時間對齊進行強化。 這個定位和「通用多語模型」不同:Breeze 不一定要在所有語言都贏,而是希望在台灣使用者真正會遇到的中文與混合語音情境中更實用。
中英混用值得特別說明。台灣的會議、科技課程與商務訪談經常在中文句子中插入英文產品名、縮寫或專有名詞,例如模型名稱、軟體工具、程式碼和公司品牌。若模型把英文當成中文音節,或錯誤翻譯成中文,最後的字幕就需要大量修正。Breeze-ASR-25 將句內與句外 code-switching 都列為優化方向,這使它成為 Whisper Large-v3 很有意義的比較對象。
| 比較項目 | Whisper Large-v3 | Breeze-ASR-25 |
|---|---|---|
| 基礎定位 | 通用多語 ASR 基線 | 台灣中文/中英混用專項微調 |
| 公開架構 | Whisper encoder-decoder | 基於 Whisper-large-v2 微調 |
| 主要語言重點 | 多語言 | 繁體中文、台灣中文、英文混用 |
| 字幕場景 | 可搭配 timestamp 工具 | 官方特別強調時間戳對齊與字幕 |
| 優勢 | 生態成熟、文件與工具多 | 台灣中文與 code-switching 方向明確 |
| Scribis 狀態 | 已整合 | 已整合 |
台灣中文 benchmark:不要把 Twister 寫成 Breeze
MediaTek 相關論文提出 Twister,一個透過 TTS 合成資料與 self-refining framework 改良 Whisper-large-v2 的研究模型。論文使用 6,000 小時未標註語音、文字資料和 BreezyVoice 合成內容,報告 Twister 在普通話和中英混用 benchmark 上降低錯誤率;這是 Twister 的結果,不能直接寫成 Breeze-ASR-25 的結果。
在論文 Table IV 中,CommonVoice16-zh-TW 的 MER 為 Whisper-large-v2 auto 9.84、Whisper-large-v3 8.95、Twister 7.97;CSZS-zh-en 的 MER 為 Whisper-large-v2 auto 29.49、Whisper-large-v3 26.43、Twister 13.01,相對 WERR 為 55.88%。這組數字可以用來說明台灣中文和 code-switching 微調的價值,但文章必須精確標示模型名稱與來源。
| 研究資料 | Whisper-large-v2 auto | Whisper-large-v3 | Twister | 說明 |
|---|---|---|---|---|
| CommonVoice16-zh-TW MER | 9.84 | 8.95 | 7.97 | 台灣中文短音訊;論文 Table IV。 |
| CSZS-zh-en MER | 29.49 | 26.43 | 13.01 | 中英混用;Twister 相對 WERR 55.88%。 |
| ML-lecture-2021-long MER | 6.13 | 6.41 | 4.98 | 台灣課程長音訊。 |
Whisper Large-v3 的優勢仍然很重要
Breeze 聚焦台灣中文,不代表 Whisper Large-v3 沒有價值。Whisper 的模型權重、量化版本、faster-whisper、WhisperX、字幕工具和社群範例都非常成熟;當專案需要英文、多語或跨平台支援時,成熟度本身就是成本優勢。第三方 ASR Leaderboard 的 English short-form 測試中,Whisper Large-v3 平均 WER 為 7.44%、RTFx 為 146;這個結果是固定資料集和硬體下的基線,不代表台灣中文表現。
Breeze-ASR-25 的優勢則是「更接近台灣內容」。但在真正使用前,仍要測試人名、地名、數字、英文專有名詞、口語贅詞、多人交談和長訪談。模型說明裡的「強化」不等同每一個使用者資料集都會下降相同比例的錯誤率。
在 Scribis 中建立你的台灣中文 A/B test
建議把一段 5 至 15 分鐘的台灣中文素材匯入 Scribis,分別使用 Whisper Large-v3 與 Breeze-ASR-25。第一輪看文字錯誤:中文同音字、數字、英文品牌名和專有名詞;第二輪看字幕體驗:句子切分、每行長度、時間戳、說話者與匯出後是否需要大量手動調整。
如果 Breeze 讓人工校對時間下降,即使它在某個英文公開 leaderboard 沒有排名第一,也可能更適合台灣影片製作。反過來,如果你的素材主要是英文、日文或多語混合,Whisper 的廣泛生態可能更有彈性。Scribis 的價值是把這個比較放進轉錄、字幕、翻譯和匯出流程,而不是只提供一張模型排行榜。
FAQ
Breeze-ASR-25 是不是 Whisper 的新版?
不是。Breeze-ASR-25 是基於 Whisper-large-v2 微調、針對台灣中文與中英混用強化的模型;Whisper Large-v3 是 OpenAI 的較新通用模型。兩者有關聯,但不是同一個 checkpoint。
Breeze-ASR-25 適合台灣口音嗎?
它的官方定位就是台灣 Mandarin、繁體中文與中英混用,值得作為台灣口音候選;但不同地區、年齡、語速與錄音品質仍會造成差異,應用自己的素材測試。
Twister 是 Breeze-ASR-25 嗎?
不是。Twister 是論文中的 TTS-enhanced Whisper 研究模型;Breeze-ASR-25 是 MediaTek Research 的另一個公開模型。文章和 SEO 內容不應把兩者當成同一模型。
結論:用 Whisper 做通用基線,用 Breeze 找台灣中文優勢
Whisper Large-v3 適合作為成熟、多語和工具生態的通用基線;Breeze-ASR-25 則適合台灣中文、中英混用和字幕時間軸優先的內容。兩者都已整合到 Scribis,最實際的方式不是預先認定誰一定最好,而是用同一批台灣素材比較 WER/MER、專有名詞、字幕切句和人工校對時間。

圖:此圖呈現 Twister 論文的 MER,不是 Breeze-ASR-25 本身的 benchmark;MER 混合中文 CER 與英文 WER。
CTA: 如果你正在整理台灣中文訪談、課程或影片字幕,可以使用 Scribis.app 直接比較 Whisper Large-v3 與 Breeze-ASR-25,再把最適合的結果匯出成字幕或逐字稿。