ASR 比較

Qwen3-ASR-1.7B vs Whisper:中文、方言與台灣口音 ASR 怎麼選?

personJH LAI
calendar_today

解析 Qwen3-ASR-1.7B 的 52 語言/方言、串流、離線與 ForcedAligner 能力,並比較 Whisper、Breeze、FireRed 和 Fun-ASR,了解如何在 Scribis 製作台灣中文字幕。

文章定位: 本文介紹 Scribis 已整合的 Qwen3-ASR-1.7B,並與 Whisper、Breeze-ASR-25、FireRedASR2-AED 和 Fun-ASR-Nano 比較。外部模型的規格與 benchmark 僅供理解與選型參考,不表示 Scribis 已整合全部比較模型。

先講結論:Qwen3-ASR-1.7B 適合當作中文多語言主力候選

Qwen3-ASR-1.7B 是 Qwen 團隊推出的開源自動語音辨識模型,主打多語言、中文方言、離線與串流轉錄。官方資料指出,Qwen3-ASR 家族支援 30 種語言與 22 種中文方言或口音,合計 52 種語言/方言,也能處理語音、歌聲與帶背景音樂的歌曲。 對需要將訪談、課程、Podcast 或影片轉成字幕的使用者來說,它的優勢不只在 WER,而在於中文語境、口音、串流和字幕時間軸可以放在同一套模型家族中考慮

Qwen3-ASR-1.7B 已整合到 Scribis。實際使用時,讀者可以直接把音訊或影片交給 Scribis,完成轉錄、字幕時間軸、校對、翻譯與多種格式匯出;模型選擇是工作流的一部分,而不是使用者必須自行處理 CUDA、權重和推論腳本的全部工作。Scribis 也整合 Whisper、Breeze-25、SenseVoice Small、Parakeet TDT v3、Paraformer-zh、Nemotron ASR、Qwen3-ASR-0.6B、VibeVoice ASR、Voxtral Mini 3B 與 Voxtral 4B Realtime,可用來做同一份素材的 A/B test。

Qwen3-ASR-1.7B 有哪些技術特色?

Qwen3-ASR-1.7B 由 Qwen3-1.7B、投影層與約 300M 參數的 AuT 音訊編碼器組成。技術報告描述 AuT 對 Fbank 音訊特徵做下採樣,並使用動態注意力視窗處理不同長度的語音;模型可透過 qwen-asr 套件、vLLM、批次推論或 streaming pipeline 使用。

模型的上下文定位也很適合內容製作。官方模型卡列出單段語音約 20 分鐘的使用情境,而 Qwen3-ForcedAligner-0.6B 則可以對既有文字補上字、詞或句子級時間戳,最多約 300 秒、支援 11 種語言。 這代表「轉錄」與「字幕對齊」可以分開處理:先用 ASR 產生內容,再用 aligner 讓文字更準確地回到時間軸。

能力 Qwen3-ASR-1.7B 的定位 對 Scribis 使用者的意義
語言 30 語言加 22 種中文方言/口音 適合多語內容與中文口音比較。
模式 離線與串流 可同時覆蓋影片批次轉錄和即時字幕。
時間資訊 搭配 ForcedAligner 輸出字/詞/句時間戳 有助於字幕切句、歌詞與剪輯標記。
模型規模 1.7B,精度優先於 0.6B 適合較重視品質、可接受較高硬體需求的專案。
授權 Apache-2.0 可研究與自建部署,但仍要檢查整體資料和服務合規。

和 Whisper、Breeze、FireRed、Fun-ASR 怎麼比?

Whisper Large-v3 是最常見的多語言本地 ASR 基線,生態成熟、文件多、部署工具豐富;它的優點是可預期,缺點是台灣中文、中英混用或特定領域專有名詞未必是最佳結果。ASR Leaderboard 的 English short-form 結果中,Whisper Large-v3 平均 WER 為 7.44%、RTFx 為 146;Qwen3-ASR-1.7B 則為 5.76%、RTFx 為 148。這組數字來自固定測試環境,不代表所有語言都會得到相同差距。

Breeze-ASR-25 是 MediaTek Research 基於 Whisper-large-v2 微調的 ASR,特別強化繁體中文、中英 code-switching 與時間戳對齊。 如果內容有台灣中文或句內中英混用,Breeze 是非常合理的近身比較對象。Breeze 的優勢是台灣使用情境清楚;Qwen3-ASR-1.7B 的優勢則是語言與方言覆蓋更廣。

FireRedASR2-AED 針對普通話、中文方言/口音、英文、code-switching 和歌聲轉錄,官方在 4 個普通話 benchmark 報告平均 CER 3.05%,在 19 個方言/口音 benchmark 報告平均 CER 11.67%。同一份官方表格中,Qwen3-ASR 的平均 CER 為 3.76% 與 11.85%。這是 FireRed 官方報告,必須標示為 vendor-reported,不能當成完全獨立的總排名。

Fun-ASR-Nano-2512 是 800M 級的中文與多語 ASR,主打中文方言、英文、日文與產業語音;Fun-ASR-MLT-Nano-2512 則擴展到 31 語言。 如果硬體有限、希望用較小模型批次處理大量檔案,Fun-ASR-Nano 或 Qwen3-ASR-0.6B 可能比 1.7B 更適合。

模型 主要強項 和 Qwen3-ASR-1.7B 的差異
Whisper Large-v3 成熟生態、多語言、本地部署 泛用基線強,但不特別針對台灣中文與中文方言。
Breeze-ASR-25 台灣中文、中英混用、字幕對齊 語言範圍較聚焦,適合台灣本地素材 A/B test。
FireRedASR2-AED 中文方言、歌聲、ASR pipeline 中文專項能力強,但 benchmark 多為官方表格。
Fun-ASR-Nano 中文方言、產業語音、較小模型 資源較省,1.7B 版本則有較大的多語言餘裕。
Qwen3-ASR-1.7B 52 語言/方言、串流、離線、對齊家族 更適合多語和中文方言並重的工作流。

Benchmark 怎麼看才不會誤判?

Qwen 官方公開評測中,Qwen3-ASR-1.7B 在 Common Voice 台灣中文的 WER 為 3.77%、FLEURS 粵語為 3.98%、KeSpeech 中文方言為 5.10%;這些數字對台灣中文內容創作者有參考價值,但屬於 Qwen 官方 benchmark。 第三方 ASR Leaderboard 則在 English short-form 評測中給 Qwen3-ASR-1.7B 5.76% WER、148 RTFx,並在 multilingual track 報告 5.11% 平均 WER。

WER 越低通常越好,RTFx 越高通常越快,但英文 WER、中文 CER、台灣中文資料集、背景噪音和長音訊不應混在一起排名。真正要在 Scribis 中選模型,建議準備一組包含台灣口音、專有名詞、多人交談和中英混用的素材,觀察的不只是轉錄字數,也包括字幕切句、時間軸、說話者與人工校對時間。

在 Scribis 中怎麼使用這個比較?

最實用的流程是先把同一段素材匯入 Scribis,分別使用 Qwen3-ASR-1.7B、Whisper、Breeze 或其他已整合模型產生逐字稿,再比較錯字、專有名詞、中文英文切換和字幕節奏。對長訪談,應記錄完整處理時間與人工校對時間;對即時場景,則要記錄第一段 partial transcript 的延遲和後續修正。

若內容以台灣中文為主,Breeze-25、Qwen3-ASR-1.7B、FireRedASR2-AED 和 SenseVoice Small 都值得實測;若同時有日文、英文或多語內容,Qwen3-ASR-1.7B 的 52 語言/方言定位會更有吸引力。當你不想自行管理模型環境時,Scribis 的價值就在於把轉錄結果直接接到字幕時間軸、翻譯、編輯與匯出。

常見問題

Qwen3-ASR-1.7B 適合台灣口音嗎?

它的官方語言與 benchmark 包含 Common Voice 台灣中文等資料,具備值得測試的台灣中文定位;不過「台灣口音」涵蓋說話速度、年齡、錄音品質與地區差異,正式專案仍應以自己的資料驗證。Scribis 已整合 Qwen3-ASR-1.7B,可直接和 Breeze-25、Whisper 等模型比較。

Qwen3-ASR-1.7B 比 Whisper 一定準嗎?

不一定。第三方 English short-form benchmark 顯示 Qwen3-ASR-1.7B 在該設定的平均 WER 低於 Whisper Large-v3,但不同語言、資料集和長度可能出現不同結果。最可靠的方法是用同一批內容在 Scribis 中實測。

Qwen3-ASR-1.7B 需要 GPU 嗎?

本地推論通常需要依模型量化、batch 和服務吞吐配置 GPU;Scribis 使用者不一定要自行處理部署細節,但仍要依桌面版與專案版本確認硬體需求。若資源有限,可以把 Qwen3-ASR-0.6B、SenseVoice 或 Parakeet 一起列入測試。

結論:Qwen3-ASR-1.7B 是 Scribis 使用者值得先測的中文多語模型

如果你的工作同時涉及中文、台灣口音、中英混用、字幕時間軸和多語影片,Qwen3-ASR-1.7B 是值得優先測試的 Scribis 已整合模型。Whisper 提供成熟基線,Breeze 更聚焦台灣中文,FireRed 與 Fun-ASR 對中文方言和產業資料各有強項;沒有任何一個 benchmark 可以取代真實素材測試。

Qwen3-ASR-1.7B 與 Whisper、Parakeet 的 WER/RTFx 參考圖

圖:第三方 ASR Leaderboard English short-form snapshot;不代表中文或台灣口音總排名。

CTA: 想把錄音或影片快速整理成可編輯逐字稿與字幕,可以從 Scribis.app 的影音轉錄工作流開始,再用同一批素材比較不同 ASR 模型。

相關連結

  1. Qwen3-ASR 官方 GitHub 與公開 benchmark
  2. Qwen3-ASR Technical Report
  3. Qwen3-ASR-1.7B 官方模型卡
  4. ASR Leaderboard:可重現的多語言與長音訊評測
  5. MediaTek Breeze-ASR-25 官方模型卡
  6. FireRedASR2-AED 官方模型卡與 benchmark
  7. Fun-ASR-Nano-2512 官方模型卡