ASR 比較

VibeVoice ASR vs Qwen3-ASR:多語言 Speech-LLM 轉錄怎麼選?

personJH LAI
calendar_today

解析 VibeVoice ASR 與 Qwen3-ASR 的 Speech-LLM 路線,並比較 Voxtral Mini 3B、Whisper、長音訊、多語言、台灣中文、GPU 需求與 Scribis 字幕工作流。

文章定位: VibeVoice ASR、Qwen3-ASR、Voxtral Mini 3B 與 Whisper 都是值得放在多語言與長音訊工作流中比較的模型;其中 VibeVoice ASR 與 Qwen3-ASR 已整合到 Scribis。本文不把 CrispASR 的 backend 支援清單當成 Scribis 的整合清單,並將沒有統一 benchmark 的部分明確標示。

先講結論:VibeVoice 適合研究多語言 Speech-LLM,Qwen3-ASR 更容易直接對照中文與方言

VibeVoice ASR 和 Qwen3-ASR 都不是單純的傳統 CTC ASR。它們把語音編碼器、語言模型與文字生成結合,目標是處理多語言、長音訊和更複雜的語音內容。VibeVoice-ASR 的公開生態常以 σ-VAE、ConvNeXt 與 Qwen2.5-7B 路線描述,CrispASR 則列出 VibeVoice-ASR 與 BitNet 變體;Qwen3-ASR 則提供 0.6B、1.7B、串流/離線和 ForcedAligner 家族。

如果你的內容以中文、台灣口音、中英混用和字幕時間軸為主,Qwen3-ASR 比較容易找到直接相關的官方 benchmark;如果你想探索更大型 Speech-LLM、長音訊和多語言上下文,VibeVoice ASR 值得測試。兩者都已整合到 Scribis,使用者可以用同一段影片比較完整工作流。

VibeVoice ASR 的定位

VibeVoice ASR 走大型 Speech-LLM 路線,重點在語音與語言上下文的整合,而不是只追求最小參數。CrispASR README 將 VibeVoice-ASR 描述為多語言 backend,另有 BitNet 低位元變體;Scribis 公開文案也曾提到 VibeVoice 的高速轉錄情境。

這種模型的優點是可以利用語言模型處理句子上下文、專有名詞與多語言內容,缺點是通常需要較多 GPU 記憶體與更複雜的 runtime。若只是處理大量短句,Parakeet、SenseVoice 或 Paraformer 可能更有效率;若內容需要長上下文、語意穩定和多語言,VibeVoice 的方向更值得觀察。

Qwen3-ASR 為什麼適合中文內容?

Qwen3-ASR 支援 30 種語言與 22 種中文方言/口音,合計 52 種語言/方言,並提供離線、串流、歌聲與背景音樂轉錄。 Qwen3-ASR-1.7B 技術報告描述約 300M AuT 音訊編碼器和 Qwen3-1.7B;0.6B 版本則以較小模型換取效率。

Qwen 官方公開測試中,Qwen3-ASR-1.7B 在 Common Voice 台灣中文報告 3.77% WER、FLEURS 粵語 3.98%、KeSpeech 中文方言 5.10%;這些是官方評測,應和第三方 benchmark 分開閱讀。 對 Scribis 使用者而言,這些資料至少提供了台灣中文和中文方言的明確測試方向。

比較項目 VibeVoice ASR Qwen3-ASR
主要定位 大型多語言 Speech-LLM 多語、中文方言、串流/離線 ASR
模型路線 σ-VAE/ConvNeXt+Qwen2.5-7B 生態 AuT encoder+Qwen3 0.6B/1.7B
語言重點 多語言,依 checkpoint 為準 30 語言+22 中文方言/口音
長音訊 適合研究長上下文,需依版本驗證 官方模型卡提供約 20 分鐘單段定位
資源取捨 大模型,GPU 需求較高 0.6B/1.7B 可依硬體選擇
Scribis 狀態 已整合 已整合

和 Voxtral Mini 3B、Whisper 比較

Voxtral Mini 3B 是 Mistral 的語音 LLM,CrispASR 將 voxtral 列為 3B 變體,另以 voxtral4b 列出 4B Realtime。3B 比較適合離線語音理解,4B Realtime 則針對串流。 若你想比較 Speech-LLM 的大小與延遲,VibeVoice、Qwen3-ASR、Voxtral Mini 3B 是合理的同類候選。

Whisper Large-v3 則是成熟的通用基線,適合用來確認大型 Speech-LLM 的複雜架構是否真的帶來實際收益。第三方 English short-form leaderboard 報告 Qwen3-ASR-1.7B 平均 WER 5.76%、RTFx 148,Whisper Large-v3 為 7.44%、RTFx 146;Voxtral Small 24B 為 6.62%、RTFx 54.1。 VibeVoice 沒有在這組表格中提供可直接對照的數字,所以不應自行補排名。

Speech-LLM 的 benchmark 限制

大型 Speech-LLM 很容易因語言模型、prompt、解碼設定和文字正規化方式不同而產生差異。即使同一個模型,在保留口語贅詞、刪除 filler、翻譯或摘要模式下,也可能得到不同 WER。因此,不能把某模型的 demo 聽感直接寫成 benchmark。

對 VibeVoice、Qwen3-ASR 和 Voxtral,建議把測試分為多語、中文方言、台灣口音、專有名詞、長音訊和中英混用。除了 WER/CER,也應檢查字幕切句、段落合併、時間戳和人工校對時間。

在 Scribis 中怎麼測試?

先使用一段包含台灣中文、中英混用和專有名詞的 10 分鐘訪談。接著在 Scribis 中分別使用 VibeVoice ASR、Qwen3-ASR-1.7B、Whisper Large-v3 和 Voxtral Mini 3B。若你也需要即時字幕,再加入 Voxtral 4B Realtime 和 Nemotron ASR。

比較時記錄四件事:完整轉錄耗時、第一段字幕出現時間、最終文字修正次數,以及匯出後字幕需要的人工調整。這些指標能將「Speech-LLM 很強」轉換成內容團隊真正關心的交付結果。

FAQ

VibeVoice ASR 比 Qwen3-ASR 更準嗎?

目前不能用一個通用結論回答。兩者的模型路線、公開 benchmark 和語言資料不同;Qwen3-ASR 有較清楚的中文方言與台灣中文資料可參考,而 VibeVoice 應以自己的長音訊和多語資料實測。

VibeVoice ASR 需要多少 GPU?

大型 Speech-LLM 通常比 Paraformer、SenseVoice 或 Parakeet 更吃資源,實際需求取決於模型版本、量化、context、batch 和 runtime。Scribis 使用者應依產品版本的硬體建議確認。

這篇提到的 VibeVoice 是 Scribis 已整合嗎?

依本次產品提供的整合清單,VibeVoice ASR 已整合到 Scribis。CrispASR 的 VibeVoice backend、外部模型 checkpoint 和 Scribis 產品整合仍是不同層級,文章不應混為一談。

結論:多語 Speech-LLM 應回到內容和硬體選擇

VibeVoice ASR 適合探索大型多語言 Speech-LLM 與長音訊上下文;Qwen3-ASR 則提供更清楚的中文方言、台灣中文、串流/離線與 ForcedAligner 路線;Voxtral Mini 3B 補足 Mistral 的 Speech-LLM 選項,Whisper 則是不可缺少的成熟基線。

VibeVoice ASR 與 Qwen3-ASR 的 Speech-LLM 架構示意

圖:這是內容工作流視角的概念示意,不是兩個模型的官方完整計算圖。

CTA: 想比較多語言與台灣中文轉錄品質,可以在 Scribis.app 直接測試 VibeVoice ASR、Qwen3-ASR、Whisper 和 Voxtral,再把結果接到字幕時間軸與影音編輯。

相關連結

  1. CrispASR ASR backend 清單
  2. Microsoft VibeVoice 官方 GitHub
  3. Scribis 官方網站
  4. Qwen3-ASR 官方 GitHub與 benchmark
  5. Qwen3-ASR Technical Report
  6. ASR Leaderboard:WER 與 RTFx 比較