ASR 比較

Qwen3-ASR-0.6B vs 1.7B:速度、顯示卡與準確率怎麼選?

personJH LAI
calendar_today

比較 Scribis 已整合的 Qwen3-ASR-0.6B 與 1.7B,解析模型大小、RTF、TTFT、中文方言、批次處理,並與 Parakeet TDT v3、SenseVoice Small 及 Whisper 對照。

文章定位: Qwen3-ASR-0.6B 與 1.7B 都已整合到 Scribis。本文聚焦兩個版本的取捨,並和 Parakeet TDT v3、SenseVoice Small 比較本地部署、批次速度、即時延遲與中文內容品質。外部 benchmark 只代表特定測試設定。

先講結論:0.6B 適合效率,1.7B 適合品質與複雜語音

Qwen3-ASR-0.6B 和 Qwen3-ASR-1.7B 是同一個模型家族的兩種取捨。0.6B 版本以較小的語言模型和聲學編碼器換取較低資源需求、高併發與更快的處理;1.7B 版本則以較大的模型容量換取更好的多語言、方言、上下文和複雜聲學表現。兩者都支援離線與串流,並涵蓋 30 種語言與 22 種中文方言/口音。

對 Scribis 使用者而言,最簡單的決策方式是:短音訊大量批次、硬體有限或重視回應速度,先測 0.6B;訪談、多人對話、專有名詞、台灣中文與多語內容,先測 1.7B。 由於 Scribis 已整合兩個版本,可以用同一個音訊直接比較,而不必把結果分別匯入不同工具。

兩個版本差在哪裡?

Qwen3-ASR-1.7B 由 Qwen3-1.7B、投影層與約 300M 參數的 AuT 音訊編碼器組成;0.6B 則搭配 Qwen3-0.6B 與約 180M 參數的 AuT 編碼器。 參數量不是品質的唯一決定因素,但在長上下文、語言辨識、低訊噪比和多說話者內容上,較大版本通常比較有餘裕。

比較項目 Qwen3-ASR-0.6B Qwen3-ASR-1.7B
模型定位 效率、批次、高併發 品質、多語、複雜聲音
聲學編碼器 約 180M AuT 約 300M AuT
語言/方言 30 語言+22 種中文方言/口音 同一語言範圍
官方 online async 最高吞吐 併發 128 時約 2,000 倍音訊秒/秒 併發 128 時約 1,219.51 倍音訊秒/秒
TTFT 併發 1 平均約 92ms 併發 1 平均約 102ms
優先使用情境 大量短檔、edge、成本敏感服務 高品質字幕、訪談、跨語言內容
Scribis 狀態 已整合 已整合

上表速度數據來自 Qwen 技術報告的特定 vLLM、CUDA Graph、bfloat16 與 GPU 設定,不能直接當成一般 Windows 或 macOS 電腦的保證速度。 在真實情境中,音訊格式、batch size、模型量化、顯示卡記憶體與同時工作的其他功能都會影響結果。

Qwen3-ASR 和 Parakeet、SenseVoice 怎麼比較?

Parakeet TDT v3 是 NVIDIA NeMo 生態中偏高速的 ASR,TDT 與 CTC 系列通常以高 throughput 和低延遲見長。第三方 English short-form ASR Leaderboard 在 A100 測試中報告 Parakeet TDT 0.6B v3 平均 WER 6.32%、RTFx 3,330,Qwen3-ASR-1.7B 則為 5.76%、RTFx 148。 這組結果非常能說明兩種路線:Parakeet 速度驚人,Qwen3-ASR 在該測試的文字錯誤率較低,但二者並不是完全相同的語言和工作流定位。

SenseVoice Small 是 FunASR 生態的多功能語音模型,除了 ASR,也能做語言識別、情緒辨識與音訊事件偵測。官方模型卡主打 50 多種語言、non-autoregressive 架構和低延遲,並宣稱 10 秒音訊約 70ms 推論時間;這是官方測試值,實際部署仍需自行驗證。

模型 強項 可能的限制
Qwen3-ASR-0.6B 小型、多語、批次與高併發 複雜長音訊與口音可能不如 1.7B。
Qwen3-ASR-1.7B 中文方言、多語、上下文與品質 資源需求和延遲高於 0.6B。
Parakeet TDT v3 極高 RTFx、英語與高速批次 不應只用 English benchmark 推論中文與台灣口音。
SenseVoice Small ASR+LID+事件、低延遲 額外任務需搭配正確 pipeline,不能只看單一 ASR 數字。
Whisper Large-v3 成熟、多語與工具生態 速度與特定中文口音不一定是最佳。

0.6B 或 1.7B,實際應看哪些指標?

第一個指標是人工校對時間。如果 0.6B 轉得很快,但每十分鐘音訊需要多花五分鐘修正專有名詞、數字或台灣口音,它未必比 1.7B 省成本。第二個指標是完整工作流延遲,包括上傳、切段、轉錄、字幕切句、時間軸和匯出,而不是只測模型 forward time。

第三個指標是音訊類型。純朗讀、清楚單人錄音通常容易辨識;多人重疊、背景音、口語贅詞、英文品牌名、台灣中文或中英混用才是模型差距容易放大的地方。Qwen3-ASR 的官方測試包含中文方言、低訊噪比、長者與兒童、多說話者和 code-switching robustness suite,因此值得作為中文專案的候選,但仍應以你的資料驗證。

在 Scribis 裡怎麼選?

如果你的內容是每天大量匯入短影音、客服錄音或社群影片,可以先用 Qwen3-ASR-0.6B 做快速草稿,再挑重要素材用 1.7B 重跑。若是一次性的高價值訪談、課程、會議紀錄或字幕交付,直接使用 1.7B 可能比較省人工校對時間。

Scribis 同時整合 Parakeet TDT v3、SenseVoice Small、Whisper、Nemotron ASR、VibeVoice ASR 與 Voxtral realtime,因此也能用「品質—速度—即時性」三個維度做 A/B test。對中文和台灣口音,建議固定一段 5 至 10 分鐘素材,檢查人名、地名、數字、中英品牌詞、字幕切句和時間軸,再決定預設模型。

FAQ

Qwen3-ASR-0.6B 可以處理台灣中文嗎?

可以把它視為值得測試的候選,因為 Qwen3-ASR 家族的語言範圍包括中文方言/口音;但 0.6B 和 1.7B 在你的錄音上可能有差異,尤其是多人、噪音和中英混用情境。Scribis 已整合兩個版本,最好的方法是直接比較。

Parakeet 一定比 Qwen3-ASR 快嗎?

在第三方 English short-form、A100 設定中,Parakeet TDT v3 的 RTFx 顯著較高;但硬體、batch、語言和 runtime 都會影響結果。速度快不等於字幕一定需要較少人工修正。

1.7B 會不會太大?

要看部署方式。對雲端或工作站而言,1.7B 是可管理的中型模型;對 CPU-only edge 裝置,0.6B、SenseVoice 或 Parakeet 可能更實際。Scribis 使用者應依產品版本的硬體建議確認,而不是只用參數量判斷。

結論:把 0.6B 當效率版,把 1.7B 當品質版

Qwen3-ASR-0.6B 和 1.7B 不是誰全面取代誰,而是同一套語音轉文字工作流的兩個檔位。0.6B 適合高併發、快速草稿和資源受限;1.7B 適合多語、中文方言、複雜聲音和需要減少人工校對的內容。Parakeet 提供速度優勢,SenseVoice 提供額外語音理解能力,Whisper 則提供成熟生態。

Qwen3-ASR 0.6B 與 1.7B 官方 RTF 快照

圖:Qwen3 技術報告在特定 vLLM、CUDA Graph、bfloat16 與併發 128 設定下的 RTF;不是一般電腦的保證速度。

CTA: 想實際比較速度與字幕品質,可以在 Scribis.app 用同一段錄音測試 Qwen3-ASR-0.6B、1.7B 與其他已整合模型,再依你的內容和硬體選擇預設模型。

相關連結

  1. Qwen3-ASR 官方 GitHub
  2. Qwen3-ASR Technical Report
  3. ASR Leaderboard:WER 與 RTFx 比較
  4. SenseVoiceSmall 官方模型卡
  5. Scribis 官方功能頁