Qwen3-ASR-0.6B vs 1.7B:速度、顯示卡與準確率怎麼選?
比較 Scribis 已整合的 Qwen3-ASR-0.6B 與 1.7B,解析模型大小、RTF、TTFT、中文方言、批次處理,並與 Parakeet TDT v3、SenseVoice Small 及 Whisper 對照。
文章定位: Qwen3-ASR-0.6B 與 1.7B 都已整合到 Scribis。本文聚焦兩個版本的取捨,並和 Parakeet TDT v3、SenseVoice Small 比較本地部署、批次速度、即時延遲與中文內容品質。外部 benchmark 只代表特定測試設定。
先講結論:0.6B 適合效率,1.7B 適合品質與複雜語音
Qwen3-ASR-0.6B 和 Qwen3-ASR-1.7B 是同一個模型家族的兩種取捨。0.6B 版本以較小的語言模型和聲學編碼器換取較低資源需求、高併發與更快的處理;1.7B 版本則以較大的模型容量換取更好的多語言、方言、上下文和複雜聲學表現。兩者都支援離線與串流,並涵蓋 30 種語言與 22 種中文方言/口音。
對 Scribis 使用者而言,最簡單的決策方式是:短音訊大量批次、硬體有限或重視回應速度,先測 0.6B;訪談、多人對話、專有名詞、台灣中文與多語內容,先測 1.7B。 由於 Scribis 已整合兩個版本,可以用同一個音訊直接比較,而不必把結果分別匯入不同工具。
兩個版本差在哪裡?
Qwen3-ASR-1.7B 由 Qwen3-1.7B、投影層與約 300M 參數的 AuT 音訊編碼器組成;0.6B 則搭配 Qwen3-0.6B 與約 180M 參數的 AuT 編碼器。 參數量不是品質的唯一決定因素,但在長上下文、語言辨識、低訊噪比和多說話者內容上,較大版本通常比較有餘裕。
| 比較項目 | Qwen3-ASR-0.6B | Qwen3-ASR-1.7B |
|---|---|---|
| 模型定位 | 效率、批次、高併發 | 品質、多語、複雜聲音 |
| 聲學編碼器 | 約 180M AuT | 約 300M AuT |
| 語言/方言 | 30 語言+22 種中文方言/口音 | 同一語言範圍 |
| 官方 online async 最高吞吐 | 併發 128 時約 2,000 倍音訊秒/秒 | 併發 128 時約 1,219.51 倍音訊秒/秒 |
| TTFT | 併發 1 平均約 92ms | 併發 1 平均約 102ms |
| 優先使用情境 | 大量短檔、edge、成本敏感服務 | 高品質字幕、訪談、跨語言內容 |
| Scribis 狀態 | 已整合 | 已整合 |
上表速度數據來自 Qwen 技術報告的特定 vLLM、CUDA Graph、bfloat16 與 GPU 設定,不能直接當成一般 Windows 或 macOS 電腦的保證速度。 在真實情境中,音訊格式、batch size、模型量化、顯示卡記憶體與同時工作的其他功能都會影響結果。
Qwen3-ASR 和 Parakeet、SenseVoice 怎麼比較?
Parakeet TDT v3 是 NVIDIA NeMo 生態中偏高速的 ASR,TDT 與 CTC 系列通常以高 throughput 和低延遲見長。第三方 English short-form ASR Leaderboard 在 A100 測試中報告 Parakeet TDT 0.6B v3 平均 WER 6.32%、RTFx 3,330,Qwen3-ASR-1.7B 則為 5.76%、RTFx 148。 這組結果非常能說明兩種路線:Parakeet 速度驚人,Qwen3-ASR 在該測試的文字錯誤率較低,但二者並不是完全相同的語言和工作流定位。
SenseVoice Small 是 FunASR 生態的多功能語音模型,除了 ASR,也能做語言識別、情緒辨識與音訊事件偵測。官方模型卡主打 50 多種語言、non-autoregressive 架構和低延遲,並宣稱 10 秒音訊約 70ms 推論時間;這是官方測試值,實際部署仍需自行驗證。
| 模型 | 強項 | 可能的限制 |
|---|---|---|
| Qwen3-ASR-0.6B | 小型、多語、批次與高併發 | 複雜長音訊與口音可能不如 1.7B。 |
| Qwen3-ASR-1.7B | 中文方言、多語、上下文與品質 | 資源需求和延遲高於 0.6B。 |
| Parakeet TDT v3 | 極高 RTFx、英語與高速批次 | 不應只用 English benchmark 推論中文與台灣口音。 |
| SenseVoice Small | ASR+LID+事件、低延遲 | 額外任務需搭配正確 pipeline,不能只看單一 ASR 數字。 |
| Whisper Large-v3 | 成熟、多語與工具生態 | 速度與特定中文口音不一定是最佳。 |
0.6B 或 1.7B,實際應看哪些指標?
第一個指標是人工校對時間。如果 0.6B 轉得很快,但每十分鐘音訊需要多花五分鐘修正專有名詞、數字或台灣口音,它未必比 1.7B 省成本。第二個指標是完整工作流延遲,包括上傳、切段、轉錄、字幕切句、時間軸和匯出,而不是只測模型 forward time。
第三個指標是音訊類型。純朗讀、清楚單人錄音通常容易辨識;多人重疊、背景音、口語贅詞、英文品牌名、台灣中文或中英混用才是模型差距容易放大的地方。Qwen3-ASR 的官方測試包含中文方言、低訊噪比、長者與兒童、多說話者和 code-switching robustness suite,因此值得作為中文專案的候選,但仍應以你的資料驗證。
在 Scribis 裡怎麼選?
如果你的內容是每天大量匯入短影音、客服錄音或社群影片,可以先用 Qwen3-ASR-0.6B 做快速草稿,再挑重要素材用 1.7B 重跑。若是一次性的高價值訪談、課程、會議紀錄或字幕交付,直接使用 1.7B 可能比較省人工校對時間。
Scribis 同時整合 Parakeet TDT v3、SenseVoice Small、Whisper、Nemotron ASR、VibeVoice ASR 與 Voxtral realtime,因此也能用「品質—速度—即時性」三個維度做 A/B test。對中文和台灣口音,建議固定一段 5 至 10 分鐘素材,檢查人名、地名、數字、中英品牌詞、字幕切句和時間軸,再決定預設模型。
FAQ
Qwen3-ASR-0.6B 可以處理台灣中文嗎?
可以把它視為值得測試的候選,因為 Qwen3-ASR 家族的語言範圍包括中文方言/口音;但 0.6B 和 1.7B 在你的錄音上可能有差異,尤其是多人、噪音和中英混用情境。Scribis 已整合兩個版本,最好的方法是直接比較。
Parakeet 一定比 Qwen3-ASR 快嗎?
在第三方 English short-form、A100 設定中,Parakeet TDT v3 的 RTFx 顯著較高;但硬體、batch、語言和 runtime 都會影響結果。速度快不等於字幕一定需要較少人工修正。
1.7B 會不會太大?
要看部署方式。對雲端或工作站而言,1.7B 是可管理的中型模型;對 CPU-only edge 裝置,0.6B、SenseVoice 或 Parakeet 可能更實際。Scribis 使用者應依產品版本的硬體建議確認,而不是只用參數量判斷。
結論:把 0.6B 當效率版,把 1.7B 當品質版
Qwen3-ASR-0.6B 和 1.7B 不是誰全面取代誰,而是同一套語音轉文字工作流的兩個檔位。0.6B 適合高併發、快速草稿和資源受限;1.7B 適合多語、中文方言、複雜聲音和需要減少人工校對的內容。Parakeet 提供速度優勢,SenseVoice 提供額外語音理解能力,Whisper 則提供成熟生態。

圖:Qwen3 技術報告在特定 vLLM、CUDA Graph、bfloat16 與併發 128 設定下的 RTF;不是一般電腦的保證速度。
CTA: 想實際比較速度與字幕品質,可以在 Scribis.app 用同一段錄音測試 Qwen3-ASR-0.6B、1.7B 與其他已整合模型,再依你的內容和硬體選擇預設模型。