ASR 比較

Nemotron 3.5 ASR vs Voxtral 4B Realtime:即時轉錄怎麼選?

personJH LAI
calendar_today

比較 Scribis 已整合的 Nemotron 3.5 ASR 與 Voxtral Mini 4B Realtime,解析 chunk delay、streaming、語言、模型規模、字幕延遲,並與 Parakeet、Qwen3-ASR 對照。

文章定位: Nemotron ASR 與 Voxtral Mini 4B Realtime 都已整合到 Scribis。本文專注即時字幕、會議、語音助手與串流轉錄,並比較 Parakeet TDT v3、Qwen3-ASR 的速度、延遲、語言和硬體取捨。

先講結論:Nemotron 偏串流效率,Voxtral 偏開源 Speech-LLM 即時能力

Nemotron 3.5 ASR 和 Voxtral Mini 4B Realtime 都是即時語音辨識候選,但技術路線不同。Nemotron 3.5 是 600M 級、cache-aware FastConformer-RNNT 的串流模型;Voxtral Mini 4B Realtime 是 4B 參數、native streaming 的開源權重 Speech-LLM,具備 custom causal audio encoder 和可調式 transcription delay。

如果你需要大量、持續、低成本的串流音訊,Nemotron 的 cache 和較小模型很有吸引力;如果你需要在即時字幕中保留較大型語言模型的上下文和多語言能力,Voxtral 4B Realtime 值得測試。兩者都已整合到 Scribis,因此可直接比較即時字幕出現速度、partial transcript 修正和最後文字品質。

Nemotron 3.5 ASR 的架構與語言

Nemotron 3.5 ASR 使用 cache-aware FastConformer-RNNT。傳統滑動視窗若每次都重新計算重疊音訊,會浪費大量運算;cache-aware streaming 會保存先前的 encoder 狀態,只對新 chunk 做必要計算。

官方模型卡以 40 個 language-locales 描述覆蓋範圍,Hugging Face 標籤則顯示 35 languages;CrispASR README 以約 39 語言描述。這種差異來自語言、locale 和版本計數方式,文章最穩妥的說法是「約 39–40 個語言/locale」,並以最新模型卡為準。

Nemotron 可設定 80、160、320、560 和 1120ms chunk,也能輸出 punctuation 與 capitalization。這些選項讓開發者能在字幕「快一點出現」與「多等一點以取得更完整上下文」之間選擇。

Voxtral Mini 4B Realtime 的特色

Voxtral Mini 4B Realtime 是 Mistral 的多語言即時轉錄模型,官方模型卡列出 13 語言、Apache-2.0、BF16 和 native streaming architecture。它可以設定 240ms 到 2.4s 的延遲,官方建議 480ms 作為品質與低延遲的折衷點,並主張小於 500ms delay 時可接近離線開源系統的表現。

Voxtral 的模型規模大於 Nemotron,但 4B 仍比 24B 級離線 Voxtral Small 更適合 on-device 或即時部署。它適合 live subtitling、private meeting transcription 和 real-time assistant;官方也提供 vLLM、Transformers、WebSocket 與執行方式。

比較項目 Nemotron 3.5 ASR Voxtral Mini 4B Realtime
主要定位 高效率串流 ASR Speech-LLM 即時轉錄
模型規模 約 600M 4B
架構 Cache-aware FastConformer-RNNT Causal audio encoder + language model
語言 約 39–40 language-locales 13 languages
延遲控制 80–1120ms chunk 等設定 240ms–2.4s delay,官方建議 480ms
授權 以 NVIDIA 模型卡為準 Apache-2.0
Scribis 狀態 已整合 已整合

和 Parakeet、Qwen3-ASR 比較

Parakeet TDT v3 也適合高速 ASR,但它的優勢更常體現在離線批次 throughput。第三方 ASR Leaderboard 在 A100 English short-form 測試中報告 Parakeet TDT v3 平均 WER 6.32%、RTFx 3,330;Qwen3-ASR-1.7B 為 5.76%、RTFx 148。 這些結果可以幫助理解速度與文字品質的取捨,但不能直接回答即時 partial transcript 的體驗。

Qwen3-ASR-0.6B/1.7B 支援離線與串流、30 種語言加 22 種中文方言/口音,對台灣中文、中英混用和多語內容很有吸引力。 如果即時字幕以中文和台灣口音為主,Qwen3-ASR 應加入測試;如果以全球多語、低延遲和硬體效率為主,Nemotron 或 Voxtral 可能更合適。

使用需求 優先測試 理由
高 throughput 批次 Parakeet TDT v3 第三方 English short-form RTFx 很高。
低延遲連續串流 Nemotron 3.5 cache-aware FastConformer-RNNT 與 chunk 控制。
即時字幕+較大語言模型 Voxtral 4B Realtime native streaming、13 語言、可調 delay。
台灣中文/中文方言 Qwen3-ASR、Breeze、FireRed、Nemotron 用同一批本地素材實測。

即時 ASR 不能只測第一個字

即時字幕的品質至少包含四個時間點:音訊送入、第一段 partial transcript、字幕穩定、完整結果。某個模型可能很早顯示文字,但後續修改很多;另一個模型可能晚一點出現,卻更快穩定。對觀眾來說,字幕反覆跳動也會造成閱讀負擔。

在 Scribis 中測試時,建議記錄 30 秒、5 分鐘和 30 分鐘三種長度;加入單人、多人、背景噪音、台灣中文、中英混用與專有名詞。除了 TTFT 和 chunk delay,也要記錄最後字幕的人工修正時間、時間軸、說話者和匯出結果。

在 Scribis 中怎麼選?

如果你正在製作即時會議字幕,可以先比較 Nemotron 3.5 和 Voxtral 4B Realtime 的字幕穩定性;如果是錄完後大量處理影片,Parakeet TDT v3 可能更有效率;若內容以台灣中文為主,則加入 Qwen3-ASR、Breeze-25 和 SenseVoice Small。Scribis 已整合這些方向的模型,可以將比較結果直接接到字幕校對、翻譯與匯出。

FAQ

Nemotron 3.5 ASR 比 Voxtral 4B Realtime 小很多嗎?

是,Nemotron 約 600M,Voxtral Realtime 是 4B;但模型大小不等於完整使用成本,還要看量化、batch、硬體與延遲設定。

Voxtral Realtime 的 480ms 是所有情況都適用嗎?

不是。480ms 是官方建議的折衷設定,實際最佳值會受到語言、噪音、硬體和字幕用途影響。

這兩個模型適合台灣中文嗎?

Scribis 已整合兩者,但台灣中文應和 Qwen3-ASR、Breeze、FireRed 等模型用真實素材做 A/B test,不宜只依多語言數量推論。

結論:即時字幕要同時看延遲、穩定和人工修正

Nemotron 3.5 ASR 適合以 cache-aware streaming 追求效率;Voxtral Mini 4B Realtime 適合需要 native streaming、13 語言與可調延遲的開源 Speech-LLM;Parakeet TDT v3 偏大量批次,Qwen3-ASR 偏多語與中文方言。把模型放入 Scribis 的完整字幕工作流後,才知道哪個方案真正適合你的內容。

Nemotron 3.5 與 Voxtral Realtime 的延遲設定範圍

圖:官方設定範圍示意,不是模型品質曲線;較低延遲可能需要在上下文與穩定性間取捨。

CTA: 想製作即時字幕或會議逐字稿,可以在 Scribis.app 比較 Nemotron、Voxtral Realtime、Parakeet 與 Qwen3-ASR 的完整轉錄體驗。

相關連結

  1. NVIDIA Nemotron 3.5 ASR 官方模型卡
  2. Voxtral Mini 4B Realtime 官方模型卡
  3. CrispASR ASR backend 清單
  4. ASR Leaderboard:WER 與 RTFx 比較
  5. Qwen3-ASR 官方 GitHub
  6. Scribis 官方功能頁