Parakeet TDT v3 vs Nemotron 3.5:高速與串流 ASR 怎麼選?
比較 Scribis 已整合的 Parakeet TDT v3 與 Nemotron 3.5 ASR,解析 RTFx、chunk delay、streaming、批次轉錄、字幕和硬體需求,並與 Voxtral Realtime 對照。
文章定位: Parakeet TDT v3 與 Nemotron ASR 都已整合到 Scribis。本文比較高速批次與即時串流兩種使用情境,並把 Parakeet CTC、Voxtral Mini 4B Realtime 與 Qwen3-ASR 放在相近場景中理解。外部 benchmark 不代表 Scribis 的所有實際速度。
先講結論:大量檔案看 Parakeet,即時字幕看 Nemotron 或 Voxtral
Parakeet TDT v3 和 Nemotron 3.5 ASR 都把「速度」放在重要位置,但優化方向不同。Parakeet TDT v3 以高吞吐和批次處理見長;Nemotron 3.5 使用 cache-aware FastConformer-RNNT,重點是持續接收新音訊時降低重複計算和延遲。
如果你每天要處理大量影片、課程或客服錄音,Parakeet TDT v3 值得優先測試;如果你的需求是會議即時字幕、語音助手、客服代理或持續的 WebSocket 音訊,Nemotron 3.5 更貼近串流架構。兩者都已整合到 Scribis,使用者可以把「高速批次」和「低延遲即時」放在同一個產品工作流中比較。
Parakeet TDT v3 的強項是什麼?
Parakeet 是 NVIDIA NeMo 生態中的 FastConformer ASR 系列。TDT 代表 Token-and-Duration Transducer,除了預測文字 token,也預測 token 持續時間;CTC 版本則以更簡化的解碼路線追求速度。Parakeet TDT v3 適合英文與多語批次轉錄,並且有成熟的 NVIDIA 部署工具鏈。
第三方 ASR Leaderboard 在 A100-SXM4-80GB、English short-form 設定下,報告 Parakeet TDT 0.6B v3 平均 WER 6.32%、RTFx 3,330;Qwen3-ASR-1.7B 為 5.76%、RTFx 148,Whisper Large-v3 為 7.44%、RTFx 146。 RTFx 是音訊長度除以處理時間,越高越快;這張表的重點不是宣布 Parakeet「所有語言都最準」,而是顯示 TDT 路線在固定硬體上能取得非常高的 throughput。
Nemotron 3.5 ASR 為什麼適合串流?
Nemotron 3.5 ASR 是 NVIDIA 的 600M 參數 multilingual streaming ASR,採用 cache-aware FastConformer-RNNT。每次接收新音訊 chunk 時,模型會重用先前 encoder cache,降低滑動視窗反覆計算的成本。
官方模型卡以約 39–40 個 language-locales 描述覆蓋範圍,並提供 80、160、320、560、1120ms 等 chunk 設定;官方頁面標示 480ms 以內的設定可在延遲與品質間取捨,且原生輸出 punctuation 與 capitalization。 由於 language-locales 的計數方式與 CrispASR README 的語言數不同,文章應寫成「約 39–40 個語言/locale」,不要把不同版本數字硬湊成單一結論。
| 比較項目 | Parakeet TDT v3 | Nemotron 3.5 ASR |
|---|---|---|
| 主要定位 | 高速批次與多語 ASR | 低延遲串流 ASR |
| 核心架構 | FastConformer + TDT | Cache-aware FastConformer-RNNT |
| 關鍵優勢 | 高 RTFx、批次吞吐 | cache、chunk delay、持續音訊 |
| 主要輸出 | 文字與時間資訊依 pipeline | punctuation、capitalization、partial transcript 路線 |
| 適合內容 | 大量影片、課程、錄音 | 即時會議、字幕、語音代理 |
| Scribis 狀態 | 已整合 | 已整合 |
和 Voxtral Mini 4B Realtime 比較
Voxtral Mini 4B Realtime 是 Mistral 的開源權重即時轉錄模型,具備 native streaming architecture、custom causal audio encoder、13 語言與可設定延遲。官方模型卡主張小於 500ms delay,並建議 480ms 作為品質與延遲的折衷點;模型以 Apache-2.0 發布。
Nemotron 更像高效率的串流 encoder/RNNT;Voxtral Realtime 則把較大型語言模型與 causal audio encoder 結合,讓模型在即時輸出之外保留更廣的語言理解能力。Voxtral 的代價是模型較大、硬體需求與解碼設定需要更仔細管理。Scribis 已整合 Parakeet TDT v3、Nemotron、Voxtral Mini 4B Realtime,因此可用同一段會議錄音比較 partial transcript 的穩定性,而不是只看第一個字出現的時間。
速度 benchmark 要怎麼讀?
RTFx 最容易被誤讀。當測試使用 A100、batch 64、短音訊和特定 CUDA 設定時,得到的 3,330 RTFx 並不代表在一般筆電上也有相同表現。串流模型也不能只用離線 RTFx 來判斷體驗,因為即時使用還包括 chunk size、partial output、修正次數、網路和 UI 顯示延遲。
對 Scribis 的實際內容製作,建議同時記錄「十分鐘音訊完成時間」「第一段字幕出現時間」「字幕修正次數」「完整匯出時間」和「人工校對時間」。Parakeet 可能在大量批次處理中節省時間;Nemotron 或 Voxtral 則可能在即時字幕中提供更好的互動感。
在 Scribis 中怎麼選?
想把大量影片快速整理成字幕草稿,可以先用 Parakeet TDT v3;需要即時顯示或語音助手,可以測 Nemotron 3.5 和 Voxtral Mini 4B Realtime;若需要更廣的多語言與中文方言,再把 Qwen3-ASR 加入測試。最後在 Scribis 內完成字幕時間軸、翻譯、標點、樣式和匯出,才能看出模型速度是否真正轉換成內容交付速度。
FAQ
Parakeet TDT v3 適合中文嗎?
它可以作為速度和批次處理候選,但公開 leaderboard 的強項數據主要是 English short-form。中文、台灣口音、粵語和中英混用仍應使用自己的素材測試,並和 Qwen3-ASR、SenseVoice 或 Paraformer 比較。
Nemotron 3.5 比 Voxtral Realtime 快嗎?
不能只從參數量判斷。Nemotron 的 cache-aware streaming 架構適合低延遲,Voxtral 4B 則提供可調延遲與較大型語言模型;實際速度取決於 chunk、硬體和 runtime。
高 RTFx 就一定適合 Scribis 字幕嗎?
不一定。若字幕錯字多、切句差或人工修正時間高,高 RTFx 可能沒有帶來實際收益。字幕品質和完整工作流時間都要納入評估。
結論:先區分批次速度與即時延遲
Parakeet TDT v3 適合大量批次與高 throughput;Nemotron 3.5 適合 cache-aware streaming;Voxtral Mini 4B Realtime 則是開源權重與可調延遲的即時選項。三者不應只用同一個「誰最快」問題比較,而要回到 Scribis 內的影片轉錄、即時字幕和內容交付需求。

圖:ASR Leaderboard English short-form snapshot;Parakeet 的速度優勢不代表它在每一種語言或即時字幕都最準。
CTA: 想測試高速批次或即時字幕,可以在 Scribis.app 以同一段素材比較 Parakeet TDT v3、Nemotron 和 Voxtral Realtime,再用完整校對時間決定模型。