ASR 比較

SenseVoiceSmall vs Paraformer-zh:中文快速 ASR 哪個適合字幕?

personJH LAI
calendar_today

解析 Scribis 已整合的 SenseVoiceSmall 與 Paraformer-zh,比較中文 ASR、低延遲、VAD、語言識別、音訊事件和字幕工作流,並與 Fun-ASR、Parakeet 對照。

文章定位: SenseVoiceSmall 與 Paraformer-zh 都已整合到 Scribis。本文比較兩者的中文轉錄速度、語言識別、音訊事件、VAD pipeline 和字幕工作流,並帶入 Fun-ASR-Nano、Parakeet 與 Qwen3-ASR 作為外部或同平台參考。

先講結論:只要字幕,Paraformer 輕量;要更多音訊理解,SenseVoice 更完整

SenseVoiceSmall 和 Paraformer-zh 都是中文內容製作者值得認識的快速 ASR。Paraformer-zh 以約 220M 參數的 non-autoregressive 架構,主打中文與英文、低延遲和容易部署;SenseVoiceSmall 則在 ASR 之外加入 spoken language identification、speech emotion recognition 和 audio event detection。 Fun-ASR-Nano 是本文納入的外部比較模型,不代表 Scribis 已整合。

如果你只需要把錄音快速轉成字幕草稿,Paraformer-zh 的簡潔與資源效率很有吸引力;如果你希望同時知道語言、情緒或音訊事件,SenseVoiceSmall 的功能範圍更廣。兩者都已整合到 Scribis,可直接把結果接到字幕時間軸、翻譯、校對與匯出。

SenseVoiceSmall 是什麼?

SenseVoiceSmall 是 FunASR 生態中的多功能語音 foundation model。官方模型卡描述它使用超過 400,000 小時資料,支援 50 多種語言,採 non-autoregressive end-to-end 架構,並主打低延遲推論。 它不只是「另一個中文 Whisper」,而是把 ASR、語言識別和音訊事件視為同一個語音理解 pipeline 的不同輸出。

FunASR 官方資料曾以 10 秒音訊約 70ms 推論時間描述 SenseVoiceSmall,並宣稱約為 Whisper Large 的 15 倍速度;這是官方測試值,會受到硬體、batch、音訊格式和 runtime 影響,不能直接當成所有電腦的保證。

Paraformer-zh 的路線比較單純。它使用 SANM encoder、CIF predictor 與 non-autoregressive decoder,CrispASR README 將其列為約 220M 的中文/英文模型。 對需要低延遲、可預測和相對低資源的中文語音轉文字來說,這種架構很容易理解,也適合與 VAD、標點和說話者模組組合。

比較項目 SenseVoiceSmall Paraformer-zh
模型定位 多功能 speech foundation model 輕量中文/英文 ASR
ASR 支援 支援
語言識別 原生能力之一 通常需額外 LID 或由 pipeline 處理
情緒/音訊事件 有相關任務支援 非主要定位
架構 non-autoregressive end-to-end SANM + CIF + NAR decoder
適合情境 快速轉錄加上語音分析 中文字幕、客服、批次和 edge
Scribis 狀態 已整合 已整合

和 Fun-ASR、Parakeet、Qwen3-ASR 怎麼選?

Fun-ASR-Nano-2512 是同一個 FunAudioLLM 生態中的較新模型,重點放在中文方言、英文、日文和產業語音。它比較像「更大型、語言與資料覆蓋更廣的 ASR 候選」,SenseVoiceSmall 則更像「低延遲、多任務語音理解工具」。

Parakeet TDT v3 代表另一條路線:高速 encoder/TDT 模型,適合大量批次處理。第三方 English short-form leaderboard 報告 Parakeet TDT v3 平均 WER 6.32%、RTFx 3,330;SenseVoiceSmall 和 Paraformer-zh 未必在同一張表中,因此不能把官方 SenseVoice 速度宣稱和 Parakeet RTFx 直接合併排名。

Qwen3-ASR 則適合多語言、中文方言、串流/離線與較複雜的上下文。若你處理的是台灣中文、粵語、中英混用或多語影片,Qwen3-ASR-0.6B/1.7B 值得加入 Scribis 的比較;若你重視超快字幕草稿,SenseVoice、Paraformer 和 Parakeet 可能更具效率優勢。

模型 最適合的工作 和 SenseVoice/Paraformer 的差異
SenseVoiceSmall ASR+LID+音訊事件 功能面最廣,適合需要語音分析的流程。
Paraformer-zh 中文快速字幕、客服與 edge 模型較輕、任務較聚焦。
Fun-ASR-Nano 中文方言、英文、日文、產業資料 外部比較模型;語言與內容覆蓋較廣,資源需求需實測。
Parakeet TDT v3 大量批次、極高 throughput 速度強,需另測中文與台灣口音。
Qwen3-ASR 多語、方言、串流與長上下文 模型較大,但複雜語音理解能力更值得測試。

中文字幕要測什麼?

第一個測試是中文字錯誤,包括同音字、專有名詞、數字和英文品牌。第二個測試是時間軸:字幕是否在適當的停頓切句、每行是否過長、匯出 SRT/VTT 後是否需要大量人工調整。第三個測試是音訊環境,例如手機遠場、鍵盤聲、多人聊天與背景音樂。

如果使用 SenseVoice 的情緒或音訊事件輸出,還要另外檢查事件標籤是否適合你的產品,不要把自動分類直接當成真實判斷。對正式字幕來說,最重要的依然是文字正確率、時間軸和人工校對效率。

在 Scribis 中建立快速字幕流程

你可以先將 MP3、WAV、M4A 或 MP4 匯入 Scribis,使用 SenseVoiceSmall 產生快速草稿;對需要更精細中文或多語表現的內容,再使用 Paraformer-zh、Qwen3-ASR 或其他已整合模型重跑。接著在 Scribis 內整理時間軸、翻譯、字幕樣式、說話者和匯出格式。

這種工作流比在模型之間只看秒數更實際。若 SenseVoice 的速度讓你能先快速瀏覽大量檔案,再用高品質模型處理重點片段,它就可能是很有效率的前處理層;若內容需要穩定中文字幕,Paraformer-zh 的低延遲和較小模型也很適合當預設選項。

FAQ

SenseVoiceSmall 比 Paraformer-zh 準嗎?

沒有一個適用所有錄音的答案。SenseVoice 的強項是多任務和低延遲,Paraformer-zh 的強項是輕量中文/英文 ASR;應以自己的台灣中文、噪音、多人和字幕資料測試。

SenseVoiceSmall 能辨識台灣口音嗎?

它支援多語言,且在中文內容中值得測試,但不能只根據「50 多種語言」推論所有台灣口音都一樣準。Scribis 已整合 SenseVoiceSmall,可直接和 Breeze、Qwen3-ASR、Paraformer 比較。

Paraformer-zh 適合長訪談嗎?

可以作為快速草稿候選,但長音訊表現取決於切段、VAD、標點和時間軸處理。正式交付前應檢查跨段落合併和字幕切句。

結論:中文快速字幕先測 Paraformer,語音分析再看 SenseVoice

SenseVoiceSmall 和 Paraformer-zh 都適合追求效率的中文 ASR 工作流。Paraformer-zh 比較像低延遲、任務聚焦的字幕引擎;SenseVoiceSmall 則把 ASR、LID、情緒和音訊事件整合到更廣的語音理解方向。Fun-ASR、Parakeet 和 Qwen3-ASR 可以分別補足方言、速度和多語能力。

中文快速 ASR 功能矩陣

圖:這是功能定位矩陣,不是模型分數或全球排名;實際結果仍應以同一批台灣中文素材測試。

CTA: 想快速比較中文 ASR 的速度與字幕品質,可以在 Scribis.app 直接測試 SenseVoiceSmall、Paraformer-zh 和其他已整合模型,再依人工校對時間選擇工作流。

相關連結

  1. SenseVoiceSmall 官方模型卡
  2. FunASR 官方 GitHub
  3. CrispASR backend 與模型說明
  4. Fun-ASR-Nano-2512 官方模型卡
  5. ASR Leaderboard:WER 與 RTFx 比較
  6. Scribis 官方功能頁