Paraformer-zh vs Fun-ASR-Nano:中文方言與低延遲部署怎麼選?
解析 Scribis 已整合的 Paraformer-zh 與 Fun-ASR-Nano,比較中文方言、英文日文、CER、低延遲、CPU/GPU 部署,並與 SenseVoiceSmall、FireRedASR2-AED 對照。
文章定位: Paraformer-zh 與 Fun-ASR-Nano 都已整合到 Scribis。本文比較中文、方言、英文/日文、低延遲與部署成本,並將 SenseVoiceSmall、FireRedASR2-AED 作為相近的中文語音辨識參考。
先講結論:Paraformer 偏輕量快速,Fun-ASR-Nano 偏多語與方言覆蓋
Paraformer-zh 和 Fun-ASR-Nano 都適合中文語音轉文字,但設計取向不同。Paraformer-zh 是 FunASR 生態中約 220M 的 non-autoregressive 中文/英文 ASR,重視低延遲和部署效率;Fun-ASR-Nano-2512 是約 800M 的較新模型,主打中文方言、英文、日文與產業語音。
如果你的需求是快速把中文錄音變成字幕草稿、客服逐字稿或本地批次資料,Paraformer-zh 很適合先測;如果內容有較多方言、中英混用、日文或專業場域,Fun-ASR-Nano 的語言與資料覆蓋值得優先評估。兩者都已整合至 Scribis,可以在同一個轉錄、字幕校對和匯出流程比較。
Paraformer-zh 的優勢
Paraformer 以 SANM encoder、CIF predictor 和 non-autoregressive decoder 為核心。與需要逐 token 自回歸生成的模型相比,non-autoregressive 路線通常更容易做到低延遲和穩定吞吐,特別適合固定語言、短句和批次處理。
Paraformer-zh 的優點是架構成熟、模型較小、對中文客服和一般語音轉錄容易部署。缺點是它不是以「超多語言」或大型語音語言模型的長上下文推理為主要賣點,當錄音有複雜 code-switching、跨語言或大量專有名詞時,需要和較新的模型實際比較。
Fun-ASR-Nano 的優勢
Fun-ASR-Nano-2512 是 FunAudioLLM 的 800M 級 end-to-end ASR,官方強調中文、英文、日文與中文方言,並提供 Fun-ASR-MLT-Nano-2512 這個 31 語言版本。 FunASR 工具鏈還可串接 VAD、標點、說話者辨識和 serving,讓它不只是單一 checkpoint,而是可以放進完整語音 pipeline。
Fun-ASR 官方 benchmark 表格顯示,Fun-ASR-Nano 在 WenetSpeech Meeting、FLEURS-zh、AISHELL-1 和 FLEURS-en 等資料集有具競爭力的結果;在 industry dataset 平均 WER 表格中,Fun-ASR-Nano 為 16.72%,Fun-ASR 7.7B 為 12.70%。這些是 FunAudioLLM 官方報告,應標示為 vendor-reported,不能和不同資料集的 CER 或第三方排行榜直接混合。
| 比較項目 | Paraformer-zh | Fun-ASR-Nano-2512 |
|---|---|---|
| 模型規模/路線 | 約 220M、non-autoregressive | 約 800M、end-to-end |
| 主要語言 | 中文、英文 | 中文、英文、日文與方言;MLT 版本 31 語言 |
| 主要強項 | 低延遲、輕量、中文字幕 | 方言、多語、產業語音 |
| pipeline | 常與 VAD、Punc、Diarization 組合 | FunASR 生態提供多個可組合模組 |
| 適合情境 | 快速字幕、客服、edge | 方言訪談、中英日內容、複雜場域 |
| Scribis 狀態 | 已整合 | 已整合 |
和 SenseVoiceSmall、FireRedASR2-AED 比較
SenseVoiceSmall 同樣出自 FunASR 生態,但它的特色是 ASR 之外還能做語言識別、情緒辨識和音訊事件偵測。若你需要辨識語言或做音訊分析,SenseVoice 的功能面比 Paraformer 更廣;若你只想要可預測的中文轉錄,Paraformer 反而比較簡單。
FireRedASR2-AED 則是中文方言、英文、code-switching 和歌聲轉錄的專項候選。FireRed 官方報告在 4 個普通話 benchmark 的平均 CER 為 3.05%,在 19 個中文方言/口音 benchmark 的平均 CER 為 11.67%;Fun-ASR-Nano 的測試資料和指標不同,不能直接排在同一列宣布誰一定更好。
Qwen3-ASR-0.6B 和 1.7B 也值得加入比較。Qwen3 的語言範圍與串流/離線能力更廣,1.7B 特別適合多語和複雜口音;Paraformer-zh 則更像低資源、低延遲中文引擎。
中文方言 benchmark 應該怎麼設計?
第一層是乾淨朗讀:用來看模型是否能穩定處理基本中文。第二層是台灣中文和地區口音:加入自然對話、不同年齡、快速語速和手機錄音。第三層是中英混用與專有名詞:加入公司名、英文產品名、數字和程式術語。第四層是長音訊與多人:檢查切段、標點、說話者和字幕時間軸。
中文常用 CER,英文常用 WER;兩者不宜直接比較。若希望知道模型是否真的適合字幕,還要記錄人工校對分鐘數和匯出後的字幕切句,而不是只看一個公開數字。
在 Scribis 中的實務選擇
如果你要將大量中文短影音、客服錄音或課程片段快速轉成草稿,可以先用 Paraformer-zh;若內容包含台灣中文、方言、英文或日文混用,則應並行測試 Fun-ASR-Nano、Qwen3-ASR 和 FireRedASR2-AED。Scribis 已經把多個模型放在同一個產品工作流中,使用者可以直接比較結果,再進行字幕時間軸、翻譯、標點和匯出。
當模型輸出需要加入說話者或 VAD 時,不要把這些能力誤認為每個 ASR checkpoint 都原生支援。實際上,很多中文 ASR pipeline 是由 ASR、VAD、標點、diarization 和後處理模組組成。Scribis 的價值,就是把這些內容製作步驟交給同一個工作環境處理。
FAQ
Paraformer-zh 適合台灣中文嗎?
它可以作為中文快速轉錄候選,但模型官方定位不等於針對所有台灣口音最佳。建議在 Scribis 中和 Breeze-25、Qwen3-ASR、SenseVoiceSmall 一起測試自己的素材。
Fun-ASR-Nano 比 Paraformer-zh 大很多嗎?
Fun-ASR-Nano 約 800M,Paraformer-zh 約 220M,前者通常需要更多資源,但可能換來更廣的語言與方言能力。Fun-ASR-Nano 在本文是外部比較對象,不是 Scribis 已整合模型;實際差距要看量化、batch 和硬體。
中文 ASR 應該看 WER 還是 CER?
中文通常以 CER 更直觀,英文或以詞切分的語言常用 WER。比較時必須確認資料集、正規化規則和指標一致。
結論:效率和覆蓋率是兩個不同選擇
Paraformer-zh 適合中文快速字幕、低延遲和資源受限部署;Fun-ASR-Nano 則適合中文方言、多語和產業語音。SenseVoiceSmall 補足多任務語音分析,FireRedASR2-AED 補足方言與歌聲,Qwen3-ASR 則補足多語和較大模型的上下文能力。

圖:FireRed 官方模型卡的比較快照,數字屬 vendor-reported,不能直接取代自己的中文方言測試。
CTA: 想找出最適合自己中文內容的 ASR,可以在 Scribis.app 用同一批錄音比較 Paraformer-zh、Fun-ASR-Nano 與其他已整合模型,再以字幕品質和人工校對時間做決策。