TTS 比較

Qwen3-TTS vs Kokoro:Scribis 中文、日文、英文配音怎麼選?

personJH LAI
calendar_today

比較 Scribis 已整合的 Qwen3-TTS 與 Kokoro,解析中文、日文、英文配音、3 秒 voice cloning、VoiceDesign、模型大小、速度與授權,並對照 Chatterbox、VoxCPM2。

文章定位: Qwen3-TTS 與 Kokoro 都已整合到 Scribis。本文比較多語言配音、聲音設計、voice cloning、模型大小、速度與商業使用注意事項,並以 Chatterbox、VoxCPM2 作為外部 TTS 參考。

先講結論:Kokoro 適合輕量旁白,Qwen3-TTS 適合多語與聲音控制

Qwen3-TTS 和 Kokoro 都能用來產生旁白,但定位很不一樣。Kokoro-82M 是小型 open-weight TTS,適合固定音色、低資源和大量批次;Qwen3-TTS 則提供 Base、CustomVoice 與 VoiceDesign,支援中文、英文、日文等 10 種主要語言,並能進行聲音克隆、風格控制與自然語言聲音設計。

如果你的需求是把字幕或腳本快速做成穩定旁白,Kokoro 的小模型和部署效率很有吸引力;如果你需要中文、日文、英文之間切換,或想描述「年輕、溫暖、慢速、紀錄片」這種聲音風格,Qwen3-TTS 更值得優先測試。兩者都已整合到 Scribis,能直接放進文字、字幕與影音內容製作流程。

Qwen3-TTS 有哪些版本?

Qwen3-TTS 主要分為三個方向。Base 版本可使用約 3 秒參考音訊做 zero-shot voice cloning;CustomVoice 提供多個內建音色與 instruction/style control;VoiceDesign 則透過自然語言描述建立新的聲音形象,支援情緒、年齡、音質、語速和說話風格。

Qwen3-TTS 官方列出的主要語言包括中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,共 10 種。對台灣內容團隊來說,中文、英文和日文一起存在於同一個影片或課程時,模型的多語言控制比單一英文 TTS 更重要。

Kokoro-82M 為什麼受歡迎?

Kokoro-82M 只有 82M 參數,採 StyleTTS 2 與 iSTFTNet 相關架構,使用 Apache-2.0 權重。它的價值是用很小的模型提供自然、快速、容易部署的語音,適合固定 speaker、短旁白、批次生成和本地應用。

Kokoro 的限制也很清楚:它的主要賣點不是 3 秒 zero-shot voice cloning 或自然語言聲音設計,而是固定 voices、速度與部署成本。若需要複製特定人物聲音、跨語言維持聲音身份,應把 Qwen3-TTS、Chatterbox、IndexTTS 或 VoxCPM2 一起納入。

比較項目 Qwen3-TTS Kokoro-82M
主要定位 多語、聲音設計與 voice cloning 輕量、高性價比固定旁白
模型規模 0.6B/1.7B 變體 82M
語言 10 種主要語言 依 voices/backend 為準,多語變體
聲音控制 Base、CustomVoice、VoiceDesign、instruction 以固定 voices 為主
適合情境 多語影片、角色、品牌聲音 批次旁白、CPU/低資源部署
授權 Apache-2.0 Apache-2.0
Scribis 狀態 已整合 已整合

和 Chatterbox、VoxCPM2 比較

Chatterbox 是 Resemble AI 的開源 TTS 家族,Multilingual V3 約 500M、支援 23 種以上語言,另有約 350M Turbo 和約 110M Nano 變體;官方也提供 voice cloning、paralinguistic tags 與 Perth perceptual watermark。 如果你重視多語聲音克隆、笑聲或非語音標記,Chatterbox 是 Qwen3-TTS 的重要外部比較對象。

VoxCPM2 是 OpenBMB 的 2B tokenizer-free TTS,官方描述支援 30 種語言、voice design、controllable cloning 和 48kHz 輸出;專案 README 報告 RTX 4090 上標準 PyTorch RTF 約 0.30、Nano-vLLM 約 0.13。 這類數據是官方部署 benchmark,不能直接和 Kokoro 在不同設定下比較。

需求 優先測試 理由
小模型固定旁白 Kokoro 82M、Apache-2.0、部署簡單。
中文/日文/英文同一工作流 Qwen3-TTS 10 種主要語言與多種 voice control。
多語 voice cloning 加浮水印 Chatterbox 23+ 語言、cloning、watermark。
48kHz、多語與聲音設計 VoxCPM2 30 語言、48kHz、tokenizer-free 路線。

TTS benchmark 不只看 WER

TTS 常見的自動指標包括生成語音再經 ASR 的 WER/CER,以及 speaker similarity。前者偏向 intelligibility,後者偏向聲音身份;二者都不能完全代表自然度、情緒、停頓和聽感。IndexTTS 官方 README 的 CV3-Eval Table 1 報告 IndexTTS2.5 平均 WER 6.75%、speaker similarity 73.18%,VoxCPM2 為 7.22%/72.02%,OmniVoice 為 6.76%/70.39%;這是專案整理的 vendor-reported snapshot,不是跨所有模型的獨立總榜。

對中文、日文和英文配音,建議實際檢查數字、英文縮寫、日文長音、中文多音字、台灣地名、語速和情緒。自動指標可以幫你篩選,但最後仍要由母語者聽過一輪。

在 Scribis 中怎麼選?

如果你已經有字幕或腳本,先用 Kokoro 產生快速旁白預覽,再用 Qwen3-TTS 產生需要品牌感、聲音設計或多語版本的段落。Scribis 已整合 Qwen3-TTS 和 Kokoro,可以把文字、字幕和聲音放在同一個內容製作流程中。

如果內容需要台灣口音,應把 Scribis 自製 TTS 一起納入實測。自製 TTS 已支援中文、日文、英文與台灣口音;這是產品提供的整合能力資訊,不應用外部模型 benchmark 數字代替。對本地品牌、教學、Podcast 和台灣觀眾,口音自然度往往比模型的全球語言數更重要。

FAQ

Kokoro 可以做中文、日文和英文嗎?

Kokoro 的實際語言取決於使用的 voice 和 backend。文章發布時應以 Scribis 版本可選聲音與官方 model card 為準,不要只因為模型是多語就推論每個 voice 都支援三種語言。

Qwen3-TTS 可以複製別人的聲音嗎?

技術上具備參考音訊 voice cloning 路線,但使用他人聲音前必須取得明確同意,並確認模型與內容的授權、標示和商業使用條件。

哪個更適合台灣口音?

Qwen3-TTS 與 Kokoro 可以測試,但 Scribis 自製 TTS 已明確支援中文、日文、英文和台灣口音,應把它當作本地內容的實際比較基準。

結論:用 Kokoro 做效率,用 Qwen3-TTS 做控制

Kokoro-82M 以小模型和固定旁白取勝,Qwen3-TTS 以多語言、聲音設計和 voice cloning 取勝;Chatterbox 補足多語浮水印與表達力,VoxCPM2 補足 48kHz 與 30 語言。對 Scribis 使用者,最實際的做法是先用 Kokoro 快速預覽,再用 Qwen3-TTS 或自製 TTS 完成需要風格和台灣口音的正式內容。

Qwen3-TTS、Kokoro 與其他 TTS 的 voice cloning benchmark 參考

圖:CV3-Eval vendor-reported snapshot;WER/CER 越低越好,speaker similarity 越高越好,不能直接視為所有語言與場景的總排名。

CTA: 想把逐字稿或字幕轉成中文、日文與英文旁白,可以在 Scribis.app 使用 Qwen3-TTS、Kokoro 與自製 TTS,依聲音風格、語言和台灣口音需求選擇。

相關連結

  1. Qwen3-TTS 官方 GitHub
  2. Kokoro-82M 官方模型卡
  3. Chatterbox 官方 GitHub
  4. VoxCPM2 官方 GitHub
  5. IndexTTS 官方 GitHub 與 CV3-Eval
  6. Scribis 官方功能頁