Qwen3-TTS vs Kokoro:Scribis 中文、日文、英文配音怎麼選?
比較 Scribis 已整合的 Qwen3-TTS 與 Kokoro,解析中文、日文、英文配音、3 秒 voice cloning、VoiceDesign、模型大小、速度與授權,並對照 Chatterbox、VoxCPM2。
文章定位: Qwen3-TTS 與 Kokoro 都已整合到 Scribis。本文比較多語言配音、聲音設計、voice cloning、模型大小、速度與商業使用注意事項,並以 Chatterbox、VoxCPM2 作為外部 TTS 參考。
先講結論:Kokoro 適合輕量旁白,Qwen3-TTS 適合多語與聲音控制
Qwen3-TTS 和 Kokoro 都能用來產生旁白,但定位很不一樣。Kokoro-82M 是小型 open-weight TTS,適合固定音色、低資源和大量批次;Qwen3-TTS 則提供 Base、CustomVoice 與 VoiceDesign,支援中文、英文、日文等 10 種主要語言,並能進行聲音克隆、風格控制與自然語言聲音設計。
如果你的需求是把字幕或腳本快速做成穩定旁白,Kokoro 的小模型和部署效率很有吸引力;如果你需要中文、日文、英文之間切換,或想描述「年輕、溫暖、慢速、紀錄片」這種聲音風格,Qwen3-TTS 更值得優先測試。兩者都已整合到 Scribis,能直接放進文字、字幕與影音內容製作流程。
Qwen3-TTS 有哪些版本?
Qwen3-TTS 主要分為三個方向。Base 版本可使用約 3 秒參考音訊做 zero-shot voice cloning;CustomVoice 提供多個內建音色與 instruction/style control;VoiceDesign 則透過自然語言描述建立新的聲音形象,支援情緒、年齡、音質、語速和說話風格。
Qwen3-TTS 官方列出的主要語言包括中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,共 10 種。對台灣內容團隊來說,中文、英文和日文一起存在於同一個影片或課程時,模型的多語言控制比單一英文 TTS 更重要。
Kokoro-82M 為什麼受歡迎?
Kokoro-82M 只有 82M 參數,採 StyleTTS 2 與 iSTFTNet 相關架構,使用 Apache-2.0 權重。它的價值是用很小的模型提供自然、快速、容易部署的語音,適合固定 speaker、短旁白、批次生成和本地應用。
Kokoro 的限制也很清楚:它的主要賣點不是 3 秒 zero-shot voice cloning 或自然語言聲音設計,而是固定 voices、速度與部署成本。若需要複製特定人物聲音、跨語言維持聲音身份,應把 Qwen3-TTS、Chatterbox、IndexTTS 或 VoxCPM2 一起納入。
| 比較項目 | Qwen3-TTS | Kokoro-82M |
|---|---|---|
| 主要定位 | 多語、聲音設計與 voice cloning | 輕量、高性價比固定旁白 |
| 模型規模 | 0.6B/1.7B 變體 | 82M |
| 語言 | 10 種主要語言 | 依 voices/backend 為準,多語變體 |
| 聲音控制 | Base、CustomVoice、VoiceDesign、instruction | 以固定 voices 為主 |
| 適合情境 | 多語影片、角色、品牌聲音 | 批次旁白、CPU/低資源部署 |
| 授權 | Apache-2.0 | Apache-2.0 |
| Scribis 狀態 | 已整合 | 已整合 |
和 Chatterbox、VoxCPM2 比較
Chatterbox 是 Resemble AI 的開源 TTS 家族,Multilingual V3 約 500M、支援 23 種以上語言,另有約 350M Turbo 和約 110M Nano 變體;官方也提供 voice cloning、paralinguistic tags 與 Perth perceptual watermark。 如果你重視多語聲音克隆、笑聲或非語音標記,Chatterbox 是 Qwen3-TTS 的重要外部比較對象。
VoxCPM2 是 OpenBMB 的 2B tokenizer-free TTS,官方描述支援 30 種語言、voice design、controllable cloning 和 48kHz 輸出;專案 README 報告 RTX 4090 上標準 PyTorch RTF 約 0.30、Nano-vLLM 約 0.13。 這類數據是官方部署 benchmark,不能直接和 Kokoro 在不同設定下比較。
| 需求 | 優先測試 | 理由 |
|---|---|---|
| 小模型固定旁白 | Kokoro | 82M、Apache-2.0、部署簡單。 |
| 中文/日文/英文同一工作流 | Qwen3-TTS | 10 種主要語言與多種 voice control。 |
| 多語 voice cloning 加浮水印 | Chatterbox | 23+ 語言、cloning、watermark。 |
| 48kHz、多語與聲音設計 | VoxCPM2 | 30 語言、48kHz、tokenizer-free 路線。 |
TTS benchmark 不只看 WER
TTS 常見的自動指標包括生成語音再經 ASR 的 WER/CER,以及 speaker similarity。前者偏向 intelligibility,後者偏向聲音身份;二者都不能完全代表自然度、情緒、停頓和聽感。IndexTTS 官方 README 的 CV3-Eval Table 1 報告 IndexTTS2.5 平均 WER 6.75%、speaker similarity 73.18%,VoxCPM2 為 7.22%/72.02%,OmniVoice 為 6.76%/70.39%;這是專案整理的 vendor-reported snapshot,不是跨所有模型的獨立總榜。
對中文、日文和英文配音,建議實際檢查數字、英文縮寫、日文長音、中文多音字、台灣地名、語速和情緒。自動指標可以幫你篩選,但最後仍要由母語者聽過一輪。
在 Scribis 中怎麼選?
如果你已經有字幕或腳本,先用 Kokoro 產生快速旁白預覽,再用 Qwen3-TTS 產生需要品牌感、聲音設計或多語版本的段落。Scribis 已整合 Qwen3-TTS 和 Kokoro,可以把文字、字幕和聲音放在同一個內容製作流程中。
如果內容需要台灣口音,應把 Scribis 自製 TTS 一起納入實測。自製 TTS 已支援中文、日文、英文與台灣口音;這是產品提供的整合能力資訊,不應用外部模型 benchmark 數字代替。對本地品牌、教學、Podcast 和台灣觀眾,口音自然度往往比模型的全球語言數更重要。
FAQ
Kokoro 可以做中文、日文和英文嗎?
Kokoro 的實際語言取決於使用的 voice 和 backend。文章發布時應以 Scribis 版本可選聲音與官方 model card 為準,不要只因為模型是多語就推論每個 voice 都支援三種語言。
Qwen3-TTS 可以複製別人的聲音嗎?
技術上具備參考音訊 voice cloning 路線,但使用他人聲音前必須取得明確同意,並確認模型與內容的授權、標示和商業使用條件。
哪個更適合台灣口音?
Qwen3-TTS 與 Kokoro 可以測試,但 Scribis 自製 TTS 已明確支援中文、日文、英文和台灣口音,應把它當作本地內容的實際比較基準。
結論:用 Kokoro 做效率,用 Qwen3-TTS 做控制
Kokoro-82M 以小模型和固定旁白取勝,Qwen3-TTS 以多語言、聲音設計和 voice cloning 取勝;Chatterbox 補足多語浮水印與表達力,VoxCPM2 補足 48kHz 與 30 語言。對 Scribis 使用者,最實際的做法是先用 Kokoro 快速預覽,再用 Qwen3-TTS 或自製 TTS 完成需要風格和台灣口音的正式內容。

圖:CV3-Eval vendor-reported snapshot;WER/CER 越低越好,speaker similarity 越高越好,不能直接視為所有語言與場景的總排名。
CTA: 想把逐字稿或字幕轉成中文、日文與英文旁白,可以在 Scribis.app 使用 Qwen3-TTS、Kokoro 與自製 TTS,依聲音風格、語言和台灣口音需求選擇。