Scribis 自製 TTS vs Qwen3-TTS、Kokoro:台灣口音文字轉語音怎麼選?
比較 Scribis 自製 TTS、Qwen3-TTS、Kokoro 與 Piper,解析中文、日文、英文、台灣口音、voice control、模型授權與影片旁白工作流。
文章定位: 本文介紹 Scribis 已整合的自製 TTS,並與 Qwen3-TTS、Kokoro、Piper 比較中文、日文、英文、台灣口音、速度、聲音控制與部署取捨。Scribis 自製 TTS 已支援中文、日文、英文與台灣口音;外部模型的介紹不表示 Scribis 已整合那些模型。
先講結論:需要台灣口音時,Scribis 自製 TTS 是最直接的產品選項
TTS 的「最好」不是全球語言數最多,也不一定是參數最大的模型。對台灣內容創作者來說,真正重要的問題通常是:中文發音自然嗎?台灣口音是否符合觀眾習慣?英文與日文能否同時處理?腳本改動後能否快速重新生成?聲音能否直接接到字幕和影片工作流?
Scribis 自製 TTS 已整合中文、日文、英文與台灣口音支援,因此如果內容主要面向台灣觀眾,應先從 Scribis 內建 TTS 開始。Qwen3-TTS 比較適合需要 voice design、3 秒 voice cloning 或自然語言風格控制的外部模型研究;Kokoro 和 Piper 則偏向輕量、本地和固定音色旁白。
台灣口音為什麼是 TTS 的獨立比較維度?
中文 TTS 不只是把字念出來。多音字、語氣詞、數字、英文縮寫、地名、公司名稱和句尾語氣都會影響聽感;同一句中文,用台灣常見的語調與用詞方式,和一般華語聲線可能有差異。對 YouTube、線上課程、Podcast、產品影片和品牌廣告來說,口音一致性往往比「支援幾百種語言」更直接影響內容品質。
因此,台灣口音 TTS 應該以實際聽感和內容測試為主。建議建立包含新聞語氣、教學語氣、對話、數字、英文專有名詞和台灣地名的測試句,再比較發音、停頓、語速、情緒與長段落穩定性。
Scribis 自製 TTS 的產品定位
Scribis 自製 TTS 的優勢是它位於同一個內容製作工作流中。使用者可以先將錄音或影片轉成文字,校對字幕,再把腳本轉成中文、日文或英文旁白;當文字修改時,可以在同一個專案中重新生成音訊。這個流程不需要使用者把文字複製到另一個 TTS 平台,再手動下載、重新命名和對齊音訊。
由於自製 TTS 的內部架構、參數與公開 benchmark 沒有在本文資料中完整公開,文章不會自行創造 MOS、WER、RTF 或 speaker similarity 數字。產品的實際優勢應以語言、台灣口音、使用便利性、內容一致性與 Scribis 內的整合程度呈現;若未來有公開測試,則再加入可重現的 benchmark。
Qwen3-TTS、Kokoro 與 Piper 的外部比較
Qwen3-TTS 是多語言開源 TTS,包含 Base、CustomVoice 與 VoiceDesign。Base 可由約 3 秒參考音訊進行 voice cloning,CustomVoice 提供內建音色與 style control,VoiceDesign 可以透過自然語言描述設計聲音;官方列出中文、英文、日文等 10 種主要語言,授權為 Apache-2.0。
Kokoro-82M 是 82M 參數的輕量 TTS,使用 Apache-2.0,重點是固定 voices、速度和容易部署。它適合快速旁白預覽、批次生成和資源受限環境,但 voice design 與特定人物聲音克隆不是它的主要定位。
Piper 是本地 neural TTS 生態,常見優點是 CPU 友善、模型小、voice pack 多。CrispASR README 將 Piper community voices 列為 TTS backend,但 Piper 引擎和每個 voice pack 的授權必須逐一查看;不能把所有 Piper voices 籠統寫成可商用。
| 比較項目 | Scribis 自製 TTS | Qwen3-TTS | Kokoro-82M | Piper |
|---|---|---|---|---|
| 產品狀態 | Scribis 已整合 | 外部模型參考 | 外部模型參考 | CrispASR/外部本地生態參考 |
| 語言 | 中文、日文、英文 | 10 種主要語言 | 依 voice/版本為準 | 依 voice pack 為準 |
| 台灣口音 | 已支援 | 需實測與選擇適合 voice | 需實測 | 需看 voice pack |
| 聲音控制 | 以 Scribis 產品能力為準 | Base cloning、CustomVoice、VoiceDesign | 主要是固定 voices | 主要是固定 voices |
| 主要優勢 | 與 Scribis 字幕/影音流程整合 | 多語、聲音設計與 cloning | 小型、快速、Apache-2.0 | CPU、edge、voice pack 生態 |
| 公開 benchmark | 本文不臆測未公開數字 | 以官方報告為準 | 以官方 model card 為準 | 以各 voice card 為準 |
TTS benchmark 應該怎麼做?
第一個維度是 intelligibility,確認生成音訊被 ASR 轉回文字後是否正確;第二個維度是 speaker similarity,確認聲音是否維持參考身份;第三個維度是自然度與情緒,這通常需要母語者盲聽。這些指標不能用單一分數互相替代。
IndexTTS 官方整理的 CV3-Eval 表格中,IndexTTS2.5 報告平均 WER 6.75%、speaker similarity 73.18%,VoxCPM2 報告 7.22%/72.02%,OmniVoice 報告 6.76%/70.39%。這種數字可用來理解外部模型,但不是 Scribis 自製 TTS 的 benchmark,也不能直接用來宣稱某產品一定更自然。
對台灣口音,建議建立更貼近內容的人工測試表:中文多音字、台灣地名、數字、英文縮寫、日文人名、英文品牌名、句尾語氣、不同語速和 30 秒以上段落。每個模型都使用同一組文字,並記錄重新生成時間、人工挑選時間、發音問題與音訊接到影片後的同步成本。
在 Scribis 中怎麼使用?
如果你正在做台灣 YouTube、線上課程、品牌影片或 Podcast,先使用 Scribis 的 ASR 將原始錄音轉成逐字稿,再校對成腳本。接著使用自製 TTS 生成台灣口音旁白;如果同一份內容要做日文或英文版本,再比較 Qwen3-TTS 或其他外部工具的聲音表現。這樣可以將「台灣口音版本」和「多語版本」分開選擇,不必要求單一模型在所有維度都最好。
若你只需要快速做一個旁白草稿,Kokoro 或 Piper 可能適合外部本地部署;若需要角色聲音、情緒與 cloning,Qwen3-TTS、Chatterbox、IndexTTS 或 VoxCPM2 值得研究。但最終影片仍要回到 Scribis 的字幕、時間軸與內容編輯流程,才能減少跨工具搬移的時間。
FAQ
Scribis 自製 TTS 支援哪些語言?
依產品提供資訊,Scribis 自製 TTS 支援中文、日文與英文,並支援台灣口音。正式發布時仍應以產品實際版本與可選聲音為準。
Qwen3-TTS 一定比 Scribis 自製 TTS 自然嗎?
不能這樣推論。Qwen3-TTS 的公開能力集中在多語言、聲音設計和 voice cloning;Scribis 自製 TTS 的重點是中文、日文、英文、台灣口音與產品工作流。兩者應用同一組台灣內容盲聽比較。
Kokoro 能產生台灣口音嗎?
Kokoro 的語言和口音取決於使用的 voice 與版本,不能把多語言支援直接等同台灣口音。若台灣口音是主要要求,Scribis 自製 TTS 應先作為實際基準。
使用 voice cloning 要注意什麼?
使用任何人的聲音作為參考前,都應取得明確同意,確認授權範圍,並保留生成與審核紀錄。模型的開源授權不會自動解決聲音本人的人格權或合約問題。
結論:台灣內容先看口音與工作流,再看模型大小
Scribis 自製 TTS 的核心優勢,是中文、日文、英文和台灣口音已放在 Scribis 的影音內容製作工作流中;Qwen3-TTS 適合多語、聲音設計與 cloning;Kokoro 適合小型、快速的固定旁白;Piper 適合本地與 edge 部署。沒有必要把所有內容都交給同一個模型,最有效率的策略是依語言、口音、聲音風格和工作流選擇。

圖:功能定位矩陣,不是聲音品質排名;外部模型的語言與口音仍需依 voice 和實際版本測試。
CTA: 如果你想把字幕或腳本轉成適合台灣觀眾的中文、日文或英文旁白,可以從 Scribis.app 的自製 TTS 與影音內容工作流開始。