TTS 比較

Scribis 自製 TTS vs Qwen3-TTS、Kokoro:台灣口音文字轉語音怎麼選?

personJH LAI
calendar_today

比較 Scribis 自製 TTS、Qwen3-TTS、Kokoro 與 Piper,解析中文、日文、英文、台灣口音、voice control、模型授權與影片旁白工作流。

文章定位: 本文介紹 Scribis 已整合的自製 TTS,並與 Qwen3-TTS、Kokoro、Piper 比較中文、日文、英文、台灣口音、速度、聲音控制與部署取捨。Scribis 自製 TTS 已支援中文、日文、英文與台灣口音;外部模型的介紹不表示 Scribis 已整合那些模型。

先講結論:需要台灣口音時,Scribis 自製 TTS 是最直接的產品選項

TTS 的「最好」不是全球語言數最多,也不一定是參數最大的模型。對台灣內容創作者來說,真正重要的問題通常是:中文發音自然嗎?台灣口音是否符合觀眾習慣?英文與日文能否同時處理?腳本改動後能否快速重新生成?聲音能否直接接到字幕和影片工作流?

Scribis 自製 TTS 已整合中文、日文、英文與台灣口音支援,因此如果內容主要面向台灣觀眾,應先從 Scribis 內建 TTS 開始。Qwen3-TTS 比較適合需要 voice design、3 秒 voice cloning 或自然語言風格控制的外部模型研究;Kokoro 和 Piper 則偏向輕量、本地和固定音色旁白。

台灣口音為什麼是 TTS 的獨立比較維度?

中文 TTS 不只是把字念出來。多音字、語氣詞、數字、英文縮寫、地名、公司名稱和句尾語氣都會影響聽感;同一句中文,用台灣常見的語調與用詞方式,和一般華語聲線可能有差異。對 YouTube、線上課程、Podcast、產品影片和品牌廣告來說,口音一致性往往比「支援幾百種語言」更直接影響內容品質。

因此,台灣口音 TTS 應該以實際聽感和內容測試為主。建議建立包含新聞語氣、教學語氣、對話、數字、英文專有名詞和台灣地名的測試句,再比較發音、停頓、語速、情緒與長段落穩定性。

Scribis 自製 TTS 的產品定位

Scribis 自製 TTS 的優勢是它位於同一個內容製作工作流中。使用者可以先將錄音或影片轉成文字,校對字幕,再把腳本轉成中文、日文或英文旁白;當文字修改時,可以在同一個專案中重新生成音訊。這個流程不需要使用者把文字複製到另一個 TTS 平台,再手動下載、重新命名和對齊音訊。

由於自製 TTS 的內部架構、參數與公開 benchmark 沒有在本文資料中完整公開,文章不會自行創造 MOS、WER、RTF 或 speaker similarity 數字。產品的實際優勢應以語言、台灣口音、使用便利性、內容一致性與 Scribis 內的整合程度呈現;若未來有公開測試,則再加入可重現的 benchmark。

Qwen3-TTS、Kokoro 與 Piper 的外部比較

Qwen3-TTS 是多語言開源 TTS,包含 Base、CustomVoice 與 VoiceDesign。Base 可由約 3 秒參考音訊進行 voice cloning,CustomVoice 提供內建音色與 style control,VoiceDesign 可以透過自然語言描述設計聲音;官方列出中文、英文、日文等 10 種主要語言,授權為 Apache-2.0。

Kokoro-82M 是 82M 參數的輕量 TTS,使用 Apache-2.0,重點是固定 voices、速度和容易部署。它適合快速旁白預覽、批次生成和資源受限環境,但 voice design 與特定人物聲音克隆不是它的主要定位。

Piper 是本地 neural TTS 生態,常見優點是 CPU 友善、模型小、voice pack 多。CrispASR README 將 Piper community voices 列為 TTS backend,但 Piper 引擎和每個 voice pack 的授權必須逐一查看;不能把所有 Piper voices 籠統寫成可商用。

比較項目 Scribis 自製 TTS Qwen3-TTS Kokoro-82M Piper
產品狀態 Scribis 已整合 外部模型參考 外部模型參考 CrispASR/外部本地生態參考
語言 中文、日文、英文 10 種主要語言 依 voice/版本為準 依 voice pack 為準
台灣口音 已支援 需實測與選擇適合 voice 需實測 需看 voice pack
聲音控制 以 Scribis 產品能力為準 Base cloning、CustomVoice、VoiceDesign 主要是固定 voices 主要是固定 voices
主要優勢 與 Scribis 字幕/影音流程整合 多語、聲音設計與 cloning 小型、快速、Apache-2.0 CPU、edge、voice pack 生態
公開 benchmark 本文不臆測未公開數字 以官方報告為準 以官方 model card 為準 以各 voice card 為準

TTS benchmark 應該怎麼做?

第一個維度是 intelligibility,確認生成音訊被 ASR 轉回文字後是否正確;第二個維度是 speaker similarity,確認聲音是否維持參考身份;第三個維度是自然度與情緒,這通常需要母語者盲聽。這些指標不能用單一分數互相替代。

IndexTTS 官方整理的 CV3-Eval 表格中,IndexTTS2.5 報告平均 WER 6.75%、speaker similarity 73.18%,VoxCPM2 報告 7.22%/72.02%,OmniVoice 報告 6.76%/70.39%。這種數字可用來理解外部模型,但不是 Scribis 自製 TTS 的 benchmark,也不能直接用來宣稱某產品一定更自然。

對台灣口音,建議建立更貼近內容的人工測試表:中文多音字、台灣地名、數字、英文縮寫、日文人名、英文品牌名、句尾語氣、不同語速和 30 秒以上段落。每個模型都使用同一組文字,並記錄重新生成時間、人工挑選時間、發音問題與音訊接到影片後的同步成本。

在 Scribis 中怎麼使用?

如果你正在做台灣 YouTube、線上課程、品牌影片或 Podcast,先使用 Scribis 的 ASR 將原始錄音轉成逐字稿,再校對成腳本。接著使用自製 TTS 生成台灣口音旁白;如果同一份內容要做日文或英文版本,再比較 Qwen3-TTS 或其他外部工具的聲音表現。這樣可以將「台灣口音版本」和「多語版本」分開選擇,不必要求單一模型在所有維度都最好。

若你只需要快速做一個旁白草稿,Kokoro 或 Piper 可能適合外部本地部署;若需要角色聲音、情緒與 cloning,Qwen3-TTS、Chatterbox、IndexTTS 或 VoxCPM2 值得研究。但最終影片仍要回到 Scribis 的字幕、時間軸與內容編輯流程,才能減少跨工具搬移的時間。

FAQ

Scribis 自製 TTS 支援哪些語言?

依產品提供資訊,Scribis 自製 TTS 支援中文、日文與英文,並支援台灣口音。正式發布時仍應以產品實際版本與可選聲音為準。

Qwen3-TTS 一定比 Scribis 自製 TTS 自然嗎?

不能這樣推論。Qwen3-TTS 的公開能力集中在多語言、聲音設計和 voice cloning;Scribis 自製 TTS 的重點是中文、日文、英文、台灣口音與產品工作流。兩者應用同一組台灣內容盲聽比較。

Kokoro 能產生台灣口音嗎?

Kokoro 的語言和口音取決於使用的 voice 與版本,不能把多語言支援直接等同台灣口音。若台灣口音是主要要求,Scribis 自製 TTS 應先作為實際基準。

使用 voice cloning 要注意什麼?

使用任何人的聲音作為參考前,都應取得明確同意,確認授權範圍,並保留生成與審核紀錄。模型的開源授權不會自動解決聲音本人的人格權或合約問題。

結論:台灣內容先看口音與工作流,再看模型大小

Scribis 自製 TTS 的核心優勢,是中文、日文、英文和台灣口音已放在 Scribis 的影音內容製作工作流中;Qwen3-TTS 適合多語、聲音設計與 cloning;Kokoro 適合小型、快速的固定旁白;Piper 適合本地與 edge 部署。沒有必要把所有內容都交給同一個模型,最有效率的策略是依語言、口音、聲音風格和工作流選擇。

Scribis 自製 TTS 與外部模型的台灣口音選型矩陣

圖:功能定位矩陣,不是聲音品質排名;外部模型的語言與口音仍需依 voice 和實際版本測試。

CTA: 如果你想把字幕或腳本轉成適合台灣觀眾的中文、日文或英文旁白,可以從 Scribis.app 的自製 TTS 與影音內容工作流開始。

相關連結

  1. Qwen3-TTS 官方 GitHub
  2. Kokoro-82M 官方模型卡
  3. CrispASR TTS backend 與 Piper/Kokoro 清單
  4. IndexTTS 官方 GitHub 與 CV3-Eval
  5. Scribis 官方功能頁