使用 Qwen3-TTS 在 Scribis 建立自訂聲音與影片配音
學習如何在 Mac 上透過 Scribis 搭配 Qwen3-TTS 建立自訂聲音、複製參考聲音,並將翻譯後的字幕合成為影片配音。
Scribis 可以搭配 Qwen3-TTS,直接在 Mac 上建立自訂聲音、產生多語語音,並將產生的聲音套用到影片配音流程。
本篇會學到什麼
在這篇教學中,你將學會如何完整掌握 Scribis 與 Qwen3-TTS 的語音設計與 AI 影片配音工作流程:
- 安裝 Qwen3-TTS 模型(VoiceDesign 與 Base)
- 使用文字描述設計全新的 AI 聲音
- 使用參考音訊建立自訂聲音或進行語音複製
- 預聽並儲存 Voice 至 Native Voices
- 轉錄與翻譯影片字幕
- 在 Speaker Mode 為不同講者指定專屬聲音
- 合成 AI 語音並同步至影片時間軸
開始之前
這個工作流程主要使用兩個 Qwen3-TTS 模型:
Qwen3-TTS 1.7B VoiceDesign
用來建立新的聲音。你可以透過自然語言描述想要的聲音特徵,例如聲音風格、音色或表達方式。
Qwen3-TTS 0.6B Base
用來產生最終語音。建立 Voice 之後,Scribis 會使用 Base 模型將文字合成為實際音訊。
因此,如果你想完整使用 Voice Design 與影片配音功能,建議同時準備這兩個模型。
詳細操作步驟
1. 安裝 Qwen3-TTS 模型
首先開啟 Scribis,進入:
Settings → Model Selection
在模型管理頁面找到 Qwen3-TTS,下載:
Qwen3-TTS 1.7B VoiceDesignQwen3-TTS 0.6B Base

VoiceDesign 負責建立聲音,而 Base 模型負責最後的語音合成。模型下載完成後,就可以開始建立自己的 Voice。
2. 開啟 Voice Design
接著前往:
Experimental Features → Voice Design
Voice Design 是 Scribis 用來管理自訂 AI 聲音的功能。目前你可以透過兩種方式建立 Voice:
- 使用文字描述設計聲音
- 使用錄音或音訊檔案作為參考

3. 使用文字描述建立聲音
如果你不需要複製既有聲音,可以直接使用自然語言描述想要的 Voice。例如:
A warm and calm male narrator with a clear voice and slightly slow speaking pace.
或者:
A young female voice with an energetic and friendly presentation style.
Qwen3-TTS VoiceDesign 會根據這些描述產生新的聲音特徵。這種方式適合:
- YouTube 旁白
- 教學影片
- Podcast
- 虛擬角色
- 不需要對應真人的 AI Voice
你可以反覆修改描述,直到產生符合需求的聲音。
4. 使用參考音訊建立自訂聲音
除了 Voice Design,你也可以使用自己的錄音或音訊檔案作為參考。在 Voice Design 中:
- 錄製一段聲音,或
- 上傳現有的音訊檔案
Scribis 會將這段音訊作為建立自訂 Voice 的參考。這種方式特別適合希望在不同影片中維持一致旁白音色的情況。
請只使用你擁有權利或取得授權的聲音進行語音複製。
5. 預聽 Voice
Voice 建立完成後,你不需要立即套用到影片。可以先輸入一段測試文字,例如:
Welcome to Scribis. Today we're going to learn how to create multilingual video dubbing.
接著直接在 Scribis 裡產生語音並預聽結果。建議測試幾種不同類型的句子,例如短句、長句、問句、數字、英文與其他語言,以及情緒較強的句子。確認聲音效果符合需求後,再儲存 Voice。
6. 儲存到 Native Voices
如果對產生的聲音滿意,可以將它儲存到 Native Voices。
儲存之後,這個 Voice 就會成為 Scribis 裡可以重複使用的聲音。之後不論建立新的影片、字幕或配音專案,都不需要重新產生相同 Voice。這對需要維持固定角色或頻道聲音的內容特別方便。例如你可以建立:
- Narrator
- Host
- Male Speaker
- Female Speaker
- Character A
- Character B
並在不同專案中持續使用。
7. 選擇需要配音的影片
Voice 準備完成後,進入 Media Library 選擇想要處理的影片。
Scribis 可以先將影片中的語音轉錄成具有時間資訊的字幕片段。基本流程是:
Video → Transcription → Timed Segments → Translation → TTS → Dubbed Audio
這些時間資訊之後會用來將新的語音重新同步到影片。
8. 翻譯影片字幕
完成轉錄後,可以將整份字幕翻譯成目標語言。例如:
English → Traditional Chinese
或:
English → Japanese
也可以處理其他 Qwen3-TTS 支援的語言。翻譯完成後,Scribis 仍然會保留原本字幕與時間軸之間的關係,方便後續產生配音。
9. 開啟 Speaker Mode
接著切換到 Speaker Mode,然後打開 Speaker Voice Settings。這裡可以控制每個 Speaker 要使用哪一個 Voice。
例如影片只有一位講者,可以設定:
Speaker 1 → My Custom Voice
如果是多人訪談:
Speaker 1 → Voice A
Speaker 2 → Voice B
Speaker 3 → Voice C
這樣不同角色就能維持各自的聲音。
10. 為不同講者指定 Voice
Speaker Voice Settings 的用途不只是在單人影片中指定 Voice,它更適合:
- Podcast
- 訪談
- 多人會議
- 對話影片
- 教學影片
- 多角色內容
每一位 Speaker 都可以使用不同的 Voice。例如:
| Speaker | Voice |
|---|---|
| Host | Custom Voice A |
| Guest | Custom Voice B |
| Narrator | Custom Voice C |
因此即使影片包含多人對話,也可以分別產生不同的 AI 配音。

11. 產生翻譯後的配音
完成 Voice 設定後,按下 Synthesize All Speech。Scribis 會根據:
- 翻譯後的字幕
- Speaker 講者標記
- Voice 設定
- 字幕時間資訊
產生新的語音。流程大致如下:
Translated Subtitle + Speaker Voice + Subtitle Timing
↓
Qwen3-TTS
↓
Generated Speech
完成後,每個字幕片段都會得到對應的語音。
12. 同步到影片時間軸
語音產生完成後,Scribis 會將新的語音放回影片時間軸。例如原始字幕:
00:01:20 → 00:01:24
Welcome to our channel.
翻譯後:
歡迎來到我們的頻道。
Scribis 會根據原本的時間區段安排產生的 TTS 音訊。這樣可以盡量讓新的配音保持與原影片相近的節奏。
完整工作流程
整個 Qwen3-TTS 配音流程可以整理成:
Download Qwen3-TTS
↓
Voice Design
↓
Create / Clone Voice
↓
Preview Voice
↓
Save to Native Voices
↓
Import Video
↓
Transcribe
↓
Translate
↓
Speaker Mode
↓
Assign Voice
↓
Synthesize
↓
Sync to Timeline
↓
Dubbed Video
概念補充與常見問題 (FAQ)
Voice Design 與 Voice Cloning 有什麼不同?
Scribis 的 Voice 功能可以分成兩種使用方式:
Voice Design
你透過文字描述建立一個新的聲音,例如:A calm documentary narrator with a deep voice.。這種方式不需要提供真人錄音,適合建立虛擬旁白、AI Presenter、遊戲角色或 Podcast 聲音。
使用參考音訊 (Voice Cloning)
另外一種方式則是提供錄音或音訊檔案作為參考,這比較適合希望保留特定聲音特徵的工作流程。
無論使用哪一種方式,建立好的 Voice 都可以儲存在 Scribis 的 Native Voices 中,供之後的專案使用。
多語影片配音的優勢是什麼?
這套流程不只是將文字轉成語音。Scribis 將 轉錄 → 翻譯 → Speaker → Voice → TTS → Timeline 整合在同一個影片工作流程中。
因此,你可以從原始影片開始:
Original Video → Speech to Text → Translation → Qwen3-TTS → Multilingual Dubbing
而不需要分別在多個工具中匯出字幕、音訊,再重新整理時間軸。
適合哪些使用情境?
這套工作流程適合:
- YouTube 多語影片
- 線上課程與教學影片
- Podcast 與訪談
- 產品 Demo 與簡報旁白
- 多角色內容與 AI Avatar 配音
尤其當影片本身已經有完整語音內容時,可以直接從 Scribis 的轉錄流程開始處理。
總結
透過 Scribis 與 Qwen3-TTS,你可以在 Mac 上完成:
聲音設計 + 語音複製 + 語音轉文字 + 字幕翻譯 + 講者管理 + TTS + 影片配音
建立好的 Voice 也可以儲存在 Native Voices,之後直接套用到其他專案。如果你的目標是製作多語 YouTube、Podcast、課程或訪談內容,就可以把整個流程放在同一個工作環境中完成。