操作教學

使用 Qwen3-TTS 在 Scribis 建立自訂聲音與影片配音

personJH LAI
calendar_today

學習如何在 Mac 上透過 Scribis 搭配 Qwen3-TTS 建立自訂聲音、複製參考聲音,並將翻譯後的字幕合成為影片配音。

Scribis 可以搭配 Qwen3-TTS,直接在 Mac 上建立自訂聲音、產生多語語音,並將產生的聲音套用到影片配音流程。

本篇會學到什麼

在這篇教學中,你將學會如何完整掌握 Scribis 與 Qwen3-TTS 的語音設計與 AI 影片配音工作流程:

  • 安裝 Qwen3-TTS 模型(VoiceDesign 與 Base)
  • 使用文字描述設計全新的 AI 聲音
  • 使用參考音訊建立自訂聲音或進行語音複製
  • 預聽並儲存 Voice 至 Native Voices
  • 轉錄與翻譯影片字幕
  • 在 Speaker Mode 為不同講者指定專屬聲音
  • 合成 AI 語音並同步至影片時間軸

開始之前

這個工作流程主要使用兩個 Qwen3-TTS 模型:

Qwen3-TTS 1.7B VoiceDesign

用來建立新的聲音。你可以透過自然語言描述想要的聲音特徵,例如聲音風格、音色或表達方式。

Qwen3-TTS 0.6B Base

用來產生最終語音。建立 Voice 之後,Scribis 會使用 Base 模型將文字合成為實際音訊。

因此,如果你想完整使用 Voice Design 與影片配音功能,建議同時準備這兩個模型。


詳細操作步驟

1. 安裝 Qwen3-TTS 模型

首先開啟 Scribis,進入:

Settings → Model Selection

在模型管理頁面找到 Qwen3-TTS,下載:

  • Qwen3-TTS 1.7B VoiceDesign
  • Qwen3-TTS 0.6B Base

Scribis Settings 中的 Model Selection 頁面,顯示 Qwen3-TTS 1.7B VoiceDesign 與 0.6B Base 下載與安裝管理。

VoiceDesign 負責建立聲音,而 Base 模型負責最後的語音合成。模型下載完成後,就可以開始建立自己的 Voice。

2. 開啟 Voice Design

接著前往:

Experimental Features → Voice Design

Voice Design 是 Scribis 用來管理自訂 AI 聲音的功能。目前你可以透過兩種方式建立 Voice:

  1. 使用文字描述設計聲音
  2. 使用錄音或音訊檔案作為參考

Scribis Voice Design 介面,提供 Prompt 語音描述與參考音訊上傳功能。

3. 使用文字描述建立聲音

如果你不需要複製既有聲音,可以直接使用自然語言描述想要的 Voice。例如:

A warm and calm male narrator with a clear voice and slightly slow speaking pace.

或者:

A young female voice with an energetic and friendly presentation style.

Qwen3-TTS VoiceDesign 會根據這些描述產生新的聲音特徵。這種方式適合:

  • YouTube 旁白
  • 教學影片
  • Podcast
  • 虛擬角色
  • 不需要對應真人的 AI Voice

你可以反覆修改描述,直到產生符合需求的聲音。

4. 使用參考音訊建立自訂聲音

除了 Voice Design,你也可以使用自己的錄音或音訊檔案作為參考。在 Voice Design 中:

  1. 錄製一段聲音,或
  2. 上傳現有的音訊檔案

Scribis 會將這段音訊作為建立自訂 Voice 的參考。這種方式特別適合希望在不同影片中維持一致旁白音色的情況。

請只使用你擁有權利或取得授權的聲音進行語音複製。

5. 預聽 Voice

Voice 建立完成後,你不需要立即套用到影片。可以先輸入一段測試文字,例如:

Welcome to Scribis. Today we're going to learn how to create multilingual video dubbing.

接著直接在 Scribis 裡產生語音並預聽結果。建議測試幾種不同類型的句子,例如短句、長句、問句、數字、英文與其他語言,以及情緒較強的句子。確認聲音效果符合需求後,再儲存 Voice。

6. 儲存到 Native Voices

如果對產生的聲音滿意,可以將它儲存到 Native Voices。

儲存之後,這個 Voice 就會成為 Scribis 裡可以重複使用的聲音。之後不論建立新的影片、字幕或配音專案,都不需要重新產生相同 Voice。這對需要維持固定角色或頻道聲音的內容特別方便。例如你可以建立:

  • Narrator
  • Host
  • Male Speaker
  • Female Speaker
  • Character A
  • Character B

並在不同專案中持續使用。

7. 選擇需要配音的影片

Voice 準備完成後,進入 Media Library 選擇想要處理的影片。

Scribis 可以先將影片中的語音轉錄成具有時間資訊的字幕片段。基本流程是:

Video → Transcription → Timed Segments → Translation → TTS → Dubbed Audio

這些時間資訊之後會用來將新的語音重新同步到影片。

8. 翻譯影片字幕

完成轉錄後,可以將整份字幕翻譯成目標語言。例如:

English → Traditional Chinese

或:

English → Japanese

也可以處理其他 Qwen3-TTS 支援的語言。翻譯完成後,Scribis 仍然會保留原本字幕與時間軸之間的關係,方便後續產生配音。

9. 開啟 Speaker Mode

接著切換到 Speaker Mode,然後打開 Speaker Voice Settings。這裡可以控制每個 Speaker 要使用哪一個 Voice。

例如影片只有一位講者,可以設定:

Speaker 1 → My Custom Voice

如果是多人訪談:

Speaker 1 → Voice A
Speaker 2 → Voice B
Speaker 3 → Voice C

這樣不同角色就能維持各自的聲音。

10. 為不同講者指定 Voice

Speaker Voice Settings 的用途不只是在單人影片中指定 Voice,它更適合:

  • Podcast
  • 訪談
  • 多人會議
  • 對話影片
  • 教學影片
  • 多角色內容

每一位 Speaker 都可以使用不同的 Voice。例如:

Speaker Voice
Host Custom Voice A
Guest Custom Voice B
Narrator Custom Voice C

因此即使影片包含多人對話,也可以分別產生不同的 AI 配音。

Scribis Speaker Mode 介面,顯示時間軸波形、字幕翻譯對照與 Speaker 配音設定。

11. 產生翻譯後的配音

完成 Voice 設定後,按下 Synthesize All Speech。Scribis 會根據:

  • 翻譯後的字幕
  • Speaker 講者標記
  • Voice 設定
  • 字幕時間資訊

產生新的語音。流程大致如下:

Translated Subtitle + Speaker Voice + Subtitle Timing
                      ↓
                  Qwen3-TTS
                      ↓
               Generated Speech

完成後,每個字幕片段都會得到對應的語音。

12. 同步到影片時間軸

語音產生完成後,Scribis 會將新的語音放回影片時間軸。例如原始字幕:

00:01:20 → 00:01:24
Welcome to our channel.

翻譯後:

歡迎來到我們的頻道。

Scribis 會根據原本的時間區段安排產生的 TTS 音訊。這樣可以盡量讓新的配音保持與原影片相近的節奏。


完整工作流程

整個 Qwen3-TTS 配音流程可以整理成:

Download Qwen3-TTS
        ↓
Voice Design
        ↓
Create / Clone Voice
        ↓
Preview Voice
        ↓
Save to Native Voices
        ↓
Import Video
        ↓
Transcribe
        ↓
Translate
        ↓
Speaker Mode
        ↓
Assign Voice
        ↓
Synthesize
        ↓
Sync to Timeline
        ↓
Dubbed Video

概念補充與常見問題 (FAQ)

Voice Design 與 Voice Cloning 有什麼不同?

Scribis 的 Voice 功能可以分成兩種使用方式:

Voice Design

你透過文字描述建立一個新的聲音,例如:A calm documentary narrator with a deep voice.。這種方式不需要提供真人錄音,適合建立虛擬旁白、AI Presenter、遊戲角色或 Podcast 聲音。

使用參考音訊 (Voice Cloning)

另外一種方式則是提供錄音或音訊檔案作為參考,這比較適合希望保留特定聲音特徵的工作流程。

無論使用哪一種方式,建立好的 Voice 都可以儲存在 Scribis 的 Native Voices 中,供之後的專案使用。

多語影片配音的優勢是什麼?

這套流程不只是將文字轉成語音。Scribis 將 轉錄 → 翻譯 → Speaker → Voice → TTS → Timeline 整合在同一個影片工作流程中。

因此,你可以從原始影片開始:

Original Video → Speech to Text → Translation → Qwen3-TTS → Multilingual Dubbing

而不需要分別在多個工具中匯出字幕、音訊,再重新整理時間軸。

適合哪些使用情境?

這套工作流程適合:

  • YouTube 多語影片
  • 線上課程與教學影片
  • Podcast 與訪談
  • 產品 Demo 與簡報旁白
  • 多角色內容與 AI Avatar 配音

尤其當影片本身已經有完整語音內容時,可以直接從 Scribis 的轉錄流程開始處理。


總結

透過 Scribis 與 Qwen3-TTS,你可以在 Mac 上完成:

聲音設計 + 語音複製 + 語音轉文字 + 字幕翻譯 + 講者管理 + TTS + 影片配音

建立好的 Voice 也可以儲存在 Native Voices,之後直接套用到其他專案。如果你的目標是製作多語 YouTube、Podcast、課程或訪談內容,就可以把整個流程放在同一個工作環境中完成。


相關連結

  1. Scribis 官方網站
  2. Qwen3-TTS 模型介紹