使用 Scribis 即時辨識不同講者:Nemotron-3 Diarization 教學
學習如何在 Scribis 搭配 NVIDIA Nemotron-3 Diarization 模型,在錄音與即時語音轉文字的過程中即時分辨講者,並透過時間軸快速跳轉播放。
在會議、訪談、Podcast 或多人對話中,只有即時語音轉文字往往還不夠。如果逐字稿裡所有人的發言都混在一起,事後仍然需要花時間判斷「這句話是誰說的」。
Scribis 可以搭配 NVIDIA Nemotron-3 Diarization,在錄音與即時轉錄的同時辨識不同講者,並使用不同顏色的 Speaker 標籤顯示目前是誰在說話。

本篇會學到什麼
在這篇教學中,你將學會:
- 下載 Nemotron-3 Diarization 模型
- 啟用即時語音轉文字與 Progressive Updates
- 在錄音過程中即時顯示不同講者標籤
- 在 Project Workspace 使用時間軸快速跳轉到指定講者的發言片段
Scribis 支援 macOS 與 Windows。本文畫面以 macOS 示範,但講者辨識功能並不限於 Mac。
什麼是 Speaker Diarization?
Speaker Diarization,也就是「講者分離/講者辨識」,主要解決的是:
誰在什麼時間說話?
一般的語音轉文字只會把音訊轉成文字。例如:
Welcome back to the deep dive. Oh yeah. I have to ask...
但經過 Speaker Diarization 後,Scribis 可以進一步整理成:
Speaker 1
Welcome back to the deep dive...
Speaker 2
Oh yeah.
Speaker 1
I have to ask...
這對於多人會議、訪談與 Podcast 特別有幫助。
詳細操作步驟
Step 1:下載 Nemotron-3 Diarization
首先開啟 Scribis 的設定。前往:
Models → Separate Speakers
找到 NVIDIA Nemotron-3 Diarization 並下載模型。
Nemotron-3 Diarization 模型大小約為 107 MB,不需要下載數 GB 的大型模型,就可以在本地端加入 Speaker Diarization 功能。下載完成後,Scribis 就能使用這個模型分析錄音中的不同講者。
Step 2:開啟浮動錄音列
接下來開啟 Scribis 上方的 Floating Recording Bar。
這個浮動錄音列可以讓你在使用其他 App、播放影片或進行會議時,直接控制 Scribis 的錄音與轉錄。你可以從這裡:
- 開始錄音
- 暫停錄音
- 結束錄音
- 查看目前錄音時間
- 查看即時音訊狀態
Step 3:開啟 Transcription 與 Progressive Updates
在開始錄音之前,確認偏好設定中已經啟用:
- Transcription
- Progressive Updates
其中 Transcription 負責將收到的語音即時轉換成文字。而 Progressive Updates 則可以讓逐字稿在語音轉錄過程中持續更新,而不是等整段音訊處理完成後才一次顯示。
當這兩個功能同時啟用時,你就能看到接近即時更新的逐字稿內容。
Step 4:開始錄音
設定完成後,點擊錄音按鈕。接著播放你想要轉錄的外部音訊,或直接開始進行:
- 會議
- 訪談
- Podcast
- 課程
- 記者會
- 多人討論
Scribis 會持續接收音訊並進行語音轉文字。
Step 5:即時顯示不同講者
當 Scribis 偵測到不同講者時,逐字稿不只會顯示文字,也會加入不同的 Speaker 標籤。例如:
Speaker 1
Welcome back to the deep dive. You know, I had a bit of a moment this morning...
Speaker 2
Oh yeah.
Speaker 1
A full verse chorus, the whole thing just sort of landed in my head...
Speaker 2
I hate to ruin the magic for you right at the start...
不同講者會使用不同顏色的標籤顯示,因此即使是在轉錄進行中,也能快速看出目前是誰正在說話。
這也是 Speaker Diarization 與一般 Live Captions 最大的差別:一般即時字幕只負責 Audio → Text,加入 Diarization 後則變成 Audio → Text → Speaker。因此不只知道「說了什麼」,也能知道「誰說了什麼」。
Step 6:錄音完成後開啟 Project Workspace
錄音完成後,可以進入 Scribis 的 Project Workspace。
即時產生的逐字稿、時間資訊與 Speaker 資料會保留在專案中,方便後續整理。除了閱讀完整逐字稿之外,也可以搭配時間軸快速檢查不同講者的發言。
Step 7:從時間軸快速找到講者片段
Speaker Diarization 不只是讓逐字稿多一個 Speaker 標籤。Scribis 也會將講者資訊呈現在時間軸中。
只要點擊某一個 Speaker Interval,就可以直接跳到該段音訊。例如你想重新確認 Speaker 2 的某一段發言,不需要從頭播放整段錄音,直接:
點擊 Speaker 區段 → 跳轉時間點 → 播放
就能快速聽到對應內容。對於長時間的會議、Podcast 或訪談,這會比手動拖動時間軸方便很多。
完整工作流程
Models → Separate Speakers (Nemotron-3 Diarization)
↓
Open Floating Recording Bar
↓
Enable Transcription & Progressive Updates
↓
Start Recording
↓
Real-time Speaker Labels
↓
Open Project Workspace
↓
Click Speaker Interval on Timeline to Jump & Play
概念補充與常見問題 (FAQ)
為什麼使用 Nemotron-3 Diarization?
Scribis 將 Nemotron-3 Diarization 作為一個輕量化的 Speaker Diarization 選項。它的主要優勢是模型體積小,約只有 107 MB,因此適合直接整合到本機工作流程中,不需要為了講者辨識額外載入非常龐大的模型。
對 Scribis 來說,它特別適合用於:
- 即時字幕
- 會議記錄
- Podcast
- 訪談
- 多人錄音
- 課程
- YouTube 或影音內容轉錄
Nemotron-3 的講者辨識可以在本機執行,因此 Speaker Diarization 本身不需要將音訊送到 Scribis 的伺服器處理。實際的語音轉文字流程則會依照你在 Scribis 中選擇的 ASR 模型或服務而有所不同。
即時字幕與 Speaker Diarization 的差別
如果只是一般的即時語音轉文字,你看到的可能是:
Hello everyone. Hi, thanks for having me. Let's start with today's topic.
但你不知道究竟是哪個人說了哪一句。加入 Speaker Diarization 之後:
Speaker 1
Hello everyone.
Speaker 2
Hi, thanks for having me.
Speaker 1
Let's start with today's topic.
對於只有一個人的錄音,差異可能不大。但只要是兩人以上的對話,Speaker Diarization 就會開始變得非常實用。
適合哪些使用情境?
- 會議記錄: 多人開會時,可以快速知道每一段內容分別由誰發言。
- Podcast: 雙人或多人 Podcast 可以在轉錄階段直接建立 Speaker 結構。
- 訪談: 訪談者與受訪者的內容可以自動區隔,不需要事後手動重新整理逐字稿。
- 課程與討論: 老師、學生或不同參與者的發言可以使用 Speaker 標籤分開。
- 影音內容: 播放外部影片或音訊時,也可以透過 Scribis 同時建立即時字幕與講者資訊。
總結
使用 Scribis 搭配 Nemotron-3 Diarization,只需要幾個步驟:
- 前往 Models → Separate Speakers
- 下載 Nemotron-3 Diarization
- 開啟 Floating Recording Bar
- 啟用 Transcription
- 啟用 Progressive Updates
- 開始錄音
- 即時查看 Speaker 1、Speaker 2 等講者標籤
- 錄音完成後透過時間軸快速跳轉不同 Speaker 區段
這讓 Scribis 的即時轉錄不再只是「現在說了什麼?」,而是進一步知道「誰,在什麼時間,說了什麼?」。對於會議、訪談、Podcast 與任何多人錄音工作流程來說,這會讓後續整理逐字稿與查找內容簡單許多。