第三章:音訊與影片轉錄指南
探索 VibeVoice、Parakeet v3 TDT、Breeze-ASR 26 等頂尖語音模型、Prompt 技巧與多人發言人群組自動標記。
第三章:音訊與影片轉錄指南 (Audio & Video Transcription)
3.1 支援的影音檔案格式
Scribis 支援匯入市面上絕大多數常見的影音格式,無需事先手動轉檔:
- 常用音訊:
.mp3,.wav,.m4a,.flac,.aac,.ogg,.wma,.opus - 常用影片:
.mp4,.mov,.mkv,.avi,.webm,.wmv,.flv
將檔案拖入後,Scribis 會自動讀取並產生音軌波形預覽。
轉錄檔案清單視圖,顯示多個音訊與影片檔案的時長、檔案大小與音軌波形預覽
3.2 頂尖語音模型推薦與選型指南
Scribis 整合了業界最具突破性的 AI 語音模型,滿足不同語言與場景的極致需求:
各大語音辨識模型 (VibeVoice, Parakeet, Breeze, SenseVoice, Whisper) 效能與適用場景對照雷達圖
1. 🏆 VibeVoice (綜合實力與中文第一名 ⭐⭐⭐⭐⭐)
- 核心優勢:當前業界最高水準的語音理解與轉錄模型。具備超凡的語境上下文理解力、極致自然的長句斷句,且幾乎零幻覺 (Zero Hallucination)。
- 最適合:正式演講、深度專訪、Podcast、商務會議、長篇教學與重要影音紀錄。
2. 🦅 Parakeet v3 TDT (英文轉錄第一名 ⭐⭐⭐⭐⭐)
- 核心優勢:英文語音辨識的絕對霸主。擁有業界最低的英文錯誤率 (WER),運算速度極快(CPU/GPU 上可達 3x 至 16x 轉錄速度),且自帶精準的單詞級 (Word-Level) 時間戳。
- 最適合:全英文訪談、美劇字幕製作、國際學術研討會、英文教學與外語影音剪輯。
3. 🇹🇼 Breeze-ASR 26 (繁體中文 / 台灣在地化專用)
- 核心優勢:針對台灣繁體中文、台灣國語腔調、台語、客語以及台灣日常習慣的「中英夾雜 (Code-Switching)」深度優化。
- 最適合:台灣 YouTuber 影音創作、本土專訪、電視新聞與本地企業會議。
4. ⚡ SenseVoice Small (極速輕量 / 情緒與事件偵測)
- 核心優勢:在普通 CPU 上即可實現十幾倍速的閃電轉錄,並能自動偵測聲音中的「情緒」(開心、憤怒、悲傷)與「聲音事件」(笑聲、掌聲、背景音樂)。
- 最適合:短影音、即時字幕生成與輕薄筆電快速聽寫。
5. 🌐 Whisper 系列 (全球通用 / 抗噪音標竿)
- Whisper Large-v3 / Distil-Whisper:多語言泛化能力強、對背景嘈雜環境有極高耐受力。
3.3 轉錄進階設定與 Prompt 提示詞小技巧
在開始轉錄前,善用以下設定能讓成品更完美:
轉錄進階設定視窗,展示語言選擇、溫度參數 (Temperature) 與自訂 Prompt 輸入框
💡 實用技巧:填寫「提示詞 (Prompt)」
在轉錄面板的「提示詞 (Prompt)」欄位中輸入簡短的文字,可以大幅引導 AI 正確辨識特殊名詞並統一語氣:
- 提示專有名詞與品牌:
範例 Prompt:「這是一段關於 Next.js, React 19, TypeScript, Kubernetes 與 Docker 的雲端架構演講。」
- 強制繁體中文輸出:
範例 Prompt:「請使用繁體中文(台灣)輸出,語句通順,標點符號完整。」
- 去除口語贅字:
範例 Prompt:「請以正式書面語為主,自動略過口語中的『嗯』、『那個』、『就是說』。」
3.4 說話者分離與發言人群組自動標記
當您轉錄的是多人訪談、Podcast 雙人對談或團隊會議時:
說話者分離設定與辨識結果預覽,不同講者 (Speaker 1, Speaker 2) 以不同色彩標籤區分
- 開啟 「說話者分離 (Speaker Diarization)」 開關。
- 設定 發言人數(如雙人專訪填
2,不確定可保持-1自動偵測)。 - 👥 發言人群組自動標記 (Group Matching):
- 辨識出各發言人後,您可以將辨識的人員一鍵加入建立為 群組 (Group)(例如「每週產品例會組」)。
- 下次轉錄該群組的會議錄音時,只需選取該群組,Scribis 將自動辨識並直接標註群組內每位成員的姓名,無需反覆手動修改!