部落格
掌握 AI 語音技術的最新發展與應用。
Cloud ASR 語音轉文字服務比較:Deepgram、OpenAI、AssemblyAI、Google Cloud 與 Azure
錄音轉文字已經不只是「把聲音變成文字」這麼簡單。本系列完整比較 Deepgram、OpenAI、AssemblyAI、Google Cloud STT 與 Azure AI Speech 的特色、價格、繁中支援與說話者辨識。
Gemini 3.5 Transcribe:Google 最新語音轉文字模型介紹與使用教學
Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。
Nemotron 3.5 ASR vs Voxtral 4B Realtime:即時轉錄怎麼選?
比較 Scribis 已整合的 Nemotron 3.5 ASR 與 Voxtral Mini 4B Realtime,解析 chunk delay、streaming、語言、模型規模、字幕延遲,並與 Parakeet、Qwen3-ASR 對照。
Paraformer-zh vs Fun-ASR-Nano:中文方言與低延遲部署怎麼選?
解析 Scribis 已整合的 Paraformer-zh 與 Fun-ASR-Nano,比較中文方言、英文日文、CER、低延遲、CPU/GPU 部署,並與 SenseVoiceSmall、FireRedASR2-AED 對照。
Parakeet TDT v3 vs Nemotron 3.5:高速與串流 ASR 怎麼選?
比較 Scribis 已整合的 Parakeet TDT v3 與 Nemotron 3.5 ASR,解析 RTFx、chunk delay、streaming、批次轉錄、字幕和硬體需求,並與 Voxtral Realtime 對照。
Qwen3-ASR-0.6B vs 1.7B:速度、顯示卡與準確率怎麼選?
比較 Scribis 已整合的 Qwen3-ASR-0.6B 與 1.7B,解析模型大小、RTF、TTFT、中文方言、批次處理,並與 Parakeet TDT v3、SenseVoice Small 及 Whisper 對照。
Qwen3-ASR-1.7B vs Whisper:中文、方言與台灣口音 ASR 怎麼選?
解析 Qwen3-ASR-1.7B 的 52 語言/方言、串流、離線與 ForcedAligner 能力,並比較 Whisper、Breeze、FireRed 和 Fun-ASR,了解如何在 Scribis 製作台灣中文字幕。
Qwen3-TTS vs Kokoro:Scribis 中文、日文、英文配音怎麼選?
比較 Scribis 已整合的 Qwen3-TTS 與 Kokoro,解析中文、日文、英文配音、3 秒 voice cloning、VoiceDesign、模型大小、速度與授權,並對照 Chatterbox、VoxCPM2。
AssemblyAI 語音轉文字介紹:從逐字稿延伸到內容理解
深入了解 AssemblyAI 的 Universal-3.5 Pro 與 Universal-2 模型、預錄音訊 API、speaker labels、實體辨識與摘要功能,並說明如何搭配 Scribis 進行語音工作流。
Azure AI Speech 語音轉文字介紹:Microsoft 生態系的企業級選擇
深入介紹 Azure AI Speech 服務的 zh-TW 語言設定、短音訊 REST API、Fast & Batch Transcription 與 Microsoft 企業級認證,並說明如何搭配 Scribis 進行語音工作流。
Scribis 自製 TTS vs Qwen3-TTS、Kokoro:台灣口音文字轉語音怎麼選?
比較 Scribis 自製 TTS、Qwen3-TTS、Kokoro 與 Piper,解析中文、日文、英文、台灣口音、voice control、模型授權與影片旁白工作流。
Deepgram Nova-3 語音轉文字介紹:高速繁中轉錄與說話者辨識
探索 Deepgram Nova-3 的核心特色、繁體中文代碼(zh-TW)、說話者辨識(diarization)、Keyterm Prompting 與官方 API 測試,並了解如何搭配 Scribis 進行語音工作流。
Google Cloud Speech-to-Text 介紹:台灣繁中與企業級語音辨識
解析 Google Cloud Speech-to-Text V2、cmn-Hant-TW 語言代碼、Chirp 模型、Dynamic Batch 與服務帳戶認證,並介紹如何搭配 Scribis 進行語音工作流。
OpenAI Speech-to-Text 語音轉文字介紹:從中文轉錄到說話者標籤
深入介紹 OpenAI Speech-to-Text API 模型(gpt-transcribe、gpt-4o-transcribe-diarize 等)、25MB 檔案限制、Prompt 提示詞與計費方式,並說明如何配合 Scribis 整理逐字稿。
SenseVoiceSmall vs Paraformer-zh:中文快速 ASR 哪個適合字幕?
解析 Scribis 已整合的 SenseVoiceSmall 與 Paraformer-zh,比較中文 ASR、低延遲、VAD、語言識別、音訊事件和字幕工作流,並與 Fun-ASR、Parakeet 對照。
VibeVoice ASR vs Qwen3-ASR:多語言 Speech-LLM 轉錄怎麼選?
解析 VibeVoice ASR 與 Qwen3-ASR 的 Speech-LLM 路線,並比較 Voxtral Mini 3B、Whisper、長音訊、多語言、台灣中文、GPU 需求與 Scribis 字幕工作流。
Whisper Large-v3 vs Breeze-ASR-25:台灣中文與中英混用 ASR 怎麼選?
比較 Scribis 已整合的 Whisper Large-v3 與 Breeze-ASR-25,解析台灣中文、繁體中文、中英 code-switching、字幕時間戳與 benchmark,找出適合影片轉錄的模型。
Gemini API 如何補足 YouTube 無字幕影片?Scribis 的 timedtext、翻譯與多語言 TTS 工作流程
Scribis 不下載 YouTube 影片、音訊或字幕,而是透過 iframe 播放並被動擷取可用的 timedtext;若影片沒有字幕,再使用 Gemini API 產生字幕內容,翻譯後以本地 TTS 提供多語言語音輸出。
Scribis 整合 Groq API:使用 Whisper 快速完成語音轉文字
想在 Scribis 中使用超高速雲端語音辨識?本文完整介紹如何建立與配置 Groq API Key、挑選 Whisper 模型(whisper-large-v3 與 whisper-large-v3-turbo)、檔案限制與進階設定,助你快速完成音訊及影片轉錄。
用 ElevenLabs Scribe v2 強化 Scribis 語音轉文字:API 設定與使用教學
本教學詳細介紹如何在 Scribis 中設定與使用 ElevenLabs Scribe v2 批次語音轉文字模型,包括 API key 建立、權限設定、隱私保護與 credit 費用估算。
SmartSub vs Scribis:兩款桌面 AI 字幕與語音工作站怎麼選?
從開源、離線/本地端、字幕翻譯、說話者辨識、配音、時間軸編輯、平台與價格等面向,比較 SmartSub 與 Scribis 的特色與適用情境。
Subtitle Edit v5 vs Scribis:字幕精修與 AI 語音工作站,該怎麼選?
比較 Subtitle Edit v5 與 Scribis 的產品定位、字幕編輯、語音轉錄、時間軸、翻譯、影音處理、隱私與成本,協助創作者依照工作流程做出合適選擇。
What'Sub vs Scribis:兩種字幕工作流,你該選哪一套?
對比 What'Sub 網頁字幕工具與 Scribis 桌面 AI 影音工作站,從轉錄、翻譯、樣式到硬體門檻與隱私安全,幫你找到最適合的字幕工作流。
別再手動對字幕了!6 項更新幫你省下無聊的剪輯苦力活
為了解決上字幕這些打斷工作節奏的麻煩事,我們推出了這波更新。沒有空泛的技術名詞,只有 6 個能幫你早點下班的實用功能。
2026 語音辨識技術完整指南:開源與閉源 ASR 系統選型與效能解析
探討 2026 年自動語音辨識 (ASR) 技術演進。從 OpenAI Whisper、SenseVoice 到台灣在地化模型,透徹解析企業如何透過混合路由架構降低成本並提升效能。
聽懂人類語言的機器腦:2026年開源語音辨識模型架構、評測與硬體部署全解析
深入剖析 2026 年開源語音辨識技術,從 Wav2Vec 2.0、VibeVoice 到台灣在地化的 Breeze ASR,解析自迴歸與非自迴歸架構,並探討邊緣運算與醫療隱私的部署策略。
如何選擇合適的 ASR 語音辨識模型:全面指南
市面上這麼多語音轉文字模型,該如何挑選?本指南針對不同使用場景,從即時串流到高精度離線轉錄,為您分析最適合的 ASR 模型。
影片 OCR 與三款 AI 語音模型更新:減少筆記與輸入的切換干擾
整理影片筆記時頻繁切換視窗,或語音輸入遇到專有名詞辨識錯誤,常會打斷工作節奏。近期推出的影片 OCR 工具與 VibeVoice、Voxtral、Distil-Whisper 三款語音模型,主要針對這些輸入痛點提供了新的解決方式。
開源語音辨識的新巨頭:Qwen3-ASR、Parakeet-TDT 與 SenseVoice Small
2026 年語音辨識領域迎來了範式轉移。我們深入分析了 Qwen3-ASR 的技術突破、NVIDIA Parakeet-TDT-0.6B-v3 的極致效率,以及阿里巴巴 SenseVoice Small 的多任務處理能力。
Breeze ASR 25:聯發科在在地化語音辨識的重大突破
認識 Breeze ASR 25,這是聯發創新基地(MediaTek Research)最新的開源模型。針對台灣國語與中英混用進行優化,相較於 OpenAI Whisper,它在混合語音辨識上的表現提升了 56%。了解為什麼這款擁有 15.5 億參數的模型是在地 AI 應用的遊戲規則改變者。
Breeze ASR 26:填補台語語音辨識空白的關鍵里程碑
聯發創新基地(MediaTek Research)推出 Breeze ASR 26,這是首款針對台語(台灣台語)深度優化的開源模型。作為 MR Breeze 3 系列的一員,這款擁有 20 億參數的模型精通國、台、英三語夾雜辨識,讓 AI 真正走進台灣的語言現實。
體積縮減 49%、速度飆升 6 倍!英文語音辨識開源神器 Distil-Whisper 完整解析
面對龐大的雲端運算成本,企業該如何兼顧語音辨識的精準度與效率?Hugging Face 推出的 Distil-Whisper 透過「知識蒸餾」技術,打造出體積縮小 49%、推論速度飆升 6 倍的輕量級變體模型,且字錯率(WER)與原版差距保持在 1% 以內。本文將為您完整解析 Distil-Whisper 的核心優勢、技術原理與驚人的成本效益,帶您了解這款開源神器如何改變語音 AI 產業的遊戲規則!
告別斷片!微軟開源 VibeVoice-ASR:60分鐘長音頻一次直出結構化逐字稿
處理長篇會議錄音總讓人頭痛?微軟開源語音 AI「VibeVoice-ASR」支援單次處理 60 分鐘長音頻,徹底解決上下文碎片化痛點。本文深度解析其如何一次生成包含說話人與時間戳記的 3W 結構化逐字稿,並附上本地端實戰部署指南。
語音 AI 新霸主?Voxtral Mini 3B 深度評測:詞錯率低至 1.57 的輕量級多模態模型
面對高昂的雲端 API 成本與資料隱私考量,Mistral AI 的 Voxtral Mini 3B 提供了極佳的企業級解決方案。本文探討這款 30 億參數模型如何兼顧高精度語音轉錄與複雜語義理解,並介紹其在 Red Hat AI 平台的 FP8 動態量化部署優勢。看它如何以極低的硬體門檻,為跨國會議記錄與客服質檢帶來極致的性價比與資安保障。
挑戰 Whisper 霸主地位!低於 500ms 的開源語音模型 Voxtral 4B 完整指南
語音 AI 的開源新紀元!Mistral 釋出採用 Apache 2.0 授權的 Voxtral Mini 4B Realtime,打破了高效能即時語音轉錄的商業生態限制。本文詳解其小巧卻強大的硬核架構,並分享生產級別的最佳環境參數設定,助您在注重隱私的本地設備上,快速建構低延遲、高精準的雙向互動系統。