最新動態

部落格

掌握 AI 語音技術的最新發展與應用。

JH LAI

Cloud ASR 語音轉文字服務比較:Deepgram、OpenAI、AssemblyAI、Google Cloud 與 Azure

錄音轉文字已經不只是「把聲音變成文字」這麼簡單。本系列完整比較 Deepgram、OpenAI、AssemblyAI、Google Cloud STT 與 Azure AI Speech 的特色、價格、繁中支援與說話者辨識。

閱讀更多arrow_forward
JH LAI

Gemini 3.5 Transcribe:Google 最新語音轉文字模型介紹與使用教學

Google 在 2026 年 8 月推出 Gemini 3.5 Transcribe,這是一個專門用於語音轉文字的 Gemini 模型,支援自動語言偵測、多人說話者辨識、逐字時間戳記、自訂詞彙和智慧轉錄格式。

閱讀更多arrow_forward
JH LAI

Nemotron 3.5 ASR vs Voxtral 4B Realtime:即時轉錄怎麼選?

比較 Scribis 已整合的 Nemotron 3.5 ASR 與 Voxtral Mini 4B Realtime,解析 chunk delay、streaming、語言、模型規模、字幕延遲,並與 Parakeet、Qwen3-ASR 對照。

閱讀更多arrow_forward
JH LAI

Paraformer-zh vs Fun-ASR-Nano:中文方言與低延遲部署怎麼選?

解析 Scribis 已整合的 Paraformer-zh 與 Fun-ASR-Nano,比較中文方言、英文日文、CER、低延遲、CPU/GPU 部署,並與 SenseVoiceSmall、FireRedASR2-AED 對照。

閱讀更多arrow_forward
JH LAI

Parakeet TDT v3 vs Nemotron 3.5:高速與串流 ASR 怎麼選?

比較 Scribis 已整合的 Parakeet TDT v3 與 Nemotron 3.5 ASR,解析 RTFx、chunk delay、streaming、批次轉錄、字幕和硬體需求,並與 Voxtral Realtime 對照。

閱讀更多arrow_forward
JH LAI

Qwen3-ASR-0.6B vs 1.7B:速度、顯示卡與準確率怎麼選?

比較 Scribis 已整合的 Qwen3-ASR-0.6B 與 1.7B,解析模型大小、RTF、TTFT、中文方言、批次處理,並與 Parakeet TDT v3、SenseVoice Small 及 Whisper 對照。

閱讀更多arrow_forward
JH LAI

Qwen3-ASR-1.7B vs Whisper:中文、方言與台灣口音 ASR 怎麼選?

解析 Qwen3-ASR-1.7B 的 52 語言/方言、串流、離線與 ForcedAligner 能力,並比較 Whisper、Breeze、FireRed 和 Fun-ASR,了解如何在 Scribis 製作台灣中文字幕。

閱讀更多arrow_forward
JH LAI

Qwen3-TTS vs Kokoro:Scribis 中文、日文、英文配音怎麼選?

比較 Scribis 已整合的 Qwen3-TTS 與 Kokoro,解析中文、日文、英文配音、3 秒 voice cloning、VoiceDesign、模型大小、速度與授權,並對照 Chatterbox、VoxCPM2。

閱讀更多arrow_forward
JH LAI

AssemblyAI 語音轉文字介紹:從逐字稿延伸到內容理解

深入了解 AssemblyAI 的 Universal-3.5 Pro 與 Universal-2 模型、預錄音訊 API、speaker labels、實體辨識與摘要功能,並說明如何搭配 Scribis 進行語音工作流。

閱讀更多arrow_forward
JH LAI

Azure AI Speech 語音轉文字介紹:Microsoft 生態系的企業級選擇

深入介紹 Azure AI Speech 服務的 zh-TW 語言設定、短音訊 REST API、Fast & Batch Transcription 與 Microsoft 企業級認證,並說明如何搭配 Scribis 進行語音工作流。

閱讀更多arrow_forward
JH LAI

Scribis 自製 TTS vs Qwen3-TTS、Kokoro:台灣口音文字轉語音怎麼選?

比較 Scribis 自製 TTS、Qwen3-TTS、Kokoro 與 Piper,解析中文、日文、英文、台灣口音、voice control、模型授權與影片旁白工作流。

閱讀更多arrow_forward
JH LAI

Deepgram Nova-3 語音轉文字介紹:高速繁中轉錄與說話者辨識

探索 Deepgram Nova-3 的核心特色、繁體中文代碼(zh-TW)、說話者辨識(diarization)、Keyterm Prompting 與官方 API 測試,並了解如何搭配 Scribis 進行語音工作流。

閱讀更多arrow_forward
JH LAI

Google Cloud Speech-to-Text 介紹:台灣繁中與企業級語音辨識

解析 Google Cloud Speech-to-Text V2、cmn-Hant-TW 語言代碼、Chirp 模型、Dynamic Batch 與服務帳戶認證,並介紹如何搭配 Scribis 進行語音工作流。

閱讀更多arrow_forward
JH LAI

OpenAI Speech-to-Text 語音轉文字介紹:從中文轉錄到說話者標籤

深入介紹 OpenAI Speech-to-Text API 模型(gpt-transcribe、gpt-4o-transcribe-diarize 等)、25MB 檔案限制、Prompt 提示詞與計費方式,並說明如何配合 Scribis 整理逐字稿。

閱讀更多arrow_forward
JH LAI

SenseVoiceSmall vs Paraformer-zh:中文快速 ASR 哪個適合字幕?

解析 Scribis 已整合的 SenseVoiceSmall 與 Paraformer-zh,比較中文 ASR、低延遲、VAD、語言識別、音訊事件和字幕工作流,並與 Fun-ASR、Parakeet 對照。

閱讀更多arrow_forward
JH LAI

VibeVoice ASR vs Qwen3-ASR:多語言 Speech-LLM 轉錄怎麼選?

解析 VibeVoice ASR 與 Qwen3-ASR 的 Speech-LLM 路線,並比較 Voxtral Mini 3B、Whisper、長音訊、多語言、台灣中文、GPU 需求與 Scribis 字幕工作流。

閱讀更多arrow_forward
JH LAI

Whisper Large-v3 vs Breeze-ASR-25:台灣中文與中英混用 ASR 怎麼選?

比較 Scribis 已整合的 Whisper Large-v3 與 Breeze-ASR-25,解析台灣中文、繁體中文、中英 code-switching、字幕時間戳與 benchmark,找出適合影片轉錄的模型。

閱讀更多arrow_forward
JH LAI

Gemini API 如何補足 YouTube 無字幕影片?Scribis 的 timedtext、翻譯與多語言 TTS 工作流程

Scribis 不下載 YouTube 影片、音訊或字幕,而是透過 iframe 播放並被動擷取可用的 timedtext;若影片沒有字幕,再使用 Gemini API 產生字幕內容,翻譯後以本地 TTS 提供多語言語音輸出。

閱讀更多arrow_forward
JH LAI

Scribis 整合 Groq API:使用 Whisper 快速完成語音轉文字

想在 Scribis 中使用超高速雲端語音辨識?本文完整介紹如何建立與配置 Groq API Key、挑選 Whisper 模型(whisper-large-v3 與 whisper-large-v3-turbo)、檔案限制與進階設定,助你快速完成音訊及影片轉錄。

閱讀更多arrow_forward
JH LAI

用 ElevenLabs Scribe v2 強化 Scribis 語音轉文字:API 設定與使用教學

本教學詳細介紹如何在 Scribis 中設定與使用 ElevenLabs Scribe v2 批次語音轉文字模型,包括 API key 建立、權限設定、隱私保護與 credit 費用估算。

閱讀更多arrow_forward
JH LAI

SmartSub vs Scribis:兩款桌面 AI 字幕與語音工作站怎麼選?

從開源、離線/本地端、字幕翻譯、說話者辨識、配音、時間軸編輯、平台與價格等面向,比較 SmartSub 與 Scribis 的特色與適用情境。

閱讀更多arrow_forward
Manus AI

Subtitle Edit v5 vs Scribis:字幕精修與 AI 語音工作站,該怎麼選?

比較 Subtitle Edit v5 與 Scribis 的產品定位、字幕編輯、語音轉錄、時間軸、翻譯、影音處理、隱私與成本,協助創作者依照工作流程做出合適選擇。

閱讀更多arrow_forward

What'Sub vs Scribis:兩種字幕工作流,你該選哪一套?

對比 What'Sub 網頁字幕工具與 Scribis 桌面 AI 影音工作站,從轉錄、翻譯、樣式到硬體門檻與隱私安全,幫你找到最適合的字幕工作流。

閱讀更多arrow_forward
JH LAI

別再手動對字幕了!6 項更新幫你省下無聊的剪輯苦力活

為了解決上字幕這些打斷工作節奏的麻煩事,我們推出了這波更新。沒有空泛的技術名詞,只有 6 個能幫你早點下班的實用功能。

閱讀更多arrow_forward
JH LAI

2026 語音辨識技術完整指南:開源與閉源 ASR 系統選型與效能解析

探討 2026 年自動語音辨識 (ASR) 技術演進。從 OpenAI Whisper、SenseVoice 到台灣在地化模型,透徹解析企業如何透過混合路由架構降低成本並提升效能。

閱讀更多arrow_forward
JH LAI

聽懂人類語言的機器腦:2026年開源語音辨識模型架構、評測與硬體部署全解析

深入剖析 2026 年開源語音辨識技術,從 Wav2Vec 2.0、VibeVoice 到台灣在地化的 Breeze ASR,解析自迴歸與非自迴歸架構,並探討邊緣運算與醫療隱私的部署策略。

閱讀更多arrow_forward
JH LAI

如何選擇合適的 ASR 語音辨識模型:全面指南

市面上這麼多語音轉文字模型,該如何挑選?本指南針對不同使用場景,從即時串流到高精度離線轉錄,為您分析最適合的 ASR 模型。

閱讀更多arrow_forward
JH LAI

影片 OCR 與三款 AI 語音模型更新:減少筆記與輸入的切換干擾

整理影片筆記時頻繁切換視窗,或語音輸入遇到專有名詞辨識錯誤,常會打斷工作節奏。近期推出的影片 OCR 工具與 VibeVoice、Voxtral、Distil-Whisper 三款語音模型,主要針對這些輸入痛點提供了新的解決方式。

閱讀更多arrow_forward
JH LAI

開源語音辨識的新巨頭:Qwen3-ASR、Parakeet-TDT 與 SenseVoice Small

2026 年語音辨識領域迎來了範式轉移。我們深入分析了 Qwen3-ASR 的技術突破、NVIDIA Parakeet-TDT-0.6B-v3 的極致效率,以及阿里巴巴 SenseVoice Small 的多任務處理能力。

閱讀更多arrow_forward
JH LAI

Breeze ASR 25:聯發科在在地化語音辨識的重大突破

認識 Breeze ASR 25,這是聯發創新基地(MediaTek Research)最新的開源模型。針對台灣國語與中英混用進行優化,相較於 OpenAI Whisper,它在混合語音辨識上的表現提升了 56%。了解為什麼這款擁有 15.5 億參數的模型是在地 AI 應用的遊戲規則改變者。

閱讀更多arrow_forward
JH LAI

Breeze ASR 26:填補台語語音辨識空白的關鍵里程碑

聯發創新基地(MediaTek Research)推出 Breeze ASR 26,這是首款針對台語(台灣台語)深度優化的開源模型。作為 MR Breeze 3 系列的一員,這款擁有 20 億參數的模型精通國、台、英三語夾雜辨識,讓 AI 真正走進台灣的語言現實。

閱讀更多arrow_forward
JH LAI

體積縮減 49%、速度飆升 6 倍!英文語音辨識開源神器 Distil-Whisper 完整解析

面對龐大的雲端運算成本,企業該如何兼顧語音辨識的精準度與效率?Hugging Face 推出的 Distil-Whisper 透過「知識蒸餾」技術,打造出體積縮小 49%、推論速度飆升 6 倍的輕量級變體模型,且字錯率(WER)與原版差距保持在 1% 以內。本文將為您完整解析 Distil-Whisper 的核心優勢、技術原理與驚人的成本效益,帶您了解這款開源神器如何改變語音 AI 產業的遊戲規則!

閱讀更多arrow_forward
JH LAI

告別斷片!微軟開源 VibeVoice-ASR:60分鐘長音頻一次直出結構化逐字稿

處理長篇會議錄音總讓人頭痛?微軟開源語音 AI「VibeVoice-ASR」支援單次處理 60 分鐘長音頻,徹底解決上下文碎片化痛點。本文深度解析其如何一次生成包含說話人與時間戳記的 3W 結構化逐字稿,並附上本地端實戰部署指南。

閱讀更多arrow_forward
JH LAI

語音 AI 新霸主?Voxtral Mini 3B 深度評測:詞錯率低至 1.57 的輕量級多模態模型

面對高昂的雲端 API 成本與資料隱私考量,Mistral AI 的 Voxtral Mini 3B 提供了極佳的企業級解決方案。本文探討這款 30 億參數模型如何兼顧高精度語音轉錄與複雜語義理解,並介紹其在 Red Hat AI 平台的 FP8 動態量化部署優勢。看它如何以極低的硬體門檻,為跨國會議記錄與客服質檢帶來極致的性價比與資安保障。

閱讀更多arrow_forward
JH LAI

挑戰 Whisper 霸主地位!低於 500ms 的開源語音模型 Voxtral 4B 完整指南

語音 AI 的開源新紀元!Mistral 釋出採用 Apache 2.0 授權的 Voxtral Mini 4B Realtime,打破了高效能即時語音轉錄的商業生態限制。本文詳解其小巧卻強大的硬核架構,並分享生產級別的最佳環境參數設定,助您在注重隱私的本地設備上,快速建構低延遲、高精準的雙向互動系統。

閱讀更多arrow_forward