產品更新

影片 OCR 與三款 AI 語音模型更新:減少筆記與輸入的切換干擾

personJH LAI
calendar_today

整理影片筆記時頻繁切換視窗,或語音輸入遇到專有名詞辨識錯誤,常會打斷工作節奏。近期推出的影片 OCR 工具與 VibeVoice、Voxtral、Distil-Whisper 三款語音模型,主要針對這些輸入痛點提供了新的解決方式。

看國外教學影片時,如果想記錄內嵌的簡報字幕,通常得反覆暫停、切換視窗並手動輸入。這種在播放器和筆記軟體間來回切換的過程,很容易打斷原有的思緒。

語音輸入也有類似的狀況。雖然口述通常比打字快,但在吵雜的環境中,或當對話夾雜 API、Prompt 等中英術語時,辨識錯誤往往會增加額外的手動修改時間,導致許多人寧願放棄使用。近期的工具更新,針對這兩種情境提供了較為實際的作法。

影片 OCR 工具:直接框選提取文字

過去要擷取影片上的硬字幕,不是認命手打,就是得下載整支影片去跑語音辨識。

新版影片播放器加入了直接選取的 OCR 功能。現在看到想要的簡報字卡或程式碼,用滑鼠框選畫面,系統就能將圖片轉為純文字。這省去了手動輸入的步驟,減少了觀看與作筆記之間的切換頻率。這類工具的設計初衷,主要在於降低工作時的認知負擔,有興趣的話可以參考 [認知負荷與生產力] 的相關研究。

三款語音模型:針對速度與抗噪設計

語音輸入的實用性,很大程度取決於辨識準確度。目前的系統支援 VibeVoice、Voxtral 和 Distil-Whisper 三款模型,讓使用者可以依據當下的環境選擇。

  • Distil-Whisper:特點是輕量與低延遲。在安靜環境下,它能以極快的速度處理口述紀錄,適合在需要快速捕捉靈感時使用。
  • VibeVoice 與 Voxtral:這兩款模型偏向處理吵雜環境或中英夾雜的場景。根據開發社群提供的基準測試,VibeVoice 在開源模型中辨識率名列前茅,Voxtral 也具備高度準確性。在背景音樂較大或術語較多的情況下,它們能減少事後手動修正錯字的比例。

實際應用的節奏

在日常工作流中,這兩項工具的分工很單純:遇到螢幕上的靜態資訊,用 OCR 框選截取;需要快速記錄口頭想法時,開啟語音模型輔助。

這些更新並不會自動幫你寫出有深度的文章,但它們確實能把手動抄寫與改錯字的時間省下來。把這些瑣碎的勞動交給工具,你才有更多餘裕去處理內容本身的邏輯與觀點。