用 AI 上字幕時,斷句常常斷在奇怪的地方——右側是逐句字幕與時間碼

為什麼 AI 上的字幕,斷句老是斷在奇怪的地方

用 AI 上字幕,最煩的其實不是它把字聽錯。

錯字很好處理,用搜尋取代掃一遍就完了。真正折磨人的是這種東西:

我是開車前往 Sellfoss 這段路
過去我很少來過

明明中間有停頓,它偏偏不斷;不該斷的地方倒是斷得很乾脆。你得一句一句手動去切,切到最後會開始懷疑人生。

我做字幕工具這段時間,被問最多的就是這個。而幾乎每個人都以為,這是「AI 不夠聰明」。

斷句其實不是 AI 決定的

這是最關鍵的一件事:你看到的斷句,絕大多數不是辨識模型決定的。

AI 模型的工作,是把聲音變成文字、順便標出每個字的時間點。斷句是在那之後才發生的——由軟體自己照幾條寫死的規則去切。

以我自己做的工具為例,規則就三條:

  1. 講話停頓超過 0.6 秒 → 換行
  2. 中文累積到 16 個字 → 換行
  3. 碰到句號、問號、驚嘆號 → 換行

而且順序上是「字數先算」——額度一滿就先收行,不會等你講完那句話。

各家軟體的數字不一樣,但邏輯大同小異。知道這件事之後,前面那兩個問題就都說得通了。

為什麼明明有停頓,它卻不斷?

因為那個停頓沒有超過門檻。

人講話的自然停頓,常常只有 0.3 到 0.5 秒。你耳朵聽起來「明顯停了一下」,但對程式來說還不到 0.6 秒,它就不當作斷點,繼續往下接。

老實說,0.6 秒這個門檻我自己訂得太寬鬆了,這是我的問題,已經排進調整。但你如果用的是別家的軟體,也可以用同樣的方式去理解它為什麼不斷——去想它的門檻是多少,而不是想它是不是笨

為什麼中英夾雜特別容易壞?

這個坑更隱蔽。

中文一行算 16 個字,但英文單字怎麼算?很多軟體(包括我早期的版本)是按字母去吃中文的字數額度

所以「Sellfoss」這一個字,等於 8 個字,一口氣吃掉一行 16 字裡的一半。剩下的額度撐不到句子講完,就在莫名其妙的地方斷掉了。

這也是為什麼,你的片子只要出現產品名、外國地名、專業術語,斷句就會特別亂。

(純英文影片是另一套算法,一行 42 個字母,這是國際字幕的慣例。)

所以,換一個更大的 AI 模型有用嗎?

沒有。

這是我想澄清的最大誤解。很多人斷句斷不好,第一個反應是去換更大的模型、或把「辨識品質」調到最高。

但模型換大,改變的是聽寫的準確度時間點的精準度。斷句規則還是那三條,一個字都沒變。

模型變準之後,時間點會跟著變準,切點間接會好一點——但那是副作用,不是解法。花三倍的時間跑一個大模型來解斷句,投報率很差。

在軟體改好之前,怎麼自救

三個實務做法,順序是我建議的優先度:

  1. 錄的時候就把停頓留足 — 這是最有效的一招,而且零成本。該斷句的地方,刻意停滿一秒。你會發現字幕品質整個不一樣。
  2. 先切再修 — 辨識完之後,用分割快捷鍵(多數軟體是 Ctrl/⌘+K)把長句切開,比起一行一行重打快非常多。
  3. 同音錯字用搜尋取代批次處理 — 「誕是」改「我是」這種,一次改完,不要一個一個點。

為什麼我會知道這些

因為這些坑我全部踩過。

我做了一套叫 FatSub 胖字幕 的工具,Mac 和 Windows 都能跑,字幕辨識在你自己的電腦上完成、不用上傳雲端。上面講的三條規則,就是它的邏輯;中英夾雜那個算法的問題,也是使用者回報之後我才修掉的。

不過就算你不用我的工具,這篇的東西也帶得走——斷句是規則,不是玄學。看懂規則,你在任何軟體裡都能預判它會斷在哪、為什麼斷在那,然後決定要遷就它,還是先把講話的節奏調整好。

那才是真正省時間的地方。


不想再一句一句手動切字幕?

FatSub 胖字幕.Mac & Windows.辨識在你自己的電腦上跑,不用上傳雲端.買斷制,字幕功能永久免費升級

最後想問問你:你遇過最扯的斷句是什麼? 留言貼給我看,我挑幾個來拆解它為什麼會斷成那樣。

下一篇我想聊另一個很常被搞混的:模型選 Small、Medium 還是 Large,跟「辨識品質」那三檔,到底差在哪。同一支影片我每個設定都實測跑過,數字有點出乎意料。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

返回頂端

嗨!朋友為了能提供更多優質內容,本網站使用 cookies 分析技術。若繼續瀏覽本網站,即表示您同意我們使用 cookies,關於更多 cookies 資訊請閱讀 隱私權政策