用 AI 上字幕,最煩的其實不是它把字聽錯。
錯字很好處理,用搜尋取代掃一遍就完了。真正折磨人的是這種東西:
我是開車前往 Sellfoss 這段路
過去我很少來過
明明中間有停頓,它偏偏不斷;不該斷的地方倒是斷得很乾脆。你得一句一句手動去切,切到最後會開始懷疑人生。
我做字幕工具這段時間,被問最多的就是這個。而幾乎每個人都以為,這是「AI 不夠聰明」。
斷句其實不是 AI 決定的
這是最關鍵的一件事:你看到的斷句,絕大多數不是辨識模型決定的。
AI 模型的工作,是把聲音變成文字、順便標出每個字的時間點。斷句是在那之後才發生的——由軟體自己照幾條寫死的規則去切。
以我自己做的工具為例,規則就三條:
- 講話停頓超過 0.6 秒 → 換行
- 中文累積到 16 個字 → 換行
- 碰到句號、問號、驚嘆號 → 換行
而且順序上是「字數先算」——額度一滿就先收行,不會等你講完那句話。
各家軟體的數字不一樣,但邏輯大同小異。知道這件事之後,前面那兩個問題就都說得通了。
為什麼明明有停頓,它卻不斷?
因為那個停頓沒有超過門檻。
人講話的自然停頓,常常只有 0.3 到 0.5 秒。你耳朵聽起來「明顯停了一下」,但對程式來說還不到 0.6 秒,它就不當作斷點,繼續往下接。
老實說,0.6 秒這個門檻我自己訂得太寬鬆了,這是我的問題,已經排進調整。但你如果用的是別家的軟體,也可以用同樣的方式去理解它為什麼不斷——去想它的門檻是多少,而不是想它是不是笨。
為什麼中英夾雜特別容易壞?
這個坑更隱蔽。
中文一行算 16 個字,但英文單字怎麼算?很多軟體(包括我早期的版本)是按字母去吃中文的字數額度。
所以「Sellfoss」這一個字,等於 8 個字,一口氣吃掉一行 16 字裡的一半。剩下的額度撐不到句子講完,就在莫名其妙的地方斷掉了。
這也是為什麼,你的片子只要出現產品名、外國地名、專業術語,斷句就會特別亂。
(純英文影片是另一套算法,一行 42 個字母,這是國際字幕的慣例。)
所以,換一個更大的 AI 模型有用嗎?
沒有。
這是我想澄清的最大誤解。很多人斷句斷不好,第一個反應是去換更大的模型、或把「辨識品質」調到最高。
但模型換大,改變的是聽寫的準確度和時間點的精準度。斷句規則還是那三條,一個字都沒變。
模型變準之後,時間點會跟著變準,切點間接會好一點——但那是副作用,不是解法。花三倍的時間跑一個大模型來解斷句,投報率很差。
在軟體改好之前,怎麼自救
三個實務做法,順序是我建議的優先度:
- 錄的時候就把停頓留足 — 這是最有效的一招,而且零成本。該斷句的地方,刻意停滿一秒。你會發現字幕品質整個不一樣。
- 先切再修 — 辨識完之後,用分割快捷鍵(多數軟體是 Ctrl/⌘+K)把長句切開,比起一行一行重打快非常多。
- 同音錯字用搜尋取代批次處理 — 「誕是」改「我是」這種,一次改完,不要一個一個點。
為什麼我會知道這些
因為這些坑我全部踩過。
我做了一套叫 FatSub 胖字幕 的工具,Mac 和 Windows 都能跑,字幕辨識在你自己的電腦上完成、不用上傳雲端。上面講的三條規則,就是它的邏輯;中英夾雜那個算法的問題,也是使用者回報之後我才修掉的。
不過就算你不用我的工具,這篇的東西也帶得走——斷句是規則,不是玄學。看懂規則,你在任何軟體裡都能預判它會斷在哪、為什麼斷在那,然後決定要遷就它,還是先把講話的節奏調整好。
那才是真正省時間的地方。
不想再一句一句手動切字幕?
FatSub 胖字幕.Mac & Windows.辨識在你自己的電腦上跑,不用上傳雲端.買斷制,字幕功能永久免費升級
最後想問問你:你遇過最扯的斷句是什麼? 留言貼給我看,我挑幾個來拆解它為什麼會斷成那樣。
下一篇我想聊另一個很常被搞混的:模型選 Small、Medium 還是 Large,跟「辨識品質」那三檔,到底差在哪。同一支影片我每個設定都實測跑過,數字有點出乎意料。
