用剪映剪好一條影片,到最後一步加字幕,卻發現自動辨識把廣東話和中英夾雜的句子認錯了一大半,而且匯出的字幕全是簡體,要逐句轉成繁體——這一段,往往比剪片本身更花時間。
其實字幕可以拆成兩步來做:先把「準確的繁體字幕」生成好,再把字幕檔匯入剪映排版。剪映負責畫面與花字,字的準確度交給專門做語音轉文字的工具。這篇教學會示範怎樣用 Subanana 生成準確的繁體字幕,匯出 SRT 後接回剪映的工作流程。先講清楚:我自己經營 Subanana,所以下面會用它做示範;不過這套「準確字幕+剪映排版」的思路,換成任何能匯出 SRT 的字幕工具都同樣成立。
直接答案:想幫剪映剪好的影片加上準確的繁體字幕,做法是先用專門的語音轉文字工具生成字幕、匯出 SRT 檔,再匯入剪映排版,用剪映的花字與動態效果完成畫面。下面逐步說明操作流程。

剪映自動字幕,對繁體用戶有什麼限制?
第一,輸出是簡體,要簡轉繁。剪映以簡體中文為主,自動字幕匯出的 SRT 通常也是簡體。香港、台灣用戶拿到之後要額外做簡轉繁,還要逐句校對用字(例如「视频」要改成「影片」、慣用語的差異),數量一多就相當費時。
第二,粵語與中英夾雜是難點。廣東話的九聲六調,加上香港內容常見的中英夾雜(「呢個 feature 幾好用」這種句子),對以華語為主的辨識模型特別容易出錯。剪映的自動字幕在純華語、發音清晰的內容上表現不錯,但一遇到粵語口語或中英混講,往往要大量人手修正。
平心而論,剪映的強項在另一邊:一站式剪輯、字幕花字與模板、轉場與動態效果、貼近社群短影片的排版,而且剪輯功能本身免費。它把「影片做得好看」這件事做得很全面,本來就不是、也不需要是一個粵語語音轉文字引擎。所以與其拿它的辨識去硬碰,不如讓兩邊各司其職。
為什麼先用 AI 生成繁體字幕,再匯入剪映?
Subanana 是專門做語音轉文字與字幕的工具,剛好補上剪映較弱的那一段:
- 直接生成繁體。粵語、華語、口語與書面語都是獨立的語言選項,你可以直接得到繁體字幕,省去簡轉繁。
- 為粵語與中英夾雜而設計。針對香港內容常見的廣東話、口語、中英夾雜處理;廣東話的口語與書面語是各自獨立的輸出/翻譯語言選項,想要書面語字幕,在揀語言那一步選「書面語」即可。字幕準確度怎樣靠得住,可以參考 Subanana 的 AI 字幕工具 的說明。
- 95+ 語言與雙語字幕。需要中英對照的話,可以匯出一個同時含原文與翻譯的雙語 SRT。
- 不只上傳檔案。除了上傳影片檔,也可以直接貼上公開的 YouTube、Instagram、Facebook 連結,Subanana 會抓取並轉錄。
- 背後會按來源語言挑選表現較好的模型,再經過校對流程,而不是一個模型一錘定音。
以上幾點合起來,決定了字幕生成後還要改多少;下面說明完整的操作步驟。
剪映加字幕的步驟是什麼?(Subanana 生成 → 匯入剪映)

- 把影片放進 Subanana。上傳影片檔,或直接貼上公開的 YouTube/IG/FB 連結。
- 選語言與模式。選好來源語言(例如廣東話或華語);想要書面語字幕,就在這一步把輸出或翻譯目標語言揀成「書面語」。需要雙語就加一個翻譯目標;字幕模式可以一次輸出多個語言版本。
- 生成並快速校對。AI 生成字幕後,在編輯器裡逐句校對錯字、人名與專有名詞。可以順手參考 三個 AI 字幕小秘訣 提升準確度。
- 匯出 SRT。匯出 SRT 字幕檔(要中英對照就匯出雙語 SRT)。Subanana 也支援 VTT、TXT、DOCX 等格式。
- 匯入剪映排版。在剪映專業版按「文本 → 新建文本 → 導入本地字幕」,選擇剛才匯出的 SRT 檔(剪映支援 SRT 等字幕格式;介面路徑可能隨版本微調)。匯入後就用剪映的花字、字體與動態效果去排版。
想省略剪映那一步?如果你要的只是一條「已經燒好字幕」的成品影片,Subanana 也可以一鍵輸出燒錄字幕的影片(單語或雙語),不一定每次都要再進剪映。
SRT 字幕檔要用 UTF-8,避免匯出後變亂碼
字幕檔本質上是一個純文字檔加時間碼,但編碼一旦出錯,打開時中文字就會變成問號、方框,或者一串完全對不上的符號——這種情況在繁體中文字幕特別常見,尤其是字幕檔在不同工具之間反覆匯出、匯入的時候。常見的觸發點是:用了預設編碼不是 UTF-8 的舊版文字編輯器改過檔案,或者把字幕檔用郵件、即時通訊軟件傳來傳去,中途被轉了一次編碼。
粵語口語常用的一些字(例如「嘅」「咗」「喺」)本身已經不算最常見的中文字,一旦編碼出錯,這類字往往最先看得出不對勁,反而變成一個順手的檢查點。如果打開 SRT 檔發現中文變成亂碼,第一步不是重新生成字幕,而是先檢查檔案的編碼:用文字編輯器(例如 VS Code、Notepad++)打開該檔案,查看目前的編碼,然後另存為 UTF-8(不建議用帶 BOM 的 UTF-8,部分排版軟件無法正確識別),再重新匯入排版。如果同一個 SRT 檔要交給不同的人或不同的軟件用,最好先在自己電腦上打開確認一次顯示正常,再傳出去,比匯入之後才發現變亂碼再回頭排查快得多。養成這個檢查習慣,可以省下不少「明明生成正確,匯入後卻整段變問號」的來回排查時間,尤其是字幕檔會經過多人、多個裝置傳遞的時候。
校對粵語字幕的清單:五個最容易出錯的地方
不論用哪一個工具生成,粵語字幕都值得花時間校對一次,尤其是以下幾類最容易出錯:
- 人名與品牌名。 AI 對不常見的人名、公司名、產品名特別容易讀錯或寫錯字,例如同音的英文品牌名被寫成普通名詞、嘉賓的名字每次生成寫法都不一樣。第一次出現就核對正確寫法,後面重複出現的地方可以用同一個詞快速搜尋,逐一核對一次,比事後被觀眾指出更省心。
- 專有名詞與術語。 行業用語、內部代號、外語詞彙夾雜,未必識別得到上下文,容易被寫成發音相近但意思完全不同的字,需要人手核對,尤其是第一次在影片裡出現的那一句。
- 口語助詞。 廣東話口語裡的「啦」「喎」「嘅」「咗」等助詞,寫法有慣用習慣,也有場合不適合出現在正式字幕裡(例如企業簡介、教學影片),校對時要留意語境是否需要保留,還是要收成比較書面的講法。
- 數字與英文夾雜。 日期、金額、型號、英文縮寫夾在廣東話句子中間,容易被誤判斷句位置;金額、電話號碼這類數字,用阿拉伯數字還是中文數字表示,最好按內容場合統一一套規則,再逐句核對數字有沒有讀錯或漏聽。
- 同音字。 廣東話同音字多,有時會選錯字(例如意思相近但寫法不同的詞),這類錯誤肉眼掃過去容易漏過,尤其是句子讀起來語意也算通順的情況,最好逐句對照原音檔,而不是只看字幕本身順不順。
這五類逐一過一次,通常已經能處理掉大部分需要人手修正的地方。
字幕行文規範:斷句、停留時間與標點
字幕好不好讀,除了用字是否正確之外,行文規範同樣重要,尤其是以下幾點:
- 每行字數不要太多。 字幕是給觀眾在有限時間內掃視的,一行塞太多字,觀眾看字幕就會錯過畫面,寧願拆成兩行,也不要擠成一行長句。
- 停留時間要留夠。 一句字幕在畫面上出現的時間,要讓觀眾來得及看完再消化,語速快的內容尤其要注意,不要讓字幕一閃即過。
- 斷句要跟語意,不要跟呼吸。 分句的位置應該落在意思完整的地方,而不是按說話者換氣的停頓來切——按呼吸斷句容易把一個完整意思拆成兩句不完整的字幕,反而更難讀。
- 標點要克制。 逗號、頓號可以幫助斷意,但句號、驚嘆號、問號這些收尾標點在字幕裡通常可以省略,因為畫面切換本身就是一種「句子結束」的訊號。
- 用字前後一致。 同一個人名、同一個術語,全片要用同一種寫法;「你」「妳」、書面語或口語的取捨,也是決定一次就用到底,不要中途換風格,觀眾會覺得字幕像是幾個人分開打的。
這幾點都是通用的字幕製作習慣,跟用哪一種語言、哪一個工具無關,卻直接影響觀眾會不會把整條字幕看完。編碼正確、校對過人名術語、行文又統一,這條 SRT 才算真正準備好匯入剪映排版。
什麼時候單用剪映就夠?
如果你的內容是純華語、發音清晰,又不講究繁體精準(或你本來就用簡體),剪映的自動字幕已經夠用,省事為上。
但只要涉及廣東話、中英夾雜、要交付繁體,或者字幕準確度會直接影響觀感(教學、訪談、客戶內容),先生成準確的繁體字幕再匯入剪映,通常比事後逐句修正省時得多。想先比較不同字幕工具的取捨,可以看 五款 AI 字幕 App 實測比較。
字幕拆成兩步:準確的字交給語音轉文字工具,好看的畫面交給剪映。對香港與台灣的繁體內容來說,這一步往往能省下大量簡轉繁與修錯的時間。