我經營 Subanana,這篇教學會用它示範流程。近兩年台灣的 podcast 節目愈來愈多會剪成短片放上 YouTube、Instagram、Threads,這些平台的自動播放預設是靜音,沒有字幕的影片很多人滑過去就沒了。如果節目本身有國際聽眾,或主持人、來賓講的內容夾雜英文,多語言字幕能讓這集內容被聽不懂中文的人看懂、看到。這篇把從一份錄音檔到多語言字幕影片的實際流程整理出來。

逐字稿和字幕,用途不一樣
逐字稿是整段對話的文字紀錄,適合做成部落格文章、SEO 內容,或給聽眾之後回頭查資料用。字幕是切好時間軸、跟著畫面或聲音同步顯示的短句,是給看影片的人用的,可以直接翻成另一種語言、燒錄進影片裡發布。一段有繁體中文加英文雙語字幕、可以直接發到 YouTube 的短片,跟單純的逐字稿,觸及到的族群完全不一樣。
完整流程:從音檔到多語言字幕影片

實際操作分成四步,每一步都會影響最後字幕的品質:
第一步:上傳音檔或影片。 podcast 通常是純音檔(mp3/wav),如果已經剪成有畫面的影片版本,直接上傳影片檔也可以。Subanana 單檔支援到 30GB、8 小時,所有方案(含免費版)的檔案大小與長度上限都一樣,差別在後面能不能匯出。
第二步:自動逐字稿與講者辨識。 系統會自動把音檔轉成文字,同時辨識不同的講者,這對有主持人加來賓的節目特別重要,字幕才不會把兩個人講的話混在一起,變成同一行。
第三步:AI 校對與翻譯。 轉出來的逐字稿先做一次 AI 校對潤飾,處理明顯的辨識錯字,接著才是翻譯成目標語言。Subanana 涵蓋 95+ 種語言的轉錄與翻譯,用同一份語言清單,不會出現「這個語言能轉錄但不能翻成字幕」的落差。節目內容如果有固定的人名、術語或品牌名稱,可以先建立詞彙庫,翻譯時系統會照著詞彙庫的寫法產出,每一集的譯名可以保持一致。
第四步:匯出字幕或直接匯出燒錄好字幕的影片。 校對完成後,可以匯出 SRT、VTT、TXT、DOCX、XLSX、Markdown 六種格式的字幕或逐字稿檔,交給剪輯軟體(DaVinci Resolve、Premiere、Final Cut Pro 都吃得下 SRT/VTT)自己上字幕;也可以直接在 Subanana 裡匯出已經燒錄好字幕的影片檔,單語或雙語對照都可以,不用另外找剪輯軟體。可以到 AI 字幕生成工具 頁面先看實際操作畫面。
多語言字幕實際會遇到的幾個問題
多位主持人/來賓的講者辨識。 一集節目如果有三、四個人同時聊天,講話會互相蓋過去,自動辨識的難度比單人獨白高。上傳前先確認錄音品質,背景音樂、雜訊愈少,辨識出來的講者分行會愈準確。
術語和專有名詞的一致性。 訪談型節目常有固定來賓、固定術語,每一集翻譯若各翻各的,看久了會顯得不專業。前面提到的詞彙庫功能可以解決這個問題,設定一次,之後每一集都套用同樣的譯名。
免費版能不能做完整流程。 免費版可以上傳、可以看到每個檔案前 15 分鐘的轉錄與翻譯結果,用來確認辨識品質、語言支援夠不夠用。免費版不提供字幕或逐字稿的匯出功能;正式要拿到可以用的字幕檔,需要 Lite 以上的方案(年繳等於每月 US$9 起)。
常見問題
Podcast 逐字稿和多語言字幕有什麼不一樣? 逐字稿是完整對話的文字紀錄,沒有切時間軸,適合拿來做成文章或搜尋引擎能讀的內容。字幕是切好時間軸、跟著聲音或畫面同步顯示的短句,做完可以直接燒錄進影片或匯出成 SRT/VTT 檔,兩者用途不同,字幕才是給觀眾邊看邊讀用的格式。
免費版可以做多語言字幕嗎? 免費版可以上傳並看到每個檔案前 15 分鐘的轉錄與翻譯結果,用來確認語言和辨識品質夠不夠用,正式匯出字幕檔或逐字稿需要付費方案。
只有音檔沒有影片,也能上多語言字幕嗎? 可以。字幕本質上是跟著時間軸走的文字檔(SRT/VTT),不一定要先有畫面。純音檔一樣可以轉出逐字稿、翻譯、匯出字幕檔,之後要不要燒錄進影片是另外一個步驟,兩者可以分開處理。
一集節目做多語言字幕大概要多久? 主要看單集長度和講者人數。自動轉錄與翻譯的處理時間通常是音檔長度的一小部分,大部分時間會花在校對翻譯用詞、確認講者分得對不對,這部分需要人工檢查,內容愈重要,值得花的校對時間就愈多。
愈常發布的節目,愈值得把詞彙庫、流程先建立起來,之後每一集都能用同一套做法處理,省下每一集重新校對譯名的時間。