
把一份 .txt 純文字檔拖進線上「TXT 轉 SRT」工具,通常幾秒鐘就能得到一個看起來正常的 .srt 檔案——序號、時間碼、文字,格式全都對。但把它套到影片上播放,落差很快就會出現:第一句字幕可能第 3 秒就跳出來,畫面裡的人卻要到第 8 秒才開口,而且影片越長,這個時間差通常會越拉越大。
問題出在純文字本身。一份 .txt 檔案只有文字和換行,沒有任何時間長度、語速或停頓的資訊。任何只讀文字、不去讀對應音檔或影片的轉換流程,都不可能知道你的錄音實際在第幾秒說了哪一句話——它只能用某種估算規則(例如每行給固定秒數,或依字數換算成閱讀速度)去分配時間碼,猜的成分永遠大於量出來的成分。這篇說明這件事為什麼結構上就是如此,你手上材料不同時可以怎麼選,以及如果你的起點其實是一段錄音或影片,怎麼直接跳過「先有 TXT、再補時間碼」這一步。
為什麼純文字沒辦法自己算出準確的時間碼
一條 SRT 字幕的完整結構是序號、時間碼(00:00:03,120 --> 00:00:05,800 這種開始時間到結束時間)、字幕文字,再加一行空行標示這一條結束。時間碼需要精準到千分之一秒,理論上要對應到「這句話真正被說出來的那一刻」。
.txt 檔案完全不記錄這件事。它只是一串字元和換行符號,沒有波形、沒有音框、沒有任何跟時間相關的資料留在檔案裡。所以任何把純文字轉成 SRT 的流程,本質上只剩兩條路:
- 用公式估算——例如假設每個字需要幾分之一秒閱讀時間,或每一行固定給 2-3 秒,然後照這個假設往下排。
- 留白讓你自己填——工具生成的只是時間碼欄位的骨架,實際數字要你對著影片一條一條手動調整。
這兩條路都沒有真的解決問題,只是把猜測的工作搬到不同的地方——公式猜錯了你不會知道,留白則是把時間全部還給你自己。我這次實際查了幾個排名在「txt to srt」這個關鍵字前面的免費線上轉換工具,操作流程確實都只有「上傳 TXT 檔案」到「下載 SRT 檔案」這一步,頁面上沒有提供上傳對應音檔或影片的選項,也沒有說明時間碼是怎麼算出來的——這剛好印證了上面的結構性限制:這類工具收到的輸入本來就不包含語音,自然也就沒有語音時間點可以參考。
如果你手上還留著原始錄音或影片
如果你會需要 TXT 轉 SRT,通常是因為手上有一份逐字稿(可能是自己整理的訪談稿、會議紀錄,或是別的工具轉出來的文字檔),想幫它加上字幕用的時間軸。這時候真正該問的第一個問題是:原始的錄音或影片檔案還在嗎?
如果還在,直接拿原始音檔或影片重新做語音辨識,會比想辦法把現有 TXT 「補上」時間碼準確得多——差別在於,語音辨識是直接對著聲音的波形分析,量出每一段話實際開始與結束的位置,而不是憑字數去猜。Subanana 的 AI 字幕生成工具做的正是這件事:上傳原始音訊或影片後,系統會依你選的來源語言,自動路由到目前評測表現最好的語音辨識模型,直接輸出對好時間碼的 SRT,逐字稿本身反而變成附帶產物,不用再走「先產生 TXT、再轉成 SRT」這條回頭路。
如果你真的只剩 TXT,原始檔案已經不在了
有些情況原始錄音確實拿不回來——外包廠商只交付了逐字稿、舊專案的原始檔案已經刪除,或是這份 TXT 本來就是別人整理好轉寄給你的。這種情況老實說沒有捷徑,但可以按對時間準確度的要求分兩種處理:
- 不需要精準對到影格,只是要有大致的字幕節奏(例如翻譯校對用、抓大概的段落長度):線上 TXT 轉 SRT 工具可以先求有再求好,產出的時間碼會是均勻或依閱讀速度估算出來的,跟影片對不準是預期中的事,拿到之後還是得整份抓出來看一遍有沒有明顯脫節的地方。
- 需要精準對到畫面(要上架給觀眾看、要匯入剪輯軟體):用字幕編輯軟體人工對時,例如 Subtitle Edit(Windows 免費)或 Aegisub(跨平台免費),兩者都有波形顯示,可以一邊聽聲音一邊拖拉每一條字幕的起訖時間。這條路準,但一支十分鐘的影片手動對時通常要花上大半小時,是真正的體力活。
用 Subanana 從錄音或影片直接生成 SRT
如果材料還在,這是最省事、也是唯一能得到「跟語音真正對上」時間碼的做法。整體流程如下:

- 上傳影片或音訊檔案,或貼上公開連結——支援常見的影片格式(.mp4/.mov/.m4v/.webm/.mkv/.mpeg)與音訊格式(.mp3/.m4a/.wav/.ogg/.aac/.flac/.opus),也可以直接貼 YouTube、Instagram 或 Facebook 的公開連結,不必先下載到本機。單檔上限 30 GB、最長 8 小時,免費與付費方案通用,想一次處理多支檔案,也可以批次上傳。
- 選擇來源語言(中文(國語)、英文、日文、韓文等 95+ 種語言)。
- 系統自動辨識並對時——不綁死單一供應商,而是持續評測市面上的語音辨識模型,依來源語言挑選當前表現最好的一個來處理,辨識過程中如果偵測到某段輸出品質有問題,也會自動換一個模型重新處理那一段。
- 在編輯器檢視、修改文字與時間碼——過密、不易閱讀的字幕會被系統標出來,方便你優先修正,不用整份從頭看到尾。
- 匯出
.srt(或 VTT、TXT、DOCX、XLSX、Markdown,共 6 種格式,也可以一次打包全部匯出)。
免費方案可以完整上傳、預覽每個檔案前 15 分鐘的辨識結果,先拿自己的素材測試效果;但免費方案沒辦法匯出 SRT、VTT、TXT 等檔案,只能匯出有浮水印的影片。要實際把 SRT 字幕檔匯出來用,需要升級付費方案,費用由 US$9/月起(年繳),詳細方案可以參考方案費用頁面。
三種情況怎麼選
| 你的情況 | 建議做法 | 時間碼準確度 |
|---|---|---|
| 手上還有原始錄音或影片 | 直接用 AI 語音辨識重新生成 SRT | 準——依實際語音波形對時 |
| 只有 TXT,時間不用完全精準(校對、抓大致節奏用) | 線上 TXT 轉 SRT 工具 | 粗略估算,跟畫面通常對不準 |
| 只有 TXT,但需要精準對到畫面,原始檔案已經不在 | 用 Subtitle Edit / Aegisub 等軟體人工對時 | 準,但很花時間 |
常見問題
TXT 可以直接轉成 VTT 嗎?
如果起點一樣是沒有時間資訊的純文字,VTT 跟 SRT 遇到的是同一個問題——一樣需要時間碼,一樣沒辦法靠文字本身生出來。如果你手上是原始錄音或影片,用 Subanana 的 AI 字幕工具可以直接選擇匯出 VTT,不用先轉成 SRT 再另外轉檔。
可以一次批次轉換很多個 TXT 檔案嗎?
免費線上轉換工具大多一次只處理一份檔案。如果你的起點其實是多支錄音或影片,Subanana 支援一次過批次上傳多個檔案,各自依選定的來源語言辨識、產生字幕,不用一支一支重複操作。
用 Subanana 生成 SRT 之後,時間碼還能再手動調整嗎?
可以。匯出前都能在編輯器裡逐條檢視、修改文字與時間碼,系統也會把過密、不易閱讀的字幕標出來,方便你優先檢查;匯出之後如果還想再調整,也可以用 Subtitle Edit 之類的軟體對現有 SRT 檔案做微調。
手機上可以操作嗎?
Subanana 是網頁版工具,手機瀏覽器一樣能開啟、上傳檔案。不過上傳大檔案、逐條核對字幕文字與時間碼這類工作,畫面和操作在電腦上會順手很多,手機比較適合臨時看一下處理進度或結果。
結尾
TXT 轉 SRT 這個需求,結構上分成兩種完全不同的情況:手上還有原始錄音或影片,那就直接重新辨識,拿到真正對時的 SRT;手上真的只剩文字,那不管用什麼工具,時間碼都只能是估算出來的,差別只在於你願意花多少力氣人工修正。如果你正在處理的其實是一段錄音或影片,不妨直接試試
,省掉先產生純文字、再回頭補時間軸的這一圈。