「錄音翻譯」這個詞背後其實藏了兩個步驟:第一步把錄音轉成原始語言的文字,第二步才是把文字翻譯成目標語言。搞混這兩步,是多數人卡住的原因。
如果沒有先理解這兩個步驟,就容易把語音辨識錯誤誤認為翻譯品質問題。原文如果沒有正確轉錄,後面的翻譯自然不可能準確。本文將說明完整流程,並示範如何用 Subanana 將錄音檔轉成可閱讀、可編輯和可匯出的翻譯文字稿。
錄音翻譯其實包含兩個步驟

錄音翻譯的核心流程如下:
| 步驟 | 主要工作 | 影響結果的重點 |
|---|---|---|
| 語音轉文字 | 將錄音轉成原始語言文字稿 | 聽寫內容、標點、段落和專有名詞 |
| 文字翻譯 | 將原文轉成目標語言 | 語意、語氣和專有名詞的一致性 |
第一步:先將語音轉成文字
語音轉文字,也稱為轉錄,是將錄音中的人聲辨識成文字。這一步必須先處理,因為翻譯工具需要文字內容才能理解上下文。
轉錄結果的品質會直接影響翻譯結果。若原始錄音中的人名、公司名稱或專業術語被辨識錯誤,翻譯系統就會以錯誤內容為基礎繼續處理。
錄音中的背景噪音、多人同時說話、口音、語速和中英夾雜,都可能影響轉錄結果。因此,錄音翻譯不只是把檔案放進翻譯工具,而是先建立一份可靠的原文稿。
第二步:將文字翻譯成目標語言
完成原文轉錄後,系統才能把文字翻譯成中文、英文、日文、韓文或其他目標語言。
好的翻譯不應只做逐字對照。它需要保留原文的語意、語氣和上下文,也要讓句子符合目標語言的閱讀習慣。
專有名詞的一致性同樣重要。例如產品名稱、人名、地名和技術詞彙,如果在不同段落使用不同譯法,讀者就可能無法確認它們是否指向同一個對象。
手動兩步與一站式工具的差異
傳統做法通常需要使用兩個工具。先將錄音轉成文字,再把整份文字複製到另一個翻譯工具。
這種流程在短錄音中仍然可行,但長篇訪談或會議會增加許多重複工作。你需要檢查轉錄內容是否完整,也要確認翻譯後的段落和原文是否對齊。
| 手動使用兩個工具 | 使用一站式錄音翻譯工具 |
|---|---|
| 先轉錄,再複製文字到翻譯工具 | 在同一個流程中完成轉錄與翻譯 |
| 需要自行整理格式 | 系統保留段落或字幕時間軸 |
| 需要人工核對原文與譯文 | 可在同一個編輯器中檢查內容 |
| 專有名詞可能在兩個工具中不一致 | 可使用詞彙表統一指定寫法 |
| 長篇錄音需要較多複製與整理 | 長篇檔案的處理流程較集中 |
一站式工具仍然要做語音轉文字這一步,差別在於轉錄、翻譯、校對和匯出全部發生在同一個編輯器裡:先在詞彙表(Glossary)指定人名、專有名詞的寫法,系統翻譯時會優先採用,不用分別在兩個工具裡各修一次。錄音超過一小時(例如整場訪談或會議)時,這個差別最明顯——手動流程光是核對原文與譯文有沒有對齊,就要花掉不少時間。
用 Subanana 將錄音檔翻譯成文字稿
Subanana 可以將上傳的音訊或影片轉錄,再翻譯成指定語言。你也可以直接貼上公開的 YouTube、Instagram 或 Facebook 連結。
1. 匯入錄音或影片
登入 Subanana 後,先上傳需要處理的檔案。支援的格式包括:
.mp3.wav.m4a.mp4.mov.webm.ogg
單一檔案上限為 30 GB 或 8 小時。這項上限適用於所有方案,包括免費方案。
如果內容已經發布在公開平台,也可以貼上 YouTube、Instagram 或 Facebook 的公開連結。系統會取得內容後進行後續處理。
2. 選擇轉錄模式或字幕模式
接著選擇要產出的內容類型。
如果你需要閱讀、引用或整理訪談內容,請選擇轉錄模式。這個模式會產生包含標點符號和段落的文字內容,適合製作文章、研究筆記或會議紀錄。
如果你要處理影片,請選擇字幕模式。字幕模式會依照時間軸將內容切成較短的句子,方便放回影片中使用。
3. 設定來源語言和翻譯目標語言
先指定錄音使用的來源語言,再選擇要翻譯成的目標語言。
轉錄模式和會議模式支援一個翻譯目標。字幕模式則可以一次設定多個翻譯目標語言,讓同一個上傳檔案產出多個語言版本。
例如,一段中文訪談可以轉成英文字幕,也可以同時產出日文或韓文字幕。這樣不需要為每種語言重複上傳同一個檔案。
4. 使用詞彙表並校對內容
處理完成後,可以在編輯器中檢查轉錄和翻譯結果。人名、公司名稱、產品名稱或專業術語都可以直接修改。
如果內容包含固定寫法,建議在處理前建立詞彙表(Glossary)。詞彙表可以讓系統在翻譯時優先採用你指定的寫法,減少同一個名稱在不同段落出現不同翻譯的情況。
校對時可以優先檢查以下內容:
- 人名和公司名稱是否正確。
- 數字、日期和專業術語是否完整。
- 句子是否因為口語停頓而出現不自然斷句。
- 翻譯後是否保留原文的重點和語氣。
轉錄與翻譯仍然應該經過人工確認,尤其是法律、醫療、研究或對外發布的內容。AI 可以縮短整理時間,但不能取代重要內容的最終審閱。
5. 匯出可使用的檔案
完成校對後,可以依照用途選擇匯出格式。
轉錄模式可以匯出:
- TXT
- DOCX
- XLSX
- Markdown
字幕模式可以匯出:
- SRT、VTT、TXT、DOCX、XLSX、Markdown(六種單獨匯出,或打包成 ZIP)
- 雙語對照 SRT(原文與譯文同檔案,依時間碼上下排列)
雙語對照 SRT 會將原文和譯文放在同一個字幕檔案中,依照時間軸上下排列兩種語言,適合製作雙語影片或進行翻譯校對。
免費方案可以產生並預覽上傳檔案的前 15 分鐘內容,但無法匯出逐字稿或字幕檔案。免費方案也不能在編輯器中選取並複製文字,並且每月最多可上傳 3 個檔案。
免費方案唯一提供的匯出內容是加上浮水印的影片。影片上限為 5 分鐘,解析度上限為 720p。若要匯出 TXT、DOCX、XLSX、Markdown、SRT、VTT 或雙語對照 SRT,需要使用付費方案。
目前翻譯功能不會在轉錄費用之外另外收費。付費方案也會移除浮水印,並解鎖完整匯出格式。可在方案費用頁查看目前的美元定價。
錄音翻譯常見問題
哪裡可以即時翻譯錄音檔?
「即時」和「錄音檔」是兩種不同情境:Subanana 的即時字幕翻譯功能是針對正在進行的活動或會議,讓觀眾即時看到多語字幕;如果你手上已經是錄好的檔案,走的是本文說的轉錄+翻譯流程,不是即時通道。免費方案可預覽前 15 分鐘,但無法匯出文字稿或字幕檔案。
iPhone 可以錄音轉文字嗎?
可以,常見的 .m4a 格式可以直接匯入 Subanana 處理。但轉成文字只完成一半——如果錄音內容需要翻譯,匯入後還要另外設定翻譯目標語言,才能拿到其他語言版本。
錄音檔如何轉成逐字稿?
上傳錄音檔後選轉錄模式,系統會辨識內容並產生包含標點符號和段落的文字稿(不是按時間切碎的字幕行)。Subanana 支援單一檔案最高 30 GB 或 8 小時,免費方案每月可上傳 3 個檔案並預覽前 15 分鐘;要匯出逐字稿檔案則需要付費方案。
如何將聲音轉換成文字?
匯入音訊檔、設定正確的來源語言後開始轉錄。完成後可以在編輯器修正錯字、補充專有名詞,用詞彙表固定人名和術語的寫法——這一步決定的是準確度,跟要不要翻譯是兩件事。
錄音翻譯的關鍵,是先取得可靠的原文,再產生符合語意的目標語言內容。使用整合轉錄、翻譯、校對和匯出的流程,可以更快取得真正能使用的翻譯文字稿。
如果你想先了解多人錄音如何分辨不同講者,可以閱讀語音轉文字如何分辨講者。