caption 中文是什麼?字幕英文怎麼說?caption、subtitle、CC、逐字稿差別一次看懂

caption 中文是什麼?字幕英文怎麼說?caption、subtitle、CC、逐字稿差別一次看懂

在影音語境中,caption 中文=字幕(無障礙用,同語言);字幕英文則依情境用 caption 或 subtitle。captioning 的中文是「字幕製作」,指的是把聲音內容轉成帶時間軸文字的這個動作;名詞 caption 的中文才是「字幕」。台灣日常講的「字幕」在英文裡通常對應 subtitle,而 CC 是 closed captioning 的縮寫,中文叫隱藏式字幕。這四個詞在中文裡幾乎混用,但在英美的無障礙規範裡意思並不相同,而且會直接影響你交出去的檔案該長什麼樣子。

一句話定義 caption 中文=字幕(無障礙用,同語言)。 字幕英文=caption 或 subtitle,視情境而定。

常見用法例句:

  • "Please add captions to this video." →「請幫這支影片上字幕。」(在英美無障礙語境中,caption 通常指同語言、含音效資訊的字幕)
  • "This French documentary has English subtitles." →「這部法語紀錄片有英文字幕。」(這裡是翻譯用的 subtitle,不是 caption)

我經營 Subanana,一套 AI 字幕與逐字稿工具。這篇只做定義整理,起因是我們每天都看到有人把這幾個詞當成同義詞,然後在交件時才發現對方要的不是自己做的那一種。先把定義弄清楚,後面選工具才不會選錯。

captioning 中文是什麼:caption、subtitle、CC、逐字稿差別解析

caption、subtitle、CC、逐字稿:四個詞差在哪?

先講一個很多中文教學不會說的前提:caption 和 subtitle 的差別,本質上是地區用法差異,不是絕對的技術分野。

W3C 的無障礙教育資源(WAI)寫得很直白:同一件事,不同地區用不同的字。原文是:「The terms "captions" and "subtitles" are used for the same thing in different regions of the world.」W3C 自己在那份文件裡採用的區分方式是:caption 指與口說語言相同語言的文字,subtitle 指其他語言的版本。

真正有實質差別的,是這一句:「Captions are needed for accessibility, whereas subtitles in other languages are not directly an accessibility accommodation.」caption 是無障礙需求,翻譯用的 subtitle 不是。

美加地區的慣例,中文維基百科的〈隱藏式字幕〉條目有更完整的說明:「在美國和加拿大,「subtitles」與「captions」有不同含義。「Subtitles」通常假設觀眾能聽見,但無法理解語言或口音……而「captions」則旨在為聾人和聽力障礙者傳達所有重要的聲音資訊——包括對白、非語言聲音資訊(如說話人身分、語氣),以及重要的音樂或音效。」

整理成一張表:

中文內容涵蓋主要目的你會拿到的檔案
caption字幕(無障礙用)對白+非語音聲音資訊(音效、說話人、語氣)讓聽不到的人取得完整資訊SRT / VTT,含音效標記
subtitle字幕(翻譯用)只有對白與必要畫面文字讓聽得到但不懂該語言的人理解SRT / VTT
closed caption(CC)隱藏式字幕同 caption觀眾可自行開關獨立字幕檔或播放器軌道
open caption開放式字幕同 caption永遠顯示,不能關已燒錄進影片畫面
transcript逐字稿完整文字,無時間軸閱讀、搜尋、存證、做會議紀錄DOCX / TXT / Markdown

最後一列是實務上最容易踩到的:逐字稿和字幕不是同一種東西。字幕要短、要切句、要對時間軸;逐字稿要完整、要標點、要分段。同一段音訊,兩種輸出的排版邏輯是相反的。

把這五個詞放進同一張圖,關係會更清楚:三個分支的差別不在技術,而在「做給誰看」:

caption、subtitle、CC、逐字稿的關係圖:無障礙取向、翻譯取向與閱讀取向三類的分支對照

為什麼 CC 在台灣叫隱藏式字幕?

因為 closed 在這裡指的是「預設關著」,「封閉」只是字面上的中文翻法。

中文維基百科的定義是:「術語「隱藏式」(closed)字幕指的是字幕在預設狀態下對觀眾不可見,通常需要通過遙控器或選單選項手動開啟。相對地,「開放式」(open)、「嵌入式」(burned-in、baked on)、「寫死」(hard-coded)或簡稱「硬字幕」(hard)則表示字幕直接嵌入影片中,所有觀眾均可見。」

所以 CC 和硬字幕的差別不在內容,在於「能不能關掉」:

  • 隱藏式字幕:字幕是一個獨立檔案或播放器軌道,觀眾按一下就能開關,也能換語言。YouTube、Netflix 的字幕按鈕就是這種。
  • 開放式字幕(硬字幕):字幕已經燒進畫面像素裡,永遠都在,觀眾關不掉,也不能翻譯或搜尋。

這件事會影響你的交付格式。如果對方要的是「可開關、可換語言」,你要交的是 SRT 或 VTT 檔;如果對方要的是「上傳就能播、平台不吃字幕檔」,你要交的是燒錄好的影片。台灣客戶講「幫我上字幕」的時候,這兩種都有人在講,值得先問清楚。

如果你還不確定 SRT 檔到底長什麼樣,可以先看SRT 檔是什麼?一分鐘看懂結構與開啟方式

這個差別會怎麼影響實作?

三個具體的地方。

1. 標點符號的處理邏輯相反

字幕在慣例上少用句號。換行本身就是斷句,句末標點反而干擾閱讀節奏;逐字稿則相反,需要完整標點與分段才好讀。所以「這個工具輸出的字幕沒有標點」通常不算缺點,而是符合字幕慣例。反過來說,如果你要的是會議紀錄,那沒有標點就是真的不夠用。

2. 閱讀速度是硬限制

字幕不是把話全部塞進去就好,一行字停留的時間如果不夠觀眾讀完,字幕等於沒有作用。這是為什麼專業字幕流程會看 CPS(每秒字元數)。逐字稿沒有這個限制,因為讀者可以自己控制速度。

3. 自動字幕不能直接當成交付品

自動產生的字幕,除非經過確認完全正確,否則不符合無障礙要求。W3C WAI 對這點的措辭相當強硬:「Automatically-generated captions do not meet user needs or accessibility requirements, unless they are confirmed to be fully accurate.」

YouTube 官方說明頁的立場一致,他們自己寫:「We encourage creators to add professional captions first.」以及「You should always review automatic captions and edit any parts that haven't been properly transcribed.」

因此,不管你用哪一家的 AI,自動輸出都是起點,不是終點。任何宣稱「上傳完就能直接發布」的說法,跟平台自己的建議是相反的。

直播或活動場景有個常被忽略的限制值得先確認:中文直播想要即時字幕,得走別的路。YouTube 說明頁明確寫著:「Automatic captions for live streams are available in English only.」也就是說,直播的自動字幕只有英文。

那實際要做繁體中文字幕,有哪些路線?

三條,各有各的適用場景:

路線適合代價
剪輯軟體內建(Premiere、Final Cut、CapCut 等)已經在剪片、字幕只是其中一步綁在該軟體裡,換工具要重做;多語言支援有限
平台自動字幕(YouTube 等)免費、只要影片放在該平台品質不穩、需人工校對,且直播僅限英文(見上)
AI 字幕工具需要多語言、要交檔案、要一次做完翻譯需要付費;仍需人工確認

想看各類工具的實際比較,可以參考上字幕軟體推薦與比較,或直接看線上影片加字幕的完整流程

Subanana 適合誰?不適合誰?

先講不適合的,這樣你可以省下時間。

不要選 Subanana,如果:

  • 你只要一支影片、一次性、而且是英文——YouTube 的自動字幕加上人工校對就夠了,不需要付費工具。
  • 你的字幕需求已經完全長在剪輯軟體流程裡,而且只做單一語言。留在原本的軟體裡比較省事。
  • 你需要的是通過認證的無障礙字幕。法規等級的即時聽打,天花板仍然是人工的 CART 速錄員,不是任何一套 AI。
  • 你要的是 ASS 或 FCPXML 這類格式。上傳檔案轉錄後,Subanana 匯出 SRT、VTT、TXT、DOCX、XLSX、Markdown 六種,沒有 ASS 和 FCPXML。

可以認真考慮,如果:

  • 你要一次交出多語言版本。Subanana 支援 95 種以上語言,而且來源語言、翻譯語言用的是同一份語言清單。
  • 你要的是中英對照的雙語字幕。Subanana 可以在同一個 SRT 檔裡同時輸出原文與譯文(一句上一句下),也能直接輸出燒錄好雙語字幕的影片檔。做法可以看中英對照字幕製作教學
  • 你在意閱讀速度。編輯器內建 CPS 標示,會把太密或太稀疏的字幕段落標出來,這是規則式的檢查,不是 AI 猜測。
  • 你的內容有大量專有名詞。詞彙表可以用工作區層級或單一專案層級管理,每個詞還能標記是「所有語言通用」還是「限定某語言」,也可以用 XLSX 或 CSV 批次匯入整份名單。
  • 你同時需要字幕和會議紀錄。逐字稿模式會自動補標點與分段,這在字幕模式不會套用——因為前面說過,字幕慣例本來就不加句末標點。

關於選模型這件事,我們的做法是持續評測各家語音辨識模型,依來源語言挑當下表現最好的那一個,不綁單一供應商;輸出還會經過幻覺偵測與自動換模型、LLM 輔助校對、CPS 標示等幾層檢查。我們不在部落格上寫準確率數字——這種數字很容易失真,也很難驗證。要判斷好不好用,拿你自己的音檔試最準。

即時活動字幕是另一個獨立功能:走麥克風或系統音訊直接輸入,一場最多可設定 5 種翻譯語言,觀眾掃 QR 用自己的手機選一種語言看。即時活動字幕的逐字內容無法以任何格式匯出或下載,只能在應用程式內閱讀。每個工作區有一次 5 分鐘的免費試用額度。細節在多語言活動即時字幕指南

常見問題

caption 是什麼意思?

在影音語境裡,caption 指與口說內容同語言、並且涵蓋非語音聲音資訊的字幕。W3C WAI 的定義是:「Captions are a text version of the speech and non-speech audio information needed to understand the content.」——除了對白,還包含理解內容所需的非語音資訊。這也是它和純翻譯字幕最大的不同。

(提醒:caption 在其他語境有別的意思,例如社群貼文的說明文字,以及機器學習領域的 image captioning「圖像描述」,兩者都和影音字幕無關。)

上字幕英文怎麼說?

動作叫 captioning 或 subtitling,「幫這支影片上字幕」可以說 caption this video 或 add subtitles to this video。名詞 caption / subtitle 才是「字幕」本身。要注意 captioning 在英美語境偏向無障礙用途,subtitling 偏向翻譯用途。

subtitle 是什麼意思?

subtitle 的中文是「字幕」,指顯示在畫面下方、與聲音同步的文字。依 W3C WAI 的用法,subtitle 特指「其他語言」的版本,也就是翻譯字幕;它假設觀眾聽得到,只是聽不懂該語言。這也是為什麼 W3C 說翻譯用的 subtitle「不直接算是無障礙措施」。

字幕為什麼叫 CC?

CC 是 closed captioning(隱藏式字幕)的縮寫。closed 的意思是「預設不顯示」,觀眾要自己用遙控器或播放器選單打開。相對的是 open caption(開放式字幕),也就是燒進畫面、關不掉的硬字幕。所以看到 CC 標誌,代表這個節目有可自行開關的字幕軌道。

一句話總結

captioning 是「字幕製作」這個動作,caption 是無障礙取向的字幕,subtitle 是翻譯取向的字幕,CC 是可開關的隱藏式字幕,逐字稿則根本不是字幕。搞清楚對方要哪一種,比選哪一套工具重要。

如果你已經知道自己要的是多語言字幕檔或雙語燒錄影片,可以直接用免費額度試一支自己的影片再決定。

資料來源:W3C Web Accessibility Initiative — Captions/SubtitlesYouTube 說明中心 — Use automatic captioning維基百科 — 隱藏式字幕。以上頁面均於 2026 年 7 月 28 日查閱。

相關工具與文章

別再把說過的話重新打一次。

把語音變成可以直接交付的成品。

免費開始