什麼是AI逐字稿?運作原理、準確度與人工聽打比較(2026)

2026-07-17

如果你手上有一段訪談錄音、一場會議或一集Podcast要整理成文字,你大概會在「自己慢慢聽打」和「用AI逐字稿工具」之間猶豫。這篇文章會先講清楚AI逐字稿到底是什麼、背後怎麼運作,再用速度、成本和準確度三個角度,把AI逐字稿和傳統人工聽打放在一起比較,最後示範怎麼用Subanana的AI逐字稿工具幾分鐘完成一份逐字稿。

什麼是AI逐字稿

AI逐字稿,是指用人工智慧的語音辨識(Speech-to-Text,STT)技術,把語音自動轉換成文字的過程。你上傳一段音訊或影片,系統辨識裡面的說話內容,輸出對應的文字稿,通常還會附上時間碼,方便你回頭對照原始錄音。

它和過去的「人工聽打」最大的差別,在於誰來聽、誰來打。人工聽打是由聽打員一句一句聽、一個字一個字打;AI逐字稿則是把這件事交給語音辨識模型,在幾分鐘內完成初稿,你只需要做最後的校對。

AI逐字稿的運作原理

AI逐字稿的核心是語音辨識模型。整個流程大致可以拆成三步:

  1. 音訊前處理:系統會先把音訊切分成適合辨識的片段,並處理取樣率、聲道等格式問題。
  2. 語音辨識:模型分析聲音的聲學特徵,對照它學過的大量語音資料,推測出最可能的文字序列。這一步也會判斷語言、標點與斷句。
  3. 輸出與後處理:把辨識結果組合成完整文字稿,加上時間碼,並讓你在編輯器裡校對、修正專有名詞。

值得注意的是,市面上沒有一個語音辨識模型能在所有語言、所有場景都表現最好。Subanana的做法是持續評測多個前沿語音辨識模型,針對每一種來源語言自動挑選當下表現最好的模型,並在其中一個失效時自動切換,藉此在中文、中英夾雜等情境下維持穩定的辨識品質。

AI逐字稿 vs 人工聽打:速度、成本、準確度

很多人以為人工聽打一定比較準,但實際的取捨比想像中複雜。

速度是最明顯的差距。根據多家逐字稿服務業者的公開說明,專業聽打員處理一小時清晰錄音,通常需要約四到六小時,也就是業界常說的4:1到6:1比例(來源:RevGoTranscript);音質差、口音重或術語多時還會更久。AI逐字稿則多半在幾分鐘內就能產出初稿。

成本上,人工聽打是以人力工時計價,因此逐字稿越長、越急,價格越高;AI逐字稿把大部分工作交給模型,你付的主要是訂閱或用量費用,長音檔的邊際成本低很多。

準確度才是關鍵,也是最容易被誤解的地方。清晰、單一講者的錄音,AI逐字稿的初稿已經相當堪用;但遇到嚴重雜訊、多人交談重疊、罕見專有名詞時,任何方式都需要人工校對。實務上比較合理的分工是:讓AI產出初稿,再由人做最後校對,兼顧速度與品質。

比較項目AI逐字稿人工聽打
一小時錄音所需時間通常數分鐘出初稿約4至6小時
計價方式訂閱/用量,長音檔邊際成本低依人力工時,越長越貴
清晰錄音準確度初稿堪用,需輕度校對高,但耗時
困難音檔(雜訊/重疊)需人工校對需反覆重聽,仍需校對
多語言與翻譯支援多語辨識與翻譯需另找對應語言人力

AI逐字稿與人工聽打的速度、成本比較

ChatGPT、Gemini 可以做逐字稿嗎?

這是很多人會問的問題。ChatGPT、Gemini 這類通用大型語言模型,本質上是處理「文字」的工具,並非為長音檔的語音辨識而設計。它們的語音輸入通常有長度限制,也不會給你附時間碼、可校對、可匯出的逐字稿格式,更難穩定處理中英夾雜或多人會議。

如果只是想把一小段語音訊息轉成文字,通用模型或許夠用;但只要牽涉到訪談、會議、Podcast這類較長、較正式的內容,交給專門的AI逐字稿工具會更省事,也更容易得到一份結構完整、能直接使用的文字稿。

如何用 Subanana 製作 AI 逐字稿

Subanana 是一個在瀏覽器就能使用的AI字幕與逐字稿工具,專門把語音轉成準確、可編輯、可匯出的文字稿。以下是基本流程:

  1. 上傳:把影片或音訊上傳到 Subanana,或直接貼上 YouTube、Instagram、Facebook 的公開影片連結,系統會自動抓取並轉寫,不必先下載檔案。選擇錄音的來源語言。
  2. 產生逐字稿:點擊開始,Subanana 會挑選最適合該語言的模型,產生帶時間碼的逐字稿。
  3. 校對:在編輯器裡修正字詞、調整斷句,並處理專有名詞。
  4. 匯出:以你需要的格式下載,支援 SRT、VTT、TXT、DOCX、XLSX、Markdown,也可以一次打包成 ZIP。

Subanana 支援 95 種以上語言的辨識與翻譯,若需要雙語版本,可在字幕專案中把逐字稿翻譯成其他語言,或匯出雙語字幕。要提醒的是,免費方案可以預覽轉寫結果,讓你先確認品質;匯出逐字稿檔案則屬於付費方案的功能。

如果你的內容偏向影片字幕,也可以參考我們的影片轉文字準確度與教學,以及逐字稿產生器教學

結論

AI逐字稿不是要取代人的判斷,而是把最花時間的「聽和打」交給模型,讓人專注在校對和內容本身。清晰錄音交給AI幾分鐘就有初稿,困難音檔也能先讓AI打底、再人工修正。與其在一小時錄音上耗掉整個下午,不如讓AI逐字稿先做完最累的一步。

常見問題

ChatGPT可以做逐字稿嗎?

ChatGPT 是通用語言模型,主要處理文字,語音輸入有長度限制,也不提供時間碼與可匯出的逐字稿格式。短語音或許堪用,但訪談、會議這類較長內容,交給專門的AI逐字稿工具會更穩定、更好用。

哪個AI可以生成逐字稿?

專門的語音辨識(STT)工具最適合,例如 Subanana 這類AI逐字稿工具。和通用聊天機器人不同,它們會產出帶時間碼、可編輯、可匯出的文字稿,並針對不同語言選用合適的辨識模型。

Gemini可以轉逐字稿嗎?

和 ChatGPT 類似,Gemini 屬於通用模型,並非為長音檔的逐字稿而設計。它可以處理簡單的語音理解,但要得到一份完整、可校對、可下載的逐字稿,仍建議使用專門的AI逐字稿工具。

如何將音檔轉成逐字稿?

把音檔上傳到AI逐字稿工具,選擇來源語言並產生初稿,接著在編輯器校對字詞與斷句,最後以 SRT、DOCX 或 TXT 等格式匯出。以 Subanana 為例,整個流程在瀏覽器就能完成,一小時的錄音通常幾分鐘就能拿到可校對的初稿。

選用 Subanana,讓工作更輕鬆

無需提供付款方式
免費試用
隨時取消