挑選逐字稿軟體時,先用三個問題檢查:它能否分辨多人講者?能否把口語整理成容易閱讀的文字?國語辨識能否穩定處理你的錄音?
這三項能力會直接影響校對時間與交付結果。多人錄音若沒有清楚的講者分界,就得回頭猜每句話是誰說的;口語未經整理,閱讀與引用都更費力;中文錄音則應以相似素材試轉,檢查人名、專有名詞、數字與中英夾雜內容。先確認這些條件,再比較價格、介面與方案限制。
選逐字稿軟體,先看三個核心標準
多人對話能不能清楚分辨講者
多人錄音的第一個檢查點,是結果裡有沒有清楚的講者分界。會議、訪談、課堂與研究錄音,很少只有一個人從頭說到尾。當兩人或多人輪流發言時,工具最好能自動標示「講者一」「講者二」等不同角色。講者辨識會先把不同聲音的段落分開,標籤名稱不需要一次就完全正確,之後在編輯器裡改成真實姓名即可,校對時便有清楚的分界可以依循。
沒有講者辨識的轉錄結果,常會把整段錄音變成一大團文字。使用者必須自己回頭聽每一句,判斷是主持人、受訪者,還是其他與會者。
口語能不能整理成可閱讀的書面文字
需要交付或引用時,標點、段落與贅字處理會直接影響閱讀速度。人說話時常會出現「呃」、「就是」、「然後」等贅字,也常有未完成的句子、重複表達與臨時改口。好的逐字稿軟體會將語音轉成文字,同時自動加入標點並切分段落,讓讀者能快速理解內容。
結果通常有兩種。第一種是逐字照打的語音轉寫,內容接近原始說話方式。第二種是經過基本整理的逐字稿,仍然保留原意,但讀起來更像可以引用、分享與編輯的文字。採訪稿、會議紀錄與課程筆記通常更需要第二種結果。
中文國語辨識是否適合你的錄音
先拿一段與工作內容相似的錄音試轉,再檢查人名、專有名詞、數字與中英夾雜內容。台灣常見的國語錄音,可能包含不同口音、快速說話、英文縮寫、人名、品牌名稱與專業術語。通用語音引擎遇到這些內容時,錯字不一定會集中在某一類,因此不能只看一個簡短示範就下結論。
目前沒有一個可以套用到所有錄音情境的通用業界準確度百分比。比較實際的做法,是準備一段與工作內容相似的錄音,使用工具提供的免費額度試轉,再檢查人名、專有名詞、數字與中英夾雜內容。
三種逐字稿做法,時間與品質怎麼取捨
不同方法沒有絕對的優劣,差別在於你願意投入多少時間,以及最後需要什麼格式的成果。

手動聽打的準確度上限通常最高,但投入時間也最大。免費線上轉換工具適合先確認錄音內容,不一定適合直接交付。AI 逐字稿軟體則是實務上的中間解法:先讓系統處理大量重複工作,再由使用者檢查重要細節。
例如,主持人臨時追問、受訪者接著回答的訪談,若免費工具只提供文字預覽,最後要交付 DOCX 時仍得重新回聽來補講者分界;手動聽打會把時間耗在反覆停播,AI 方案則仍要回頭檢查人名與術語。
如果成果只要看懂內容,文字預覽就可能足夠;若要校對後交付,講者辨識、編輯器與匯出格式就和轉錄速度同樣重要。
用 Subanana 產生可校對的逐字稿
Subanana 的流程適合需要從錄音取得文字,再進行人工確認與匯出的工作。你可以依照以下步驟處理會議、訪談、課堂或影片內容。
1. 匯入音檔或公開 YouTube 連結
你可以直接上傳音檔或影片,支援 .mp3、.wav、.m4a、.mp4、.mov、.webm、.ogg 等常見格式,也可以貼上公開 YouTube 連結。單一檔案上限為 30 GB 或 8 小時,免費與付費方案相同。
2. 設定來源語言與轉錄模式
選擇適合內容的轉錄模式,並將來源語言設定為中文的國語/普通話。逐字稿模式會自動加入標點並切分段落,不需要另外設定。來源語言設定越貼近實際錄音,通常越有利於人名、術語與句子結構的判斷。
3. 分辨講者並替換名稱
講者數目可以設定為自動偵測,也可以手動輸入。系統會將不同聲音標記為 Speaker 1、Speaker 2 等講者。完成初步檢查後,可以在編輯器中把標籤改成「主持人」、「受訪者」或實際姓名,整份逐字稿會同步更新。
4. 使用詞彙表與編輯器校對
轉錄完成後,可以直接在編輯器內點選文字並修正錯字。人名、公司名稱與專業術語則可以事先加入詞彙表(Glossary),讓系統在轉錄時優先採用指定寫法。例如,可先把產品名稱、研究名詞與固定縮寫整理進詞彙表。
5. 匯出適合工作的檔案
付費方案可以匯出 TXT、DOCX、XLSX、SRT、VTT 與 Markdown。TXT 與 DOCX 適合交付或繼續編輯,XLSX 可保留時間碼與講者標記,SRT 與 VTT 則適合需要字幕檔的工作流程。校對完成後,報告可使用 DOCX,字幕工作則可使用 SRT 或 VTT。
常見問題
哪裡可以免費線上逐字稿?
Subanana 免費方案可以讓你上傳檔案,並預覽前 15 分鐘的轉錄結果。每月可上傳 3 次,但免費方案不能匯出 TXT、DOCX、XLSX、SRT、VTT 或 Markdown,也不能在編輯器內選取並複製逐字稿。免費額度適合先試轉、看結果;例如先確認一段訪談內容,再決定是否需要整理成 DOCX。要取得完整可交付檔案,則需要付費方案。
iPhone 錄音怎麼轉成逐字稿?
先將 iPhone 錄音匯出成常見音檔格式,例如 .m4a,再上傳到逐字稿軟體,將來源語言設為中文國語/普通話。若錄音有多人,完成轉錄後可先確認 Speaker 1、Speaker 2 的分界,再把標籤改成主持人或受訪者;需要字幕時則選 SRT 或 VTT。
如何將音檔轉成逐字稿?
最直接的流程是上傳音檔、選擇來源語言、設定講者辨識,完成轉錄後在編輯器中校對。若使用 Subanana,單一檔案上限為 30 GB 或 8 小時;免費方案可以先預覽前 15 分鐘,完整文字檔匯出則需要付費方案。方案與最新額度可參考台灣定價頁面。
整理逐字稿的工具有哪些?
可以把工具分成三類:手動聽打、免費線上轉換工具,以及具備講者辨識與編輯器的 AI 逐字稿軟體。若只是確認內容,免費工具可能已經足夠;若需要交付檔案,則應優先檢查標點分段、詞彙表、講者標記與匯出格式。需要報告時可選 DOCX,需要字幕時則可選 SRT 或 VTT。
結語
比較逐字稿軟體時,一段真實錄音的實測比價格表更快告訴你一套工具合不合用。想直接試轉,可以到 AI 逐字稿工具 上傳一段錄音看結果。
如果你更在意的是「這筆錢跟時間划不划算」,可以接著看台灣逐字稿工具比較:一小時錄音,外包與 AI 各要花多少錢、多久,那篇專門算外包聽打與 AI 工具的成本差距。