語音轉文字如何分辨講者?講者分離的原理、提高準確度的方法與工具選擇(2026)

語音轉文字如何分辨講者?講者分離的原理、提高準確度的方法與工具選擇(2026)

多人開會或做訪談,錄音轉了文字之後常常剩下一個問題:分不出誰講了哪句。要把錄音變成可用的會議記錄或訪談逐字稿,需要的是「講者分離」(speaker diarization):由系統根據聲音特徵,標出「講者 A:⋯⋯」「講者 B:⋯⋯」。

這篇文章解釋講者分離的原理、甚麼情況會分錯、怎樣錄音可以令結果更準,以及三條實際路線的取捨。文末示範的 Subanana 是我經營的產品,哪類情況它不適合,我也會寫清楚。

講者分離與語音轉文字是兩件事

語音轉文字如何分辨講者:講者分離的原理與工具選擇

  • 語音轉文字(STT)處理「講了甚麼」:把聲音變成文字。
  • 講者分離(diarization)處理「何時講」:根據聲音特徵,偵測講者轉換的位置,再把每段聲音歸到不同講者。

根據 Google Cloud 的語音辨識文件,講者分離是辨識請求中一個獨立的參數:系統偵測講者何時轉換,並用編號標記音檔中偵測到的每一把聲音。換句話說,這是疊在轉文字之上的另一層處理;兩層都做好,才會得到「按人分段」的逐字稿。

會議記錄、訪談逐字稿、多人 Podcast:只要錄音裡有兩個人以上,有沒有講者分離,可用性差天共地。

甚麼情況會分錯?

講者分離不是萬能,以下情況最容易出現「講者張冠李戴」或「一個人被分成兩個」:

  1. 發言重疊。附和、插話多,講者邊界就模糊。
  2. 聲線相近。同性別、年紀相近的講者,聲音特徵接近,較難區分。
  3. 雜音多、收音遠。一部手機收全房間的聲,遠處講者的分離效果一定差。
  4. 壓縮音源。電話錄音、網上會議的壓縮音訊,聲音特徵的線索本身就少了。

反過來說,錄音質素愈好,講者分離愈準:每人一支麥克風、環境安靜、主持人控制輪流發言,結果會明顯改善。另外,多數工具支援預先指定講者人數,知道確切人數時手動指定,通常比全自動更穩。

三條路線:雲端 AI、本機組合、專用設備

1. 雲端 AI 語音轉文字工具(方便、自動)

瀏覽器上傳檔案,轉文字與講者分離一次過自動完成,毋須安裝任何東西。多數工具連標點、分段、摘要都一併處理,適合想直接得到可用會議記錄的人。代價是檔案需要上傳到雲端處理。

2. 本機 Whisper+pyannote(免費、技術門檻高)

想零成本、或者資料不能離開自己電腦,可以在本機跑開源模型。要注意:OpenAI 的 Whisper 只做語音轉文字,本身不做講者分離。開源社群的標準做法是配搭 pyannote。根據 pyannote 專案說明(2026 年 8 月 28 日查閱),這個開源工具包的功能正是講者分離:偵測語音活動、講者轉換、重疊發言,再把各段聲音歸類。兩件工具搭配使用,就是「先分人、再逐段轉文字」的兩步流程。

  • 適合:懂 Python、願意處理環境設定,而且在乎資料留在本機的人。
  • 代價:模型下載、GPU、指令操作都要自己搞;廣東話等語言的效果也要自己測試。

3. 專用錄音設備

實體會議可以用專門的錄音硬件收高質音源,再交給軟件處理。適合經常開實體會的團隊,但要先買設備。

雲端 AI 工具與本機 Whisper+pyannote 的比較表

用 Subanana 做分講者逐字稿

Subanana 屬於第一條路線:瀏覽器完成、自動分講者。步驟如下:

  1. 上傳錄音或影片檔(每個檔案上限 30 GB 或 8 小時),或貼上公開的 YouTube、Instagram、Facebook 連結。
  2. 選來源語言。廣東話錄音直接選廣東話,輸出可選口語或書面語;支援語言共 95 種以上,中英夾雜的會議一樣處理。
  3. 設定講者人數:自動偵測或手動指定都可以。
  4. 轉錄完成後,逐字稿已按講者分段,並自動加標點、分段落。把「講者 1」「講者 2」改成真實姓名,讀起來就像正式記錄。
  5. 需要會議摘要的話,同一份轉錄可以直接生成重點、決議與行動項目,摘要用的 AI 模型可以自選,並有超過 30 個模板。

轉錄完成後花一兩分鐘掃一次講者標籤,有錯手動改正,是提升成品質素回報最高的一步。免費方案可以預覽每個檔案首 15 分鐘的結果,先用一段短會議錄音試試分離效果最實際;想直接在網頁試,可以用免費語音轉文字工具頁。匯出(SRT、VTT、TXT、DOCX、XLSX、Markdown)屬付費功能,各方案見方案費用頁

Subanana 不適合的情況:資料完全不能上雲的場景,本機 Whisper+pyannote 組合或設有內部部署需求的方案才是正路;純粹想錄實體會議的高質音源,先解決收音硬件更實際。

常見問題

講者分離是甚麼? 根據聲音特徵,標出錄音中「誰」在「何時」發言的處理,配合語音轉文字使用,就得到按講者分段的逐字稿。轉文字處理「講了甚麼」,講者分離處理「誰講的」,兩者是獨立的步驟。

怎樣提高講者分離的準確度? 錄音質素最關鍵:每人一支麥克風、環境安靜、減少插話,以及預先指定講者人數。完成後再花一兩分鐘核對講者標籤,成品就穩妥得多。

Whisper 可以分辨講者嗎? Whisper 本身只做語音轉文字,不做講者分離。本機方案需要配搭 pyannote 之類的開源工具包,由它負責偵測講者轉換再分段。不想處理技術設定的話,用內建講者分離的雲端工具直接得多。

廣東話錄音都分到講者嗎? 可以。講者分離根據聲音特徵運作,與語言無關;Subanana 的廣東話轉錄支援口語與書面語輸出,訪談做法可以參考訪談逐字稿教學