
Google 在 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe。官方公布的數字很好看:支援超過 85 種語言、提供逐字時間碼,平均字錯率(WER,Word Error Rate,即轉錄文字與正確文字的差異比例)非串流 2.6%、串流 4.0%,由第三方機構 Artificial Analysis 量度。
我經營 Subanana,一個語音轉文字的網頁工具。每次有新的語音模型推出,我們都會用內部測試集完整評估一次,再決定要不要用。這一次的評估分四輪進行,主體是 26 條生產環境錄音、共 238 分鐘。
結果與發布數字對不上。26 條之中,只讀文字的評判有 24 條偏好我們的輸出;其中 16 條廣東話錄音,16 條全部由我們的輸出勝出。廣東話智能模式那一輪,有錄音回傳空白,也有回傳英文。
這篇文章把過程和原始文字都放出來,包括我們測不到的部分。
快速摘要:Gemini 3.5 Transcribe 在廣東話上的弱點
- 三條公開影片在智能模式下全部回傳空白轉錄,一個字都沒有交回來。
- 一條 12 分 57 秒的廣東話影片,逐字模式只回傳一句英文
2000 years later.,改模式與改語言提示都救不回來。 - 內部測試集 16 條廣東話錄音的逐字比較,16 條全部由我們的輸出勝出。
- 轉錄文字平均比我們的短,內容大約少了一成。
- 詞語會被換成讀起來通順、但意思完全不同的詞,例如湯名「爵士湯」變成不存在的「著絲湯」。
- 廣東話錄音有時會回傳英文,繁體錄音有時會回傳簡體。
- 在三段乾淨的單一講者英語示範錄音上,Gemini 六次比較全勝。
26 段測試集那一輪由評判盲測逐對比較,評判不知道哪一份轉錄來自哪個系統;字錯率與長度一類數字則是與我們輸出的一致度統計。全程沒有人手校對的正確文本。測試日期為 2026 年 8 月 27 至 29 日,只涵蓋檔案轉錄。

為什麼你會在下面看到三條 YouTube 影片
內部測試集用的是真實生產錄音,不能公開貼出來。所以我們另外挑了三條香港創作者的廣東話影片,全部是 Creative Commons Attribution 授權,可以連原文帶出處一起刊出。
這三條是樣本重點,不是整個測試。挑它們是因為授權容許我們把完整逐字對照放出來,而它們出現的問題與較大批評估看到的一致:詞語被換成無意義的詞、內容整段消失、整條檔案回傳空白。
其中一條 12 分 57 秒的廣東話旅遊影片,逐字模式回傳的完整內容是一句 2000 years later.,十七個字元,然後沒有了。
官方數字與我們量到的東西
兩者量度的東西不同。
| Google 公布 | 我們這次評估 | |
|---|---|---|
| 樣本 | 多語言基準測試集 | 26 條生產環境錄音、238 分鐘,另加三段乾淨示範錄音與三條 CC 授權廣東話影片 |
| 語言 | 超過 85 種 | 廣東話(口語與書面語)、華語、英語四個組別,當中不少是中英夾雜的日常說話 |
| 長度 | 未說明 | 由 1 分半鐘到 35 分鐘不等 |
| 量度方式 | 字錯率,對照人手校對文本 | 盲測逐對比較,另加與我們輸出的一致度統計 |
| 廣東話 | 發布文章以跨語言平均值報告 | 26 條之中有 16 條,另有一輪廣東話專項的智能模式測試 |
| 日期 | 2026 年 8 月 26 日發布 | 2026 年 8 月 27 至 29 日測試 |
Google 的 2.6% 是跨 85 種語言的平均值,發布文章報告的就是這個平均數。一個跨 85 種語言的平均數,本來就不會告訴你其中某一種語言的表現,這正是我們每次都要自己再測一遍的原因,做法寫在我們如何測試轉錄準確度那篇。
可以公開引用的三個樣本
三條都是同一個帳戶最新上傳的廣東話影片,全部標明 Creative Commons Attribution 授權,所以可以在這裡引用內容並附上出處。
| 影片 | 作者 | 長度 |
|---|---|---|
| 【廣東話】 韓國大學生の釜山小旅行 | CHERYL 희정이 | 12 分 57 秒 |
| 英國煮飯仔・夏日湯水食譜・簡易版爵士湯 | 吃貨伴旅 | 5 分 34 秒 |
| ♥ VLOG ♥ 植眼睫毛・長洲睇樓日 | Dottie Hidee | 14 分 24 秒 |
三條影片均以 Creative Commons Attribution 授權發布,授權狀態於 2026 年 8 月 30 日在 YouTube 頁面再次確認。
語體差異不計算為錯誤
下面的對照表裡,Gemini 寫「係」、「嘅」、「咁」,我們的輸出寫「是」、「的」、「這樣」,這不是錯誤。那是口語粵語與書面中文兩種輸出格式的分別,兩邊都合理。廣東話轉文字可以輸出口語,也可以輸出書面語,兩者都是正常選項。
我們只數三種情況:詞語被換成無意義或意思不同的詞、句子結構壞掉、內容整段消失。語體差異一律不算。
錯在哪裡:逐字對照
| 內容 | 我們的輸出 | Gemini 3.5 Transcribe | 問題 |
|---|---|---|---|
| 湯的名稱 | 簡易版爵士湯 | 簡易版著絲湯 | 湯名變成沒有意義的詞 |
| 湯料 | 不要再加蜜棗或者無花果 | 唔好再加味精或者味精粉囉 | 材料由蜜棗、無花果變成味精 |
| 室內裝修 | 好像日本的和室一樣 | 好似日本嗰啲和服樣面 | 「和室」變成「和服樣面」 |
| 睫毛技術 | 專門針對毛乳頭去改善頭髮 | 專門針對母嬰頭去改善頭髮 | 技術名詞變成無關詞語 |
| 廁所間隔 | 它的廁所反而沒有乾濕分離 | 佢個廁所係反而呢係無干涉分嘅 | 常見裝修詞語壞掉 |
| 選擇款式 | 原來除了選款式外還可以選不同的彎曲度 | 變咗除咗減款之外呢仲可以減唔同嘅 | 整句意思消失 |
第一行不需要靠我們的輸出去判斷對錯。那條影片自己的 YouTube 標題就寫著「簡易版爵士湯」,爵士湯是一款以響螺煲的廣東湯水。Gemini 轉出的「著絲湯」在廣東話裡不存在。
其餘幾行是同一類問題:發音接近、字形無關、意思整個換掉。「毛乳頭」是植睫毛會講到的毛囊結構,變成「母嬰頭」之後,那句話對讀者已經沒有用。這類錯誤最麻煩的地方在於,它們讀起來很順,不像亂碼,你不重聽原片是看不出來的。
如果你要處理的是這種內容,AI 逐字稿工具可以先用免費額度把同一條片跑一次,自己對一對。這種比較不需要相信任何人的數字。
那句「2000 years later」
第三條影片,12 分 57 秒的廣東話旅遊影片,Gemini 逐字模式回傳的完整內容是:
2000 years later.
十七個字元。原片是一段有旁白、有食物介紹、有對話的旅遊影片。
我們沒有就此收工。同一個音檔再送四次,改模式、改語言提示:
| 模式 | 語言提示 | 回傳結果 |
|---|---|---|
| 逐字 | yue-Hant-HK | 2000 years later. |
| 逐字 | 不提供 | 2000 years later. |
| 智能 | yue-Hant-HK | 空白 |
| 智能 | 不提供 | 空白 |
四次請求都沒有出現傳輸錯誤,全部正常完成。改語言提示救不回,改模式也救不回。
長度也解釋不了。Google 的文件寫明,開啟逐字時間碼時單次請求可處理 30 分鐘音訊;這條片只有 12 分 57 秒,遠低於上限。
智能模式:三條全部空白
三條影片在智能模式下全部回傳空白轉錄,內容欄完全沒有文字。
範圍要界定準確:智能模式在廣東話上仍然可以有輸出。評估的另一輪把測試集裡 16 條廣東話錄音全部用智能模式再跑一次,15 條有輸出,1 條在重試後仍然空白;另有 3 條首次上傳失敗、重試後成功。那一輪 15 次逐對比較,Gemini 贏 1 次。所以準確的講法是,這三條影片全部空白,而在較大的樣本裡,空白是偶發但確實存在的情況。
評估主體:26 條生產環境錄音
上面三條影片是可以公開引用的樣本;評估的主體是這一批。26 條生產環境錄音、共 238 分鐘,分廣東話口語、廣東話書面語、華語、英語四個組別,其中 16 條廣東話、5 條繁體華語、5 條英語,內容包括影評、旅遊與生活 vlog、食譜、歷史講解、訪談、網上課程與學科教學。逐對比較由一個只讀文字的評判進行:評判每次只看到「轉錄 A」與「轉錄 B」,不知道哪一份來自哪個系統,而 A、B 的排列在不同檔案之間並不固定。
- 26 條之中,評判有 24 條偏好我們的輸出,2 條偏好 Gemini。
- 其中 16 條是廣東話,16 條全部由我們的輸出勝出。
- Gemini 的轉錄文字平均比我們的短,內容大約少了一成。
- 26 條之中只有 4 條達到可靠的文字對位標準。這一點與字幕直接相關:對不上位,時間碼就用不了。
字錯率、長度比例與對位覆蓋率是與我們輸出的一致度統計,不能證明誰更接近事實;上面的勝負則來自盲測逐對比較。另有幾類現象不需要任何比較基準也看得出問題。
廣東話進去,英文出來。 一條廣東話問答錄音,智能模式回傳的是英文:「The Q&A is a chance for everyone to ask me anything about our current problems.」轉錄變成了翻譯。
廣東話進去,無關內容出來。 一條講自學打鼓的廣東話影片,智能模式回傳一段與內容完全無關的英文歌詞式文字。
繁體進去,簡體出來。 多條指定繁體中文的音檔,回傳的是簡體字。對香港與台灣的使用者來說,這等於交件之後還要多做一次轉換。
整段訪談,回傳兩個字。 一段完整的廣東話訪談錄音,智能模式的全部輸出是:
OK。
英文也會這樣。 這不只發生在中文。一條英文經濟科教學錄音,逐字模式回傳的是散落的碎片:「. of staying in Hong Kong. travel to Seoul stay Hong Kong first preference second preference will necessarily remain unchanged.」原本是一段完整的機會成本講解。
Gemini 贏的地方
評估還有一輪用的是三段乾淨的示範錄音:單一講者、錄音室級收音、英語,長度由 86 秒到 35 分鐘。三段錄音、兩種模式、六次比較,Gemini 六次全勝。
分數也拉開得明顯。那批比較裡,被指出有重複段落、有遺漏、有破碎句子的是我們的輸出,不是 Gemini 的。在乾淨的單一講者英語音訊上,Gemini 3.5 Transcribe 的表現比我們好,這是同一批測試裡量出來的結果,照樣寫出來。
這就是整件事的重點。同一個模型,在錄音室級英語上贏足六場,在真實廣東話影片上把一條 13 分鐘的片變成一句話。發布會的平均數字告訴你第一種情況,不會告訴你第二種。
這次測試不能證明什麼
以下是這次評估的邊界。
- 沒有人手校對的正確文本。 26 段測試集那一輪是盲測逐對比較,評判只看到兩份未標示來源的轉錄;三條公開影片那一輪,評判的其中一項評分是與我們輸出的一致度。字錯率、長度比例與對位覆蓋率一律是一致度統計,不是準確度。要下一般性的準確度結論,仍然需要人手校對的樣本。
- 評判只讀文字。 它沒有聽過音訊,不能判斷發音、講者分辨或時間碼是否準確。
- 測試集有覆蓋面,但不是窮盡。 26 條生產環境錄音涵蓋四個語言/書寫組別、多種內容類型與長度,足以看出穩定的模式。Google 公布支援超過 85 種語言,我們實測的是其中四個組別;收音環境的影響則超出這次的量度範圍。這篇文章的結論只涵蓋我們實際測過的東西。
- 只涵蓋檔案轉錄。 這次測試全部是上傳檔案的批次轉錄。Gemini 3.5 Transcribe 的即時串流路徑不在測試範圍,這篇文章的結論只涵蓋檔案轉錄。
- 有時效。 以上全部是 2026 年 8 月的結果。模型會更新,這些數字會過期。
另外一提,Gemini 的一般消費者存取在香港部分受限,本次測試是透過 API 進行的。
我們決定了什麼
整個評估做完之後,以 2026 年 8 月的結果來說,Gemini 3.5 Transcribe 不會加入我們的檔案轉錄模型組合。理由不是逐對比較的分數,是那條 12 分 57 秒的影片所代表的失效方式。一個會偶爾把整段內容換成一句話、而且改設定救不回來的模型,放在使用者的檔案上風險太高。
這個決定只適用於檔案轉錄,也只適用於 2026 年 8 月這個版本。
我們的做法一直沒有變:每個新模型都用內部測試集完整跑一次,每種語言都用當時表現最好的模型,不會綁定任何一家供應商。下一版 Gemini 出來,我們會再測一次;如果它贏,我們就用它。
想自己驗證的話,把你自己的錄音放上 Subanana 的 AI 逐字稿工具跑一次,再與其他工具對照。你自己的音檔才是唯一有意義的測試。
測試日期:2026 年 8 月 27 至 29 日。所有效能描述均以此日期為準。影片內容引用自三條 Creative Commons Attribution 授權影片,作者為 CHERYL 희정이、吃貨伴旅、Dottie Hidee,授權狀態於 2026 年 8 月 30 日確認。