Gemini 3.5 Transcribe 廣東話實測:一條 13 分鐘影片,只轉出一句「2000 years later」

Gemini 3.5 Transcribe 廣東話實測:一條 13 分鐘影片,只轉出一句「2000 years later」

Gemini 3.5 Transcribe 廣東話測試對照圖:12 分 57 秒影片只轉出一句英文碎片

Google 在 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe。官方公布的數字很好看:支援超過 85 種語言、提供逐字時間碼,平均字錯率(WER,Word Error Rate,即轉錄文字與正確文字的差異比例)非串流 2.6%、串流 4.0%,由第三方機構 Artificial Analysis 量度。

我經營 Subanana,一個語音轉文字的網頁工具。每次有新的語音模型推出,我們都會用內部測試集完整評估一次,再決定要不要用。這一次的評估分四輪進行,主體是 26 條生產環境錄音、共 238 分鐘。

結果與發布數字對不上。26 條之中,只讀文字的評判有 24 條偏好我們的輸出;其中 16 條廣東話錄音,16 條全部由我們的輸出勝出。廣東話智能模式那一輪,有錄音回傳空白,也有回傳英文。

這篇文章把過程和原始文字都放出來,包括我們測不到的部分。

快速摘要:Gemini 3.5 Transcribe 在廣東話上的弱點

  • 三條公開影片在智能模式下全部回傳空白轉錄,一個字都沒有交回來。
  • 一條 12 分 57 秒的廣東話影片,逐字模式只回傳一句英文 2000 years later.,改模式與改語言提示都救不回來。
  • 內部測試集 16 條廣東話錄音的逐字比較,16 條全部由我們的輸出勝出。
  • 轉錄文字平均比我們的短,內容大約少了一成。
  • 詞語會被換成讀起來通順、但意思完全不同的詞,例如湯名「爵士湯」變成不存在的「著絲湯」。
  • 廣東話錄音有時會回傳英文,繁體錄音有時會回傳簡體。
  • 在三段乾淨的單一講者英語示範錄音上,Gemini 六次比較全勝。

26 段測試集那一輪由評判盲測逐對比較,評判不知道哪一份轉錄來自哪個系統;字錯率與長度一類數字則是與我們輸出的一致度統計。全程沒有人手校對的正確文本。測試日期為 2026 年 8 月 27 至 29 日,只涵蓋檔案轉錄。

Gemini 3.5 Transcribe 評測數字一覽:26 條錄音中 24 條由我們的輸出勝出,16 條廣東話全部由我們的輸出勝出

為什麼你會在下面看到三條 YouTube 影片

內部測試集用的是真實生產錄音,不能公開貼出來。所以我們另外挑了三條香港創作者的廣東話影片,全部是 Creative Commons Attribution 授權,可以連原文帶出處一起刊出。

這三條是樣本重點,不是整個測試。挑它們是因為授權容許我們把完整逐字對照放出來,而它們出現的問題與較大批評估看到的一致:詞語被換成無意義的詞、內容整段消失、整條檔案回傳空白。

其中一條 12 分 57 秒的廣東話旅遊影片,逐字模式回傳的完整內容是一句 2000 years later.,十七個字元,然後沒有了。

官方數字與我們量到的東西

兩者量度的東西不同。

Google 公布我們這次評估
樣本多語言基準測試集26 條生產環境錄音、238 分鐘,另加三段乾淨示範錄音與三條 CC 授權廣東話影片
語言超過 85 種廣東話(口語與書面語)、華語、英語四個組別,當中不少是中英夾雜的日常說話
長度未說明由 1 分半鐘到 35 分鐘不等
量度方式字錯率,對照人手校對文本盲測逐對比較,另加與我們輸出的一致度統計
廣東話發布文章以跨語言平均值報告26 條之中有 16 條,另有一輪廣東話專項的智能模式測試
日期2026 年 8 月 26 日發布2026 年 8 月 27 至 29 日測試

Google 的 2.6% 是跨 85 種語言的平均值,發布文章報告的就是這個平均數。一個跨 85 種語言的平均數,本來就不會告訴你其中某一種語言的表現,這正是我們每次都要自己再測一遍的原因,做法寫在我們如何測試轉錄準確度那篇。

可以公開引用的三個樣本

三條都是同一個帳戶最新上傳的廣東話影片,全部標明 Creative Commons Attribution 授權,所以可以在這裡引用內容並附上出處。

三條影片均以 Creative Commons Attribution 授權發布,授權狀態於 2026 年 8 月 30 日在 YouTube 頁面再次確認。

語體差異不計算為錯誤

下面的對照表裡,Gemini 寫「係」、「嘅」、「咁」,我們的輸出寫「是」、「的」、「這樣」,這不是錯誤。那是口語粵語與書面中文兩種輸出格式的分別,兩邊都合理。廣東話轉文字可以輸出口語,也可以輸出書面語,兩者都是正常選項。

我們只數三種情況:詞語被換成無意義或意思不同的詞、句子結構壞掉、內容整段消失。語體差異一律不算。

錯在哪裡:逐字對照

內容我們的輸出Gemini 3.5 Transcribe問題
湯的名稱簡易版爵士湯簡易版著絲湯湯名變成沒有意義的詞
湯料不要再加蜜棗或者無花果唔好再加味精或者味精粉材料由蜜棗、無花果變成味精
室內裝修好像日本的和室一樣好似日本嗰啲和服樣面「和室」變成「和服樣面」
睫毛技術專門針對毛乳頭去改善頭髮專門針對母嬰頭去改善頭髮技術名詞變成無關詞語
廁所間隔它的廁所反而沒有乾濕分離佢個廁所係反而呢係無干涉分常見裝修詞語壞掉
選擇款式原來除了選款式外還可以選不同的彎曲度變咗除咗減款之外呢仲可以唔同嘅整句意思消失

第一行不需要靠我們的輸出去判斷對錯。那條影片自己的 YouTube 標題就寫著「簡易版爵士湯」,爵士湯是一款以響螺煲的廣東湯水。Gemini 轉出的「著絲湯」在廣東話裡不存在。

其餘幾行是同一類問題:發音接近、字形無關、意思整個換掉。「毛乳頭」是植睫毛會講到的毛囊結構,變成「母嬰頭」之後,那句話對讀者已經沒有用。這類錯誤最麻煩的地方在於,它們讀起來很順,不像亂碼,你不重聽原片是看不出來的。

如果你要處理的是這種內容,AI 逐字稿工具可以先用免費額度把同一條片跑一次,自己對一對。這種比較不需要相信任何人的數字。

那句「2000 years later」

第三條影片,12 分 57 秒的廣東話旅遊影片,Gemini 逐字模式回傳的完整內容是:

2000 years later.

十七個字元。原片是一段有旁白、有食物介紹、有對話的旅遊影片。

我們沒有就此收工。同一個音檔再送四次,改模式、改語言提示:

模式語言提示回傳結果
逐字yue-Hant-HK2000 years later.
逐字不提供2000 years later.
智能yue-Hant-HK空白
智能不提供空白

四次請求都沒有出現傳輸錯誤,全部正常完成。改語言提示救不回,改模式也救不回。

長度也解釋不了。Google 的文件寫明,開啟逐字時間碼時單次請求可處理 30 分鐘音訊;這條片只有 12 分 57 秒,遠低於上限。

智能模式:三條全部空白

三條影片在智能模式下全部回傳空白轉錄,內容欄完全沒有文字。

範圍要界定準確:智能模式在廣東話上仍然可以有輸出。評估的另一輪把測試集裡 16 條廣東話錄音全部用智能模式再跑一次,15 條有輸出,1 條在重試後仍然空白;另有 3 條首次上傳失敗、重試後成功。那一輪 15 次逐對比較,Gemini 贏 1 次。所以準確的講法是,這三條影片全部空白,而在較大的樣本裡,空白是偶發但確實存在的情況。

評估主體:26 條生產環境錄音

上面三條影片是可以公開引用的樣本;評估的主體是這一批。26 條生產環境錄音、共 238 分鐘,分廣東話口語、廣東話書面語、華語、英語四個組別,其中 16 條廣東話、5 條繁體華語、5 條英語,內容包括影評、旅遊與生活 vlog、食譜、歷史講解、訪談、網上課程與學科教學。逐對比較由一個只讀文字的評判進行:評判每次只看到「轉錄 A」與「轉錄 B」,不知道哪一份來自哪個系統,而 A、B 的排列在不同檔案之間並不固定。

  • 26 條之中,評判有 24 條偏好我們的輸出,2 條偏好 Gemini。
  • 其中 16 條是廣東話,16 條全部由我們的輸出勝出。
  • Gemini 的轉錄文字平均比我們的短,內容大約少了一成。
  • 26 條之中只有 4 條達到可靠的文字對位標準。這一點與字幕直接相關:對不上位,時間碼就用不了。

字錯率、長度比例與對位覆蓋率是與我們輸出的一致度統計,不能證明誰更接近事實;上面的勝負則來自盲測逐對比較。另有幾類現象不需要任何比較基準也看得出問題。

廣東話進去,英文出來。 一條廣東話問答錄音,智能模式回傳的是英文:「The Q&A is a chance for everyone to ask me anything about our current problems.」轉錄變成了翻譯。

廣東話進去,無關內容出來。 一條講自學打鼓的廣東話影片,智能模式回傳一段與內容完全無關的英文歌詞式文字。

繁體進去,簡體出來。 多條指定繁體中文的音檔,回傳的是簡體字。對香港與台灣的使用者來說,這等於交件之後還要多做一次轉換。

整段訪談,回傳兩個字。 一段完整的廣東話訪談錄音,智能模式的全部輸出是:

OK。

英文也會這樣。 這不只發生在中文。一條英文經濟科教學錄音,逐字模式回傳的是散落的碎片:「. of staying in Hong Kong. travel to Seoul stay Hong Kong first preference second preference will necessarily remain unchanged.」原本是一段完整的機會成本講解。

Gemini 贏的地方

評估還有一輪用的是三段乾淨的示範錄音:單一講者、錄音室級收音、英語,長度由 86 秒到 35 分鐘。三段錄音、兩種模式、六次比較,Gemini 六次全勝

分數也拉開得明顯。那批比較裡,被指出有重複段落、有遺漏、有破碎句子的是我們的輸出,不是 Gemini 的。在乾淨的單一講者英語音訊上,Gemini 3.5 Transcribe 的表現比我們好,這是同一批測試裡量出來的結果,照樣寫出來。

這就是整件事的重點。同一個模型,在錄音室級英語上贏足六場,在真實廣東話影片上把一條 13 分鐘的片變成一句話。發布會的平均數字告訴你第一種情況,不會告訴你第二種。

這次測試不能證明什麼

以下是這次評估的邊界。

  • 沒有人手校對的正確文本。 26 段測試集那一輪是盲測逐對比較,評判只看到兩份未標示來源的轉錄;三條公開影片那一輪,評判的其中一項評分是與我們輸出的一致度。字錯率、長度比例與對位覆蓋率一律是一致度統計,不是準確度。要下一般性的準確度結論,仍然需要人手校對的樣本。
  • 評判只讀文字。 它沒有聽過音訊,不能判斷發音、講者分辨或時間碼是否準確。
  • 測試集有覆蓋面,但不是窮盡。 26 條生產環境錄音涵蓋四個語言/書寫組別、多種內容類型與長度,足以看出穩定的模式。Google 公布支援超過 85 種語言,我們實測的是其中四個組別;收音環境的影響則超出這次的量度範圍。這篇文章的結論只涵蓋我們實際測過的東西。
  • 只涵蓋檔案轉錄。 這次測試全部是上傳檔案的批次轉錄。Gemini 3.5 Transcribe 的即時串流路徑不在測試範圍,這篇文章的結論只涵蓋檔案轉錄。
  • 有時效。 以上全部是 2026 年 8 月的結果。模型會更新,這些數字會過期。

另外一提,Gemini 的一般消費者存取在香港部分受限,本次測試是透過 API 進行的。

我們決定了什麼

整個評估做完之後,以 2026 年 8 月的結果來說,Gemini 3.5 Transcribe 不會加入我們的檔案轉錄模型組合。理由不是逐對比較的分數,是那條 12 分 57 秒的影片所代表的失效方式。一個會偶爾把整段內容換成一句話、而且改設定救不回來的模型,放在使用者的檔案上風險太高。

這個決定只適用於檔案轉錄,也只適用於 2026 年 8 月這個版本。

我們的做法一直沒有變:每個新模型都用內部測試集完整跑一次,每種語言都用當時表現最好的模型,不會綁定任何一家供應商。下一版 Gemini 出來,我們會再測一次;如果它贏,我們就用它。

想自己驗證的話,把你自己的錄音放上 Subanana 的 AI 逐字稿工具跑一次,再與其他工具對照。你自己的音檔才是唯一有意義的測試。

測試日期:2026 年 8 月 27 至 29 日。所有效能描述均以此日期為準。影片內容引用自三條 Creative Commons Attribution 授權影片,作者為 CHERYL 희정이、吃貨伴旅、Dottie Hidee,授權狀態於 2026 年 8 月 30 日確認。