語音轉文字 · Speech to Text

語音轉文字:錄音檔與影片自動轉成逐字稿.

錄音檔也好,會議錄音也好,影片也好——上傳或貼上公開連結,AI 就會自動把語音轉成文字。分好講者、補回標點與分段,拿到手就能讀的逐字稿。支援 95+ 種語言,平均準確率 98%。不必安裝軟體,每個檔案前 15 分鐘可以免費先看結果。

免費開始每個檔案前 15 分鐘免費 · 不需信用卡
Wind-shaped dunes under a pale sky
plus.subanana.com
逐字稿
講者 100:12:04

這次改版會把申請流程從三個步驟縮成一個步驟。

講者 200:12:12

現在平均要填五次資料,之後填一次就好了。

講者 100:12:21

三月試營運的時候,完成率從六成拉到八成五。

講者 200:12:30

正式上線預計排在下個月十五號。

  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush
  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush

實際上是怎麼跑的?

週會錄音_0721.m4a

M4A · 43:18 · 已上傳

MP3·M4A·WAV 音訊、MP4·MOV 影片,或公開連結單檔最長 8 小時、30 GB,所有方案相同

轉成文字

00:15

今天先把整個時程分成三個階段跟大家說明。

00:23

第一個階段是上傳檔案,大概兩分鐘就結束了。

00:31

第二個是確認,匯出是第三個階段。

講者辨識講者 1講者 2標點與分段補回

文字格式

TXTDOCXXLSXMarkdown

逐字稿

TXT · DOCX · XLSX · Markdown

字幕檔

SRT · VTT

翻譯後的文字

95+ 種語言

摘要

30+ 範本 · 決議 · 待辦

向逐字稿提問

答案指回出處

不必自己一句一句聽打的九個理由。

從上傳錄音檔、轉成文字、校對,到匯出——要做的事情在同一個地方做完。

錄音檔從哪裡來都可以

  • 上傳音訊檔或影片檔MP3、M4A、WAV、MP4、MOV、WEBM——錄音檔或影片檔直接拖進瀏覽器就開始轉錄。
  • 或者貼上一條連結公開的 YouTube、Instagram、Facebook 連結,不必先把影片下載下來。
  • 長檔不用先剪開單一檔案最長 8 小時、最大 30 GB,所有方案相同。
  • 錄音筆與手機錄音直接用會議室錄下來的音訊、手機的語音備忘錄,不必先轉檔。

要哪一種文字檔,就有哪一種

  • 文字與表格TXT、DOCX、XLSX、Markdown——講者與時間戳會一併帶出來。
  • 字幕檔SRT 與 VTT,單語或雙語都可以。
  • 一次打包多種格式一次下載成 ZIP。
  • 分享連結傳給同事看結果,對方不必另外開帳號。

憑空生出來的句子,不會寫進你的逐字稿

  • 兩重偵測每一份轉寫結果都會做品質檢查,與音訊對不上的字句當場標記。
  • 自動換引擎重跑被標記的片段交給另一個引擎重新處理,不會就這樣寫進檔案。
  • 靜音就是靜音停頓就是停頓,不會變成模型想像出來的一句話。

交出去之前,先過一次校對

  • 把要改的地方分類列出建議會按類別分組,通常十到三十秒內出結果。
  • 逐組核准聽錯的字、同音字——你同意的那幾組才會套用,其餘原封不動。
  • 時間碼不會動校對只改文字,時間軸維持原樣。
  • 完全可以略過在你按下按鈕之前,不會有任何改動。

內容講什麼語言都認得

  • 95+ 種語言先選定原始語言,系統會依那個語言挑選評測成績最好的辨識模型。
  • 中英夾雜照樣準「這個 quarter 的 target」轉出來不會亂寫,英文詞會保留原文。
  • 繁簡都輸出得了中文的輸出可以是繁體或簡體,在語言選項裡選定。
  • 同時要譯文也可以同一段語音,逐字稿可以再加一種翻譯語言一併拿到。

人名與專有名詞不會被寫錯

  • 工作區詞彙表人名、產品名、行業術語存起來,之後每個檔案都照你的寫法。
  • 逐項套用詞彙可以設定全域套用,或只用在某幾個專案。
  • 匯入你已經有的從 CSV 或 XLSX 批次載入,或讓 AI 從 PDF 抽出候選詞。
  • 套用前先看報告哪些詞被統一了寫法,一眼就看得到。

同一份逐字稿,還能再長出好幾樣

  • 摘要與重點30 種以上範本,長檔的重點自動抽出來。
  • 決議與待辦會議記錄範本會把決定了什麼、誰要做什麼分開列。
  • 章節與金句長檔自動分段,值得引用的句子直接可以用。
  • 向逐字稿提問直接問 AI 助理,每個答案都指回出處那一句。

要順便出字幕,樣式也調得動

  • 兩種樣式底外框加陰影,或是可以調透明度的背景色塊。
  • 字級自動調整長句會自動縮排,不會衝出畫面邊緣。
  • 雙語各自設定原文與譯文兩條軌的樣式互不干擾,同時出現也看得清楚。
  • 邊調邊預覽字型、大小、顏色、對齊、留白,在真實畫面上即時看。

要連字幕一起的成品影片,也可以

  • 最高 4K720P、1080P、2K 或 4K,樣式與預覽完全一致。
  • 雙語一併燒錄兩種語言排在同一個畫面,各自有自己的樣式。
  • 浮水印你決定預設的浮水印可以完全隱藏,或者換成你自己的。
  • 背景算圖算圖期間可以繼續編輯,輸出用的是按下按鈕那一刻的版本。

錄音檔就在那裡,但沒有時間把它變成看得懂的文字。

四種現場,同一個問題——一小時的錄音,用手聽打要花掉好幾個小時。

採訪與訪談錄音

記者與文字工作者

截稿時間是固定的,但引述一個字都不能錯,還要交代誰在什麼時候說的。

課堂與研究訪談錄音

研究者與學生

一整個學期的錄音檔堆在那裡,可是沒有人有時間為了找一段引文重聽一次。

會議與專案討論錄音

公司團隊

轉成逐字稿之後,後來決定了什麼、誰要負責,之後用搜尋就找得回來。

節目與 Podcast

影音創作者

一份轉好的文字,可以拿去寫說明欄、寫部落格、寫貼文,不必從頭再聽一遍。

其餘的功能。

以下沒有一項是你會為它換工具的理由,但每次要把一段語音變成文字,它們都在。

上傳音訊檔上傳影片檔貼上公開連結講者辨識自訂講者人數自訂詞彙表背景資料參考繁簡輸出尋找與取代含聲波的時間軸AI 校對建議AI 摘要會議記錄範本章節標記向逐字稿提問SRT · VTT 匯出DOCX · XLSX 匯出TXT · Markdown 匯出一次打包下載分享連結免登入

細節在產品裡——開一個免費工作區大約一分鐘。

在產品中看看

開始之前常見問題

可以免費開始。用免費帳號上傳檔案,每個檔案可以看到前 15 分鐘的轉寫結果,每月 3 個檔案,不需要綁信用卡。把文字或字幕匯出成檔案是付費方案的功能——也就是說,免費方案是讓你先確認自己的音檔究竟能被轉得多準,再決定要不要付費。

可以。MP3、M4A、WAV 等音訊檔,以及 MP4、MOV、WEBM 等影片檔,都可以直接從瀏覽器上傳,不必安裝軟體。單一檔案最長 8 小時、最大 30 GB,這個上限所有方案都一樣。

可以。錄音筆的檔案、手機的語音備忘錄、會議室裡錄下來的音訊,都不必先轉檔,直接上傳就好。錄音時離講話的人越近、背景越安靜,準確率就越高。

是的。這是在瀏覽器裡開啟的網頁服務,沒有要安裝的軟體。上傳、轉文字、確認、匯出,全部在網站裡完成。貼上 YouTube、Instagram、Facebook 的公開連結,也可以不下載影片就直接轉。

平均 98%。準確率會隨音質、背景雜音、專業術語多寡而上下,把公司名與人名登錄進詞彙表,專有名詞的寫法會明顯改善。系統依語言自動分配到評測成績最好的模型,所以不會被單一家模型的強弱綁住。

每一份轉寫結果都會做品質檢查。出現與音訊對不上的內容時,那一段會自動換另一個模型重新處理,不會就這樣寫進逐字稿。靜音就是靜音,不會變成模型想像出來的一句話。內部換模型重跑不會額外扣除額度,扣的只有那一個檔案的份量。

講者會自動辨識並標記,人數也可以自己指定。標點與分段也會自動補回來,不會變成一長串沒有斷句的文字。匯出有 TXT、DOCX、XLSX、Markdown,字幕則是 SRT 與 VTT,也可以一次打包成 ZIP(不支援 PDF 匯出)。

可以。支援 95+ 種語言,中文句子裡夾英文產品名、公司名的說話方式也處理得來。轉寫完成後,還可以再拿到翻譯成另一種語言的文字。

別再把說過的話重新打一次。

把語音變成可以直接交付的成品。

免費開始