話者分離つき文字起こし — 「誰が何を言ったか」まで、自動で

動画または音声をここにドロップ
または
MP4、MOV、MP3、WAV、M4A。2 GB まで。

日本語ソースに従う

話者分離つき文字起こしとは、複数人が話している録音をテキストにする際、発言を発言者ごとに分けてラベルを付ける処理のことです。Subanana では音声ファイル(MP3・M4A・WAV など)や動画(MP4・MOV など)をブラウザからアップロードすると、AI が自動で文字起こしし、話者を判別してラベルを付け、句読点と段落を復元したテキストを返します。話者の人数は自動判別に任せることも、手動で指定することもできます。95+ 言語に対応し、平均精度は 98%。TXT・DOCX・XLSX・Markdown、字幕なら SRT・VTT で書き出せ、各ファイル最初の 15 分は無料で確認できます。

クレジットカード不要。最初の 15 分は無料でプレビューできます。

  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush
  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush

録音が文字起こしになるまで

インタビュー録音

M4A · 58:12 · アップロード済み

ファイルをアップロード、リンクを貼り付け、またはブラウザで録音95+ 言語に対応、文中の言語切り替えも認識

文字起こし

00:12

リリースは6月の第1週に変更します。

00:47

了解です——ただし料金ページはそれまでに確定を。

文字起こし

TXT · DOCX · XLSX · Markdown

字幕ファイル

SRT · VTT

翻訳

95+ 言語

要約

要点 · アクションアイテム

質問

文字起こしに直接質問

チームが録音を Subanana に任せる理由

機能一覧ではなく、聞き直さずに使える文字起こしかどうかを決める要素です。

解読ではなく、読める文字起こし

  • 話者を自動分離どの発言が誰のものか、一行ごとに自動で識別します。
  • 句読点と段落自動で復元され、壁のような文字列ではなく文章として読めます。
  • 整えられたテキスト意味はそのままに、言い淀みだけが取り除かれます。
  • 文字起こしに質問エディタ内で録音に質問し、実際の発言に基づく回答を得られます。

精度は約束ではなく、仕組みで作る

  • 言語ごとに最良モデル音声モデルを継続的に評価し、各ファイルをその言語で最高性能のモデルに割り当てます。
  • ハルシネーション検知疑わしい出力は届く前に検出され、別のエンジンで再処理されます。
  • 固有名詞はあなたの表記で人名・製品名・専門用語を用語集に登録し、プロジェクト全体に適用します。
  • 提案してから確定AI 校正が聞き間違いの修正を提案。承認するまで何も変わりません。

ここで音声を文字にしている人たち

流れは同じ。違うのは成果物です——文字起こし、議事録、字幕、要約。

会議・通話

ビジネスチーム

文字起こしの上に要約・決定事項・タスク。会議の記憶が新しいうちに共有できます。

動画・ポッドキャスト

クリエイター

一つの文字起こしから字幕・概要欄・引用句が生まれ、どのプラットフォームにも使えます。

インタビュー

記者・研究者

引用は一字一句正確に、話者を明記して——締切より前に仕上がります。

講義

学生・教育者

長い録音も要約付き・検索可能で届き、復習は重要な箇所から始められます。

話者分離つきで文字起こしする方法

アップロードして、言語と話者の人数を設定し、AI が話者ラベルつきで文字起こしし、確認して書き出す——すべてブラウザ上で完結し、インストールは不要です。

  1. 録音をアップロードする会議やインタビューの録音をブラウザにドラッグしてください。音声(.mp3・.m4a・.wav・.ogg・.aac・.flac・.opus)も動画(.mp4・.mov・.m4v・.webm・.mkv・.mpeg)も、変換なしでそのまま使えます。1 ファイル最長 8 時間・最大 30 GB で、この上限はどのプランでも同じです。
  2. 言語と話者の人数を設定する話されている言語を選び、話者の人数を指定します。人数が分からなければ自動判別に任せて構いません。二人のインタビューのように人数がはっきりしている録音では、手動で指定すると話者の分かれ方が安定します。
  3. AI が話者を分けながら文字起こしする言語ごとにベンチマークで最も成績のよいモデルへ自動的に振り分け、発言者ごとにラベルを付け、句読点と段落を復元します。疑わしい区間はそのまま反映されず、別のエンジンで自動的に処理し直されます。
  4. 確認して、質問して、書き出すエディタで話者ごとの発言を確認し、必要なら AI の校正提案を見て承認したうえで、TXT・DOCX・XLSX・Markdown、字幕なら SRT・VTT で書き出します。まとめて ZIP でも受け取れます。書き出しは有料プランの機能です。

話者分離つき文字起こしに含まれるもの

形容詞ではなく具体的な数値です。いま使っているツールと直接比べてください。

話者分離
発言者を自動判別してラベル付け。人数の手動指定にも対応
入力
音声(.mp3・.m4a・.wav・.ogg・.aac・.flac・.opus)、動画(.mp4・.mov・.m4v・.webm・.mkv・.mpeg)、公開の YouTube/Instagram/Facebook リンク
精度
平均で 98%
言語
95+ 言語対応
構造
話者ラベル、句読点、段落を自動で復元
翻訳
文字起こしでは、翻訳先の言語を 1 つ指定できます
書き出し形式
TXT・DOCX・XLSX・Markdown、字幕は SRT・VTT、まとめて ZIP(PDF 書き出しは非対応)
ファイル上限
1 ファイル 8 時間・30 GB、全プラン共通
無料プラン
各ファイル最初の 15 分、月 3 ファイル、カード不要(書き出しは有料プラン)

話者が分かれたテキストから、そのまま次の成果物へ

「誰が言ったか」が分かるテキストは、議事録にも記事にも研究データにもそのまま使えます。

  • 要点と決定事項の抽出会議、講演、ビジネス、法務など 30 種類以上のテンプレートから選び、要点・決定事項・次の行動を要約として書き出します。発言者が分かれているので、「誰の発言か」を確認しながら要約を直せます。
  • 文字起こしへの質問「この件は誰が引き受けたか」「A さんは何と答えたか」とエディタ上で直接尋ねると、根拠になった発言を示しながら答えます。長い録音を頭から聞き直す必要はありません。
  • 固有名詞をそろえる用語集社名・人名・専門用語を登録すれば、以降のファイルは同じ表記に揃います。ワークスペース全体の用語集とプロジェクトごとの用語集を使い分けられ、XLSX や CSV での一括読み込みにも対応します。
  • 翻訳と字幕同じ音源から、別の言語に翻訳したテキストを 1 言語ぶん受け取れます。動画なら SRT・VTT の字幕ファイルや、字幕を焼き込んだ動画としても書き出せます。

よくいただくよくある質問

複数人が話している録音をテキストにする際、発言を発言者ごとに分けてラベルを付ける処理です。Subanana では文字起こしと同時に自動で行われ、「話者 1」「話者 2」のようにラベルの付いた、句読点と段落も復元された読めるテキストが返ります。

できます。自動判別に任せることも、手動で人数を指定することもできます。二人のインタビューや三人の会議のように人数がはっきりしている録音では、手動指定が確実です。

自動で付くのは「話者 1」「話者 2」のような区別ラベルです。声紋から個人を特定する仕組みではありません。文字起こし後にエディタで発言を確認しながら整えられます。

会議・座談会・パネルディスカッションのような複数人の録音で使えます。人数の指定は手動でも自動でも構いません。話者が重なって同時に話している区間や、声質が近い話者どうしは、どのツールでも分離が難しくなるため、エディタでの確認をおすすめします。

音声は MP3・M4A・WAV・OGG・AAC・FLAC・OPUS、動画は MP4・MOV・M4V・WEBM・MKV・MPEG に対応し、変換なしでアップロードできます。公開されている YouTube・Instagram・Facebook のリンクを貼り付けて取り込むこともできます。1 ファイル最長 8 時間・最大 30 GB で、全プラン共通です。

無料アカウントでファイルをアップロードし、各ファイル最初の 15 分ぶんの結果を、月 3 ファイルまで確認できます。カードの登録は不要です。話者分離の精度を自分の録音で確かめてから、書き出しの必要に応じて有料プランを検討してください。

文字起こしの平均精度は 98% です。音の明瞭さ、背景の雑音、専門用語の多さで上下します。話者分離は、マイクが話し手から遠い録音や声質の近い話者で難しくなるため、重要な録音では各話者の近くで録るほど結果が良くなります。用語集に社名や人名を登録しておくと、固有名詞の表記も改善します。

TXT、DOCX、XLSX、Markdown、字幕なら SRT と VTT で書き出せ、まとめて ZIP でも受け取れます(PDF での書き出しには対応していません)。文字起こしのあとに、別の言語へ翻訳したテキストを 1 言語ぶん受け取ることもできます。

2026-08-28 更新