インタビューの文字起こし — 録音から、話者の分かれた原稿へ

動画または音声をここにドロップ
または
MP4、MOV、MP3、WAV、M4A。2 GB まで。

日本語ソースに従う

インタビューの文字起こしとは、取材や調査で録音した対話を、読んで引用できるテキストに変換する作業です。Subanana では IC レコーダーやスマートフォンの録音(MP3・M4A・WAV など)、収録動画(MP4・MOV など)をブラウザからアップロードすると、AI が自動で文字起こしし、発言者ごとに判別してラベルを付け、「えー」「あの」といった不要語を整理した、句読点と段落つきのテキストを返します。95+ 言語に対応し、平均精度は 98%。外国語インタビューは翻訳先を 1 言語指定できます。TXT・DOCX・XLSX・Markdown で書き出せ、各ファイル最初の 15 分は無料で確認できます。

クレジットカード不要。最初の 15 分は無料でプレビューできます。

  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush
  • Google
  • Deloitte
  • dentsu
  • Manulife
  • NAVER
  • Philips
  • Amazon
  • Shopify
  • Figma
  • Coinbase
  • WPP
  • Semrush

録音が文字起こしになるまで

インタビュー録音

M4A · 58:12 · アップロード済み

ファイルをアップロード、リンクを貼り付け、またはブラウザで録音95+ 言語に対応、文中の言語切り替えも認識

文字起こし

00:12

リリースは6月の第1週に変更します。

00:47

了解です——ただし料金ページはそれまでに確定を。

文字起こし

TXT · DOCX · XLSX · Markdown

字幕ファイル

SRT · VTT

翻訳

95+ 言語

要約

要点 · アクションアイテム

質問

文字起こしに直接質問

チームが録音を Subanana に任せる理由

機能一覧ではなく、聞き直さずに使える文字起こしかどうかを決める要素です。

解読ではなく、読める文字起こし

  • 話者を自動分離どの発言が誰のものか、一行ごとに自動で識別します。
  • 句読点と段落自動で復元され、壁のような文字列ではなく文章として読めます。
  • 整えられたテキスト意味はそのままに、言い淀みだけが取り除かれます。
  • 文字起こしに質問エディタ内で録音に質問し、実際の発言に基づく回答を得られます。

精度は約束ではなく、仕組みで作る

  • 言語ごとに最良モデル音声モデルを継続的に評価し、各ファイルをその言語で最高性能のモデルに割り当てます。
  • ハルシネーション検知疑わしい出力は届く前に検出され、別のエンジンで再処理されます。
  • 固有名詞はあなたの表記で人名・製品名・専門用語を用語集に登録し、プロジェクト全体に適用します。
  • 提案してから確定AI 校正が聞き間違いの修正を提案。承認するまで何も変わりません。

ここで音声を文字にしている人たち

流れは同じ。違うのは成果物です——文字起こし、議事録、字幕、要約。

会議・通話

ビジネスチーム

文字起こしの上に要約・決定事項・タスク。会議の記憶が新しいうちに共有できます。

動画・ポッドキャスト

クリエイター

一つの文字起こしから字幕・概要欄・引用句が生まれ、どのプラットフォームにも使えます。

インタビュー

記者・研究者

引用は一字一句正確に、話者を明記して——締切より前に仕上がります。

講義

学生・教育者

長い録音も要約付き・検索可能で届き、復習は重要な箇所から始められます。

インタビュー録音を文字起こしする方法

アップロードして、言語と人数を設定し、AI が話者を分けて文字起こしし、エディタで確認して書き出す——四つの手順がすべてブラウザで完結します。

  1. インタビューの録音をアップロードするIC レコーダーやスマートフォンで録った音声(.mp3・.m4a・.wav・.ogg・.aac・.flac・.opus)、あるいは収録した動画(.mp4・.mov・.m4v・.webm・.mkv・.mpeg)を、変換せずにそのままブラウザにドラッグしてください。1 ファイル最長 8 時間・最大 30 GB、全プラン共通です。
  2. 言語を選び、話者の人数を指定する話されている言語を選びます。一対一のインタビューなら話者数を 2 に指定すると話者の分かれ方が安定します。座談会やグループインタビューでは自動判別に任せることもできます。外国語のインタビューには、翻訳先の言語を 1 つ追加できます。
  3. AI が話者を分けて文字起こしする言語ごとにベンチマークで最も成績のよいモデルへ自動的に振り分け、発言者ごとにラベルを付け、不要語を整理して句読点と段落を復元します。疑わしい区間はそのまま反映されず、別のエンジンで自動的に処理し直されます。
  4. 確認して、引用箇所を探して、書き出すエディタで発言を確認し、「この話題についてどう答えたか」と AI に直接尋ねて引用箇所を探せます。仕上がったら TXT・DOCX・XLSX・Markdown で書き出します。書き出しは有料プランの機能です。

インタビュー文字起こしに含まれるもの

取材・研究の実務で判断できるよう、具体的な数値で示します。

話者分離
発言者ごとに自動判別してラベル付け。人数の手動指定にも対応
整文(ケバ取り)
「えー」「あの」などの不要語を整理し、句読点と段落を復元
入力
音声(.mp3・.m4a・.wav・.ogg・.aac・.flac・.opus)、動画(.mp4・.mov・.m4v・.webm・.mkv・.mpeg)、公開の YouTube/Instagram/Facebook リンク
精度
平均で 98%
言語
95+ 言語。外国語インタビューは翻訳先を 1 言語指定可
書き出し形式
TXT・DOCX・XLSX・Markdown、字幕は SRT・VTT、まとめて ZIP(PDF 書き出しは非対応)
ファイル上限
1 ファイル 8 時間・30 GB、全プラン共通
無料プラン
各ファイル最初の 15 分、月 3 ファイル、カード不要(書き出しは有料プラン)

文字起こしのあと、原稿と分析へ

話者の分かれたテキストは、記事にも論文にも、そのまま材料として使えます。

  • 引用箇所を対話で探す「値上げについては何と答えたか」「一番強い言葉で語った場面はどこか」とエディタ上で直接尋ねると、根拠の発言を示しながら答えます。60 分の録音を頭から聞き直さずに、記事の引用や論文のコーディング箇所にたどり着けます。
  • 専門用語と人名の表記を固定研究テーマの専門用語、取材先の社名・人名を用語集に登録すれば、以降のファイルでも同じ表記に揃います。XLSX・CSV の一括読み込みに対応し、調査計画書などの資料を参考情報として渡すこともできます。
  • 外国語インタビューの翻訳英語で行ったインタビューを日本語で読む、といった使い方ができます。文字起こしと同じジョブで翻訳先を 1 言語指定でき、元の言語のテキストと突き合わせながら確認できます。
  • 要約テンプレート30 種類以上のテンプレートから選んで、要点・発言の流れを要約として書き出せます。複数本のインタビューを比べる前の、一次整理に使えます。

よくいただくよくある質問

四つの手順です。(1) 録音をブラウザにドラッグしてアップロードする。(2) 言語を選び、話者の人数(一対一なら 2)を指定する。(3) AI が話者を分けて文字起こしし、句読点と段落を整える。(4) エディタで確認して書き出す。アプリのインストールも、ファイルの変換も要りません。

分かれます。発言者ごとに自動でラベルが付き、人数を手動で指定することもできます。一対一のインタビューでは話者数を 2 に指定すると確実です。ラベルは「話者 1」「話者 2」のような区別で、声紋から個人を特定するものではありません。

不要語は AI が整理し、句読点と段落を復元した読みやすいテキストになります。逐語の記録が必要な研究用途では、エディタで音声を聞きながら表現を確認・修正できるので、整えられた本文を出発点に、必要な箇所だけ元の言い回しに戻す使い方が現実的です。

使えます。話者ラベルつきのテキストを DOCX や TXT で書き出して、分析ソフトに読み込む流れです。専門用語を用語集に登録しておくと表記が安定します。逐語性が求められる箇所は、エディタで音声と突き合わせて確認してください。

できます。95+ 言語に対応し、言語ごとにベンチマークで最も成績のよいモデルへ自動で振り分けます。さらに同じジョブで翻訳先を 1 言語指定できるので、英語インタビューを日本語で読む、といった使い方ができます。

人手のテープ起こしは納品まで日数がかかり、録音時間あたりの単価も高くなりがちです。AI の文字起こしは数分で結果が返り、各ファイル最初の 15 分は無料で品質を確かめられます。最終的な正確さの責任を人に置きたい案件では人手が向きますが、まず AI で全文を起こし、重要箇所だけ自分で確認する流れが、時間と費用のバランスでは現実的です。

無料アカウントでファイルをアップロードし、各ファイル最初の 15 分ぶんの結果を、月 3 ファイルまで確認できます。カードの登録は不要です。自分の録音環境でどこまで正確に起こせるかを、書き出しの前に確かめられます。

平均精度は 98% ですが、音の明瞭さ、背景の雑音、専門用語の多さで上下します。カフェでの取材のような録音では、レコーダーを話し手の近くに置くだけで結果がはっきり変わります。疑わしい区間は品質チェックで検出され、別のモデルで自動的に処理し直されます。

2026-08-28 更新