コンテンツへスキップ

Gemini 3.5 Transcribe登場、文字起こしAI

Darius Z. 著者: Darius Z. 8 分で読めます
ポッドキャスト用デスクに置かれたスマートフォンに光る音声波形が表示され、Gemini 3.5 Transcribeの登場を示すイメージ

アフィリエイトリンクを含みます

Gemini(ジェミニ)3.5 Transcribeは、Google自身のベンチマークと第三者による検証の両方で、同社がこれまでに出した中で最も精度の高い音声認識モデルです。2026年8月26日にパブリックプレビューとして公開されました。モデルは用途の異なる2つのAPIとして提供されます。ひとつは、その場で音声をやり取りするアプリ向けにリアルタイムでストリーミング処理するオプション、もうひとつは、話者ラベルと単語レベルのタイムスタンプを付けられる、ポッドキャストや会議、インタビュー向けの録音済み音声処理オプションです。

Googleはこの新モデルに、文中の言い直しを検知し、フィラーワードを取り除き、出力を自動整形する「スマート文字起こし」モードを組み込みました。多くの音声認識ツールが標準としてきた、話した内容をそのまま書き起こす逐語モードに加えて用意されたものです。第三者検証機関Artificial Analysisの計測によると、単語エラー率は録音済み音声で2.6%、ライブストリーミングで4.0%。置き換え対象となる旧モデルChirp 3と比べ、最終的な文字起こし完成までの時間は70%短縮されています。提供はすでにGboard、Google Antigravity、AI Studio、macOS版Geminiアプリにまで広がっています。

重要ポイント

  • Gemini 3.5 Transcribeは2026年8月26日にパブリックプレビューを開始。リアルタイムのLive APIと、話者識別・単語レベルのタイムスタンプに対応した録音済み音声用のInteractions APIに分かれています
  • Artificial Analysisの計測で単語エラー率は録音済み音声2.6%、ライブストリーミング4.0%。置き換え対象のChirp 3と比べ、最終的な文字起こしの完成速度は70%向上しています
  • スマート文字起こしモードがフィラーワードの除去や言い直しの解消、自動整形を担当。標準の逐語モードやカスタム語彙の事前登録にも対応しています
  • 85以上の言語を自動検出でカバーし、地域ごとのアクセントにも対応。会話の途中で言語が切り替わってもそのまま追従します
  • すでにGboardのRambler、Google Antigravity、AI StudioのBuildモード、macOS版Geminiアプリで稼働しており、Chrome対応も近日予定です

音声AIと文字起こしをElevenLabs一つに

ElevenLabsなら本番品質のテキスト読み上げ、音声クローン、吹き替え、独自の文字起こしモデルScribeまで、一つのワークスペースにまとまっています。プレビューではなく、今すぐ使える形で。

ElevenLabsを無料で試す →

リアルタイムか録音済みか:Gemini Transcribe APIの仕組み

Gemini 3.5 Transcribeは、用途の異なる2つのAPIに分かれています。Live API(gemini-3.5-transcribe-live)は双方向で音声を絶え間なくストリーミングし、1秒未満のレイテンシでテキストを返します。発話の間を待っていられない音声エージェントなどのアプリ向けです。Interactions API(gemini-3.5-transcribe)は録音済み音声を処理し、話者識別と単語レベルのタイムスタンプを付加します。ポッドキャストの編集者や会議メモの作成者が必要とする形式です。

両APIとも、実際の会話にありがちな「乱れ」への対応は共通しています。標準の逐語モードは、フィラーワードも含めて話された内容をそのまま書き起こします。別途用意されたスマートモードは、「火曜日、じゃなくて水曜日に会いましょう」のような日常会話でよくある言い直しを解消し、「えー」「あの」といったフィラーワードを取り除いた上で、文章を整形して出力します。

カスタム語彙にも対応しています。専門用語や製品名、変わったスペルなどを事前に登録しておけば、推測に頼らず正確に認識します。Interactions APIはさらに、複数の話者を識別してそれぞれにタイムスタンプを付けることもできます。

情報: 話者識別は3人まで安定動作

話者識別は同じ録音内に3人までであれば信頼性が高い一方、Googleは4人以上への対応を実験的機能と位置づけています。大人数の座談会やパネルディスカッションでは、手作業での修正が必要になる場合があります。

Gemini 3.5 Transcribeの精度はどれくらい?

Googleの精度に関する主張は、第三者機関の検証によって裏付けられています。Artificial Analysisの計測では、Interactions API経由の録音済み音声で単語エラー率2.6%、Live API経由のライブストリーミングで4.0%。ノイズの多い環境でも安定して機能し、郵便番号や注文番号のような英数字の文字列も正確に捉えます。

幅広い言語セットで精度を検証する多言語ベンチマークFLEURSでは、非ストリーミング音声で単語エラー率5.04%、ストリーミング音声で5.50%を記録しました。日本語もこの85以上の対応言語に含まれており、文字起こしを日常的に使う日本語ユーザーにとっても実用的な精度域に入っています。

2.6% 単語エラー率(録音済み音声)
4.0% 単語エラー率(ライブストリーミング)
70% Chirp 3比、文字起こし完成の高速化
85+ 対応言語数

Chirp 3はGoogleの旧世代の文字起こしモデルで、この70%という速度向上の基準点になっています。Googleは、新モデルが低い単語エラー率に加えて新機能ももたらすとしていますが、実務上もっとも分かりやすい違いは速度です。Artificial AnalysisはChirp 3比70%の高速化を確認しており、これはLive APIが想定するリアルタイム用途、つまり遅延がそのまま体感されてしまう場面で特に効いてきます。

Gemini 3.5 Transcribeは今どこで使えるのか?

利用可能な範囲は対象ユーザーによって異なります。開発者はGoogle AI StudioのGemini API経由、あるいはGoogle Antigravity上で、すでにGemini 3.5 Transcribeを試せます。エンタープライズ向けにはGemini Enterprise Agent Platformでパブリックプレビューとして提供され、Gemini Enterprise for Customer Experienceは近日対応予定と案内されています。一般ユーザー向けにはすでに4つの製品に組み込まれています。

GboardのRambler

一部の国と言語で提供される、とりとめのない話し言葉を整った文章に変換するAndroidキーボード機能。すでに書き起こした内容を音声で編集することもできます

Google Antigravity

画面上のコンテキストと、許可があればチャット履歴も活用し、ファイル名などの細部の認識精度を高めます

AI StudioのBuildモード

キーボード入力の代わりに声でプロジェクトの変更点を指示する、音声主導のコーディング体験です

macOS版Geminiアプリ

現時点では英語のみ対応。画面の内容を読み取る音声コマンドで、ローカルファイルの要約やカーソル位置への画像生成を指示できます

Chrome対応も近く始まる予定で、ウェブフォームやテキスト欄への入力をタイピングの代わりに音声で行えるようになります。macOS版ではさらに、会話の途中で画像生成やファイル分析を頼むと、関数呼び出しによって別のGeminiモデルへ自動的にタスクが引き継がれます。Gemini 3.5 Transcribeはその作業自体を担うのではなく、あくまで音声インターフェースとして機能する仕組みです。

実際に手を動かすクリエイターにとって、実用的な使い道は普段使っているツールの延長線上にあります。生のポッドキャスト録音を検索可能なテキストに変換する、動画の書き出し前に字幕の下書きを作る、粗い台本をタイピングの代わりに口述する、あるいはできあがったクリーンな文字起こしを最高のAIテキスト読み上げツールに流し込んで別言語の吹き替えボイスオーバーを作る、といった具合です。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsといった開発者向けプラットフォームはすでに対応済みで、Vivo、Intellitek Health、Lingopalなどの早期利用企業はGoogleが発表時に公開したフィードバックの中で、レイテンシ・精度・言語カバレッジの高さを挙げています。

文字起こしを「インフラ」にするGoogleの狙い

Googleは8月26日のローンチにあたって、専用の製品ページも価格表も用意しませんでした。代わりにキーボード、コーディングツール、OS標準のアシスタントといった、すでに人々が使っているものの内側にレイヤーとしてモデルを組み込みました。専業の音声AIプラットフォームが掲げてきた売り込み方とは異なるアプローチです。

ElevenLabs(イレブンラボ)は、逆の方向から事業を築いてきました。文字起こしを他のアプリに埋め込まれた裏方の機能としてではなく、複数機能のうちの一つとして提供するプラットフォームです。自社の音声認識モデルScribeは、テキスト読み上げや音声クローン、吹き替えも扱う一つのワークスペースの中にあり、音声制作のために作られたツールを一つにまとめて使いたい人たちに向けたものです。音声エージェントを組み立てる開発者と、学ぶべきAPIではなく完成したインターフェースだけを求める動画編集者とでは、必要なものがまったく違います。

Gemini 3.5 Transcribeが変えるのは、その前提となる水準です。これほど精度の高いモデルがキーボードアプリに無料で搭載されてしまえば、まともな文字起こしのために別料金のサブスクリプションを払うことが当たり前ではなくなります。同じ予算を奪い合うプラットフォームは、精度の高さだけでは足りない、もっと明確な理由を示す必要に迫られます。Googleは今四半期、Gemini関連の機能を立て続けに出しており、AI生成メディア向けの透かしトグルから今回の文字起こしローンチまで、パターンは同じです。機能を単体の製品として売るのではなく、インフラとして出荷しています。この流れは引き続き追う価値があり、関連する動きはAIニュースフィードでまとめて追えます。

文字起こしをElevenLabsの吹き替えにつなげる

きれいな文字起こしは、吹き替え制作の最初の一歩です。ElevenLabsならそのスクリプトを数十言語のボイスオーバーに変換でき、音声クローンで元の話者のトーンもそのまま残せます。

ElevenLabsで吹き替えを始める →

よくある質問

Gemini 3.5 Transcribeは無料ですか?

Googleはパブリックプレビュー時点でのGemini 3.5 Transcribeの料金を公開していません。開発者はGoogle AI StudioのGemini API経由やGoogle Antigravity内で今すぐ試すことができ、macOS版GeminiアプリやGboardのRamblerを通じた一般ユーザー向けの利用にも別料金は発生しませんが、発表内容にプレビュー期間中のAPI料金の記載はありません。

Gemini 3.5 Transcribeの精度はどのくらいですか?

Artificial Analysisの独自ベンチマークによると、Gemini 3.5 Transcribeの単語エラー率は録音済み音声で2.6%、ライブストリーミング音声で4.0%です。主要言語を対象にした多言語ベンチマークFLEURSでは、非ストリーミングで5.04%、ストリーミングで5.50%という結果が出ています。Googleは、ノイズの多い環境でも安定して動作し、郵便番号や注文番号のような英数字の文字列も正確に認識するとしています。

Gemini 3.5 Transcribeは何言語に対応していますか?

Gemini 3.5 Transcribeは自動言語検出を備え、85以上の言語に対応しています。地域ごとのアクセントにも対応し、次に話される言語を事前に指定しなくても、ライブ会話の途中で言語が切り替わればそのまま追従します。

GboardのRamblerとは何ですか?

RamblerはAndroid向けGboardの機能で、Gemini 3.5 Transcribeを使ってとりとめのない話し言葉を整った文章に変換します。一度でうまくまとまった文にならない口述筆記のために作られており、すでに文字起こしされたテキストを手で打ち直すのではなく、音声での編集にも対応しています。

Gemini 3.5 TranscribeはChirp 3と何が違いますか?

Gemini 3.5 Transcribeは、Googleの文字起こしモデルとしてChirp 3を置き換えるもので、新機能に加えて単語エラー率の低下、そして体感できるほどの応答速度の向上を実現しています。Artificial Analysisの計測では、最終的な文字起こし完成までの時間がChirp 3比で70%改善しており、フィラーワードの除去や言い直しの解消といった、Chirp 3にはなかったスマート文字起こし機能も備えています。

Gemini 3.5 Transcribeと専用の文字起こしプラットフォーム、どちらを使うべきですか?

すでにGoogleの各サービスを使っていて、自社アプリにAPIを組み込みたい開発者にはGemini 3.5 Transcribeが向いています。GboardやAntigravity、AI Studioといったツールに文字起こしがバンドルされているためです。一方、本番の音声制作にはElevenLabsのような専業プラットフォームの方が適しています。自社の音声認識モデルScribeにテキスト読み上げ、音声クローン、吹き替えを一つのワークスペースにまとめており、生の文字起こしではなく完成した音声を成果物とするチーム向けに作られています。


出典

  1. Google: Gemini 3.5 Transcribe - Google、2026年8月26日
  2. 9to5Google: Gemini 3.5 Transcribe - 9to5Google、2026年8月26日
  3. Business Today: Google launches Gemini 3.5 Transcribe with smarter speech-to-text and 85 language support - Business Today、2026年8月27日
  4. Google AI for Developers: Transcribe audio - Google AI ドキュメント

この記事は役に立ちましたか?

0:00