結論:Gemini 3.5 Transcribeで何が変わるのか
Googleは2026年8月26日、新しい音声認識モデル「Gemini 3.5 Transcribe」を発表した。公式ブログ「Intelligent transcription with Gemini 3.5 Transcribe」によれば、このモデルはリアルタイムで音声を文字起こしできる点が特徴で、GIGAZINEの報道では「うーん」「あの」といったフィラー(つなぎ言葉)を自動で取り除きながら文字起こしする機能が紹介されている。9to5Googleの記事によると、GboardのRamblerという機能をこのモデルが支えており、今後Chromeにも展開される予定だという。
現時点で分かっているのは「精度と速度が向上した音声認識モデルが登場した」という事実であり、検索ボリュームやCPCなどの需要データはDataForSEO側でも取得できておらず「null」表示になっている。Googleトレンドの推定トラフィックは200+と、急上昇ワードとしてはまだ規模の小さい段階にあるとみられる。つまり、話題性は高いものの、一般ユーザーへの浸透はこれから、という段階の話題だと理解しておくのが実態に近い。
なぜ話題になっているか
話題の中心にあるのは、Googleが同日にGemini関連の音声モデルを立て続けに発表・アップデートしている点だ。ai.google.devの変更履歴(Release notes)には「August 26, 2026: Gemini 3.5 Transcribe generally available (GA)」と記載があり、Geminiの音声理解機能をベースにした2つの専用音声認識モデルが正式提供(GA)されたとされている。同時にX(旧Twitter)のGoogle AI Studio公式アカウントも「our most precise speech-to-text model yet(これまでで最も精度の高い音声認識モデル)」と投稿しており、精度面を前面に押し出したアナウンスになっている。
さらに、arstechnica.comの記事では、Gemini 3.5 Transcribeは従来の音声認識エンジン「Chirp 3」よりも高速かつ高精度だとGoogleが説明しているとされる。つまり、単なる新モデルの追加ではなく、Google内部の音声認識基盤そのものを置き換える動きとして報じられている点が、テック系メディアの関心を集めている理由と考えられる。
背景・時系列
公開情報をもとに、関連する発表を時系列で整理する。
- 2026年6月9日:blog.googleにて「Gemini 3.5 Live Translate」が発表され、70以上の言語でほぼリアルタイムの音声対訳を提供するモデルとして紹介された。同内容は workspace.google.com の日本語ブログでも2026年6月11日付で紹介されている。
- 2026年8月26日:blog.googleが「Gemini 3.5 Transcribe」を発表。リアルタイム文字起こしと、フィラー除去による整形されたテキスト出力が特徴として説明されている。
- 同日:ai.google.devの変更履歴で、Gemini 3.5 Transcribeが2つの専用音声認識モデルとしてGA(一般提供)されたことが記録されている。
- 同日〜翌日にかけて、GIGAZINE、9to5Google、arstechnica.comが相次いで解説記事を掲載し、Gboard RamblerやChromeへの展開予定、Chirp 3との比較などが報じられた。
この流れを見ると、GoogleはLive Translate(音声翻訳)とTranscribe(音声文字起こし)という2系統の音声モデルを、2026年の前半と後半で段階的に発表してきたことが分かる。両者は名前が似ているため混同されやすいが、目的が異なるモデルである点は後述する。
現時点で確認できる事実
与えられた情報から、確実に言える事実を整理する。
- Gemini 3.5 Transcribeは、リアルタイムで音声を文字起こしできる音声認識モデルである(blog.google)。
- フィラー(「うーん」「あの」など)を自動で除去し、整形されたテキストを出力する機能を持つ(GIGAZINE、X投稿)。
- GboardのRambler機能に採用されており、Chromeへの展開も予定されている(9to5Google)。
- 従来の音声認識エンジンChirp 3と比較して、高速かつ高精度だとGoogleは説明している(arstechnica.com)。
- ai.google.devの変更履歴上、2026年8月26日付でGemini 3.5 Transcribeが一般提供(GA)となり、Geminiの音声理解を基盤にした2つの専用モデルとしてリリースされている。
- DeepMindのモデルカードには、Gemini 3.5 TranscribeとGemini 3.5 Transcribe Liveという2種類が存在し、リアルタイム用途を含む開発者・企業向けユースケースが想定されていると記載されている。
一方で、まだ分かっていないことも多い。具体的な対応言語数の全リスト、日本語での精度検証データ、無料枠の詳細条件、一般消費者向けアプリでの提供時期の全容などは、与えられた情報の範囲では確認できない。検索ボリュームやCPC、競合性もDataForSEO側で取得できておらず、需要の大きさを数値で裏付ける材料は現時点でない。
Gemini 3.5 TranscribeとLive Translateの違いを整理する
検索結果を見ると、「Gemini 3.5 Live Translateの使い方」「Geminiはリアルタイム翻訳できるか」といった疑問が並んでいるが、これはGemini 3.5 TranscribeとLive Translateという別モデルが混同されやすいことの表れだと考えられる。与えられた情報を整理すると、次のように役割が分かれている。
- Gemini 3.5 Transcribe:音声を同じ言語のテキストに変換する「文字起こし」モデル。フィラー除去や整形出力が特徴(blog.google、GIGAZINE)。
- Gemini 3.5 Live Translate:音声からの近似リアルタイムな「音声対訳(音声to音声の翻訳)」を70以上の言語で行うモデル(blog.google、workspace.google.com)。
つまり、「文字起こし」と「翻訳」は別モデルとして提供されている。Geminiで自動翻訳ができるかという疑問に対しては、Live Translateがその機能を担っており、Transcribeは翻訳ではなく同一言語内の音声→テキスト変換に特化している、と整理できる。両者ともDeepMindのモデルカードで言及されており、リアルタイム性を重視した設計である点は共通しているが、混同すると使いたい機能に辿り着けない可能性がある。
料金面では、orcarouter.aiの記事にGemini 3.5 TranscribeとWhisper Large v3 Turboの比較として、従量課金が音声1分あたり平均で約0.005ドル、リアルタイム処理向けのライブSKUが1分あたり約0.009ドル、無料枠もあるとの記載がある。ただし、この数値がどの利用規模・条件を前提にしているか、また日本円換算でどの程度になるかは、与えられた情報だけでは断定できず、現時点で未確認としておく。
適する人・適さない人
Gemini 3.5 Transcribeが向いていると考えられるのは、会議や取材の音声をテキスト化する業務が多い人、Gboardなどを通じて音声入力を日常的に使う人、開発者としてAPI経由で音声認識をアプリに組み込みたい人だ。フィラー除去機能により、そのまま議事録や下書きとして使いやすいテキストが得られる点はメリットになり得る。
一方、翻訳機能を求めている人には向かない。前述の通りTranscribeは同一言語内の文字起こしモデルであり、多言語翻訳が目的ならLive Translateを確認する必要がある。また、日本語での精度や対応状況の詳細情報は与えられた情報の範囲にないため、日本語での業務利用を検討している場合は、現時点で未確認な部分が多いことを前提に判断する必要がある。料金体系についても、大量利用時の総コストが明確でないため、コスト重視でツールを選びたい人は追加の確認が必要だろう。
注意点
現時点での注意点をいくつか挙げる。まず、DataForSEOの検索ボリューム・CPC・競合性がすべてnullであることから、このキーワードに対する検索需要の規模は数値では裏付けられていない。Googleトレンドの推定トラフィックも200+とまだ小さい規模であり、話題としては立ち上がったばかりの段階とみられる。
次に、価格情報については第三者サイト(orcarouter.ai)の記述に基づくものであり、Google公式の価格ページの詳細は今回与えられた情報には含まれていない。実際の利用を検討する場合は、金額や無料枠の条件が変更される可能性がある点に留意し、最新の一次情報を別途確認することが望ましい。また、Chromeへの展開時期やGboard以外のアプリへの搭載範囲についても、公式発表の詳細はまだ確認できていない。
よくある質問
Gemini 3.5 Live Translateの使い方は?
与えられた情報の範囲では、具体的な操作手順は確認できない。blog.googleおよびworkspace.google.comの記事では、70以上の言語で近似リアルタイムの音声対訳を提供するモデルであることは説明されているが、アプリ上の操作方法までは記載がなく、現時点で未確認である。
Geminiはリアルタイム翻訳できますか?
Gemini 3.5 Live Translateが、音声から音声への近似リアルタイム翻訳を70以上の言語で提供するとblog.googleおよびworkspace.google.comで説明されている。ただし、これはGemini 3.5 Transcribe(文字起こし専用モデル)とは別のモデルである点に注意が必要だ。
Gemini 3.5 Liveとは?
与えられた情報の中では、「Gemini 3.5 Live Translate」という音声翻訳モデルの名称としてのみ言及があり、それ以外の「Gemini 3.5 Live」という単独の製品・機能についての説明は確認できない。詳細は現時点で未確認とする。



