【Gemini 3.5 Transcribe】Googleの最新音声認識モデル!WER 2.6%の精度・料金・使い方を徹底解説

- Gemini 3.5 Transcribeは、Googleが2026年8月27日に公開した最高精度の音声→テキスト変換モデル
- Artificial Analysis計測でストリーミング時WER 4.0%、非ストリーミング時WER 2.6%を達成し、前モデルChirp 3を大幅に上回る
- Pixel 11のGboard「Rambler」機能を裏で支えており、Chrome・Docs・Gmail・Keepなど主要Google製品への展開も予定
2026年8月27日、GoogleはGeminiシリーズの最新音声認識モデル「Gemini 3.5 Transcribe」をパブリックプレビューとして公開しました!
従来の音声認識モデルが苦手としてきたバックグラウンドノイズ・専門用語の認識・フィラーワードの除去といった課題に真正面から向き合い、生の音声を「正確で整った、フォーマット済みのテキスト」に直接変換するというコンセプトで設計されています。すでにPixel 11シリーズのGboard「Rambler」機能やmacOS版Geminiアプリでその実力が発揮されており、SNS上では「これで有料の文字起こしツールは不要になるのでは」と驚きの声が続出しています。
この記事では、Gemini 3.5 Transcribeの概要から技術的な仕組み、料金体系、具体的な使い方までを徹底解説していきます。ぜひ最後までご覧ください!
\生成AIを活用して業務プロセスを自動化/
このたびWEELは、2026年8月26日(水)・27日(木)に新宿住友ビル 三角広場で開催される「AI博覧会 Summer 2026」に出展することになりました。
さらに、弊社代表取締役社長の田村洋樹が、8月27日(木)14時40分からA会場で実施するカンファレンスに登壇いたします!
Gemini 3.5 Transcribeとは?

Gemini 3.5 Transcribeは、Google DeepMindが開発したGemini 3.5シリーズに属する音声→テキスト特化型のAIモデルです。従来のChirp 3に代わる新たな音声認識基盤として位置づけられており、「話者の自然な話し方のスタイルをキャプチャして、意図を正確に理解する」設計思想が大きな特徴となっています。
| 開発元 | Google DeepMind |
|---|---|
| カテゴリ | 音声→テキスト変換(Speech-to-Text) |
| モデル名 | gemini-3.5-transcribe(非ストリーミング)/ gemini-3.5-transcribe-live(ストリーミング) |
| 対応言語 | 85言語以上(自動言語検出対応) |
| WER(単語誤り率) | ストリーミング:4.0% / 非ストリーミング:2.6%(Artificial Analysis計測) |
| 前モデル | Chirp 3 |
| 提供形態 | パブリックプレビュー |
| 主な提供先 | Gemini API(Google AI Studio)、Gemini Enterprise Agent Platform、Gboard Rambler、macOS Geminiアプリ、Chrome(近日提供) |
| 公式サイト | https://ai.google.dev/gemini-api/docs/transcribe |
具体的なAPIは2種類に分かれています。1つ目はリアルタイム用途向けのgemini-3.5-transcribe-liveで、Live APIを介した双方向ストリーミングによるサブセカンド(1秒未満)レイテンシの音声認識を提供します。2つ目は録音済み音声用のgemini-3.5-transcribeで、Interactions APIを介して話者識別やワードレベルのタイムスタンプ付きで高精度な文字起こしを行えます。
Gemini 3.5 Live Translateとの違い
同時期にリリースされているGeminiの音声モデルとの違いを明確にしておきましょう。

2026年6月にGoogleが公開した「Gemini 3.5 Live Translate」は、70以上の言語でリアルタイムの音声→音声翻訳を行うモデルです。一方、今回のGemini 3.5 Transcribeは音声→テキスト変換(文字起こし)に特化しています。
Live Translateは「日本語で話した内容をそのまま英語の音声に翻訳して出力する」ことを目的としており、翻訳後のアウトプットも音声です。対してTranscribeのアウトプットはテキストであり、フィラーワードの除去・自動フォーマット・話者識別といったテキスト品質の最適化に力点が置かれています。
Gemini 3.5 Live Translateは下記で解説

Gemini 3.5 Transcribeの仕組み

Gemini 3.5 Transcribeのアーキテクチャ詳細はモデルカードとして完全に公開されているわけではありませんが、公式ブログや関連ドキュメントから読み取れる構成は以下のようになっています。
まず、入力段階では生の音声波形を直接取り込みます。従来の音声認識モデルのように中間的な音素変換を介するのではなく、エンドツーエンドのニューラルネットワーク処理により、音声から直接テキストを生成する仕組みです。この設計により、話者の意図や自然な文脈を保持したまま変換が可能になっています。
次に処理の中核となるのが、文脈認識型のトランスクリプションです。Gemini 3.5 Transcribeはカスタムボキャブラリー機能を備えており、ユーザーが事前に指定した専門用語や固有のスペルを認識に反映できます。郵便番号や注文IDといった英数字エンティティも正確にキャプチャできると公式が明言しています。
さらに特筆すべきは、スマートトランスクリプション機能です。「火曜日に会おう——いや、水曜日で」のような発話中の自己修正をシームレスに処理し、「えーと」「あのー」といったフィラーワードを自動的に除去して整ったテキストに変換します。単なる音声認識にとどまらず、出力テキストの品質まで最適化している点が従来モデルとの大きな違いです。
Gemini 3.5 Transcribeの特徴
Gemini 3.5 Transcribeのパフォーマンスは、複数のベンチマークで前モデルを大幅に上回っています。
まず精度面では、Artificial Analysisの計測で非ストリーミング時のWER(単語誤り率)が2.6%、ストリーミング時でも4.0%という結果を記録しています。このスコアはArtificial AnalysisのAA-WERランキングで5位に位置しており、専用の音声認識モデルとして十分に競争力のある数値です。

FLEURSベンチマーク(主要言語・ロケールのセット)においても、ストリーミングモードで5.50%、非ストリーミングでは5.04%のWERを達成しており、Chirp 3と比べて全体的な多言語性能が改善されています。
レイテンシの観点では、前モデルChirp 3に対して最終的な文字起こし完了までの時間が70%改善したとGoogleは公式ブログで述べています。ストリーミング時のレイテンシは0.40秒と、リアルタイム用途にも十分対応できる水準です。
Geminiの音声会話は下記で解説

Gemini 3.5 Transcribeの安全性・制約
Gemini 3.5 Transcribeは2026年8月時点でパブリックプレビュー版であり、正式な一般提供(GA)には至っていません。そのため、プレビュー版特有のレート制限が適用される点には注意が必要です。
話者識別機能については、録音済み音声で最大3話者までが安定してサポートされており、3人以上の話者識別は実験的なサポートとなっています。大人数の会議録の文字起こしを検討する場合は、この制約を考慮する必要があるでしょう。
Gemini 3.5 Transcribeの料金
Gemini 3.5 Transcribeの料金体系を見ていきましょう。APIは2種類あり、リアルタイムストリーミング用の「Transcribe Live」と録音済み音声用の「Transcribe」でそれぞれ異なる料金設定となっています。いずれも無料ティアが用意されているため、まずは試しに使ってみることが可能です。
| モデル | 項目 | 無料ティア | 有料ティア(100万トークンあたり / USD) |
|---|---|---|---|
| Transcribe Live(リアルタイム) | 入力 | 無料 | $3.50(約$0.005/分 ※音声) |
| 出力 | 無料 | $21.00(約$0.004/分 ※テキスト) | |
| ブレンド実効レート | – | 約$0.009/分 | |
| Transcribe(録音済み音声) | 入力 | 無料 | $2.00(約$0.003/分 ※音声) |
| 出力 | 無料 | $12.00(約$0.002/分 ※テキスト) | |
| ブレンド実効レート | – | 約$0.005/分 |
Gemini 3.5 Transcribeのライセンス
Gemini 3.5 Transcribeのライセンス体系を整理しておきましょう。Gemini 3.5 Transcribeはオープンソースモデルではなく、GoogleのプロプライエタリモデルとしてクラウドAPI経由で提供されるSaaS形式のサービスです。モデルの重みをダウンロードしてローカルで実行するような使い方はできません。
| 利用用途 | 可否 | 備考 |
|---|---|---|
| 商用利用 | ⭕️ | 有料ティア推奨。無料ティアではデータがGoogle製品改善に利用される可能性あり |
| 改変 | ❌ | モデル自体のカスタマイズは不可。カスタムボキャブラリーによる認識チューニングは可能 |
| 再配布 | ❌ | API経由の利用に限定 |
| 特許利用 | – | |
| 私的利用 | ⭕️ |
Gemini 3.5 Transcribeの使い方
Gemini 3.5 Transcribeには複数のアクセス方法があります。今回は代表的な3つの方法をご紹介します。
Google AI Studioからブラウザで試す
コードを書かずにブラウザ上で手軽にGemini 3.5 Transcribeを試せる方法です。
モデルを選択
プロンプト画面のモデル選択メニューから「gemini-3.5-transcribe」(録音済み音声用)または「gemini-3.5-transcribe-live」(リアルタイム用)を選択します。

Live版はLive APIのインターフェースからアクセスできます。
音声ファイルをアップロードまたはマイクで入力
録音済み音声の場合はファイルをアップロードし、リアルタイムの場合はマイク入力で文字起こしの動作を確認できます。
Python(Gemini API)でリアルタイム文字起こしを実装する
プログラムに組み込む場合の方法です。Python 3.9以上が必要です。
SDKをインストール
pip install -q -U google-genaiAPIキーを取得・設定
Google AI Studioの左下「Get API Key」からAPIキーを作成し、環境変数に設定します。
export GEMINI_API_KEY="your-api-key-here"Live APIでリアルタイム文字起こしを実装
import os
from google import genai
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
# Live APIを使ったリアルタイム文字起こしの設定
config = {
"response_modalities": ["TEXT"],
}
async with client.aio.live.connect(
model="gemini-3.5-transcribe-live",
config=config
) as session:
# マイク入力やファイルからの音声ストリームを送信
# セッションからリアルタイムで文字起こし結果を受信
pass録音済み音声の文字起こし(Interactions API)
録音済みの会議音声やポッドキャストを文字起こしする場合は、Interactions APIを利用します。
SDKをインストール(リアルタイムと同様)
pip install -q -U google-genaiInteractions APIで文字起こしを実行
import os
from google import genai
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
# 音声ファイルを指定して文字起こし
response = client.models.generate_content(
model="gemini-3.5-transcribe",
contents=[
{
"parts": [
{"file_data": {"file_uri": "YOUR_AUDIO_FILE_URI", "mime_type": "audio/wav"}}
]
}
]
)
print(response.text)【業界別】Gemini 3.5 Transcribeの活用シーン
Gemini 3.5 Transcribeは幅広い業界での活用が期待されています。ここからは代表的な業界別の活用シーンを紹介します。
コールセンター・カスタマーサポート
Gemini 3.5 Transcribeの高精度な文字起こしと話者識別機能は、通話後分析パイプラインに最適です。顧客とオペレーターの発言を自動で分離し、テキスト化された内容をもとに応対品質の分析やFAQの自動生成に活用できます。WER 2.6%の精度があれば、後から人手で修正する工数も大幅に減らせるでしょう。
生成AIをカスタマーサポートで活用する方法について、詳しく知りたい方は以下の記事も参考にしてみてください。

医療・ヘルスケア
診察中の会話をリアルタイムでカルテ用テキストに変換する用途が考えられます。カスタムボキャブラリー機能で医学用語や薬品名を事前に登録しておけば、専門用語の認識精度も向上します。ただし、医療情報は機密性が高いため、有料ティアまたはEnterprise Agent Platformの利用が推奨されます。
なお、医療・薬業界における生成AIの活用方法については下記の記事をご覧ください。
医療業界はこちら

薬業界はこちら

教育
講義の自動文字起こしや字幕生成、学生のスピーキング練習のフィードバック用途などが想定されます。フィラーワードの自動除去機能があるため、話者の発言意図をクリーンなテキストとして残すことができ、学習資料としての品質も高まるでしょう。
教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Gemini 3.5 Transcribeが解決できること
続いて、Gemini 3.5 Transcribeが解決できる代表的な課題を整理しておきましょう。
会議の議事録作成にかかる時間と手間の削減
会議の録音データをTranscribe APIに投げるだけで、話者識別付きのクリーンなテキストが自動生成されます。「えーと」や「あのー」といったフィラーワードが除去された状態で出力されるため、手動での編集作業が大幅に減ります。1分あたり約0.005ドルという低コストで処理できるため、毎日の会議録作成の自動化にも現実的な選択肢となるでしょう。
バックグラウンドノイズが多い環境での認識精度の低下
従来の音声認識モデルは、騒がしい環境や通話品質の低い音声で精度が大きく落ちることが課題でした。Gemini 3.5 Transcribeはノイズの多い実環境でも高い精度を維持できるとGoogleが明言しており、コールセンターや屋外での利用シーンでも安定した文字起こしが期待できます。
専門用語・固有名詞の誤認識
業界特有の専門用語や社内固有の略語は、汎用的な音声認識モデルでは正しく認識されにくい傾向があります。Gemini 3.5 Transcribeのカスタムボキャブラリー機能を使えば、事前に用語リストを登録して認識精度を向上させることが可能です。郵便番号や注文IDなどの英数字エンティティの正確なキャプチャにも対応しています。
Gemini 3.5 Transcribeを使ってみた
それでは実際にGemini 3.5 Transcribeの実力を検証してみましょう。Google AI Studioにアクセスし、マイク入力による文字起こしを試してみます。
「えーと、今日の会議は、あのー、15時からでしたっけ」と話しかけると、フィラーワードが除去された「今日の会議は15時からでしたっけ」というクリーンなテキストが出力されました。
出力結果はこちら

途中で言い直す場面、例えば「来週の火曜日——いや、水曜日に打ち合わせしましょう」と発話した場合も、自己修正を適切に処理して「水曜日に打ち合わせしましょう」と出力してくれました。
出力結果はこちら

よくある質問
Gemini 3.5 Transcribeで音声入力の常識が変わる!
Gemini 3.5 Transcribeは、Google DeepMind発の最高精度の音声→テキスト変換モデルです。WER 2.6%の認識精度、85言語以上の自動検出、スマートトランスクリプションによるフィラーワード除去と自動フォーマット、そして1分あたり約0.005ドルという低コスト——これらの要素が組み合わさることで、音声入力の体験が根本から変わろうとしています。
Chromeのあらゆるウェブフィールドで音声入力が使えるようになれば、キーボードに頼らない新しいインタラクションが日常になるかもしれません。まずはGoogle AI Studioで無料APIキーを取得し、その実力を体感してみてください。
最後に
いかがだったでしょうか?
弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。


