【Gemini 3.5 Transcribe】Googleの最新音声認識モデル!WER 2.6%の精度・料金・使い方を徹底解説

Gemini 3.5 Transcribe Google 最新 音声認識 モデル WER 2.6% 精度 料金 使い方 徹底 解説
押さえておきたいポイント
  • Gemini 3.5 Transcribeは、Googleが2026年8月27日に公開した最高精度の音声→テキスト変換モデル
  • Artificial Analysis計測でストリーミング時WER 4.0%、非ストリーミング時WER 2.6%を達成し、前モデルChirp 3を大幅に上回る
  • Pixel 11のGboard「Rambler」機能を裏で支えており、Chrome・Docs・Gmail・Keepなど主要Google製品への展開も予定

2026年8月27日、GoogleはGeminiシリーズの最新音声認識モデル「Gemini 3.5 Transcribe」をパブリックプレビューとして公開しました!

従来の音声認識モデルが苦手としてきたバックグラウンドノイズ・専門用語の認識・フィラーワードの除去といった課題に真正面から向き合い、生の音声を「正確で整った、フォーマット済みのテキスト」に直接変換するというコンセプトで設計されています。すでにPixel 11シリーズのGboard「Rambler」機能やmacOS版Geminiアプリでその実力が発揮されており、SNS上では「これで有料の文字起こしツールは不要になるのでは」と驚きの声が続出しています。

この記事では、Gemini 3.5 Transcribeの概要から技術的な仕組み、料金体系、具体的な使い方までを徹底解説していきます。ぜひ最後までご覧ください!

\生成AIを活用して業務プロセスを自動化/

セミナー情報
AI博覧会カンファレンス登壇情報

このたびWEELは、2026年8月26日(水)・27日(木)に新宿住友ビル 三角広場で開催される「AI博覧会 Summer 2026」に出展することになりました。

さらに、弊社代表取締役社長の田村洋樹が、8月27日(木)14時40分からA会場で実施するカンファレンスに登壇いたします!

>詳しい情報を確認する

tamura

監修者田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

Gemini 3.5 Transcribeとは?

Gemini 3.5 Transcribeとは?
参考:https://x.com/Google/status/2092659278632894576?s=20

Gemini 3.5 Transcribeは、Google DeepMindが開発したGemini 3.5シリーズに属する音声→テキスト特化型のAIモデルです。従来のChirp 3に代わる新たな音声認識基盤として位置づけられており、「話者の自然な話し方のスタイルをキャプチャして、意図を正確に理解する」設計思想が大きな特徴となっています。

スクロールできます
開発元Google DeepMind
カテゴリ音声→テキスト変換(Speech-to-Text)
モデル名gemini-3.5-transcribe(非ストリーミング)/ gemini-3.5-transcribe-live(ストリーミング)
対応言語85言語以上(自動言語検出対応)
WER(単語誤り率)ストリーミング:4.0% / 非ストリーミング:2.6%(Artificial Analysis計測)
前モデルChirp 3
提供形態パブリックプレビュー
主な提供先Gemini API(Google AI Studio)、Gemini Enterprise Agent Platform、Gboard Rambler、macOS Geminiアプリ、Chrome(近日提供)
公式サイトhttps://ai.google.dev/gemini-api/docs/transcribe
Gemini 3.5 Transcribeの概要

具体的なAPIは2種類に分かれています。1つ目はリアルタイム用途向けのgemini-3.5-transcribe-liveで、Live APIを介した双方向ストリーミングによるサブセカンド(1秒未満)レイテンシの音声認識を提供します。2つ目は録音済み音声用のgemini-3.5-transcribeで、Interactions APIを介して話者識別やワードレベルのタイムスタンプ付きで高精度な文字起こしを行えます。

Googleは公式ブログで「ボイスエージェント・リアルタイムキャプション・通話後分析パイプラインなど、開発者のワークフローにシームレスに組み込めるよう設計した」と述べており、コンシューマー向けからエンタープライズ向けまで幅広い展開を見据えたモデルであることがわかります。

Gemini 3.5 Live Translateとの違い

同時期にリリースされているGeminiの音声モデルとの違いを明確にしておきましょう。

Gemini 3.5 Live Translateとの違い

2026年6月にGoogleが公開した「Gemini 3.5 Live Translate」は、70以上の言語でリアルタイムの音声→音声翻訳を行うモデルです。一方、今回のGemini 3.5 Transcribeは音声→テキスト変換(文字起こし)に特化しています。

Live Translateは「日本語で話した内容をそのまま英語の音声に翻訳して出力する」ことを目的としており、翻訳後のアウトプットも音声です。対してTranscribeのアウトプットはテキストであり、フィラーワードの除去・自動フォーマット・話者識別といったテキスト品質の最適化に力点が置かれています。

用途が明確に異なるため、「海外とのリアルタイム通訳が必要ならLive Translate」「会議の議事録や文字起こしが必要ならTranscribe」という使い分けになるでしょう。

Gemini 3.5 Live Translateは下記で解説

Gemini 3.5 Transcribeの仕組み

Gemini 3.5 Transcribeの仕組み

Gemini 3.5 Transcribeのアーキテクチャ詳細はモデルカードとして完全に公開されているわけではありませんが、公式ブログや関連ドキュメントから読み取れる構成は以下のようになっています。

まず、入力段階では生の音声波形を直接取り込みます。従来の音声認識モデルのように中間的な音素変換を介するのではなく、エンドツーエンドのニューラルネットワーク処理により、音声から直接テキストを生成する仕組みです。この設計により、話者の意図や自然な文脈を保持したまま変換が可能になっています。

次に処理の中核となるのが、文脈認識型のトランスクリプションです。Gemini 3.5 Transcribeはカスタムボキャブラリー機能を備えており、ユーザーが事前に指定した専門用語や固有のスペルを認識に反映できます。郵便番号や注文IDといった英数字エンティティも正確にキャプチャできると公式が明言しています。

さらに特筆すべきは、スマートトランスクリプション機能です。「火曜日に会おう——いや、水曜日で」のような発話中の自己修正をシームレスに処理し、「えーと」「あのー」といったフィラーワードを自動的に除去して整ったテキストに変換します。単なる音声認識にとどまらず、出力テキストの品質まで最適化している点が従来モデルとの大きな違いです。

Gemini 3.5 Transcribeの特徴

Gemini 3.5 Transcribeのパフォーマンスは、複数のベンチマークで前モデルを大幅に上回っています。

まず精度面では、Artificial Analysisの計測で非ストリーミング時のWER(単語誤り率)が2.6%、ストリーミング時でも4.0%という結果を記録しています。このスコアはArtificial AnalysisのAA-WERランキングで5位に位置しており、専用の音声認識モデルとして十分に競争力のある数値です。

Gemini 3.5 Transcribeの特徴
参考:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

FLEURSベンチマーク(主要言語・ロケールのセット)においても、ストリーミングモードで5.50%、非ストリーミングでは5.04%のWERを達成しており、Chirp 3と比べて全体的な多言語性能が改善されています。

レイテンシの観点では、前モデルChirp 3に対して最終的な文字起こし完了までの時間が70%改善したとGoogleは公式ブログで述べています。ストリーミング時のレイテンシは0.40秒と、リアルタイム用途にも十分対応できる水準です。

加えて、85以上の言語の自動検出と文字起こしに対応しており、地域ごとのアクセントや多様な方言も処理できます。録音済み音声では最大3話者(3人以上は実験的サポート)の話者識別にも対応しており、ワードレベルのタイムスタンプ付与も可能です。

Geminiの音声会話は下記で解説

Gemini 3.5 Transcribeの安全性・制約

Gemini 3.5 Transcribeは2026年8月時点でパブリックプレビュー版であり、正式な一般提供(GA)には至っていません。そのため、プレビュー版特有のレート制限が適用される点には注意が必要です。

話者識別機能については、録音済み音声で最大3話者までが安定してサポートされており、3人以上の話者識別は実験的なサポートとなっています。大人数の会議録の文字起こしを検討する場合は、この制約を考慮する必要があるでしょう。

また、無料ティアで利用する場合、送信したコンテンツがGoogleの製品・サービス改善に利用される可能性があります。機密性の高い音声データを扱う場合は、有料ティアの利用が推奨されます。

Gemini 3.5 Transcribeの料金

Gemini 3.5 Transcribeの料金体系を見ていきましょう。APIは2種類あり、リアルタイムストリーミング用の「Transcribe Live」と録音済み音声用の「Transcribe」でそれぞれ異なる料金設定となっています。いずれも無料ティアが用意されているため、まずは試しに使ってみることが可能です。

スクロールできます
モデル項目無料ティア有料ティア(100万トークンあたり / USD)
Transcribe Live(リアルタイム)入力無料$3.50(約$0.005/分 ※音声)
出力無料$21.00(約$0.004/分 ※テキスト)
ブレンド実効レート約$0.009/分
Transcribe(録音済み音声)入力無料$2.00(約$0.003/分 ※音声)
出力無料$12.00(約$0.002/分 ※テキスト)
ブレンド実効レート約$0.005/分
Gemini 3.5 Transcribeの料金(2026年8月時点)

録音済み音声用のTranscribeモデルの場合、1分あたり約0.005ドル(約0.75円)という実効価格は、従来のGoogle Cloud Speech-to-Text(Chirp 3)の1分あたり約0.96ドルと比較すると大幅なコスト削減が見込めます。1時間の音声ファイルの文字起こしでも約0.30ドル(約45円)程度の計算になるため、コストパフォーマンスは非常に高いといえるでしょう。

Gemini 3.5 Transcribeのライセンス

Gemini 3.5 Transcribeのライセンス体系を整理しておきましょう。Gemini 3.5 Transcribeはオープンソースモデルではなく、GoogleのプロプライエタリモデルとしてクラウドAPI経由で提供されるSaaS形式のサービスです。モデルの重みをダウンロードしてローカルで実行するような使い方はできません。

スクロールできます
利用用途可否備考
商用利用⭕️有料ティア推奨。無料ティアではデータがGoogle製品改善に利用される可能性あり
改変モデル自体のカスタマイズは不可。カスタムボキャブラリーによる認識チューニングは可能
再配布API経由の利用に限定
特許利用
私的利用⭕️
Gemini 3.5 Transcribeのライセンス

商用利用は有料ティアで可能ですが、無料ティアを使う場合は、送信した音声データと生成されたテキストがGoogleの製品・サービス改善に利用される可能性がある旨が利用規約に明記されています。医療情報や顧客の個人情報など機密性の高い音声を扱う場合は、有料ティアまたはGemini Enterprise Agent Platformの利用が推奨されます。

Gemini 3.5 Transcribeの使い方

Gemini 3.5 Transcribeには複数のアクセス方法があります。今回は代表的な3つの方法をご紹介します。

Google AI Studioからブラウザで試す

コードを書かずにブラウザ上で手軽にGemini 3.5 Transcribeを試せる方法です。

STEP

Google AI Studioにアクセス

ブラウザで Google AI Studio を開き、Googleアカウントでログインします。

STEP

モデルを選択

プロンプト画面のモデル選択メニューから「gemini-3.5-transcribe」(録音済み音声用)または「gemini-3.5-transcribe-live」(リアルタイム用)を選択します。

Gemini 3.5 Transcribeの使い方

Live版はLive APIのインターフェースからアクセスできます。

STEP

音声ファイルをアップロードまたはマイクで入力

録音済み音声の場合はファイルをアップロードし、リアルタイムの場合はマイク入力で文字起こしの動作を確認できます。

Python(Gemini API)でリアルタイム文字起こしを実装する

プログラムに組み込む場合の方法です。Python 3.9以上が必要です。

STEP

SDKをインストール

pip install -q -U google-genai
STEP

APIキーを取得・設定

Google AI Studioの左下「Get API Key」からAPIキーを作成し、環境変数に設定します。

export GEMINI_API_KEY="your-api-key-here"
STEP

Live APIでリアルタイム文字起こしを実装

import os
from google import genai

client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])

# Live APIを使ったリアルタイム文字起こしの設定
config = {
    "response_modalities": ["TEXT"],
}

async with client.aio.live.connect(
    model="gemini-3.5-transcribe-live",
    config=config
) as session:
    # マイク入力やファイルからの音声ストリームを送信
    # セッションからリアルタイムで文字起こし結果を受信
    pass

録音済み音声の文字起こし(Interactions API)

録音済みの会議音声やポッドキャストを文字起こしする場合は、Interactions APIを利用します。

STEP

SDKをインストール(リアルタイムと同様)

pip install -q -U google-genai
STEP

Interactions APIで文字起こしを実行

import os
from google import genai

client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])

# 音声ファイルを指定して文字起こし
response = client.models.generate_content(
    model="gemini-3.5-transcribe",
    contents=[
        {
            "parts": [
                {"file_data": {"file_uri": "YOUR_AUDIO_FILE_URI", "mime_type": "audio/wav"}}
            ]
        }
    ]
)

print(response.text)

【業界別】Gemini 3.5 Transcribeの活用シーン

Gemini 3.5 Transcribeは幅広い業界での活用が期待されています。ここからは代表的な業界別の活用シーンを紹介します。

コールセンター・カスタマーサポート

Gemini 3.5 Transcribeの高精度な文字起こしと話者識別機能は、通話後分析パイプラインに最適です。顧客とオペレーターの発言を自動で分離し、テキスト化された内容をもとに応対品質の分析やFAQの自動生成に活用できます。WER 2.6%の精度があれば、後から人手で修正する工数も大幅に減らせるでしょう。

生成AIをカスタマーサポートで活用する方法について、詳しく知りたい方は以下の記事も参考にしてみてください。

医療・ヘルスケア

診察中の会話をリアルタイムでカルテ用テキストに変換する用途が考えられます。カスタムボキャブラリー機能で医学用語や薬品名を事前に登録しておけば、専門用語の認識精度も向上します。ただし、医療情報は機密性が高いため、有料ティアまたはEnterprise Agent Platformの利用が推奨されます。

なお、医療・薬業界における生成AIの活用方法については下記の記事をご覧ください。

医療業界はこちら

薬業界はこちら

教育

講義の自動文字起こしや字幕生成、学生のスピーキング練習のフィードバック用途などが想定されます。フィラーワードの自動除去機能があるため、話者の発言意図をクリーンなテキストとして残すことができ、学習資料としての品質も高まるでしょう。

教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Gemini 3.5 Transcribeが解決できること

続いて、Gemini 3.5 Transcribeが解決できる代表的な課題を整理しておきましょう。

会議の議事録作成にかかる時間と手間の削減

会議の録音データをTranscribe APIに投げるだけで、話者識別付きのクリーンなテキストが自動生成されます。「えーと」や「あのー」といったフィラーワードが除去された状態で出力されるため、手動での編集作業が大幅に減ります。1分あたり約0.005ドルという低コストで処理できるため、毎日の会議録作成の自動化にも現実的な選択肢となるでしょう。

バックグラウンドノイズが多い環境での認識精度の低下

従来の音声認識モデルは、騒がしい環境や通話品質の低い音声で精度が大きく落ちることが課題でした。Gemini 3.5 Transcribeはノイズの多い実環境でも高い精度を維持できるとGoogleが明言しており、コールセンターや屋外での利用シーンでも安定した文字起こしが期待できます。

専門用語・固有名詞の誤認識

業界特有の専門用語や社内固有の略語は、汎用的な音声認識モデルでは正しく認識されにくい傾向があります。Gemini 3.5 Transcribeのカスタムボキャブラリー機能を使えば、事前に用語リストを登録して認識精度を向上させることが可能です。郵便番号や注文IDなどの英数字エンティティの正確なキャプチャにも対応しています。

Gemini 3.5 Transcribeを使ってみた

それでは実際にGemini 3.5 Transcribeの実力を検証してみましょう。Google AI Studioにアクセスし、マイク入力による文字起こしを試してみます。

「えーと、今日の会議は、あのー、15時からでしたっけ」と話しかけると、フィラーワードが除去された「今日の会議は15時からでしたっけ」というクリーンなテキストが出力されました。

出力結果はこちら

Gemini 3.5 Transcribeを使ってみた

途中で言い直す場面、例えば「来週の火曜日——いや、水曜日に打ち合わせしましょう」と発話した場合も、自己修正を適切に処理して「水曜日に打ち合わせしましょう」と出力してくれました。

出力結果はこちら

Gemini 3.5 Transcribeを使ってみた

よくある質問

Gemini 3.5 Transcribeは無料で使えますか?

はい、無料ティアが用意されています。Google AI Studioから無料のAPIキーを取得すれば、レート制限内で利用可能です。ただし、無料ティアでは送信した音声データがGoogleの製品改善に利用される可能性があるため、機密情報を含む音声の処理には有料ティアの利用を推奨します。

日本語の文字起こし精度はどの程度ですか?

Gemini 3.5 Transcribeは85言語以上に対応しており、日本語も対象に含まれています。公式発表のWER値(ストリーミング4.0%、非ストリーミング2.6%)は主要言語を対象とした平均値であり、言語ごとの個別精度は2026年8月時点では公開されていません。実際の精度は、公式が提供するGoogle AI Studioのデモ環境で実際に日本語音声を入力して確認することをおすすめします。

Chirp 3からの移行は必要ですか?

Gemini 3.5 TranscribeはChirp 3の後継として位置づけられており、精度・レイテンシともに大幅な改善が報告されています。特にArtificial Analysisの計測によると、最終的な文字起こし完了までの時間が70%改善しているとのことです。現在Chirp 3を利用中の開発者は、Google AI Studioで新モデルの動作を検証した上で、移行を検討するとよいでしょう。

Gemini 3.5 Transcribeで音声入力の常識が変わる!

Gemini 3.5 Transcribeは、Google DeepMind発の最高精度の音声→テキスト変換モデルです。WER 2.6%の認識精度、85言語以上の自動検出、スマートトランスクリプションによるフィラーワード除去と自動フォーマット、そして1分あたり約0.005ドルという低コスト——これらの要素が組み合わさることで、音声入力の体験が根本から変わろうとしています。

Chromeのあらゆるウェブフィールドで音声入力が使えるようになれば、キーボードに頼らない新しいインタラクションが日常になるかもしれません。まずはGoogle AI Studioで無料APIキーを取得し、その実力を体感してみてください。

最後に

いかがだったでしょうか?

弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

大規模言語モデル(LLM)比較レポート
LLM比較レポート

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。

セミナー内容や料金については、ご相談ください。

また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

  • URLをコピーしました!
  • URLをコピーしました!
目次