Eleven v4とは?ElevenLabs最新音声AIの性能・料金・使い方とTurboとの違いを徹底解説

- Eleven v4 & Eleven v4 Turboは、ElevenLabsが2026年9月28日に公開した最新の音声合成モデル
- オーディオタグで感情や効果音まで台本に書き込め、90以上の言語に対応
- Turboは最初の音声まで中央値約150msで、音声エージェント向けに最適化
Eleven v4 & Eleven v4 Turboは、ElevenLabsが2026年9月28日に公開した、同社史上もっとも感情表現が豊かな音声合成モデルです。台本に[whispers]や[laughs]といったタグを書き込むだけで、声優に演技指導するように話し方をコントロールできます。なんと、第三者評価機関Artificial AnalysisのProvider Voiceランキングでは1位を獲得しており、音声AI界隈で大きな注目を集めているんです!

とはいえ、「従来のv3と何が違うの?」「Turboとはどう使い分ける?」「日本語でもちゃんと使える?」と気になっている方も多いのではないでしょうか。この記事では、Eleven v4 & Eleven v4 Turboの概要や仕組み・料金・ライセンス・使い方・活用シーンまで詳しく解説します。
最後まで読めば、表現力と速さを両立した最新の音声生成AIを、業務へすぐに取り入れられるはずです。ぜひご覧ください。
\生成AIを活用して業務プロセスを自動化/
Eleven v4 & Eleven v4 Turboとは?

Eleven v4 & Eleven v4 Turboは、ElevenLabsが提供するテキスト読み上げ(TTS)の最新フラッグシップモデルです。品質を最優先したEleven v4と、低遅延に特化したEleven v4 Turboの2つがセットで登場しました。

Eleven v4は、新世代モデルの第1弾と位置づけられているモデルです。出力品質・声の再現度・一貫性・感情・話し方・オーディオタグ・対応言語のすべてが、前世代のEleven v3から改善されました。
公式もほぼすべてのケースでv3より良い結果になるとして、v4への切り替えを強くすすめているほど。オーディオブックやキャラクターのボイスオーバーなど、品質が最優先される用途に向いています。

一方のEleven v4 Turboは、v4の表現力を保ったまま推論レイテンシの中央値を約100msまで抑えた低遅延版です。会話型エージェントやインタラクティブな音声体験のために作られており、サポート・営業・予約受付といったリアルタイムの応対を想定しています。
どちらも90以上の言語に対応し、日本語もネイティブのようなアクセントで話せるようになりました。前世代のEleven v3は70以上の言語だったため、対応範囲が大きく広がった形です。
Eleven v4 & Eleven v4 Turboの仕組み
Eleven v4の内部構造の詳細は公開されていないものの、公式情報からは「台本を声優のように読み解く」ための仕組みがいくつか見えてきます。ここからは、公表されている構成要素をもとに動作の流れを整理していきましょう。
台本を声優のように読み解く新アーキテクチャ

Eleven v4は、まったく新しいアーキテクチャで作られたモデルです。公式ページによると、誰が話しているのか、直前に何が起きたのか、そのセリフをどう届けるべきかを把握しながら台本を読む設計になっています。
従来のTTSはセリフを1つずつ読み上げるのが基本でした。これに対してv4はシーン全体の文脈をつかみ、直前の発言に反応するような自然な掛け合いを生成します。
さらに、v4は話し方のスタイルと効果音の両方を生成するよう学習されているとのこと。[whispers]のような演技指示と[door slams]のような環境音を、同じ台本の中で一緒に扱えるのが大きな特徴でしょう。
ElevenAgentsと一体で最適化されたTurbo
Eleven v4 Turboは、v4と同じ技術を低遅延用途に持ち込んだモデルです。公式ブログによれば、研究チームとエンジニアリングチームがTurboとElevenAgentsを1つのシステムとして最適化しました。
LLMが文章を生成している途中からテキストを流し込み、文が終わる前に音声を返し始める双方向ストリーミングにも対応。こうした構成によって、推論レイテンシ中央値約100ms、最初の音声が聞こえるまで中央値約150msという速さを実現しています。
ほかのエージェント構築ツールは複数ベンダーのモデルを組み合わせることが多く、出力を細かく調整しにくいのが難点でした。モデルとエージェント基盤を同じ会社が一体で作っている点が、Turboの強みといえるでしょう。
Eleven v4 & Eleven v4 Turboの特徴
Eleven v4 & Eleven v4 Turboは、第三者ベンチマークでのトップ評価や、話し始めまでの圧倒的な速さが大きな特徴です。ここからは、具体的な数値とともに注目ポイントを紹介します。
Artificial Analysisの音声ランキングで1位を獲得
Eleven v4は、第三者評価機関Artificial Analysisの音声ランキングでProvider Voice部門の1位を獲得しました。この部門は、各社のモデルが自社のネイティブ音声で話したサンプルを、ユーザーがブラインドで聞き比べて評価する仕組みです。

Artificial Analysisの公式ポストによると、Eleven v4のEloスコアは1,319。Cartesiaの「Sonic 3.6」やGoogleの「Gemini 3.8 Flash TTS」を上回り、カスタマーサービス・アシスタント・知識共有・エンターテインメントの4カテゴリすべてで1位でした。
発音の正確さを測るPronunciation Robustnessでも、91.7%というArtificial Analysisの計測史上最高のスコアを記録しています。
| 評価項目 | Eleven v4の結果 | 主な比較対象 |
|---|---|---|
| Provider Voice(Elo) | 1,319で1位 | Sonic 3.6:1,276、Gemini 3.8 Flash TTS:1,267 |
| Controlled Voice(Elo) | 1,157で2位 | Qwen-Audio-3.1-TTS-Plus:1,178、Eleven v3:1,073 |
| Pronunciation Robustness | 91.7%(計測史上最高) | Gemini 3.8 Flash TTS:89.5%、Eleven v3:85.6% |
| 生成速度 | 1秒あたり73.4文字 | – |
ブラインドテストで約75%のリスナーが支持
ElevenLabsが独自に実施したブラインド比較テストでは、約75%のリスナーがEleven v4を選んだそうです。比較対象は、Cartesia Sonic 3.6・Inworld TTS-2・Gemini 3.8 Flash-Lite TTS・Gemini 3.8 Flash TTSの4モデル。
テストでは、評価者がどちらのモデルか分からない状態で同じセリフを聞き比べました。そのうえで、より表現力豊かな方とより自然に聞こえる方を判定しています。

公式ブログに掲載された上記のグラフでは、各モデルとの対戦でEleven v4が65〜81%の割合で勝利。ただし、これはElevenLabs自身による計測のため、先ほどの第三者ランキングとあわせて判断するのがおすすめです。
最初の音声まで約150msで話し始めるTurbo

Eleven v4 Turboの目玉は、リクエストから最初の音声が聞こえるまでの時間が中央値約150msという速さ。公式によれば、2人の人間が会話するときの平均的な間よりも速く応答できるとのこと。
ElevenLabsの計測では、Cartesia Sonic 3.6が262ms、OpenAIのGPT-4o mini TTSが814msでした。つまり、Turboは比較対象のなかで最速だったわけです。
この数値は、同一スクリプト・デフォルト設定でネットワーク遅延を除外して測ったもので、TurboはWebSocketストリーミングで計測されています。実際のアプリではネットワーク遅延が上乗せされる点は押さえておきましょう。
Eleven v4 & Eleven v4 Turboの安全性・制約
Eleven v4 & Eleven v4 Turboは高精度な声を扱うモデルだけに、安全対策と利用上の制約をセットで理解しておくことが大切です。ここからは公式情報をもとに、両方のポイントを整理していきましょう。
ElevenLabsの安全対策
ElevenLabsは公式のセーフティページで、モデルをリリース前にレッドチーミングしていることや、登録時に顧客を審査していることを明らかにしています。
利用時の制約と注意点
まず押さえておきたいのが、v4ではSSMLに対応しておらず、StyleとSpeedのスライダーも使えない点です。設定できるのはStability(安定性)とSimilarity(類似度)の2つだけで、間の取り方などは三点リーダーやオーディオタグで調整します。
オーディオタグも完璧ではありません。v4は話し方と効果音の両方を学習しているため、タグが効果音として解釈されてしまうケースがあるとのこと。[low, gravelly voice]のように声の質感を具体的に書くのが、意図どおりの結果を得るコツです。
Eleven v4 & Eleven v4 Turboの料金
Eleven v4 & Eleven v4 Turboは、無料プランから試せるうえ、APIでは文字数に応じた従量課金で利用できます。2026年9月時点では期間限定の割引キャンペーンも実施されているため、導入を検討している方には絶好のタイミングです。
| モデル | 通常価格(1,000文字あたり) | キャンペーン価格(2026年10月12日まで) | 特徴 |
|---|---|---|---|
| Eleven v4 | $0.08 | $0.022 | 最高品質・90以上の言語に対応 |
| Eleven v4 Turbo | $0.04 | $0.011 | 推論レイテンシ約100ms・リアルタイム向け |
| Eleven v3 | $0.08 | ― | 70以上の言語・5,000文字上限 |
| Eleven v3 Conversational | $0.04 | ― | 約280msの低遅延 |
| Flash・Turbo(v2.5系) | $0.04 | ― | 約75msの低遅延・32言語 |
| プラン | 月額料金 | 月間クレジット | 主な内容 |
|---|---|---|---|
| Free | $0 | 1万 | 非商用のみ・Studioで3プロジェクト |
| Starter | $6 | 3万 | 商用ライセンス・Instant Voice Cloning |
| Creator | $22(初月$11) | 12.1万 | Professional Voice Cloning |
| Pro | $99 | 60万 | APIで44.1kHz PCM出力・192kbps |
| Scale | $299 | 180万 | 3シート・Professional Voice Clone3つ |
| Business | $990 | 600万 | 10シート・Professional Voice Clone10個 |
| Enterprise | 要問い合わせ | 個別設定 | カスタムSSO・優先サポート・HIPAA向けBAA |
Eleven v4 & Eleven v4 Turboのライセンス
Eleven v4 & Eleven v4 Turboは、オープンソースのモデルではなく、ElevenLabsのサービスとして提供されるクローズドなモデルです。2026年9月時点でモデルの重みは公開されておらず、利用条件はElevenLabsの利用規約とプランの内容によって決まります。
| 項目 | 可否 | 補足 |
|---|---|---|
| 商用利用 | ⭕️(有料プランのみ) | 有料プランはすべて商用ライセンス付き。無料プランは不可 |
| 改変 | 🔺 | 生成した音声の編集は可能。モデル自体は非公開のため改変不可 |
| 再配布 | 🔺 | 生成音声は規約の範囲で公開可能。モデルの再配布は不可 |
| 特許利用 | – | |
| 私的利用 | ⭕️ |
Eleven v4 & Eleven v4 Turboの使い方
Eleven v4 & Eleven v4 Turboは、ブラウザからノーコードで使う方法と、APIから呼び出す方法の2通りで利用可能です。今回は、それぞれの手順を順番に解説していきます。
ElevenCreative(ブラウザ)で使う方法
一番手軽なのが、ブラウザ版のElevenCreativeから使う方法です。
モデル選択
ログインしたら、Text to Speechの画面を開きます。設定パネルの「Model」でEleven v4を選択し、「Voice」で使いたい声を選んでください。


17,500以上の声から選べるので、ナレーション向けや会話向けなど用途に合わせて探してみましょう。
プロンプト入力
次に、テキスト入力欄に読み上げたい文章を入力します。「[excited]」や「[whispers]」などのタグを文章の中に書き込むと、その位置から話し方が切り替わる仕組み。タグの付け方に迷ったら、「Enhance」ボタンで自動付与するのも手です。
設定パネルでは、「Stability」と「Similarity」の2つを調整できます。Stabilityを下げると表現豊かで変化のある読み方に、上げると安定した読み方に変わるイメージです。最後に生成ボタンを押せば、音声が作られてダウンロードできるようになります。
Python SDKで使う方法
開発者の方なら、公式のPython SDKからEleven v4を呼び出すのがおすすめです。
SDKとライブラリをインストール
まずは、以下のコマンドでSDKと環境変数の読み込みに使うライブラリをインストールしましょう。
pip install elevenlabs python-dotenvAPIキー取得
コード実行
準備ができたら、以下のコードを実行します。model_idに「eleven_v4」を指定するだけで、Eleven v4による音声生成が可能です。
import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
load_dotenv()
client = ElevenLabs(api_key=os.getenv("ELEVENLABS_API_KEY"))
audio = client.text_to_speech.convert(
voice_id="21m00Tcm4TlvDq8ikWAM", # Voice Libraryで選んだ声のIDに置き換え
model_id="eleven_v4", # Turboを使う場合は "eleven_v4_turbo"
text="[excited] みなさん、ついに新しい音声モデルが登場しました! [whispers] ここだけの話、本当にすごいんです。",
output_format="mp3_44100_128",
)
with open("eleven_v4_sample.mp3", "wb") as f:
for chunk in audio:
f.write(chunk)実行すると、同じフォルダに「eleven_v4_sample.mp3」が保存されます。voice_idは、Voice Libraryで好きな声を開いて確認したIDに差し替えてください。
TypeScript(Node.js)で使う方法
Node.js環境で使いたい場合は、公式のTypeScript SDKを利用します。
SDKをインストール
以下のコマンドでインストールしてください。
npm install @elevenlabs/elevenlabs-js dotenvコード実行
コードは公式ページに掲載されているサンプルがそのまま使えます。Python版と同じく、modelIdで「eleven_v4」を指定するのがポイントです。

import { ElevenLabsClient, play } from '@elevenlabs/elevenlabs-js';
import 'dotenv/config';
const elevenlabs = new ElevenLabsClient({
apiKey: process.env.ELEVENLABS_API_KEY
});
const audio = await elevenlabs.textToSpeech.convert(
's3TPKV1kjDlVtZbl4Ksh', // "George" - browse voices at elevenlabs.io/app/voice-library
{
text: 'The first move is what sets everything in motion.',
modelId: 'eleven_v4',
}
);
play(audio);Webアプリや既存のNode.jsサーバーに組み込む場合も、このconvertの部分を差し込めば動きます。モデルの切り替えはmodelIdの1か所を書き換えるだけで済むため、v4とTurboを比較しながら開発を進められるでしょう。
【業界別】Eleven v4 & Eleven v4 Turboの活用シーン
Eleven v4 & Eleven v4 Turboは、表現力が求められる制作現場から、速さが命のコールセンターまで幅広い業界で活躍します。ここからは、業界ごとに向いている使い方を見ていきましょう。
エンタメ・ゲーム業界
ゲームやアニメの制作では、Eleven v4の表現力がそのまま武器になります。キャラクターごとに声を割り当て、[annoyed]や[ecstatic]などのタグで感情を演出すれば、NPCのセリフを大量に用意する作業も効率化できるでしょう。
公式ドキュメントでも、クエストを依頼する村人のセリフを感情タグで演じ分けるサンプルが紹介されています。シーン全体の文脈を踏まえた掛け合いが作れるので、キャラクター同士の会話劇にもぴったりです。
プレイヤーと会話するインタラクティブなキャラクターを作るなら、低遅延のTurboを組み合わせてみてください。
生成AIでクリエイティブ作成する方法について、詳しく知りたい方は以下の記事も参考にしてみてください。

出版・メディア業界
オーディオブックやニュース記事の音声化は、Eleven v4がもっとも得意とする領域です。リクエストスティッチングの改善で、長い原稿でも声のトーンやペースがブレにくくなりました。
公式ページでは、数百の出版社の記事音声化を支援するBeyondWordsの共同創業者が、v4によって出版社ごとの声をより魅力的にできるとコメントしています。
1回の生成で最大10,000文字を扱えるため、章ごとにまとめて生成するワークフローも組みやすいはずです。ナレーターの声をProfessional Voice Cloneで再現すれば、シリーズ作品の声を統一することもできます。
広告業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

教育・eラーニング業界
研修動画やオンライン講座のナレーション制作にも、Eleven v4は向いています。90以上の言語に対応しているので、同じ教材を多言語で展開しやすいのが魅力です。
1人の講師の声をクローンしておけば、日本語版・英語版・スペイン語版と言語を変えても、同じ講師が話しているような教材を作れます。v4は別の言語でもネイティブのように話すため、なまりが強くて聞き取りにくいといった問題も起きにくいでしょう。
教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Eleven v4 & Eleven v4 Turboが解決できること
Eleven v4 & Eleven v4 Turboなら、これまでの音声合成で「仕方ない」とあきらめていた課題の多くを解決できるかもしれません。ここでは、代表的な課題ごとに解決できることを整理していきます。
単調な自動音声を感情豊かな応対に変えられる
従来の音声エージェントは、速さを優先すると声が単調になりがちでした。公式ブログでも、多くの企業が優秀ながらもロボットのように感じられる単調なエージェントを選ばざるを得なかったと指摘されています。
Eleven v4 Turboは、速さと感情表現の両立を目指して作られたモデルです。v4の表現力をそのまま受け継いでいるため、謝罪の場面では申し訳なさそうに、案内の場面では明るくといった話し分けができます。
問い合わせをすぐ解決したくて焦っている顧客に対しても、人間らしい温かさのある応対を届けられるでしょう。
長尺ナレーションでの声のブレをなくせる
長い原稿を分割して生成すると、パートごとに声のトーンやテンポが微妙に変わってしまうのが悩みの種でした。Eleven v4では、生成を連鎖させるリクエストスティッチングの信頼性が大幅に向上しています。
さらに、話者のアイデンティティを捉える新しい手法によって、何度再生成しても同じ人物の声をキープ。気に入らない1文だけを作り直しても、前後とのつながりが不自然になりにくいのは大きな利点です。
オーディオブックや長編の解説動画など、これまで人の手で細かく調整していた作業の負担を減らせます。
多言語展開のコストと手間を抑えられる
海外向けに音声を作る場合、言語ごとにナレーターを手配するのは時間もコストもかかる作業でした。Eleven v4なら、1つの声を保ったまま90以上の言語で自然に話させることが可能です。
v4は元の声と違う言語で生成するとき、元のアクセントを持ち込まずにネイティブのように話します。日本語で収録した声でも、英語版では自然な英語になるため、ブランドの声を統一したまま多言語展開を進められるのです。
吹き替えやローカライズ、多言語対応の音声エージェントなど、グローバルに展開する企業ほど恩恵は大きいでしょう。
Eleven v4 & Eleven v4 Turboを使ってみた
ここからは、Eleven v4 & Eleven v4 Turboの実力を確かめるための検証を行います。日本語での感情表現の観点で、実際に試してみましょう。
日本語で感情の演じ分けができるか
同じ1人の声に、タグだけで喜怒哀楽を演じ分けさせるのが今回のポイントです。ElevenCreativeのText to Speech画面で、ModelにEleven v4を選んで生成します。
プロンプトはこちら
[excited] やった!ついに合格したよ!
[sighs] でも、正直ちょっと寂しいんだよね……。みんなと離れちゃうし。
[whispers] ここだけの話、実は泣きそうになってる。
[laughs] ……なんてね!さあ、今夜はお祝いしよう!
出力結果はこちら

タグが切り替わるたびに、喜び・切なさ・ささやき・笑いへと声色がはっきり変化している音声を生成してくれました。自然な間も入っていて、英語タグを混ぜた日本語台本でも違和感なく演じ分けてくれています。
生成AI開発・業務活用ならWEELへご相談ください
Eleven v4 & Eleven v4 Turboは、感情表現と応答速度を大きく進化させたElevenLabsの最新モデルです。
Eleven v4はArtificial Analysisの音声ランキングで1位を獲得し、タグによる演技指導や長文でもブレない声で制作の現場を変えてくれます。Eleven v4 Turboは最初の音声まで約150msで応答でき、音声エージェントづくりの強い味方です。
弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。
よくある質問



