この記事でわかること
- ElevenLabs v4の特徴と料金
- タグで声に演技させる使い方
- Gemini 3.8やGPTと聞き比べた結果
- 読み間違いの直し方と注意点
「僕が実際にElevenLabs v4で、台本に[laughs]と一言書いてみたら、AIの声にちゃんと笑い声が入りました」
ElevenLabsから、新しい音声モデル「ElevenLabs v4」と、会話向けの「v4 Turbo」が発表されました。原稿の中に短いタグを書くだけで、ささやき・はしゃぎ声・ため息・笑いまで演じ分けてくれる、表現力の高いモデルです。
こんにちは、ルーティンラボ(@rutinelabo)です。本記事では、ElevenLabs v4の使い方と料金をまとめ、v4 Turboとの英会話、Gemini 3.8 Flash TTS・Fish Audio・GPTとの聞き比べ、キャラ全員の声をv4で作った掛け合いまで、実際に試した結果を紹介します。

プロンプト配布中
LINE公式アカウントを友達追加していただければ、本記事やYouTubeで使用した使用したプロンプトを配布いたします。メンバーシップ登録で優先サポートも実施中です。
ElevenLabs v4とは|感情タグで笑いもささやきも演じる新モデル

ElevenLabs v4は、音声AIの老舗ElevenLabsが2026年9月28日に発表したテキスト読み上げ(TTS)モデルです。TTSは「Text to Speech」の略で、文章を声にして読み上げる仕組みのことです。同時に、会話や音声エージェント向けに反応を速くした「v4 Turbo」も公開されました。
いちばんの特徴は、感情の表現です。公式サイトではいきなりサンプルを再生できますが、抑揚のつき方がこれまでのAI音声とはかなり違います。僕が作った台本でも、「ねえ、ちょっとだけ聞いて」のささやきから、はしゃぐ声、ため息、笑いまで、1つの声で自然に演じ分けてくれました。
ElevenLabs v4の基本情報
| 項目 | 内容 |
|---|---|
| モデル名 | Eleven v4(eleven_v4)/Eleven v4 Turbo(eleven_v4_turbo) |
| 発表日 | 2026年9月28日 |
| 使える場所 | ElevenLabsの画面・API・ElevenAgents(無料プランでも試せる) |
| 対応言語 | 90以上(日本語を含む) |
| 1回に作れる文字数 | 10,000字 |
| 演技の指示 | 文中に角括弧のタグ([whispers] [laughs] [sighs] など)を書く |
出典:ElevenLabs公式ブログ・Eleven v4ドキュメント・モデル一覧(2026年9月時点・公式参照)
v3から変わったところ

前のv3も精度の高いモデルでしたが、感情のタグを時々無視したり、抑揚がないままそのまま話し続けたりする弱点がありました。v4はそこをしっかり克服してきています。
| 比べる点 | v3 | v4 |
|---|---|---|
| 対応言語 | 70以上 | 90以上 |
| 1回に作れる文字数 | 5,000字 | 10,000字 |
| タグへの従い方 | 無視されることがある | 確実に従う(公式) |
| 本人の声の本格クローン(PVC) | 使えない | 使える(本人確認が必須) |
出典:Eleven v4ドキュメント・Eleven v4紹介ページ(2026年9月時点・公式参照)。v4より前に作ったクローンの声は、v4用に作り直しが必要です。
ちょうどGeminiにも声のクローン機能(Voice Replication)が入りましたが、僕が試した段階ではエラーで自分の声を作り切れませんでした。自分の声を複製して読み上げたい方は、今のところElevenLabsを使うのが確実です。ElevenLabs自体の基本はElevenlabs完全ガイドでも解説しています。
-
-
Elevenlabs完全ガイド:AIでテキストを自然な音声に変換し、収益化する方法
続きを見る
ElevenLabs v4の料金|無料プラン・有料プラン・APIの単価

ElevenLabsは、月額プランで毎月もらえる「クレジット」を消費して音声を作る仕組みです。無料プランでも月1万クレジットが付くので、まずはお金をかけずにv4を試せます。
| プラン | 月額 | 月のクレジット |
|---|---|---|
| Free | 0ドル | 1万 |
| Starter | 6ドル | 3万 |
| Creator | 22ドル(初月11ドル) | 12.1万 |
| Pro | 99ドル | 60万 |
出典:ElevenLabs料金ページ(2026年9月時点・公式参照)
実際にAPIで測ってみると、v4は1文字で1クレジット、v4 Turboは1文字で0.5クレジット減りました。タグの文字もクレジットに数えられます。僕はこれからたくさん作る予定なので、初月11ドルのCreatorプランを契約するつもりです。日本円で1,600〜1,700円ほどなので激安ではありませんが、月12万クレジット使えると考えるとかなりいろいろ試せます。
APIの単価|10月12日まで72%引き
| モデル(1,000文字あたり) | 定価 | 2026年10月12日まで |
|---|---|---|
| ElevenLabs v4 | 0.08ドル | 0.022ドル |
| ElevenLabs v4 Turbo | 0.04ドル | 0.011ドル |
| (参考)Gemini 3.8 Flash TTS | 約0.0165ドル | |
出典:ElevenLabs API料金・Artificial Analysis(2026年9月時点・公式参照)
定価どうしで比べると、v4はGemini 3.8 Flash TTSの約5倍の値段です。ただ10月12日までは大きく割引されているので、試すなら今がお得なタイミングです。
商用利用は有料プランが必須
無料プランで作った音声は商用利用できません。無料のまま公開する場合はタイトルに「elevenlabs.io」の表記も必要です。YouTubeの収益化やクライアントワークで使うなら、有料プランに入ってから作りましょう(ElevenLabsヘルプ・2026年9月時点)。
v4 Turboで会話|英語のリアルタイム通話も自然だった

v4は文章を読み上げるTTSのモデルなので、人とリアルタイムにやり取りするなら、反応を速くした「v4 Turbo」がおすすめです。公式によると、最初の音声が出るまで約150ミリ秒(0.15秒)と、会話で待たされない速さになっています(モデル一覧・2026年9月時点)。
ElevenLabs v4 Turbo と英語でそのまま通話してみた
・話しかけると、AIの声が間を置かずに返ってくる
・ほぼ本物の電話のような自然さ
・台本の読み上げは v4、会話は v4 Turbo という使い分けAIの声と電話する日、もう来てますね。どんな場面で使ってみたいですか?
#ElevenLabs #AI音声 #TTS
— せなお| AIとITを使った仕事術 (@rutinelabo) 投稿を見る
公式ページから実際に通話できたので、英語で話しかけてみました。「Hello, this is Senao」と声をかけると、v4 TurboのAIが自己紹介をして、どんな声を試したいかを聞き返してきます。こちらがすごくいい声ですねと返すと、「Thank you」とすぐに返事がきました。
正直、めちゃめちゃナチュラルに声のやり取りができます。間を置かずに返ってくるので、本物の電話とほとんど変わらない感覚でした。AIの声で電話対応や音声アシスタントを作りたい方には、かなり魅力的なモデルです。
| 使い分け | 向くモデル |
|---|---|
| 台本・ナレーションを読み上げる | ElevenLabs v4 |
| 人とリアルタイムに会話する | ElevenLabs v4 Turbo |
自分の環境から測ってみると、最初の音が出るまでの時間はv4 Turboが0.45秒、v4が1.40秒でした(回線の遅れを含む・各1回)。アプリへの組み込み方は、別の動画で紹介する予定です。
同じタグで聞き比べ|Gemini 3.8・Fish Audio・GPTとの違い

同じタグ入りの台本を、ほかの有名な音声モデルにも読ませて聞き比べました。比べたのは、先日公開されたGemini 3.8 Flash TTS、Fish Audio、ChatGPTにも使われているGPT-4o mini TTSです。
笑いのタグ [laughs] を入れた同じ台本を、AI音声で聞き比べてみた
・ElevenLabs v4:ちゃんと笑い声が入る
・Gemini 3.8 Flash TTS:表現が大げさ寄り
・Fish Audio:最初のささやきのまま切り替わらない
・GPT-4o mini TTS:文中のタグに非対応同じタグでも、効き方はモデルでまったく違いました。あなたはどの声が好み?
#ElevenLabs #Gemini #AI音声
— せなお| AIとITを使った仕事術 (@rutinelabo) 投稿を見る
| モデル | 同じタグを送った結果 |
|---|---|
| ElevenLabs v4 | ささやき・笑い・ため息を自然に表現 |
| Gemini 3.8 Flash TTS | 演技はするが、表現が大げさ寄り |
| Fish Audio S2.1 Pro | 最初のささやきが最後まで続き、笑いに切り替わらない |
| GPT-4o mini TTS | 文中のタグに非対応(タグなしで読ませた) |
出典:ルーティンラボの検証ダッシュボードで生成し、AIの書き起こしで判定(2026年9月30日)。
僕の耳では、ElevenLabsのほうが自然にささやき声や笑い、ため息を表現してくれると感じました。一方で、テンポのいいコンテンツを作りたいときや、より大げさに誇張したいときはGemini 3.8 Flash TTSのほうが合っています。Fish AudioやGPTとは、抑揚や感情の表現にかなり差が出ていました。
感情の文章と英単語まじりの文章

「やったー、ついに完成した!ところが、保存に失敗してしまった」のような感情の文章でも聞き比べました。v4はめっちゃ自然に読み、Gemini 3.8 Flash TTSはやはりちょっと大げさに表現します。
英単語が混ざった文章も試しました。Claude CodeとGPT-6をAPIで比較し、TTFBを300ms未満に抑える、という文で、v4はmsを「ミリ秒」と言い換えて読んでくれました。以前のモデルならmsをそのまま「エムエス」と読んでいたところで、ここはかなり優秀になっています。
前回のGemini 3.8 Flash TTSの検証は、Gemini 3.8 Flash TTSの使い方|AI音声8モデル聞き比べと料金で詳しく紹介しています。
-
-
Gemini 3.8 Flash TTSの使い方|AI音声8モデル聞き比べと料金
続きを見る
キャラ全員の声をv4で|ため息まで演じ分ける掛け合い

最後に、キャラクターごとにやり取りをさせてみました。6人のキャラが掛け合いをしていますが、声はすべてElevenLabs v4で作っています。
キャラ全員の声を ElevenLabs v4 だけで演じさせてみた
・驚き、内緒話のささやき、ため息まで演じ分け
・演技の指示は、台本に一言タグを書くだけ
・ボイスドラマやキャラの掛け合いがひとりで作れる声の演技、もう人が読まなくてもいいかも。どのキャラの声が一番自然でした?
#ElevenLabs #AI音声 #ボイスドラマ
— せなお| AIとITを使った仕事術 (@rutinelabo) 投稿を見る
「マジで?俺の声もAIなの?」と驚く声、「ねえねえ、内緒の話していい?」というささやき、「ふぅ、やれやれ。最近のAIはため息までつけるようになったのか」というため息まで、キャラごとにきちんと演じ分けてくれます。演技の指定は、台本に一言タグを書くだけです。
正直、最高に面白いです。こういうコンテンツを人が読み上げる手間なく作れるのは、音声モデルに頼っていい段階に来たと感じました。ボイスドラマやキャラの掛け合い動画を作りたい方には、かなりおすすめです。
ElevenLabs v4の使い方|タグで声に演技させる

ここからは、ElevenLabsの画面でv4を使う手順です。難しい設定はなく、原稿の中にタグを書くだけで演技が変わります。
step
1ElevenLabsにログインしてText to Speechを開く

ElevenLabsにログインし、左のメニューからText to Speech(テキスト読み上げ)を開きます。無料アカウントでも始められます。
step
2モデルでEleven v4を選び、声を決める

モデルの選択でEleven v4を選び、右側のVoiceから使いたい声を選びます。v4は声を変えても演技のタグがそのまま効きます。
step
3原稿にタグを書いてGenerateを押す

演技させたい文の前に、英語の角括弧でタグを書きます。日本語の本文はそのままで大丈夫です。書けたらGenerateを押して再生します。
実際に使った原稿はこちらです。そのままコピーして試せます。
[whispers] ねえ、ちょっとだけ聞いて。[excited] 新しい音声モデル、もう出たんだって![sighs] 前はね、どんなセリフも同じ調子で読んじゃってたの。[laughs] でも今は、笑うのだって、台本に一言書くだけ。[calm] ささやきから、はしゃぐ声まで。ぜんぶ、ひとつの声で。
どのタグが日本語で効いたかを、AIの書き起こしで確かめた結果が下の表です。
| タグ | どうなる | v4 | v4 Turbo |
|---|---|---|---|
| [whispers] | ささやく | 効いた | 効いた |
| [excited] | はしゃぐ・興奮 | 効いた | 効いた |
| [sighs] | ため息まじり | 効いた | 効いた |
| [laughs] | 笑い声が入る | 効いた | 効いた |
| [calm] | 落ち着いて読む | ささやき寄り | 効いた |
出典:ルーティンラボの計測(2026年9月30日・各1回)。タグの効果が次の文までにじむことがあるので、強い演技のタグを続けて置くときは1文ずつ区切るのがコツです。
読み間違いの直し方|難読語10語の結果

前回Gemini 3.8 Flash TTSで試したのと同じ難読語10語を、v4にも読ませてみました。正しく読めたのは、v4が10語中7語、Gemini 3.8 Flash TTSが10語中6語です。
| 言葉(正しい読み) | ElevenLabs v4 | Gemini 3.8 Flash TTS |
|---|---|---|
| 東雲(しののめ) | ○ | ×(シモノメ) |
| 十六夜(いざよい) | ○ | ×(ヨナズキ) |
| 東海林(しょうじ) | ×(トウカイリン) | ×(ショーリ) |
| 御御御付け(おみおつけ) | ×(ゴゴゴヅケ) | ×(オミソシル) |
| GPT-6 | ×(ジーピーティーロク) | ○ |
出典:ルーティンラボの計測(v4は2026年9月30日・Gemini 3.8 Flash TTSは9月25日・各1回・AIの書き起こしで判定)。生物・月極・一日(ついたち)・Claude Code・9/25はどちらも正しく読めました。
- 漢字はひらがなに書き換える(東海林→しょうじ)
- 英単語や数字はカタカナに書き換える(GPT-6→ジーピーティーシックス)
- v4は括弧のふりがな「東海林(しょうじ)」も効く(括弧は読まれない)
間違え方にも違いがあり、v4は漢字をそのまま音読みしがちで、Gemini 3.8 Flash TTSは別の言葉に置き換えがちでした。どちらも完璧ではないので、固有名詞が多い原稿は一度聞いてから直すのがおすすめです。
ElevenLabs v4が向く仕事・向かない仕事と注意点

| 使い方 | 向き・不向き | 理由 |
|---|---|---|
| YouTube・ショートのナレーション | 向く | タグで演技がつき、指示どおりに読む |
| スライドの説明・研修動画 | 向く | 長い原稿も1回10,000字まで作れる |
| ボイスドラマ・キャラの掛け合い | 向く | ため息や笑いまで演じ分けられる |
| 音声エージェント・電話応対 | 向く(v4 Turbo) | 返事が速く、会話が自然 |
| とにかく安く大量に作る | 向かない | 定価はGemini 3.8 Flash TTSの約5倍 |
| 無料プランで作って収益化 | 向かない | 無料プランは商用利用できない |
使う場所にも注意が必要です。僕はいろいろなAIモデルをまとめて呼べるOpenRouterもよく使いますが、v4 Turboの音声モデルはまだ提供されていませんでした。v4を使うなら、ElevenLabsの公式プラットフォームか、APIキーを発行して従量課金で使いましょう。
また、英語の第三者ランキング(Artificial Analysis)ではv4が1位(ELO 1316)ですが、これは英語の音声での評価です(Artificial Analysis・2026年9月時点)。日本語は、ネットの評価でも僕の耳でも、Gemini 3.8 Flash TTSとほぼ同じレベルと感じました。
まとめ

ElevenLabs v4の要点をまとめます。
- 2026年9月28日発表。原稿にタグを書くだけで、ささやき・笑い・ため息まで演じる
- 会話は反応の速いv4 Turbo、台本の読み上げはv4と使い分ける
- APIは1,000文字0.08ドル(10月12日まで0.022ドル)。商用は有料プランが必須
- 演技の自然さはv4、大げさな表現はGemini 3.8 Flash TTSが得意
- 読み間違いは、ひらがな・カタカナや括弧のふりがなで直せる
まずは無料プランで、記事の原稿をコピーしてタグの効き方を試してみてください。ナレーションやキャラの掛け合いを作りたい方なら、1つの声でここまで演じ分けられることにきっと驚くはずです。
音声を使ったコンテンツの作り方は、YouTubeメンバーシップのスタンダードAIプランやビジネスAIプラン、限定のDiscordコミュニティで共有していきます。最新のAI情報や活用事例は、公式LINEでも配信しています。
