AIツール総合・比較・ニュース 音声・音楽生成AI

ElevenLabs v4の使い方|日本語ナレーションをタグで演技させる・Geminiと聞き比べ

本サイトではアフィリエイト広告を記載している場合があります。<景品表示法に基づく記載>

この記事でわかること

  • ElevenLabs v4の特徴と料金
  • タグで声に演技させる使い方
  • Gemini 3.8やGPTと聞き比べた結果
  • 読み間違いの直し方と注意点

 

「僕が実際にElevenLabs v4で、台本に[laughs]と一言書いてみたら、AIの声にちゃんと笑い声が入りました」

 

ElevenLabsから、新しい音声モデル「ElevenLabs v4」と、会話向けの「v4 Turbo」が発表されました。原稿の中に短いタグを書くだけで、ささやき・はしゃぎ声・ため息・笑いまで演じ分けてくれる、表現力の高いモデルです。

 

こんにちは、ルーティンラボ(@rutinelabo)です。本記事では、ElevenLabs v4の使い方と料金をまとめ、v4 Turboとの英会話、Gemini 3.8 Flash TTS・Fish Audio・GPTとの聞き比べ、キャラ全員の声をv4で作った掛け合いまで、実際に試した結果を紹介します。

 

プロンプト配布中

LINE公式アカウントを友達追加していただければ、本記事やYouTubeで使用した使用したプロンプトを配布いたします。メンバーシップ登録で優先サポートも実施中です。

LINE友だち登録して情報Get

 

ElevenLabs v4とは|感情タグで笑いもささやきも演じる新モデル

ElevenLabs v4とv4 Turboの公式紹介ページ

 

ElevenLabs v4は、音声AIの老舗ElevenLabsが2026年9月28日に発表したテキスト読み上げ(TTS)モデルです。TTSは「Text to Speech」の略で、文章を声にして読み上げる仕組みのことです。同時に、会話や音声エージェント向けに反応を速くした「v4 Turbo」も公開されました。

 

いちばんの特徴は、感情の表現です。公式サイトではいきなりサンプルを再生できますが、抑揚のつき方がこれまでのAI音声とはかなり違います。僕が作った台本でも、「ねえ、ちょっとだけ聞いて」のささやきから、はしゃぐ声、ため息、笑いまで、1つの声で自然に演じ分けてくれました。

 

ElevenLabs v4の基本情報

項目 内容
モデル名 Eleven v4(eleven_v4)/Eleven v4 Turbo(eleven_v4_turbo)
発表日 2026年9月28日
使える場所 ElevenLabsの画面・API・ElevenAgents(無料プランでも試せる)
対応言語 90以上(日本語を含む)
1回に作れる文字数 10,000字
演技の指示 文中に角括弧のタグ([whispers] [laughs] [sighs] など)を書く

 

出典:ElevenLabs公式ブログ・Eleven v4ドキュメント・モデル一覧(2026年9月時点・公式参照)

 

v3から変わったところ

v3からv4で変わったところをまとめた比較表

 

前のv3も精度の高いモデルでしたが、感情のタグを時々無視したり、抑揚がないままそのまま話し続けたりする弱点がありました。v4はそこをしっかり克服してきています。

 

比べる点 v3 v4
対応言語 70以上 90以上
1回に作れる文字数 5,000字 10,000字
タグへの従い方 無視されることがある 確実に従う(公式)
本人の声の本格クローン(PVC) 使えない 使える(本人確認が必須)

 

出典:Eleven v4ドキュメント・Eleven v4紹介ページ(2026年9月時点・公式参照)。v4より前に作ったクローンの声は、v4用に作り直しが必要です。

 

ちょうどGeminiにも声のクローン機能(Voice Replication)が入りましたが、僕が試した段階ではエラーで自分の声を作り切れませんでした。自分の声を複製して読み上げたい方は、今のところElevenLabsを使うのが確実です。ElevenLabs自体の基本はElevenlabs完全ガイドでも解説しています。

 

Elevenlabs完全ガイド:AIでテキストを自然な音声に変換し、収益化する方法

続きを見る

 

ElevenLabs v4の料金|無料プラン・有料プラン・APIの単価

ElevenLabs v4の料金と無料プラン・商用利用のまとめ

 

ElevenLabsは、月額プランで毎月もらえる「クレジット」を消費して音声を作る仕組みです。無料プランでも月1万クレジットが付くので、まずはお金をかけずにv4を試せます。

 

プラン 月額 月のクレジット
Free 0ドル 1万
Starter 6ドル 3万
Creator 22ドル(初月11ドル) 12.1万
Pro 99ドル 60万

 

出典:ElevenLabs料金ページ(2026年9月時点・公式参照)

 

実際にAPIで測ってみると、v4は1文字で1クレジット、v4 Turboは1文字で0.5クレジット減りました。タグの文字もクレジットに数えられます。僕はこれからたくさん作る予定なので、初月11ドルのCreatorプランを契約するつもりです。日本円で1,600〜1,700円ほどなので激安ではありませんが、月12万クレジット使えると考えるとかなりいろいろ試せます。

 

APIの単価|10月12日まで72%引き

モデル(1,000文字あたり) 定価 2026年10月12日まで
ElevenLabs v4 0.08ドル 0.022ドル
ElevenLabs v4 Turbo 0.04ドル 0.011ドル
(参考)Gemini 3.8 Flash TTS 約0.0165ドル

 

出典:ElevenLabs API料金・Artificial Analysis(2026年9月時点・公式参照)

 

定価どうしで比べると、v4はGemini 3.8 Flash TTSの約5倍の値段です。ただ10月12日までは大きく割引されているので、試すなら今がお得なタイミングです。

 

商用利用は有料プランが必須

無料プランで作った音声は商用利用できません。無料のまま公開する場合はタイトルに「elevenlabs.io」の表記も必要です。YouTubeの収益化やクライアントワークで使うなら、有料プランに入ってから作りましょう(ElevenLabsヘルプ・2026年9月時点)。

 

v4 Turboで会話|英語のリアルタイム通話も自然だった

v4 Turboの最初の音声までの速さを比べた公式ページと通話の画面

 

v4は文章を読み上げるTTSのモデルなので、人とリアルタイムにやり取りするなら、反応を速くした「v4 Turbo」がおすすめです。公式によると、最初の音声が出るまで約150ミリ秒(0.15秒)と、会話で待たされない速さになっています(モデル一覧・2026年9月時点)。

 

公式ページから実際に通話できたので、英語で話しかけてみました。「Hello, this is Senao」と声をかけると、v4 TurboのAIが自己紹介をして、どんな声を試したいかを聞き返してきます。こちらがすごくいい声ですねと返すと、「Thank you」とすぐに返事がきました。

 

正直、めちゃめちゃナチュラルに声のやり取りができます。間を置かずに返ってくるので、本物の電話とほとんど変わらない感覚でした。AIの声で電話対応や音声アシスタントを作りたい方には、かなり魅力的なモデルです。

 

使い分け 向くモデル
台本・ナレーションを読み上げる ElevenLabs v4
人とリアルタイムに会話する ElevenLabs v4 Turbo

 

自分の環境から測ってみると、最初の音が出るまでの時間はv4 Turboが0.45秒、v4が1.40秒でした(回線の遅れを含む・各1回)。アプリへの組み込み方は、別の動画で紹介する予定です。

 

同じタグで聞き比べ|Gemini 3.8・Fish Audio・GPTとの違い

同じタグ台本をGemini 3.8 Flash TTSで再生している聞き比べ画面

 

同じタグ入りの台本を、ほかの有名な音声モデルにも読ませて聞き比べました。比べたのは、先日公開されたGemini 3.8 Flash TTS、Fish Audio、ChatGPTにも使われているGPT-4o mini TTSです。

 

モデル 同じタグを送った結果
ElevenLabs v4 ささやき・笑い・ため息を自然に表現
Gemini 3.8 Flash TTS 演技はするが、表現が大げさ寄り
Fish Audio S2.1 Pro 最初のささやきが最後まで続き、笑いに切り替わらない
GPT-4o mini TTS 文中のタグに非対応(タグなしで読ませた)

 

出典:ルーティンラボの検証ダッシュボードで生成し、AIの書き起こしで判定(2026年9月30日)。

 

僕の耳では、ElevenLabsのほうが自然にささやき声や笑い、ため息を表現してくれると感じました。一方で、テンポのいいコンテンツを作りたいときや、より大げさに誇張したいときはGemini 3.8 Flash TTSのほうが合っています。Fish AudioやGPTとは、抑揚や感情の表現にかなり差が出ていました。

 

感情の文章と英単語まじりの文章

感情の文章をElevenLabs v4とGemini 3.8で聞き比べている画面

 

「やったー、ついに完成した!ところが、保存に失敗してしまった」のような感情の文章でも聞き比べました。v4はめっちゃ自然に読み、Gemini 3.8 Flash TTSはやはりちょっと大げさに表現します。

 

英単語が混ざった文章も試しました。Claude CodeとGPT-6をAPIで比較し、TTFBを300ms未満に抑える、という文で、v4はmsを「ミリ秒」と言い換えて読んでくれました。以前のモデルならmsをそのまま「エムエス」と読んでいたところで、ここはかなり優秀になっています。

 

前回のGemini 3.8 Flash TTSの検証は、Gemini 3.8 Flash TTSの使い方|AI音声8モデル聞き比べと料金で詳しく紹介しています。

 

Gemini 3.8 Flash TTSの要点まとめのアイキャッチ画像
Gemini 3.8 Flash TTSの使い方|AI音声8モデル聞き比べと料金

続きを見る

 

キャラ全員の声をv4で|ため息まで演じ分ける掛け合い

6人のキャラクターの声をすべてElevenLabs v4で作った掛け合いの画面

 

最後に、キャラクターごとにやり取りをさせてみました。6人のキャラが掛け合いをしていますが、声はすべてElevenLabs v4で作っています。

 

「マジで?俺の声もAIなの?」と驚く声、「ねえねえ、内緒の話していい?」というささやき、「ふぅ、やれやれ。最近のAIはため息までつけるようになったのか」というため息まで、キャラごとにきちんと演じ分けてくれます。演技の指定は、台本に一言タグを書くだけです。

 

正直、最高に面白いです。こういうコンテンツを人が読み上げる手間なく作れるのは、音声モデルに頼っていい段階に来たと感じました。ボイスドラマやキャラの掛け合い動画を作りたい方には、かなりおすすめです。

 

ElevenLabs v4の使い方|タグで声に演技させる

ElevenLabs v4のタグの書き方と日本語で効いたタグの一覧

 

ここからは、ElevenLabsの画面でv4を使う手順です。難しい設定はなく、原稿の中にタグを書くだけで演技が変わります。

 

step
1
ElevenLabsにログインしてText to Speechを開く

ElevenLabsのメニューからテキスト読み上げを開く画面

ElevenLabsにログインし、左のメニューからText to Speech(テキスト読み上げ)を開きます。無料アカウントでも始められます。

 

step
2
モデルでEleven v4を選び、声を決める

テキスト読み上げ画面でモデルにEleven v4を選んだところ

モデルの選択でEleven v4を選び、右側のVoiceから使いたい声を選びます。v4は声を変えても演技のタグがそのまま効きます。

 

step
3
原稿にタグを書いてGenerateを押す

ElevenLabsのテキスト読み上げ画面で文章を入力して生成する

演技させたい文の前に、英語の角括弧でタグを書きます。日本語の本文はそのままで大丈夫です。書けたらGenerateを押して再生します。

 

実際に使った原稿はこちらです。そのままコピーして試せます。

 

[whispers] ねえ、ちょっとだけ聞いて。[excited] 新しい音声モデル、もう出たんだって![sighs] 前はね、どんなセリフも同じ調子で読んじゃってたの。[laughs] でも今は、笑うのだって、台本に一言書くだけ。[calm] ささやきから、はしゃぐ声まで。ぜんぶ、ひとつの声で。

 

どのタグが日本語で効いたかを、AIの書き起こしで確かめた結果が下の表です。

 

タグ どうなる v4 v4 Turbo
[whispers] ささやく 効いた 効いた
[excited] はしゃぐ・興奮 効いた 効いた
[sighs] ため息まじり 効いた 効いた
[laughs] 笑い声が入る 効いた 効いた
[calm] 落ち着いて読む ささやき寄り 効いた

 

出典:ルーティンラボの計測(2026年9月30日・各1回)。タグの効果が次の文までにじむことがあるので、強い演技のタグを続けて置くときは1文ずつ区切るのがコツです。

 

読み間違いの直し方|難読語10語の結果

難読語10語をElevenLabs v4とGemini 3.8で読ませた結果と直し方

 

前回Gemini 3.8 Flash TTSで試したのと同じ難読語10語を、v4にも読ませてみました。正しく読めたのは、v4が10語中7語、Gemini 3.8 Flash TTSが10語中6語です。

 

言葉(正しい読み) ElevenLabs v4 Gemini 3.8 Flash TTS
東雲(しののめ) ○ ×(シモノメ)
十六夜(いざよい) ○ ×(ヨナズキ)
東海林(しょうじ) ×(トウカイリン) ×(ショーリ)
御御御付け(おみおつけ) ×(ゴゴゴヅケ) ×(オミソシル)
GPT-6 ×(ジーピーティーロク) ○

 

出典:ルーティンラボの計測(v4は2026年9月30日・Gemini 3.8 Flash TTSは9月25日・各1回・AIの書き起こしで判定)。生物・月極・一日(ついたち)・Claude Code・9/25はどちらも正しく読めました。

 

  • 漢字はひらがなに書き換える(東海林→しょうじ)
  • 英単語や数字はカタカナに書き換える(GPT-6→ジーピーティーシックス)
  • v4は括弧のふりがな「東海林(しょうじ)」も効く(括弧は読まれない)

 

間違え方にも違いがあり、v4は漢字をそのまま音読みしがちで、Gemini 3.8 Flash TTSは別の言葉に置き換えがちでした。どちらも完璧ではないので、固有名詞が多い原稿は一度聞いてから直すのがおすすめです。

 

ElevenLabs v4が向く仕事・向かない仕事と注意点

OpenRouterのモデル一覧(v4 Turboの音声モデルは未提供)

 

使い方 向き・不向き 理由
YouTube・ショートのナレーション 向く タグで演技がつき、指示どおりに読む
スライドの説明・研修動画 向く 長い原稿も1回10,000字まで作れる
ボイスドラマ・キャラの掛け合い 向く ため息や笑いまで演じ分けられる
音声エージェント・電話応対 向く(v4 Turbo) 返事が速く、会話が自然
とにかく安く大量に作る 向かない 定価はGemini 3.8 Flash TTSの約5倍
無料プランで作って収益化 向かない 無料プランは商用利用できない

 

使う場所にも注意が必要です。僕はいろいろなAIモデルをまとめて呼べるOpenRouterもよく使いますが、v4 Turboの音声モデルはまだ提供されていませんでした。v4を使うなら、ElevenLabsの公式プラットフォームか、APIキーを発行して従量課金で使いましょう。

 

また、英語の第三者ランキング(Artificial Analysis)ではv4が1位(ELO 1316)ですが、これは英語の音声での評価です(Artificial Analysis・2026年9月時点)。日本語は、ネットの評価でも僕の耳でも、Gemini 3.8 Flash TTSとほぼ同じレベルと感じました。

 

まとめ

ElevenLabs v4の使い方

 

ElevenLabs v4の要点をまとめます。

 

  • 2026年9月28日発表。原稿にタグを書くだけで、ささやき・笑い・ため息まで演じる
  • 会話は反応の速いv4 Turbo、台本の読み上げはv4と使い分ける
  • APIは1,000文字0.08ドル(10月12日まで0.022ドル)。商用は有料プランが必須
  • 演技の自然さはv4、大げさな表現はGemini 3.8 Flash TTSが得意
  • 読み間違いは、ひらがな・カタカナや括弧のふりがなで直せる

 

まずは無料プランで、記事の原稿をコピーしてタグの効き方を試してみてください。ナレーションやキャラの掛け合いを作りたい方なら、1つの声でここまで演じ分けられることにきっと驚くはずです。

 

音声を使ったコンテンツの作り方は、YouTubeメンバーシップのスタンダードAIプランやビジネスAIプラン、限定のDiscordコミュニティで共有していきます。最新のAI情報や活用事例は、公式LINEでも配信しています。

 

  • この記事を書いた人

せなお

RutineLaboの管理人:せなお。 AIやITに関する情報発信中。ブログでは最高月間1.8万PVを達成 | YouTubeチャンネル収益化 | 総フォロワー数12,000人以上。 副業からスタート、合同会社Routinelaboを運営中

-AIツール総合・比較・ニュース, 音声・音楽生成AI
-, , , , , ,

PAGE TOP