ElevenAgentsは「声を出すAI」ではなく「会話して仕事をするAI」
ElevenAgentsを理解するときは、ElevenLabsの音声生成機能との違いから考えると分かりやすいです。
通常のText to Speechは、入力された文章を音声へ変換します。
一方、ElevenAgentsではユーザーが話した内容を音声認識し、その内容をLLMが理解して回答を考え、ElevenLabsの音声技術で返答します。
公式ドキュメントでは、基本的な構成として、
音声を認識するSpeech to Text。
回答を考えるLLM。
回答を読み上げるText to Speech。
会話の割り込みや発話タイミングを扱うターンテイキング。
という要素が組み合わされています。
そのため、事前に作った音声を再生する自動音声とは性格が違います。
相手の質問によって回答内容を変えたり、会話の途中でユーザーが話し始めたときに対応したりしながら、リアルタイムの対話を成立させることが中心です。
さらにナレッジベースや外部ツールを接続すれば、単に雑談するだけではなく、企業の情報を参照したり、APIを使って実際の処理を行ったりできます。
ElevenAgentsは「高品質なAI音声を作りたい人」だけのサービスではなく、音声を入口にして業務を実行するAIを作りたい人向けのプラットフォームです。
どんなAIエージェントを作れる?
用途はかなり広く設定できます。
分かりやすい例はカスタマーサポートです。
会社の商品説明、FAQ、マニュアルなどをナレッジベースへ登録し、ユーザーからの質問に音声で回答するエージェントを作れます。
Webサイトへウィジェットとして設置すれば、訪問者がその場でAIへ話しかけられます。
電話対応にも使えます。
既存の電話システムとの接続やSIPトランクなどを利用し、電話を受けるAIエージェントとして展開できます。
予約受付なら、希望日時や人数を会話で聞き取り、外部の予約システムへ情報を渡すといった構成も考えられます。
営業用途では、問い合わせをした見込み客へ質問し、条件を確認して担当者へ引き継ぐ使い方があります。
社内向けなら、社内文書をナレッジベースに入れ、従業員が音声で質問できるアシスタントにすることもできます。
重要なのは、ElevenAgents側に「予約AI」「営業AI」という完成品が一つずつ用意されているわけではないことです。
エージェントの目的、プロンプト、知識、声、会話フロー、接続するツールを自分で設定して、用途に合ったAIを作ります。
コードを書かなくても作れる?
最初のエージェントはWebダッシュボードから作れます。
公式Quickstartでは、ElevenLabsへログインし、ダッシュボードから新しいエージェントを作成して、最初のメッセージやSystem Prompt、使用する声などを設定する流れが案内されています。
作成後はダッシュボード上ですぐテストできます。
たとえばサポートAIなら、
「あなたは○○社のカスタマーサポート担当です」
という役割をSystem Promptで設定し、商品情報をナレッジベースへ追加して、実際に質問しながら回答を調整していきます。
複数の処理を順番に行わせたい場合にはVisual Workflow Builderも利用できます。
そのため、簡単な試作をするだけならプログラミングは必須ではありません。
一方、自社WebアプリのUIへ組み込む、ユーザーごとに情報を渡す、社内システムを操作させる、といったことをしたい場合には開発作業が必要になります。
ElevenAgentsはノーコード専用サービスというより、ダッシュボードだけでも始められるが、必要になれば開発へ深く入っていけるサービスと考える方が近いです。
最初のエージェントを作る流れ
まずElevenLabsのアカウントを作り、ElevenAgentsのダッシュボードから新しいエージェントを作成します。
次に決めるのが、エージェントが最初に何を話すかです。
電話受付なら、
「お電話ありがとうございます。ご用件をお聞かせください」
のような最初の発話を設定します。
その後、System Promptで役割とルールを決めます。
何について答えるのか。
どのような口調で話すのか。
分からないことがあった場合にどうするのか。
どの条件で人間へ引き継ぐのか。
といった動作をここで設計します。
次に声を選びます。
ElevenAgentsではElevenLabsの音声ライブラリを利用でき、公式ドキュメントでは5,000以上の音声から選択できると案内されています。
そして実際にテスト会話を行います。
作った直後から完璧なエージェントになるわけではありません。
想定していない質問をする。
ユーザーが途中で話を遮る。
曖昧な言い方をする。
といった状況を試し、プロンプトやナレッジベースを修正していく工程が重要です。
ナレッジベースを追加すると自社情報へ答えられる
汎用LLMだけでは、自社の商品価格、社内ルール、最新マニュアルなどを正確に知っているとは限りません。
ElevenAgentsではナレッジベースを追加し、エージェントが必要な情報を検索して回答できるようにできます。
公式ドキュメントではRAGを使って登録情報に基づいた回答を生成する仕組みが用意されています。
たとえばホテルの電話受付なら、
チェックイン時間。
キャンセル規定。
駐車場。
客室設備。
朝食。
アクセス方法。
といった情報を持たせられます。
これにより、すべての情報をSystem Promptへ長文で書き込む必要がなくなります。
ただし、ナレッジベースを追加すれば自動的に正確になるわけではありません。
古い料金表と新しい料金表を両方登録している。
社内向け情報と顧客向け情報が混ざっている。
文章自体が曖昧。
という状態では、エージェントも判断しにくくなります。
AIエージェントを運用する場合は、プロンプトだけでなく参照させる情報を最新かつ整理された状態に保つことが重要です。
外部ツールにつなぐと「回答」だけでなく「処理」もできる
ElevenAgentsではToolsを接続できます。
ここが単純な音声FAQとの大きな違いです。
ユーザーの質問へ答えるだけなら、ナレッジベースとLLMだけでも成立します。
しかし予約を確定する、顧客情報を取得する、注文状況を確認する、といった処理には外部システムとの連携が必要です。
ツールを使えるようにすると、会話内容に応じてAPIなどを呼び出せます。
たとえば、
「明日の午後3時に予約できますか?」
と聞かれたときに、予約システムから空き状況を取得する。
空いていれば予約を登録する。
結果を音声で伝える。
という流れを作れます。
また、必要な場面で人間の担当者へ電話を転送するようなシステムツールもあります。
これによって「AIが質問に答えて終了」ではなく、会話を入口に実際の業務フローへ接続できます。
本格的にElevenAgentsを導入する場合は、このツール連携をどこまで行うかが実用性を大きく左右します。
Webサイトにはウィジェットで設置できる
作成したエージェントはWebサイトへ埋め込めます。
公式Quickstartでは、ElevenLabsのAgent WidgetをHTMLへ追加する方法が案内されています。
訪問者はWebページからエージェントを起動し、マイクを使って会話できます。
そのため、独自の通話画面を一から開発しなくても、まずWeb接客を試せます。
ElevenLabs自身のドキュメントサイトでも、ユーザーの質問へ答えるドキュメントアシスタントがElevenAgentsの利用例として紹介されています。
より独自のUIを作りたい場合にはReact SDKなども利用できます。
iOS向けSwift SDK、Android向けKotlin SDK、React Native SDKも公式ドキュメントで案内されています。
つまり導入方法は、
既成ウィジェットを貼る。
Webアプリへ組み込む。
iPhone・Androidアプリへ組み込む。
電話へ接続する。
と段階的に選べます。
最初から大規模な電話システムを作らなくても、小さなWebウィジェットから検証できます。
電話対応AIとしても使える
ElevenAgentsはWeb上の音声チャットだけではなく、電話へ展開できます。
公式ドキュメントではTelephonyとして、電話番号やSIPトランクなどを使った接続方法が用意されています。
電話でAIエージェントを使う場合には、
ElevenAgentsの会話料金。
使用するLLMの料金。
電話回線・Telephony Providerの料金。
などを分けて考える必要があります。
ここは料金を比較するときに見落としやすいところです。
たとえば月額プランに275分の会話時間が含まれていても、電話網を使うための費用まで完全に含まれているとは限りません。
また着信数が増えれば、同時に何件の会話を処理できるかも重要です。
Freeは4件、Starterは6件、Creatorは10件、Proは20件、Scaleは30件、Businessは40件の同時通話が公式料金表で案内されています。
個人で試す段階と、企業の代表電話を任せる段階では必要なプランが変わります。
会話の自然さは声だけでは決まらない
ElevenLabsの強みは音声品質ですが、AIエージェントの自然さは声質だけでは決まりません。
ユーザーが話し終えるまで待つ時間が長すぎれば、会話は不自然になります。
逆に早く反応しすぎれば、まだ話している途中なのにAIが割り込んでしまいます。
ElevenAgentsにはターンテイキングや割り込み処理が組み込まれています。
またLLMや音声モデルを高品質なものへ変更すると、品質が上がる一方で応答時間が長くなる可能性があります。
公式Quickstartでも、より高品質な音声やモデルはレイテンシーを増やす可能性があり、品質と応答速度のバランスを取るよう案内されています。
電話対応では数秒の沈黙でもユーザーが「切れた?」と感じることがあります。
そのため本番導入では、回答内容だけでなく、
発話開始までの時間。
ユーザーの割り込み。
相づち。
長い回答をどこで区切るか。
聞き取れなかったときの再確認。
までテストする必要があります。
会話履歴を見て改善できる
AIエージェントは作って公開したら終わりではありません。
ElevenAgentsでは会話履歴や分析機能を使って、実際にどのような会話が行われたか確認できます。
評価基準を設定し、会話が目的を達成できたか分析する仕組みもあります。
たとえば予約受付AIなら、
希望日時を正しく取得できたか。
予約完了まで到達したか。
途中で人間への転送が必要になったか。
といった観点を評価できます。
問い合わせ対応なら、何度も聞かれている質問を見つけてナレッジベースを改善できます。
本番で100人が使えば、開発者が想定していなかった言い方や質問が必ず出てきます。
そのログを見ながら改善できることは、業務用AIエージェントでは重要です。
「作れるか」だけでなく、公開後にどう評価して改善するかまで一つのプラットフォームに入っているのがElevenAgentsの特徴です。
CLIやAPIを使えば設定をコードとして管理できる
開発チーム向けにはAPIやCLIもあります。
ElevenLabs CLIでは、エージェント設定、ツール、テストなどをローカルファイルとして管理できます。
公式CLIではプロジェクトを初期化し、エージェント設定を作成してElevenLabsへpushする流れが用意されています。
これは複数人で本番エージェントを管理するときに便利です。
Webダッシュボードだけで設定を変更していると、
誰が何を変えたか。
以前の設定は何だったか。
開発環境と本番環境で何が違うか。
を追いにくくなります。
コードとして管理すればGitなどで変更履歴を残せます。
さらにHosted MCP Serverを使い、ClaudeなどのMCPクライアントから自然言語でエージェントを作成・更新する方法も公式に提供されています。
個人の試作ならダッシュボードだけで十分ですが、サービスとして継続運用するならAPI・CLIまで使えることは大きな意味があります。
ElevenAgentsの料金について
ElevenAgentsには無料プランがあります。
Freeは月額0ドルで、15分の通話時間と4件の同時通話が含まれます。
Workflow Builder、Knowledge Base、多言語、Web Widgetも利用できます。
有料プランは、
Starter:月6ドル、75分、同時6通話。
Creator:月22ドル、275分、同時10通話。
Pro:月99ドル、1,238分、同時20通話。
Scale:月299ドル、3,738分、同時30通話。
Business:月990ドル、12,375分、同時40通話。
Enterprise:個別見積もり。
という構成です。
Creatorは公式料金ページ上で初月50%オフの11ドル表示があります。
StarterではFreeに加えてテキストメッセージと商用ライセンスが含まれます。
そのため、個人的な検証ならFreeから始められますが、商用利用を考える段階ではStarter以上を確認する必要があります。
プラン料金だけでは実際の運用費は決まらない
ElevenAgentsの料金で特に注意したいのがここです。
月額22ドルのCreatorを契約すれば、すべてのAI電話費用が22ドルで収まるわけではありません。
公式料金ページでは、ElevenAgentsのホスティング料金とは別に、外部プロバイダーとしてLLMとTelephony Providerの費用が利用量に応じて発生すると案内されています。
使用するLLMによって1分あたりのモデル費用が変わります。
電話へ接続する場合はTelephonyの費用も加わります。
またプランに含まれる会話時間を超える場合、対応プランでは追加通話分が1分0.08ドルです。
同時通話上限を超えるBurst Pricingは1分0.16ドル。
テキストメッセージは1件0.003ドルです。
したがって本番導入前には、
月に何分会話するか。
同時に何件の電話が来るか。
どのLLMを使うか。
Webだけか電話も使うか。
まで想定して費用を計算した方がいいでしょう。
どこから有料にする意味が出る?
最初にエージェントを作って動作を試すだけならFreeで十分です。
15分あれば、プロンプトを設定し、声を選び、何度かテスト会話を行って「ElevenAgentsが自分の用途に使えそうか」を確認できます。
ただし実際の顧客へ公開し始めると15分はかなり短いです。
1回の問い合わせが3分なら5件程度で使い切ります。
商用利用も含めて小規模に公開するならStarterが最初の候補です。
75分なので、まず限定的なWebサポートや社内検証を行う段階に向きます。
本格的に利用者へ提供するならCreator以上が現実的です。
Creatorでは275分が含まれ、超過分も購入できます。
さらに利用量が増えるとPro、Scale、Businessへ上げていく形です。
つまり料金プランは機能の豪華さだけで選ぶより、実際にユーザーと何分会話するかから逆算するのが分かりやすいです。
ElevenAgentsはどんな人・企業に向いている?
特に向いているのは、音声での顧客対応をAI化したい企業です。
電話問い合わせが多い。
営業時間外にも一次対応したい。
予約やヒアリングを自動化したい。
Webサイトで音声サポートを提供したい。
多言語の問い合わせへ対応したい。
といった用途では、ElevenLabsの音声技術とAIエージェント機能を一つの環境で扱えるメリットがあります。
また、開発者にとってはWeb Widgetだけでなく、API、React、Swift、Kotlin、React Native、SIP、CLIなど選択肢が多いことも強みです。
最初はダッシュボードで試し、実用性が確認できたら自社システムへ深く統合できます。
一方、文章だけのチャットボットが欲しい場合は、ElevenAgentsの音声面の強みを十分に使わない可能性があります。
問い合わせ件数が極端に少なく、人間が電話に出た方が早い業務もあります。
また、予約や契約変更など重要な処理まで任せるなら、誤認識や誤操作を前提に確認フローや人間への引き継ぎを設計する必要があります。
「人間を完全に消すためのAI」と考えるより、繰り返し発生する会話をAIへ任せ、人間が必要なケースだけ引き継ぐ仕組みを作りたい場合に向いているサービスです。
まとめ|ElevenAgentsは音声AIを「実際の業務」へつなげたいときに使うサービス
ElevenAgentsは、ElevenLabsの音声技術を使ってリアルタイムに会話するAIエージェントを構築・運用できるプラットフォームです。
音声認識、LLM、音声生成、ターンテイキングを組み合わせ、ユーザーの話を聞いてその場で回答できます。
ナレッジベースを追加すれば自社情報を参照でき、Toolsを接続すれば予約確認や外部APIの操作など、回答以外の処理にもつなげられます。
作成はWebダッシュボードから始められます。
最初のメッセージ、System Prompt、声、知識などを設定し、ダッシュボード上でテストできます。
Web Widgetでサイトへ設置できるほか、React、iOS、Android、React Native、電話システムなどへ展開するためのSDK・連携手段も用意されています。
料金はFreeが月0ドルで15分。
Starterは月6ドルで75分。
Creatorは月22ドルで275分。
Proは月99ドルで1,238分。
Scaleは月299ドルで3,738分。
Businessは月990ドルで12,375分です。
ただし実際の運用ではLLMや電話回線などの費用が別途発生する可能性があります。
まず試すだけならFree。
商用の小規模運用ならStarter。
実際のユーザーへ継続的に提供する段階ではCreator以上を会話時間から検討するのが分かりやすいでしょう。
ElevenAgentsの価値は、単に「AIの声が自然」ということだけではありません。
自然な音声会話を、企業の情報、外部ツール、Web、アプリ、電話へ接続し、一つの業務フローとして運用できることが本質です。
電話受付や音声サポートをAI化したいなら、まず無料枠で実際の会話を作り、自社の業務でどこまで任せられるかを試してから本格導入を判断するのがいいでしょう。