一番大きな違いは、音声AIを「組み立てる基盤」として使うか「電話業務の環境」として使うか
VapiとRetell AIは、できることだけを並べるとかなり似ています。
どちらも電話の着信・発信、AIによるリアルタイム会話、外部APIとの連携、人間への転送、複数の音声やLLMの利用、本番前のテストに対応しています。
それでも選び方が分かれるのは、サービスの中心が少し違うからです。
Vapiは、音声AIを構成する部品を自分で選びながら組み立てる開発基盤として使いやすいサービスです。
文字起こしに使うTranscriber、会話を担当するLLM、音声を生成するVoiceをそれぞれ選べます。対応するプロバイダーでは自分のAPIキーを登録でき、その場合はVapi経由でそのプロバイダー料金を支払うのではなく、プロバイダーへ直接支払います。
さらに、複数のAIアシスタントを役割ごとに分けて会話中に切り替えるSquadsや、外部サービスへ処理を渡すツール、Webhookなどを使えます。
たとえば、
問い合わせ受付
→ 契約確認担当
→ 予約担当
→ 必要なら人間へ転送
といった処理を、一つの巨大なプロンプトだけで作らず、役割ごとのアシスタントへ分けて設計できます。Vapiには実行時に転送先を決める動的なhandoffもあります。
Retell AIにも十分な開発自由度はあります。
ただ、Retell AIは最初から「電話業務として動かし、その後も運用する」ことまでを一つの環境へまとめている印象が強いです。
Conversation Flowではノードと遷移を使い、条件分岐や状態管理を含む会話フローを構築できます。Single Promptだけで作るより、問い合わせ内容によって処理を分けるような電話業務を視覚的に管理しやすくなっています。
加えて、Simulation Testing、通話履歴、Post-call analysisなどが標準的な運用機能としてまとまっています。
そのため、最初の分け方としては、
自社サービスの中へ音声AIを深く組み込みたい → Vapi
電話受付やコールセンターのような業務を構築し、そのまま改善運用したい → Retell AI
と考えると分かりやすいです。
料金はVapiの方が単純に安いわけではない
VapiのBuildでは、Vapi側のホスティング料金が$0.05/分です。
ただし、この$0.05だけでAI電話を動かせるわけではありません。
STT、LLM、TTSなど、実際に使用するモデルプロバイダーの料金が別途加わります。自分のAPIキーを使う場合は、そのプロバイダー分についてVapiからの請求はなく、プロバイダーへ直接支払います。
そのため、Vapiの$0.05/分だけを見て「Retell AIより安い」と判断するのは適切ではありません。
Retell AIはAI Voice Agentsが$0.07〜$0.31/分です。
実際の料金は、使用するLLM、TTS、電話回線、追加機能などによって変わります。Retell AIの料金ページでも、LLM料金、音声インフラ、TTS、Telephony、Add-onsを分けて計算する仕組みになっています。
たとえばKnowledge BaseやAdvanced Denoisingなどを追加すると、分単価へ追加料金が発生します。
料金の考え方としては、
Vapi = 基盤料金+自分で選んだ各プロバイダー料金
Retell AI = Retell側の音声基盤を中心に、使用モデル・音声・追加機能で単価が変わる
という違いがあります。
Vapiでは、すでにOpenAIやElevenLabsなどの契約を持っていたり、独自のボリュームディスカウントを使いたかったりする場合、自分のAPIキーを持ち込めることに意味があります。
一方、Retell AIでは料金計算画面から構成ごとの概算コストを確認しやすいため、電話業務として一つのサービス内で費用を見積もりたい場合は扱いやすいです。
少量の検証段階なら、表示されている最低単価を比較するより、自分が使いたいLLM・音声・電話回線を設定した状態で1分あたりいくらになるかを計算した方が実際の差が分かります。
同時通話はRetell AIの方が最初から余裕がある
VapiのBuildには10同時通話が含まれています。
11通話以上を同時に動かしたい場合は、追加の同時通話枠を1枠あたり月額$10で購入します。着信と発信は同じ組織の同時通話枠を共有します。
Retell AIでは、Pay as you goでも20同時通話が含まれています。
20を超える場合は1枠あたり月額$8で追加できます。Enterpriseでは同時通話数に固定上限を設けないプランも用意されています。
この差は、個人開発や1〜2回線の問い合わせ窓口ではほとんど影響しません。
一方で、
予約確認を一斉に発信する
営業電話を複数回線で回す
広告やキャンペーン直後の問い合わせを受ける
といった用途では、最初から20同時通話を持つRetell AIの方が余裕があります。
Vapiにも大量発信用のCampaignsがあり、最大10,000件の連絡先を一つのCampaignへ登録できます。
ただしCampaign側で最大同時数を指定しても、契約している組織全体の同時通話枠そのものが増えるわけではありません。
そのため大量発信を比較するときは、単に「バッチ発信に対応しているか」ではなく、必要な同時通話数を確保したときに月額いくら追加されるかまで含めて考える必要があります。
モデル自由度はVapiの方が設計思想として分かりやすい
LLMや音声を選びたい場合、両サービスとも選択肢があります。
Retell AIの料金ページでも、GPT系、Claude、Gemini、カスタムLLMなど複数のモデルを選べます。音声についてもRetell Platform Voicesだけでなく、ElevenLabs、Cartesia、OpenAIなど複数のTTSが料金計算対象になっています。
そのため、「Retell AIはモデルを選べない」という比較は現在では正しくありません。
違いは、VapiではSTT・LLM・TTSを別々の部品として組み合わせること自体がサービス設計の中心になっていることです。
Vapiでは、Transcriber、Model、Voiceそれぞれにプロバイダーを設定できます。OpenAI互換の独自LLMエンドポイントも利用できます。
音声認識はこの会社、LLMは別の会社、音声合成はElevenLabsというように、自分で音声AIスタックを決めたい場合はVapiの考え方が自然です。
Retell AIでもモデル構成は変更できますが、そこから先の通話分析や電話回線、Simulation TestingなどもRetellのプラットフォーム内で利用することが前提になります。
つまりモデル対応数だけで勝敗を付けるより、
各部品を自分で管理する自由度を重視するならVapi
複数モデルを選びつつ、電話システム全体は一つの環境へまとめたいならRetell AI
と考える方が実際の違いに近いです。
会話設計は、VapiのSquadsとRetell AIのConversation Flowで考え方が違う
複雑な電話業務になると、一つの長いシステムプロンプトだけで会話を制御するのは難しくなります。
VapiではSquadsを使って、複数のアシスタントへ役割を分けられます。
たとえば営業電話なら、
最初の受付をするAI
→ 見込み客の条件を確認するAI
→ 商談予約をするAI
というように担当を分け、必要になった段階で次のアシスタントへ会話を引き継げます。
この方式は、複雑なサービスをソフトウェアとして設計する感覚に近いです。
Retell AIのConversation Flowは、同じエージェントの電話業務をノードと遷移で構造化する考え方です。
「この回答なら次の質問へ進む」「この条件なら人間へ転送する」といった流れを視覚的に管理でき、各ノードへ個別の処理を設定できます。
結果として、
役割そのものを複数のAIへ分離して設計したい → VapiのSquads
電話業務の一連の流れをフローチャートとして管理したい → Retell AIのConversation Flow
という違いがあります。
どちらが上というより、自分が音声AIを「複数エージェントのシステム」として設計したいのか、「一つの業務フロー」として管理したいのかで使いやすさが変わります。
テストは、以前ほどRetell AIだけの強みではない
旧記事ではRetell AIのSimulation Testingが大きな差として見えやすかった部分ですが、現在はVapi側のテスト機能もかなり充実しています。
Retell AIでは、LLM Simulation Testingを使ってユーザー役のAIに会話させ、定義した評価基準で結果を確認できます。
テストケースを保存し、複数ケースをまとめてBatch Testすることもできます。プロンプト変更後に同じケースを繰り返し実行できるため、本番前の品質確認や回帰テストに使えます。
VapiにもEvalsとSimulationsがあります。
Evalsではモック会話を作り、応答内容だけでなくツール呼び出しやSquad間のhandoffまで自動評価できます。回帰テストとしてまとめることもでき、CI/CDに組み込む用途も想定されています。
SimulationsではAIテスターを使って実際の会話シナリオを実行し、予約が正常に完了したかといった条件を評価できます。ツールの応答をモックして、実際の外部APIへ影響を与えずにテストすることも可能です。
そのため現在は、
「テストしたいならRetell AI」
だけで選ぶほど大きな差ではありません。
Retell AIは電話エージェントのテストをダッシュボード上の運用フローとして使いやすく、VapiはEvalsやSimulationsを開発工程へ組み込みやすい。
どちらも本番前の自動テストに対応しており、違いはテスト機能の有無より、開発フローへどう組み込みたいかに移っています。
通話後の分析はRetell AIの方が最初から業務に使いやすい
電話業務として運用する場合は、通話した後に何ができるかも重要です。
Retell AIではPost-call analysisを使い、電話が終わったあとに必要な情報を自動抽出できます。
Text、Boolean、Number、Selectorなどの形式で独自項目を作成でき、
契約希望か
問い合わせ内容は何か
取引金額はいくらか
人間へ転送されたか
といった情報を通話ごとに抽出できます。結果はダッシュボード、Webhook、APIから利用できます。
通話要約や通話成功判定のプロンプトを変更し、後から分析だけを再実行することもできます。
Vapiでも通話結果を取得したり、構造化された結果を自社システムへ渡したり、Webhookやツールを使ってCRMなどへ連携できます。
たとえば公式のLead qualification例では、見込み客を判定してCRMを更新し、必要なら商談予約まで行う構成が紹介されています。
ここでも違いは「できる・できない」ではありません。
Retell AIは分析結果を見る仕組みそのものが電話運用のダッシュボードへまとまっており、非エンジニアを含む運用担当者でも扱いやすいです。
Vapiは、通話結果を自社のCRMやSaaSへ送り、そこで独自の業務処理を進めたい場合に柔軟です。
通話の分析も音声AIサービス内で完結させたいならRetell AI、自社システムへ結果を持ち帰りたいならVapiという違いが見えやすい部分です。
結局VapiとRetell AIのどちらを選ぶ?
自社のWebサービスやSaaSへAI電話を組み込み、STT・LLM・TTS、外部API、複数エージェントまで自分で設計したいならVapiを選びやすいです。
特に、すでに各AIプロバイダーのAPIを利用している開発チームや、音声AIを自社プロダクトの一機能として扱いたい場合はVapiの自由度を活かせます。
予約受付、問い合わせ窓口、コールセンターなど、電話業務そのものをAI化し、テスト・通話分析・改善まで一つの環境で進めたいならRetell AIの方が扱いやすいです。
20同時通話が最初から含まれ、Conversation Flow、Simulation Testing、Post-call analysisまでまとまっているため、本番運用をサービス内で完結させやすくなっています。
以前は、
自由度ならVapi、テストや運用ならRetell AI
とかなり単純に分けられました。
現在はVapiにもEvalsやSimulations、Campaignsなどが増えているため、その差は縮まっています。
最終的には、
音声AIを自社システムの一部として作る → Vapi
AI電話そのものを一つの業務システムとして運用する → Retell AI
という違いで選ぶのが一番分かりやすいです。
まとめ
VapiとRetell AIは、どちらも本格的なAI電話を構築でき、モデル選択、外部API連携、複雑な会話設計、自動テスト、大量発信まで対応しています。
現在は機能の重なりが増えているため、一つの機能だけで勝敗を決めるより、どこまで自分でシステムを組み立て、どこから電話業務としてサービス側へ任せたいかを見る方が違いを判断しやすくなっています。
開発基盤として自由に構成するならVapi、電話業務の構築から分析・改善まで一つの環境へまとめるならRetell AI。この軸で考えれば、どちらを選ぶべきかかなり絞りやすくなります。