GPT-Liveとは?OpenAIの全二重(フルデュプレックス)音声モデル
GPT-Liveとは、OpenAIが2026年7月8日に発表した、聞くことと話すことを同時に行える「全二重(フルデュプレックス)」方式の音声モデルです。OpenAIはこのモデルで動く機能そのものを「ChatGPT Voice」と呼んでおり、日本語では「ChatGPT Live」「チャットGPTライブ」と表記されることもあります。いずれも指しているものは同じです。2026年9月10日には「GPT-Live-1」として開発者向けAPIの提供も始まり、ChatGPT内だけでなく、自社のアプリや業務フローにも組み込めるようになりました。
全二重(フルデュプレックス)とは、電話のように双方が同時に声を重ねられる通信方式を指す言葉です。従来のChatGPTの音声モードは、ユーザーが話し終わるのを待ってからAIが返答する「ターン制」でした。GPT-Liveはこのターン制をやめ、相手が話している最中も文脈を追い続け、「うん」「なるほど」といった相づちを打ちながら会話を進めます。名前の「Live」は、双方向でリアルタイムに途切れず続く会話という核心を表しています。
聞きながら同時に話せる「全二重」の会話とは
GPT-Liveの最大の特徴は、AIがユーザーの発話中でも黙って待つのではなく、自然に反応できる点です。人同士の会話では、相手が話している間に相づちを打ったり、言いかけて止めたりします。GPT-Liveはこうした振る舞いを再現し、「話す・聞く・間を取る・割り込む」の判断を絶えず行います。ユーザーが考えるために少し黙ってほしいと頼めば、静かに待つこともできます。周囲の雑音に気を取られず、ユーザーの声に集中する能力も高まっています。
具体的な体験としては、こちらが話しながら言葉に詰まって間を空けても、AIが焦って割り込まず、話し終わるまで待ってくれます。逆に、こちらの説明が長くなると「なるほど」「はい」と相づちを挟み、会話が一方通行にならないように反応します。国内の実機レビューでも、「ほぼラグのないリアルタイム会話」「自然な相づちとフィラー(つなぎ言葉)」「意図的な会話の間」が体験として確認されています。従来のように「話し終わってからしばらく待つ」ストレスが薄れ、電話で人と話しているのに近い感覚になる点が、多くのユーザーの関心を集めています。
従来の音声モードから何が変わったのか
これまでのChatGPTにも音声で対話する機能(Standard Voice Mode / Advanced Voice Mode)はありました。ただし、いずれも「一方が話し終わってからもう一方が話す」トランシーバー型のやり取りが基本でした。GPT-Liveは、この構造を電話型の自然な会話へと変えたモデルです。国内メディアのImpress Watchは本モデルを「ほぼ”本物の会話”の音声モデル」と評しており、単なる音声品質の向上ではなく、会話体験そのものの質的な変化として受け止められています。
変わったのは「テンポ」だけではありません。従来は返答を待つ間に会話のリズムが途切れ、AIと話しているという意識が強く残りました。GPT-Liveでは、相づちや自然な間が挟まることで、その意識が薄れ、思考を口に出しながら整理する流れを保てます。2026年9月のAPI提供開始時には、Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinderという12種類の新しい音声オプションも追加され、用途に合う声を選べるようになりました。
なぜいま「全二重」が注目されるのか
これまでの音声アシスタントは、便利ではあっても「コマンドを一つ伝えて、返答を待つ」道具の域を出ませんでした。全二重方式が注目されるのは、この関係を「道具」から「会話の相手」へと近づけるからです。相づちや間、割り込みといった人間らしい要素が加わることで、単なる音声検索ではなく、話しながら一緒に考えを進める体験が生まれます。話しながら考えを整理する、口頭で下書きを固める、移動中に手を使わず相談する、といった使い方が現実的になり、音声インターフェースの実用性を一段引き上げるものとして受け止められています。
GPT-Live-1 と GPT-Live-1 mini の2バージョン
GPT-Liveは「GPT-Live-1」と「GPT-Live-1 mini」の2つのバージョンで提供されます。ChatGPTの画面にあるVoiceボタンを押したときの対話を、このモデルが担います。GPT-Live-1が有料プランの既定モデル、GPT-Live-1 miniが無料プランの既定モデルという位置づけです。単体アプリではなく、ChatGPTに組み込まれた機能として届けられる点も押さえておきましょう。
GPT-Liveの仕組み|会話と推論を分ける全二重アーキテクチャ
GPT-Liveの自然さは、「会話を担うモデル」と「重い思考を担うモデル」を分けた設計から生まれています。ここでは、その技術的な仕組みを3つの角度から整理します。
音声認識・LLM・音声合成を1つのモデルに統合
従来の音声AIは、「音声認識(STT、話し言葉を文字に変換する処理)」「大規模言語モデル(LLM、文章を理解し生成するAI)」「音声合成(TTS、文字を話し言葉に変換する処理)」という3つの部品を順番につなぐ構成が主流でした。GPT-Liveはこれらを1つのモデルに統合し、音声の入力と出力をリアルタイムに同時処理します。専用の「話者交代を検知する部品」を持たずに、毎秒何度も「話す・聞く・待つ」を判断している点が、従来方式との決定的な違いです。
委譲された推論(バックエンドモデルへの委譲)で会話を止めない
もう1つの重要な設計思想が「委譲された推論(Delegated Reasoning)」です。GPT-Live-1はリアルタイムの音声会話を担い、Web検索や複数ステップの調べ物など、より深い推論や操作が必要な場面では、処理をバックエンドのテキストモデルやツールへ渡せます。OpenAIは組み合わせの例として、複雑な問い合わせにはGPT-6 Astra、件数の多い処理にはLunaを挙げていますが、開発者は第三者モデルを含めて用途に合う構成を選べます。処理中も音声モデルが会話の流れを保つため、利用者を無言で待たせにくい設計です。
応答モード(Instant / Medium / High)の選択
ChatGPTでは、目的に応じて応答モードを選べます。速さを優先する「Instant」、中程度の思考を挟む「Medium」、複雑な作業に向く「High」の3段階です。軽いモードでは即応性を、重いモードでは推論の深さを優先できます。一方、APIではこの画面上のモードを選ぶのではなく、開発者がバックエンドモデルやツールを組み合わせて、速度・コスト・推論性能のバランスを設計します。日常会話は速さ優先、調べ物や整理を伴う相談は思考優先、という考え方は共通です。
この設計の要点は、入力(ユーザーの音声)から処理(会話モデルと、必要なときのバックエンドへの委譲)を経て、出力(音声と視覚カード)までが、途切れない1本の会話として流れる点にあります。音声・推論・Web検索・翻訳といった従来なら別々に動いていた機能を、1つの会話の中に統合していることが、GPT-Liveの技術的な新しさです。
GPT-Liveでできること|主要な機能
GPT-Liveは、自然な会話を土台にしながら、検索や翻訳といった機能を1つの会話の中に統合しています。代表的な機能は次の通りです。
- 同時聞き取り・発話:相手の発話中でも自然に応答し、相づちを打つ。黙ってほしいと頼めば静かに待つ
- 自然な間・割り込みの処理:ユーザーが考え込んで間を空けても、話し終わるまで待つ
- 視覚カードの表示:天気・株価・スポーツ・地図などの質問に、会話を止めずにリッチな情報カードを画面表示する
- リアルタイム翻訳:会話を止めずに、ある言語から別の言語への同時通訳を行う
- 話し方の調整:APIではシステムプロンプトによって、声のトーン、話す速さ、会話スタイルを指定できる
- 12種類の新しい音声:APIでは用途やブランドに合わせて12種類の音声オプションから選べる
- 長時間・電話環境への対応:長いセッションや電話回線でも会話を安定して続けやすい
これらの機能の要点は、音声・推論・Web検索・翻訳が「別々の操作」ではなく「1つの会話」として動くことです。国内の技術コミュニティでも、会話を止めずに検索やファクトチェックを挟める点が高く評価されています。話しながら考えを整理したり、書く前に口頭で下書きを固めたりと、思考の相手として使える点が実用的な価値につながります。
GPT-Liveの使い方|始め方と対応プラットフォーム
GPT-Liveは、専用の申し込みや追加契約を必要としません。まず始め方と、どの環境で使えるのかを整理します。
始め方はVoiceボタンを押すだけ
GPT-Liveの使い方はシンプルです。iOS・Android・ChatGPT.com(Web版)、およびデスクトップアプリ(macOS / Windows)のいずれかでChatGPTを開き、画面のVoiceボタンを押すと、そのプランの既定の音声モデルとしてGPT-Liveが起動します。契約プランに応じて、GPT-Live-1またはGPT-Live-1 miniが自動的に有効化される仕組みで、モデルを手動で切り替える必要はありません。ローンチ以降、iOS・Android・Web版へ数日かけて順次到達し、デスクトップアプリへは2026年7月24日に展開されました(次の項で述べます)。
AIエージェントを「どう作り、どう育てるか」を、GiftX記事制作エージェントの実物で解説。
デスクトップアプリ(macOS / Windows)にも搭載された
2026年7月24日、GPT-Liveを搭載したChatGPT Voiceがデスクトップアプリ(macOS / Windows)にも展開されました。デスクトップ版の対象として案内されているのはPlus・Pro・Business・Enterprise・Eduの各プランで、同日からグローバルに提供されています(出典: openai.com)。無料プランとGoは、デスクトップ版の対象としては案内されていません。
デスクトップ版では、通常の会話に加えて、ChatGPTのChat・Work・Codex上で進んでいるタスクを音声だけで進行・調整できます。複数のエージェントが並行して動いている状況でも、状況を聞いて優先順位を変える、といったやり取りを声で挟めます。なお、スマートフォンをデスクトップ端末とペアリングすれば、Remote(リモートアクセス)経由でもボイスモードを使えます。ただし公式ドキュメントで案内されているのは2026年7月24日時点でiOSのみで、Androidでの対応についての記載はありません(出典: learn.chatgpt.com)。Remote接続そのものはiOS・Androidの両方に対応しています。記載がないのは、Remote経由で音声を使う部分についてです。スマートフォン中心だった使い方が、パソコンでの作業に組み込める段階に入ったことになります。
関連記事:ChatGPTのボイスモードとは?デスクトップでできること・使い方を整理
GPT-Liveの料金|プラン内で完結する費用と、APIで組む場合の単価
GPT-Liveの料金を調べると、ChatGPTの月額料金とAPIの分単価が混在していて戸惑います。理由は、ChatGPTの機能として使う場合と、自社サービスへAPIで組み込む場合で料金体系が異なるからです。立場によって、見るべき数字が次のように分かれます。
- ChatGPTの利用者として使う… 月額のプラン料金に含まれ、GPT-Liveの追加料金はかからない
- 自社サービスに音声対話を組み込む… GPT-Live-1 APIの音声フロントレイヤーを1分あたり0.05ドルで使う
つまり、ChatGPTの利用者として使う場合と、APIで自社サービスに組み込む場合では料金体系が異なります。APIの0.05ドル/分は会話の入出力を担うフロントレイヤーの料金で、委譲先のバックエンドモデルやツールの利用料は別に見積もる必要があります。
ChatGPTのプランで使う場合は追加料金なし
GPT-Liveは、既存のChatGPTプランの範囲内で追加料金なく利用できます。無料プランではGPT-Live-1 miniが、有料プランではGPT-Live-1が既定モデルになります。2026年7月時点のChatGPTの料金体系と、GPT-Liveの対応関係は次の通りです。まず、プランごとに使えるモデルが異なる点を押さえ、次に自分の使い方に合う段階を選ぶ、という順で確認すると迷いません。
| プラン | 月額(2026年7月時点) | 既定の音声モデル |
|---|---|---|
| Free | 無料 | GPT-Live-1 mini |
| Go | 約8ドル | GPT-Live-1 |
| Plus | 約20ドル | GPT-Live-1 |
| Pro | 約100〜200ドル | GPT-Live-1 |
| Business / Enterprise / Edu | 個別・要問い合わせ | GPT-Live-1(デスクトップ版は2026年7月24日から) |
上表のプラン料金と提供状況は2026年7月時点、後述するAPI単価は2026年9月10日の発表時点に確認した値です(出典: openai.com)。法人向けプランはローンチ時点では対象外でしたが、前述したデスクトップアプリへの搭載にあわせて、デスクトップ版の対象として案内されるようになりました。まず試したい場合は無料プランのGPT-Live-1 miniで会話の感触をつかみ、常用したい場合はGo以上でGPT-Live-1に上げる、という進め方が現実的です。プラン料金は改定が多く円換算も為替で変わるため、契約前に公式ページで最新のドル建て料金を確認してください。
関連記事:ChatGPTとは?できること・新機能・料金プランを解説
開発者向けAPIの料金
GPT-Live-1 APIは2026年9月10日に提供が始まりました。自社のアプリや業務フローへ全二重の音声会話を組み込めます。公式発表時点の料金は次の通りです。
| モデル | 用途 | 料金 |
|---|---|---|
| GPT-Live-1 | 全二重の音声フロントレイヤー | 0.05ドル / 分 |
この単価は音声フロントレイヤーだけを対象とし、複雑な処理を委譲するバックエンドモデルや外部ツールの費用は含みません。たとえば問い合わせ対応を1,000分行う場合、音声部分は50ドルが目安となり、そこへ委譲先の利用料を加えます。GPT-Realtime系は引き続き別のAPI製品ラインとして提供されているため、既存実装を直ちに移行する必要はありません。最新の仕様と料金は、OpenAIのGPT-Live-1 API公式発表で確認してください。なお、ChatGPTの月額プランにAPI利用料は含まれません。
GPT-LiveとAdvanced Voice Mode・Gemini Live・GPT-Realtimeの違い
GPT-Liveを検討するとき、混同しやすいのが「従来のAdvanced Voice Mode」「競合のGemini Live」「開発者向けのGPT-Realtime」との違いです。それぞれ役割が異なるため、3つの軸で整理します。まず会話方式・思考中の継続・視覚応答という体験面の違いを押さえ、次に開発者向けAPIとの棲み分けを確認する、という順で見ていきます。
従来のAdvanced Voice Mode・Gemini Liveとの違い
体験面での違いを、GPT-Liveを起点に整理したのが下表です。Googleも2026年9月15日付の発表で、推論しながら会話を続けるGemini 3.8 Live Extended Thinkingを紹介しました。思考中に会話を継続する設計は両者にあるため、提供アプリ、接続サービス、利用条件から比較します。同じ条件での速度や途切れにくさを実測した比較ではありません。
| 比較軸 | GPT-Live | 従来のAdvanced Voice Mode | Gemini Live |
|---|---|---|---|
| 会話方式 | 全二重(聞く・話すを同時に) | ターン制(交互に発話) | リアルタイムの双方向音声対話 |
| 思考中の会話継続 | バックエンドモデルやツールへ委譲 | ー | 3.8 Live Extended Thinkingは推論と発話を並行 |
| 視覚カード表示 | 対応(天気・株価・スポーツ等) | 非対応 | 現時点で非対応 |
| ビデオ・画面共有 | ローンチ時は未対応(近日対応予定) | 対応 | 対応 |
Gemini Liveは、スマートフォンやタブレットのGeminiアプリを中心に、音声会話とカメラ・画面共有、Googleの接続済みアプリを組み合わせられます。8月にはSpark連携、Daily Brief、Gmail操作、Personal Intelligenceも発表されましたが、地域・言語・プラン・アカウントなどの条件は機能ごとに異なります。ChatGPT内の体験や接続先を使いたいならGPT-Live、GoogleサービスとつなげたいならGemini Liveというように、利用環境から選びましょう。開発者はアプリの契約とは別に、それぞれのAPIの仕様と料金を確認する必要があります。
関連記事:Gemini Liveの使い方・無料範囲と新モデルの提供条件
関連記事:Geminiとは?できること・料金プラン・モデル体系とChatGPTとの違い
開発者向けのGPT-Realtimeとの違い
「GPT-Live」と「GPT-Realtime」も混同されがちですが、両者は別のAPI製品ラインです。2026年9月10日から、GPT-Live-1も開発者向けAPIとして利用できるようになりました。GPT-Live-1 APIは、ChatGPTで培われた自然な全二重会話と、バックエンドへの委譲を組み合わせやすい点が特徴です。OpenAIの評価では、割り込み処理を測るFull Duplex BenchでGPT-Realtime-2.1を30ポイント上回りました。一方、GPT-Realtime系も引き続き提供されています。新規開発では会話の自然さ、既存システムとの互換性、料金体系を比べて選びましょう。
全国8,000人調査で、AIの活用方法によって生産性向上に約3.8倍の差が生まれることが判明。
GPT-Liveの弱み・現時点の制約と注意点
新しいモデルだけに、リリース時点のGPT-Liveにはいくつかの制約があります。導入を検討する前に、次の点は把握しておきましょう。
- ビデオ・画面共有に非対応:ローンチ時点では音声とビデオ・画面共有の併用ができません。これらが必要な場合は、従来のStandard / Advanced Voice Modeを使う必要があります(OpenAIは近日対応予定としています)
- 言語ごとの品質差:一部の言語では、非ネイティブの訛りや流暢さのばらつきが生じうるとされています。日本語での本格運用前には、実際の会話品質を確認しておくと安心です
- 無料版は機能が絞られる:無料プランで使えるのは機能を絞ったGPT-Live-1 miniです。有料版との差は把握しておきましょう
- 法人向けプランは管理者設定に左右される:Business・Enterprise・Eduプランは2026年7月24日にデスクトップ版の対象へ加わりましたが、管理者側の設定で機能が制限されている場合があります。デスクトップ以外での提供状況は公式に明示されていません
- 出典表示の扱いが未確定:音声での回答が情報の出典をどう示すかは、まだ明確になっていません
このほか、GPT-Liveは実在する特定人物の声を模倣することはできません。また音声AI全般の限界として、AIの回答は誤りを含むことがあります。日時や場所に関わる重要な情報、医療・法律・金融・安全に関わる判断は、確定情報として扱わず、別の手段で必ず裏を取ることが前提になります。
GPT-Liveを業務で使う前に押さえたい情報の扱いとセキュリティ
GPT-Liveを個人で試すぶんには手軽ですが、業務で使う場合は「情報の扱い」に注意が必要です。音声は、キーボード入力よりも手軽に情報を渡せるぶん、顧客名や取引情報、機密情報をうっかり口に出してしまうリスクがあります。まずは機密情報を含まない範囲から試し、「AIに話してよい情報」と「話してはいけない情報」を線引きしながら使うのが安全です。
組織で使う際は、そもそも自社の契約プランでGPT-Liveが使えるかを、管理者に確認することから始まります。法人向けプランは2026年7月24日にデスクトップ版の対象へ加わりましたが、管理者側の設定で機能が制限されている場合があるためです。なお、ChatGPT Enterpriseなどの法人向けソリューションでは、組織のデータは機密として扱われ、組織が所有する状態が保たれるとされています。音声で会話ログを扱う場合は、顧客の個人情報や取引の機微な情報の取り扱いルールを、事前に定めておくことが望まれます。
関連記事:生成AIで気をつけるセキュリティとは?主要リスクと企業がとるべき対策を解説
音声AIを業務に取り入れるときに陥りがちな3つの落とし穴
GPT-Liveのような音声AIは体験のインパクトが大きく、「これで業務を一気に変えられそうだ」と期待が膨らみます。しかし、いざ自社の業務に取り入れようとすると、つまずきやすいポイントがあります。ここでは代表的な3つの落とし穴を整理します。
落とし穴1:いきなり全ての業務を任せようとする
最初から複数の業務をまとめて音声AIに置き換えようとすると、どこから手をつけるべきか判断できず、かえって前に進めなくなります。まずは対象を1つに絞ることが出発点です。
落とし穴2:壮大なAI活用構想から考えて手が止まる
「全社的にどう活用するか」という大きな設計から入ると、検討事項が膨らみすぎて着手が遅れます。構想の精緻さよりも、小さく試して手応えを確かめる動きが先です。
落とし穴3:既製の音声AIでは自社の業務フローに組み込めない
GPT-Liveのような既製品は汎用的で便利ですが、自社独自の業務手順やルールに合わせてカスタマイズするには限界があります。実務で使えるレベルまで作り込むには、自社の業務に沿った設計が必要になります。
スモールスタートで1業務をAIエージェントに任せる
実際、ビジネス職を対象とした調査では、AIをその都度チャットで質問や資料作成に使う「チャット止まり」の層が約7割を占め、複数の工程を任せられるエージェント段階まで進んでいる層は約1割にとどまります。この差を生むのは、規模の大きさではなく「まず1つの業務を、成果が出るまで作り込めているか」です。音声AIの導入も同じで、対象を1業務に絞り、スモールスタートで自動化・効率化することがポイントになります。小さく始めて成果を確かめ、そこから対象を広げていく進め方が、結果的に定着への近道です。GiftXでは、こうしたスモールスタート前提のAIエージェント構築を1業務単位から伴走支援しています。詳細はAIエージェント構築支援サービスをご覧ください。
詳細な調査データは「ビジネス職生成AI活用実態調査(2026年版)」にてご覧ください。
GPT-Liveに関するよくある質問(FAQ)
GPT-Liveについて、検討時によく挙がる質問をまとめました。
GPT-Liveは無料で使えますか?
はい、無料プランでも機能を絞った「GPT-Live-1 mini」が既定の音声モデルとして利用できます。より高性能なGPT-Live-1を使いたい場合は、Go・Plus・Proなどの有料プランへの加入が必要です。
従来のChatGPTの音声機能と何が違いますか?
従来のAdvanced Voice Modeは「一方が話し終えてからもう一方が話す」ターン制でした。GPT-Liveは、相手の発話中でも相づちを打ちながら同時に会話できる全二重方式で、より人同士の会話に近いテンポでやり取りできます。
GPT-LiveのAPIは利用できますか?
はい。GPT-Live-1 APIは2026年9月10日から利用できます。音声フロントレイヤーの料金は1分あたり0.05ドルで、委譲先のバックエンドモデルやツールの料金は別途かかります。詳しくは本文の「開発者向けAPIの料金」で整理しています。
GPT-Liveは日本語に対応していますか?
日本語での会話には対応しています。ただし、言語によっては流暢さにばらつきが生じうるとされているため、業務で本格的に使う前に、実際の会話品質を確認しておくことをおすすめします。
GPT-Liveは法人・業務で利用できますか?
デスクトップアプリでは利用できます。ローンチ時点ではBusiness・Enterprise・Eduといった法人向けプランは対象外でしたが、2026年7月24日のデスクトップアプリ搭載にあわせて、デスクトップ版の対象として案内されるようになりました。デスクトップ以外での提供状況は公式に明示されていないため、組織で利用する場合は、自社のプランで使えるかと管理者側の設定を管理者に確認してください。
まとめ
GPT-Liveは、聞きながら同時に話せる全二重方式によって、ChatGPTの音声会話を電話のような自然なやり取りへと近づけた音声モデルです。会話を担う音声モデルと、深い推論や操作を担うバックエンドを分ける設計により、処理中も会話が途切れにくい点が大きな特徴です。無料プランでも機能を絞った版を試せるため、まずは触れてみる価値があります。2026年7月24日にはデスクトップアプリ(macOS / Windows)にも搭載され、法人向けプランがデスクトップ版の対象に加わりました。さらに2026年9月10日にはGPT-Live-1 APIの提供が始まり、自社のアプリや業務フローにも組み込めるようになりました。業務で活かすなら、いきなり全体を変えようとせず、対象を1業務に絞り、スモールスタートで自動化・効率化することが第一歩です。小さく始めて成果を確かめる進め方が、音声AIを含むAI活用を定着させる近道になります。
AI活用の伴走支援をご検討の方へ
本記事で紹介したGPT-Liveのような音声AIをはじめ、AIを自社の業務に取り入れて具体的に成果を出したい・相談したいとお考えの方は、ぜひGiftX AIエージェント構築支援までお問い合わせください。
GiftX AIエージェント構築支援では、貴社の業務に合わせて1業務単位のスモールスタートから本番運用まで、AIエージェント構築をワンストップで支援します。ユースケースの洗い出しから、PoC、本番運用、社内ナレッジ化まで伴走します。
AI活用にご関心のある方は、ぜひ一度ご相談ください。
▶ GiftX AIエージェント構築支援の詳細・お問い合わせはこちら