tradingkey.logo
tradingkey.logo
検索

OpenAIは、ChatGPTの一般ユーザー向けに全二重GPT-Live音声機能を展開しました。

CryptopolitanJul 9, 2026 1:13 AM
facebooktwitterlinkedin
すべてのコメントを見る0

OpenAIは水曜日、ChatGPTの一般ユーザー向けに、再構築された音声モードの展開を開始した。これは、従来の高度な音声モードを、 ユーザーの声を聞き取り、同時に応答できる2つのモデル、 GPT-Live-1とGPT-Live-1 miniに置き換えるものだ。

このアップデートは、無料および有料の消費者向けアカウントで利用可能となり、同社によるGPT-5.6モデルファミリーのローンチの前日に実施される。.

GPT Liveへの移行の主な理由は、アーキテクチャにあります。従来の音声モデルは人間の話者が文を言い終えるまで待機していましたが、GPT-LiveはOpenAIの 全二重 アーキテクチャに基づいて動作し、入力音声を処理しながら同時に出力音声を生成します。

OpenAIの発表によると、このモデルは1秒間に何度も、話すか、聞き続けるか、一時停止するか、割り込むか、道具を使うかを判断する。実際には、ユーザーはモデルに話しかけたり、中断されることなく考えを巡らせたり、モデルが「うんうん」と相槌を打って話についてきていることを示すのを聞いたりすることができる。.

OpenAIがChatGPT VoiceにGPT-Liveを導入

ChatGPTの無料アカウントでは、デフォルトで GPT-Live-1 miniが、Go、Plus、Proプランの加入者は、より大きなGPT-Live-1を利用できます。

今回のアップデートはiOS、Android、ウェブに対応しており、 ChatGPTは既にCarPlayで動作している、9to5Macは今回のアップデートが車載システムにも適用されると指摘している。OpenAIによると、ChatGPTの9種類の音声は新型モデル向けにリマスターされているという。

また、GPT-Liveは推論エンジンではなく、会話型エンジンとして開発されたとも述べている。より複雑な要求に対しては、GPT-Liveがすべてを単独で処理するわけではない。OpenAIによると、この音声モデルは、音声会話を中断することなく、ウェブ検索、推論、さらには複数ステップの回答といったタスクをGPT-5.5に委任することができるという。.

これは、ChatGPTの以前の音声モードにおける大きな欠点の1つ、つまりタイピングに比べて機能が劣っているように感じられる場合があった点を解消するためのものです。ユーザーは、迅速な応答モードと、より手間のかかるモードを選択することもできます。.

OpenAIは、天気、株価、スポーツのスコアなどに関するほぼリアルタイムの音声翻訳とビジュアルカード機能も追加し、ChatGPTが全てを読み上げる代わりに、画面上でユーザーに回答の一部を提供するようにする。同社によると、音声認識や音声入力などのChatGPT機能はすでに毎週1億5000万人以上が利用しているという。.

GPT-Liveは音声の流れを改善するが、途切れが生じる。

OpenAIの記者会見を取材したTechCrunchによると、ヒンディー語の翻訳はtronアメリカ訛りがあり、非常に堅苦しく、いかにも学者然とした言葉遣いだったという。.

OpenAIによると、このモデルは「ChatGPTで最も一般的な言語の一部」で最も効果的に機能するものの、一部の言語ではアクセントや流暢さに問題が生じる可能性があると警告している。また、OpenAIは、現時点では音声と動画、画面共有を組み合わせた機能はサポートされていないと述べている。.

OpenAIはGPT-Liveを同社のモデルラインナップ全体の中で最も人間らしいバージョンとして売り込んでいるが、AIコンパニオンではないと強調している。同社はまた、10代の若者に対して年齢相応の応答を保証するために講じた安全対策についても言及した。さらに、ユーザーとの会話が自傷行為につながるような場合には、危機対応リソースが用意されていることも付け加えた。.

ライブ通話および高度な音声通話の音声クリップは 30日間保持され 、ユーザーが共有を選択しない限り、モデルのトレーニングには使用されません。

ChatGPT Voiceのプロダクトリーダーであるアティ・エレティ氏は、ブリーフィングで、散歩中にこの機能を使って30分から40分間の会話をしたことがあると話し、音声がより長く複雑なタスクを実行する主要な手段になる可能性があると主張した。.

CodexとChatGPTを使って人々が実現しているような素晴らしいユースケースを見ると、音声はあらゆる種類の仕事の未来のインターフェースになり得ると考えています。

– エレティ(TechCrunch経由)

GPT-5.6のローンチにより、タイミングが注目される

音声アップデートは、OpenAIが木曜日に予定しているモデルリリースとは別個のものです。.

によると Cryptopolitan、 GPT-5.6 一般公開は、米国商務省が国家安全保障審査中に課した禁輸措置を解除した後に承認され、Sol、Terra、Lunaの3つのバージョンが利用可能になった。

GPT-Liveは、一般ユーザー向け展開後、OpenAIのAPIに統合される予定で、 開発者はアクセス登録が可能となる 。

 

 

 

この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう。

免責事項:本サイトで提供する情報は教育・情報提供を目的としたものであり、金融・投資アドバイスとして解釈されるべきではありません。

コメント (0)

$ボタンをクリックし、シンボルを入力して、株式、ETF、またはその他のティッカーシンボルをリンクします。

0/500
コメントガイドライン
読み込み中...

おすすめ記事

tradingkey.logo
リスク告知:当社ウェブサイト及びモバイルアプリは特定の投資商品に関する一般的な情報のみを提供しており、Finsightsは金融アドバイスや投資商品の推奨を行うものではありません。本情報の提供をもってFinsightsが投資助言を行っていると解釈されることはありません。
投資商品には元本割れを含む重大なリスクが伴い、全ての投資家に適するものではありません。なお、過去の運用実績は将来の成果を保証するものではありません。
Finsightsは、第三者広告主または提携先が当社ウェブサイト・モバイルアプリ上に広告を掲載することを許可する場合があり、これら広告主から広告への反応に基づく報酬を受けることがあります。
© 著作権: FINSIGHTS MEDIA PTE. LTD. 無断複写・転載を禁じます。