AIと「会話」するということ、Gemini 3.8 Liveが変える風景

スマートフォンを通じて自然に会話する人とAI音声アシスタントの様子をイメージしたイラスト
AI Summary

Googleの最新音声モデルGemini 3.8 LiveとExtended Thinkingは、リアルタイム音声会話能力を大幅に強化し、AIが複雑なタスクを実行しながらも会話の流れを途切れさせないようサポートします。

想像してみてください。朝起きてスマートフォンに向かって「今日は会議が多いから、昼食の時間に合わせて一番近いレストランを探して予約しておいて」と話しかけます。これまでのAIアシスタントなら、レストランを探して予約する間「少々お待ちください」と止まったり、会話が途切れたりしがちでした。しかしこれからは、AIがまるでそばにいる有能な秘書のように「レストランを探しています。良さそうなところがいくつかありますが、12時30分に予約可能な場所でよろしいですか?」と、途切れることなく会話を続ける世界が到来しています。

Googleが最近発表した「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」は、まさにこのような未来を現実のものにする、最も先進的な音声会話モデルです出典 1 出典 4

なぜこれが重要なのか?

これまで私たちが使用していた多くの音声AIは、質問を投げかけるとデータを検索して回答を生成する間、会話が一時停止しているような感覚を与えていました。これは、料理人が料理を作っている間、厨房から音が全く聞こえず、料理が完成して初めてまた声が聞こえてくるようなものでした。

しかし今回リリースされたモデルは、「リアルタイム音声エージェント」のために設計されています出典 3。ユーザーとAIが会話している途中でも、AIが自ら複雑なタスクを実行し、その内容をユーザーにフィードバックすることで、会話の文脈が損なわれないようサポートします出典 1。これは、AIとのより自然で深いコラボレーションが可能になることを意味します。

簡単に理解する

この技術を理解するために、2つの例えを紹介します。

1つ目は、「考えながら話す」です。「Gemini 3.8 Live Extended Thinking」モデルは、私たちが悩む時に独り言を言うのと似ています。AIが複雑なリクエストを処理する際、「今、データを調べています」あるいは「この情報を処理するのに少し時間がかかっています」と進捗状況を音声で伝えてくれます出典 8。こうすることで、ユーザーはAIが応答を諦めたのではなく、今一生懸命作業中であることを知ることができます。

2つ目は、「目と耳を持つ魔法使い」です。これらのモデルは単に声を聞くだけではありません。音声、画像、ビデオ、そしてテキストまでを一度に理解できる「マルチモーダル(Multimodal:多様な形態のデータを同時に理解する技術)」AIです出典 2。まるで目と耳の両方を持つ人が状況を総合的に判断して会話に参加するのと同じです。これは、最大128K(約12万8千個)トークンという膨大な量の情報を一度に記憶し分析できるために可能なことです出典 2

現在の状況

現在、Googleのこれらのモデルは既に驚くべき成果を見せています。「Artificial Analysis」という機関の評価によると、「Gemini 3.8 Live Extended Thinking」モデルは「音声会話品質指数(Speech-to-Speech Quality Index)」で総合1位を獲得しました出典 10。82.6点という高いスコアを記録し、業界最高レベルの性能を証明したのです出典 7 出典 12

また、世界的に97以上の言語をサポートしているため、韓国語はもちろん、様々な言語のユーザーがAIアシスタントとより便利にコミュニケーションをとれるようになりました出典 11 出典 15。GeminiアプリやGoogle AI Studioを通じて、この技術を直接体験することができます出典 8

今後はどうなるか?

Googleはここ数ヶ月間、ほぼ3週間ごとに主要なGeminiモデルをアップデートするという速い動きを見せています出典 5。これは、AIが私たちが使用する日常的なデバイスにいかに急速に溶け込んでいるかを示しています。

今後、AIアシスタントは単なる命令伝達機を超え、私たちが業務を行ったり悩み事を分かち合ったりする際に共に考え、アドバイスをくれる真の「パートナー」へと発展するでしょう。今回のアップデートは、AIとの会話が技術的な通信を超え、人間的な相互作用により近づくための重要なマイルストーンとなるはずです。

MindTickleBytesのAI記者からの視点

人間の会話とは、単に情報をやり取りするだけでなく「思考の流れ」を共有するプロセスです。今回のモデルは、AIが人間のこの流れを妨げることなく、共に悩むことができるレベルに一歩近づきました。

参考資料

  1. Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking - The Keyword
  2. Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
  3. Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production-Grade Voice Agents
  4. Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail
  5. Gemini 3.8 Live & Extended Thinking: Google Voice AI [2026]
  6. Gemini 3.8 Live Launch: 82.6 Voice AI Score [2026]
  7. Meet Gemini 3.8 Live and 3.8 Live Extended Thinking: our best…
  8. 「Gemini 3.8 Live/3.8 Live Extended Thinking」正式発表 – Jetstream
  9. [Gemini 3.8 Live и 3.8 Live Extended Thinking… AiManual](https://ai-manual.ru/article/gemini-38-live-i-38-live-extended-thinking-golosovyie-ai-agentyi-s-parallelnyim-myishleniem/)
  10. Google DeepMind выпустила Gemini 3.8 Live и Extended Thinking…
  11. Gemini 3.8 Live: Google Splits Its Voice Line in Two
  12. Gemini 3.8 Live Extended Thinking Pricing, Specs & Sources
  13. Google launches Gemini 3.8 Live to take on OpenAI’s GPT-Live-1 at…
AD
この記事の理解度チェック
Q1. 今回発表された「Extended Thinking」モデルの最大の特徴は何ですか?
  • 画像だけを認識できる
  • 作業の進行状況を自ら説明し、会話の流れを維持する
  • テキストでのみ会話が可能である
Extended Thinkingモデルは、AIが複雑なタスクを処理している間も会話が途切れないよう、自身の思考や作業の進行状況を音声で説明する機能が強化されました。
Q2. Gemini 3.8 Liveモデルが処理できる入力データの種類は何ですか?
  • 音声データのみ
  • テキストのみ
  • 音声、画像、ビデオ、テキスト
新しいモデルは音声だけでなく、画像、ビデオ、テキストまで含めたマルチモーダル入力をサポートしています。
Q3. 今回のモデルがArtificial AnalysisのSpeech-to-Speechランキングで記録した総合スコアは何点ですか?
  • 70.5点
  • 82.6点
  • 90.0点
Gemini 3.8 Live Extended Thinkingモデルは、Artificial Analysisの音声会話品質指数で82.6点を記録し、総合1位を獲得しました。