谷歌发布的实时语音对话AI“Gemini 3.8 Live”和“扩展思维”模型,旨在让AI对话变得更加顺畅、智能,带来如真实交流般的体验。
想象一下:在一个繁忙的早晨醒来,你问智能手机上的AI助手:“能帮我整理一下今天下午会议的资料,并像聊天一样简要概括给我吗?”紧接着,对话流畅地进行,仿佛一位极其聪明的私人秘书就坐在你身边。这种告别了生硬命令输入、如同与人面对面交流般的顺畅体验,正是谷歌此次迈出的巨大一步。
谷歌于2026年9月15日正式发布了全新的以语音为中心的AI模型——“Gemini 3.8 Live”以及“Gemini 3.8 Live 扩展思维 (Gemini 3.8 Live Extended Thinking)” [出处: Google Launches Gemini 3.8 Live and Extended Thinking Models]。如今,AI已不再仅仅是执行指令的机器,而是正在进化成为我们日常生活中真正的对话伙伴。
这为何重要?
过去我们体验过的语音AI,往往感觉像是在听一个自动化语音应答系统(ARS)在朗读菜单。如果在对话中途插话,或者提出稍微复杂一点的问题,AI往往就会卡壳。然而,此次发布的新模型旨在不打断用户对话流程的前提下,提供如同与真人沟通般顺畅的体验 [出处: Google Releases Gemini 3.8 Live-Extended Conversational Model]。
对于开发者和企业来说,这意味着可以更轻松地实现对用户更加友好、高效的语音服务,例如智能客户咨询机器人或个人助理服务 [出处: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models]。
通俗理解
为了理解这项新技术,我们可以使用两个比喻:
首先是“连续胶片”的比喻。如果说以前的AI模型是逐张处理照片,那么 Gemini 3.8 Live 模型处理音频、视频和文本数据就像处理一部漫长的电影胶片一样,实时且不间断 [出处: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card]。因此,即使在我们说话的同时,AI也能立即理解情况并做出自然反应,就像电影中演员们不间断地对话一样。
其次是“思考深度”的比喻。之所以将模型分为两种,原因就在于此。如果说“Gemini 3.8 Live”是专为日常高效对话而优化的“敏捷选手”,那么“Gemini 3.8 Live 扩展思维”则是负责处理需要深层逻辑思考的复杂问题的“深思分析家” [出处: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking]。这就像是在解决难题或制定复杂计划时,总会有一位专家先停下来深入思考,然后再给出答案。
可以在哪里使用?
目前,这些技术已通过 Gemini API(程序间的连接通道)、Google AI Studio 以及 Gemini Enterprise 向开发者和企业公开 [出处: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models]。这意味着我们在不久的将来,很有可能在常用的各类App中体验到这些更加智能的语音AI。
未来展望
未来,在与AI对话时,与其说是发布“指令”,不如说是互通有无、相互协作的感觉会更强烈。特别是由于它能够实时识别视频和音频相结合的信息,比如AI可以实时解释智能手机摄像头拍摄到的场景并共同商讨方案,未来各种更先进的智能体(Agent)服务将层出不穷 [出处: Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card]。
我们似乎正超越将AI仅作为输入指令工具的阶段,向着与AI共同分享日常生活的伙伴关系时代更近了一步。
AI的观点
Google DeepMind 对这些模型评价道:“这是目前顶尖的对话式AI,能在后台进行对话、思考和处理任务,且完全不会打断用户的对话流程” [出处: Google DeepMind on X]。
此次 Gemini 3.8 Live 模型的核心,在于它超越了“技术的速度”,成功获取了“对话的上下文”。AI回答得有多快不再是唯一标准,与我们融合得有多自然,正在成为衡量真正创新的尺度。
参考资料
- Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking
- Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card
- Gemini 3.8 Live: gemini-3.8-live, 97 языков и Extended Thinking
- Google Launches Gemini 3.8 Live and Extended Thinking Models
- Google Releases Gemini 3.8 Live-Extended Conversational Model
- Google DeepMind on X
- Google Launches Gemini 3.8 Live and Extended Thinking Voice Models
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- 提升图像生成速度
- 实现更自然、更智能的实时语音对话
- 构建专门的文本翻译引擎
- 仅处理文本数据
- 仅处理音频数据
- 实时处理连续的音频、视频和文本流
- 通过 Gemini API、Google AI Studio 等提供
- 仅在专用硬件设备上运行
- 仅在离线环境下运行