AI 语音,现在随心所欲?谷歌 Gemini 3.8 TTS 开启新世界

Gemini 3.8 文本转语音模型用多种语言说“你好”的样子
AI Summary

谷歌的 Gemini 3.8 文本转语音 (TTS) 模型通过简单的自然语言提示创建个性化语音,并通过精细控制调节情感和语调,开启了 AI 语音技术的新时代。

AI 语音,现在随心所欲?谷歌全新的 Gemini 3.8 TTS 开启新世界

想象一下。早上醒来,你请求 AI 助手“请用更自信、清晰的声音总结今天的会议资料并进行演示”。现在,这可能不再是单纯的幻想。谷歌最近发布的 Gemini 3.8 文本转语音 (Text-to-Speech, TTS) 模型将 AI 生成语音的水平提升到一个新阶段,展现出使我们周围的许多技术更丰富、更人性化的潜力。

摆脱了仅仅是朗读文本的机械声音,AI 语音如今能像身边的人一样自然、富有情感地说话。谷歌全新的 Gemini 3.8 TTS 模型正在将这样的未来变为现实。那么,这项技术究竟是什么,它将给我们的生活带来怎样的变化呢?

这为何重要?

我们与 AI 交互的方式正日益以语音为中心发展。从智能手机的语音助手到客户服务聊天机器人,再到有声读物、游戏和教育内容的制作,AI 生成语音的质量直接影响用户体验。

传统的 AI 语音常常单调或不自然,使得听者难以沉浸其中。然而,Gemini 3.8 TTS 等新技术正在克服这些限制。就像演员根据剧本情感进行表演一样,AI 现在也能理解文本的细微之处,从而产生富有表现力、自然,有时甚至包含情感的声音 [Source 1, Source 17]。

这意味着内容创作方式的革新。个人创作者可以用更低的成本和精力制作高质量的音频内容,开发者则可以创建更逼真、更有吸引力的基于语音的应用程序。

Gemini 3.8 TTS 如何工作?

Gemini 3.8 TTS 不仅仅是将文本转换为语音,其最大特点在于用户可以精细调节所需的语音。就像专业配音演员进行配音工作一样,现在可以对 AI 发出明确的指示。

最具创新性的部分是,只需简单的自然语言提示即可生成自己的定制语音,或几乎完美地复制现有语音 [Source 1]。例如,只需“请用更平静、低沉的语调说话”或“请切换到友好、活泼的声音”之类的指示,AI 就能生成相应风格的语音。

更进一步,语音输出可以按行进行控制 [Source 1]。这意味着,就像作词家根据歌词中的每个词语调整节奏或情感一样,AI 也能精细调节说话的语速、语调、情感表达,甚至实际对话中出现的自然声音。例如,在传达重要信息时,可以降低语调,严肃地说话;在介绍下一段内容时,则可以稍作停顿,以柔和的语调进行转换。

这些可控的文本转语音 (TTS) 功能通过 Gemini API 用于将文本转换为语音 [Source 2]。开发者可以利用它构建用户交互结构,并精细引导音频的风格、口音、语速和语调。

Gemini 3.8 Live:对话式 AI 的演进

Gemini 3.8 TTS 模型在实时语音应用程序开发中也发挥着重要作用。特别是 Gemini 3.8 Live 模型,它不仅仅是简单的语音输出,更侧重于创建能够实时对话并执行任务的下一代语音代理 [Source 4, Source 7]。

该模型支持异步函数调用 (Async function calling) 功能。这意味着 AI 在不中断语音流的情况下,可以在后台调用和处理所需的工具或信息。例如,当你说“告诉我今天的天气,并预订一家意大利餐厅”时,Gemini 3.8 Live 可以在确认天气信息的同时,在后台启动餐厅预订系统。所有这些过程都会感觉像一场不间断的自然对话 [Source 7]。

这些能力使 AI 不仅仅是回答问题,更能实际进行推理、执行任务并持续对话 [Source 2, Source 4]。这将在 AI 聊天机器人、虚拟助手、客户服务系统等各种领域提供更智能、更有用的体验。

走向更广阔的世界:多语言支持和先前模型

Gemini 3.8 TTS 的发展不仅仅是为了英语语音。之前的模型 Gemini 3.1 Flash TTS 已经展现出能够说 70 多种语言的能力 [Source 9]。新的 Gemini 3.8 模型也将继承并发展这种多语言支持能力,帮助全球用户以更自然、更熟悉的语言与 AI 进行交流。

与早期版本 Gemini 3.7 Flash 相比,Gemini 3.8 Flash 在安全性和音调方面表现出相似的性能,但在编码、知识工作、多模态工作等方面提供了更高的准确性 [Source 8, Source 10]。(当然,也记录了其令牌消耗量可能略高于早期版本 [Source 10]。)

这项技术的进步也已集成到 Google Cloud 的 Text-to-Speech 服务中,支持开发者构建更强大、更灵活的语音解决方案 [Source 6]。

未来会怎样?

Gemini 3.8 TTS 和 Gemini 3.8 Live 模型的出现,让我们对 AI 语音技术的未来充满期待。

  • 个性化 AI 体验: 用户将能够选择或直接创建自己感觉最舒适、最自然的语音。这将最大限度地提升个性化 AI 助手、有声读物、教育内容等的沉浸感。
  • 内容创作的民主化: 随着成本和技术壁垒的降低,更多人将能轻松制作和分享高质量的音频内容。预计播客、有声剧、教育资料等各个领域的创造力将爆发。
  • 下一代界面的出现: AI 将不再仅仅执行命令,而是更普遍地出现能够与人类自然对话并处理复杂任务的“对话式 AI 代理”。这可能从根本上改变我们与技术互动的方式。

当然,随着 AI 生成语音变得越来越真实,也存在对深度伪造等滥用可能性的担忧。但谷歌也在通过在音频中添加隐藏水印等方式,努力防止此类滥用 [Source 9]。

Gemini 3.8 TTS 是 AI 语音技术未来发展方向的明确里程碑。我们有必要关注 AI 语音在我们的日常生活中将扮演何种角色,这段激动人心的旅程值得期待。


参考资料

  1. Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS - The Keyword: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
  2. Create your own voices with Gemini 3.8 text-to-speechText-to-speech generation (TTS) - generateContent API: (URL not explicitly provided in original list, but implied by description)
  3. New Gemini Audio models for developers - The Keyword: https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
  4. Gemini Audio — Google DeepMind: https://deepmind.google/models/gemini-audio/
  5. Gemini-TTS Cloud Text-to-Speech Google Cloud Documentation: https://docs.cloud.google.com/text-to-speech/docs/gemini-tts
  6. Thor 雷神 ⚡️ on X: “Say “Hello, ¡Hola!, 你好” to Gemini 3.8 Live …: https://x.com/thorwebdev/status/2099908141131706494
  7. Gemini3.8Flash - Model Card — Google DeepMind: https://deepmind.google/models/model-cards/gemini-3-8-flash/
  8. Gemini3.1 FlashTTS: New text-to-speech AI model: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/
  9. Gemini3.8Flash API: Price, Model ID & 1M Context EvoLink: https://evolink.ai/gemini-3-8-flash
  10. Gemini3.8Flash (low) - Intelligence, Performance… Artificial Analysis: https://artificialanalysis.ai/models/gemini-3-8-flash-low
  11. Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking - The Keyword: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
  12. Google unveils Gemini 3.8 text-to-speech models for …: https://cryptobriefing.com/google-unveils-gemini-38-text-to-speech-models-for-expressive-multilingual/
  13. Gemini-TTS Cloud Text-to-Speech Google Cloud Documentation: https://docs.cloud.google.com/text-to-speech/docs/gemini-tts (Duplicate of #5)
AD
测试你的理解
Q1. Gemini 3.8 TTS 的主要特点是什么?
  • 图像生成
  • 将文本转换为自然且富有情感的语音
  • 自动化代码编写
Gemini 3.8 TTS 专注于将文本转换为自然且富有情感的语音。 [Source 1, Source 17]
Q2. 使用 Gemini 3.8 TTS 可以通过哪些方式控制语音?
  • 按行调节语速和情感
  • 只能编辑预先录制好的语音
  • 只将特定单词转换为语音
用户可以通过简单的自然语言提示和按行控制来调节语音的语速、情感、对话等细节。 [Source 1, Source 2]
Q3. Gemini 3.8 Live 模型提到的特点是什么?
  • 支持 85 种以上语言的语音识别
  • 在后台调用工具并保持对话
  • 图像和视频生成
Gemini 3.8 Live 模型旨在在后台调用工具的同时,也能实时保持对话。 [Source 7]