← 返回 2026-09-24 简报

Gemini 3.8文本转语音功能上线,正式“打招呼”

Gemini 3.8 text-to-speech says hello

语音播报
摘要
事件:Google DeepMind 发布 Gemini 3.8 Flash TTS 及 Flash-Lite TTS 模型。 要点:支持超百种语言方言的自然语言提示定制、30秒样本克隆及 SynthID 水印; 影响:开发者可低成本构建高保真角色声音,游戏与播客创作者获得精细表演控制,解决长音频漂移问题。

首页
创新与人工智能
模型与研究
Gemini 模型
Gemini 3.8 文本转语音向您问好

2026年9月23日

12分钟阅读

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今为止最具表现力的音频生成模型。通过 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids,您可以生成自定义角色声音和直接的场景对话。

Leland Rechis
集团产品经理

Alan Cowen
代表 Gemini 音频团队的研究科学总监

分享
阅读由人工智能生成的摘要

今天,我们向 Gemini 家族推出了两款新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型使创作者、开发者和企业能够创造更丰富、更具表现力的音频体验,同时提升 Gemini Notebook 和 Google Vids 等产品中的用户体验。

Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示从头创建全新的声音,为游戏、沉浸式有声书、播客和互动媒体中的角色赋予生命。逐行指导每一句表演台词,对表演提示、节奏、方言转换和背景回应进行精细控制。
Gemini 3.8 Flash-Lite TTS:专为大规模、高性价比的扩展而设计。针对高音量配音、音频内容创作以及具有语调、节奏和表现力细微差别精细控制的表达性语音代理进行了优化。

这些模型补充了我们快速增长的 Gemini Audio 家族,紧随 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking 之后。

创建并自定义您自己的声音
00:00

从 30 个原始声音扩展到无限的声音库。无论您需要一个完全原创的角色声音还是一个一致的品牌大使,我们的 3.8 Flash TTS 模型都能提供完整的语音工作室支持。这使您能够为每个时刻创建并使用富有表现力、听起来自然的声音,同时赋能开发者和企业轻松构建自定义音频体验。

生成式语音设计:借助 Gemini 3.8 Flash TTS,通过自然语言提示定制角色、口音和声音特征,覆盖 100 多种语言和方言,从头开始创建专属声音——无论您是在塑造一条喷火的戏剧性巨龙,还是在创作一位具有独特区域节奏的魅力旁白。

听听 Gemini 3.8 Flash TTS 如何生成来自墨尔本的高能量 DJ 声音。

听听 Gemini 3.8 Flash TTS 如何生成极其尖锐、单调的机器人声音。

听听 Gemini 3.8 Flash TTS 如何让一条日本龙栩栩如生。

广阔的声音库:访问 2,000 多个生产就绪的声音,涵盖广泛的语言——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
声音复制:仅凭您自己或您有权使用的声音的 30 秒音频样本,即可重现一致的语音特征,并由内置的同意验证、SynthID 水印和 C2PA 凭证提供支持,以保护开发者和他们的语音人才。
保存与扩展:保存并管理您设计的自定义声音,以确保在持续项目中保持一致的性能并将漂移降至最低。
声音混音:即将推出,从我们的声音库中选择一个声音,并微调音色、音高、节奏和口音。使用提示来调整特征(例如,“添加微妙的美国南部口音”或“柔和语气”)。

逐行指导表演

一旦您选择了声音,这两款 TTS 模型都让您能够精确控制每句台词的呈现方式。

逐行指导表演:编写自己的舞台指示,或让 Gemini 通过自然脚本提示来引导交付——从冷静的客户服务代表到低声的悬疑场景。

听听 Gemini 3.8 Flash TTS 如何为交互式语音代理实现自然、高度表现力的对话。

观看并聆听 Gemini 3.8 Flash TTS 如何利用细粒度的脚本控制,构建深度引人入胜、沉浸式的音频体验。

长篇幅生成:在长达数小时的连续音频中,保持高音质、自然的语速和角色音色,同时将说话人漂移降至最低——非常适合播客和有声书。

原生双说话人场景编排:从单一脚本无缝引导多轮对话——无论是用于播客还是戏剧性叙事——同时通过自然的对话轮流机制,使两个声音保持清晰分离。

脚本化语音爆发与回应性发声:使用非语言线索(如 、、)和主动倾听的插入语(如 |mhm| 或 |yeah|),增添真实的对话质感,实现精准的喜剧节奏和反应节拍。

观看 Gemini 3.8 Flash TTS 如何将自然语言提示从零开始转化为定制化的声音人格。

观看 Gemini 3.8 Flash TTS 如何使创作者能够设计自定义场景,让动画对话栩栩如生。

观看 Gemini 3.8 Flash TTS 如何将脚本转化为完整的表演对话场景,让创作者能够指导语音表达和自然的对话轮流。

获取专为全球规模构建的富有表现力的高质量语音生成

Gemini 3.8 Flash TTS 提供领先的语音定制能力,在 Hume AI 的 Voice Design Benchmark(71.4)上总体排名第一,并在口音建模方面(60.8)同样领先。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 在确保可靠性的同时实现了真正富有表现力的表演,分别在 Hume AI 的总体质量指数中占据第一和第二的位置。与 Gemini 3.1 Flash TTS 相比,该模型在长篇幅内容和双说话人剧本控制等广泛用例方面显示出重大改进。

在 Voice Arena 的盲测人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语在内的关键全球语言中,在竞争对手中占据领先地位。凭借对 100 多种语言的支持,这些模型赋能创作者、开发者和企业,在全球范围内构建高质量的_multilingual_语音体验。

以信任、同意和透明为基础进行构建

我们构建了严格的保障措施,以帮助保护声音人才、尊重身份并确保内容透明,从而打造我们的语音创建和复制能力。对于语音复制,我们的系统利用同意验证:在创建声音之前,用户必须提供来自声音所有者的、与参考说话人匹配的口头同意录音。

更广泛地说,由我们的 Gemini Audio 模型生成的每个音频片段都带有 SynthID 水印。这种不可见的水印直接编织到音频输出中,确保 AI 生成的语音可被检测,从而帮助防止虚假信息。有关我们安全与责任方法的更多详情,请参阅模型卡片。

试用我们的全新 Google AI Studio 音频游乐场

从今天开始,开发者可以在 Google AI Studio 中体验这些新的语音生成能力。该工具构建为语音设计工作区,您可以从零开始提示全新的声音身份或复制您自己的声音
1
,然后将其直接导入双说话人剧本编辑器,逐行指导表达。

在 Google AI Studio 中试用语音复制功能。

轻松部署高性能语音界面

通过使用 Gemini API,Agora、LiveKit、Pipecat、Vercel 等开发者平台使开发者能够轻松构建和部署高性能的语音生成体验。

我们与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,这些公司正在集成我们最新的 TTS 模型,以帮助加速全球配音、利用细微的区域口音对媒体进行本地化,并以规模化方式驱动对话式语音代理。

开始使用我们最新的 Gemini Audio 模型:

Gemini 3.8 Flash TTS 从今天开始逐步推出:

对于开发者:在 Gemini API 和 Google AI Studio 中
对于企业客户:即将通过 Gemini Enterprise 的 API 提供
对于所有人:在 Gemini Notebook 中

Gemini 3.8 Flash-Lite TTS 今日开始推出:

对于开发者:在 Gemini API 和 Google AI Studio 中
对于企业客户:即将通过 Gemini Enterprise 的 API 提供
对于所有人:在 Google Vids 中

发布于:
Gemini 模型

本条评分 11.6 score-v1
  • 来源权威 9
    注册表 priority=9(Google DeepMind)
  • 时效 2.617
    发布 7.1 小时前,衰减到 2.62/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-10-05 9.4 14 入选
2026-10-04 9.4 19 未入选
2026-10-02 9.4 33 未入选
2026-09-24 11.62 15 入选
原文链接:https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
来源:Google DeepMind
以上内容由 AI 自动翻译,仅供参考。
← 返回简报