← 返回 2026-09-24 简报

谷歌全新Flash TTS模型:通过文本描述从零打造AI语音

Google's new Flash TTS models let you design AI voices from scratch using text descriptions

语音播报
摘要
事件:谷歌发布Gemini 3.8 Flash TTS及Flash-Lite TTS模型,支持从文本描述从零创建语音,涵盖百种语言。 要点:提供2000多种预设音色及30秒克隆;通过不可见SynthID水印防伪; 影响:大幅降低多语言配音与语音代理开发门槛,其极低定价和精细控制力将加速AI语音在影视。

谷歌正在推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,这是两款用于语音生成的新模型。Flash TTS 能够根据文本描述创建全新的声音,且这两款模型均支持超过 100 种语言,并允许用户为对话的每一行添加舞台指示(stage directions)。

据谷歌介绍,Gemini 3.8 Flash TTS 专为游戏角色、有声读物和播客等创意项目设计,而 Gemini 3.8 Flash-Lite TTS 则侧重于以低成本大规模生成语音,适用于配音、音频内容和语音代理。

Flash TTS 允许用户根据文本描述创建声音

借助 Gemini 3.8 Flash TTS,用户可以从零开始设计声音。据谷歌称,文本提示可以定义声音的角色、口音以及在广泛的语言和方言范围内的发声特征。对于不想从零开始的用户,谷歌提供了一个包含超过 2,000 个预设声音的库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

一项语音克隆功能可以通过 30 秒的音频样本构建声音档案。要使用此功能,被克隆声音的人必须录制一段口头同意的声明,且录音中的声音必须与样本匹配。据谷歌称,Gemini 音频模型生成的每一段片段都带有不可听的 SynthID 水印,以帮助检测 AI 生成的语音。

谷歌还宣布了“语音混音”(Voice Remixing)功能,该功能将允许用户调整库中声音的音色、音调、节奏和口音,但该功能目前尚不可用。

脚本指示赋予用户对对话和演绎的控制权

两款模型都允许用户为每一行编写指示,或者让模型自行解读脚本提示。谷歌表示,这些模型可以生成数小时的音频,且“说话者漂移”(speaker drift)极小,这意味着声音随时间的变化微乎其微。

据该公司称,双声模式可以从单一脚本生成对话,同时保持声音的区分度。用户还可以编写笑声、叹息以及“嗯哼”等声音,以便将反应和停顿精确放置在所需位置。

在我自己的两项测试中,我使用了一个预设声音,并附带风格提示,要求它模仿一个说着带有浓重德国口音英语的恼怒柏林人。风格控制产生了令人信服口音和语调,但在某些时刻,两项测试的背景中都出现了高频嗡嗡声。在其中一项测试中,声音在片段结束时也发生了变化。

风格提示:一位来自柏林的德语母语者以外语身份说英语,带着浓厚且 unmistakable 的德国口音。他显然不是英语母语者:他以德语方式发音英语单词,将德语的节奏和语调应用于英语句子。“Th”变成“z”或“d”(如“ze”、“sink”、“dat”),“w”变成“v”(如“vat”、“vell”),词尾辅音变得更硬(如用“goot”、“bat”代替“bad”)。“r”是喉音且低沉,绝非英语中的“r”。元音扁平且短促,缺乏美式或英式英语中的柔和感。

声音带有鼻音且略显紧张,处于中音区,带有沙哑的颤动和类似 Kermit 的晃动,但更粗糙、更少木偶感。听起来像是凌晨 2 点时疲惫的柏林人。

演绎:快速、简短、断断续续。他在寻找英语单词时会短暂犹豫,有时甚至会生硬地插入德语单词而不进行翻译。偶尔会出现因沮丧而音调上扬的情况。干燥、讽刺、无动于衷,并略带恼火,因为他不得不解释任何事情——而且更恼火的是他必须用英语来做这件事。

谷歌表示,其新模型在 Hume AI 文本转语音基准测试的大多数类别中领先。| 图片来源:谷歌

谷歌开始推出这两款模型,企业 API 访问权限将随后开放

谷歌正通过 Gemini API 和 Google AI Studio 推出这两款模型。Flash TTS 也可在 Gemini Notebook 中使用,而 Flash-Lite TTS 可在 Google Vids 中使用。谷歌表示,两款模型的 Gemini Enterprise API 访问权限也将很快推出。

包括Agora、LiveKit、Pipecat和Vercel在内的开发者平台已经通过Gemini API支持集成。尽管早期的文本转语音(TTS)模型提供了欧盟数据处理服务,但谷歌尚未列出新模型的区域端点。

谷歌表示,免费层级的数据用于改进其产品,而付费层级的数据则不会。付费价格以每百万个token的美元金额列出,其中文本token按输入计费,音频token按输出计费。

计费标准
Flash TTS(至2026年底)
Flash TTS(2027年起)
Flash-Lite TTS(至2026年底)
Flash-Lite TTS(2027年起)

文本输入
$0.50
$1.00
$0.50
$1.00

音频输出
$9.00
$18.00
$6.00
$12.00

谷歌表示,一秒钟生成的音频等于25个音频token,这意味着一小时相当于90,000个token。这意味着在2026年底前,一小时的音频输出成本为Flash TTS的$0.81和Flash-Lite TTS的$0.54。从2027年1月1日起,这些成本将分别上升至$1.62和$1.08,文本输入将单独计费。

无炒作的人工智能新闻 – 由人工策划

订阅THE DECODER,享受无广告阅读、每周人工智能通讯、每年六次的独家“AI雷达”前沿报告、完整档案访问权限以及评论区的访问权。

立即订阅

本条评分 10.7 score-v1
  • 来源权威 8
    注册表 priority=8(The Decoder)
  • 时效 2.732
    发布 4.9 小时前,衰减到 2.73/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-24 · 10.73 分

原文链接:https://the-decoder.com/googles-new-flash-tts-models-let-you-design-ai-voices-from-scratch-using-text-descriptions/
来源:The Decoder
以上内容由 AI 自动翻译,仅供参考。
← 返回简报