header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

谷歌Gemini 3.8 TTS:30秒样本就能复刻声音

动察 Beating AI 快讯,谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款文本转语音模型已在 Gemini API 和 Google AI Studio 开放。Flash 主打音质、角色表演和长文本稳定性,Lite 偏向高吞吐、低延迟和低成本。


两款模型都能直接用文字设计新声线,也能用约 30 秒参考音频复刻本人或已获授权的声音。用户可以逐句控制情绪、节奏和口音,还能插入笑声、叹气、咳嗽等声音。双人对话也可以直接用一份剧本生成。Flash 支持 130 种语言,Lite 支持 101 种。


价格也比上一代低。到 2026 年 12 月 31 日,Flash 音频输出每百万 tokens 为 9 美元,Lite 为 6 美元;上一代 Gemini 3.1 Flash TTS Preview 为 20 美元。2027 年 1 月 1 日起,两款标准价会升至 18 美元和 12 美元。

AI 解读
谷歌把 TTS 拉进 3.8 周期。9月16日 Gemini 3.8 Live 以82.6分登顶语音榜,9月2日 Gemini 3.8 Flash 上线,今日 TTS 双档补齐:Flash 主攻音质、长文本,Lite 主攻吞吐与低延迟,已在 Gemini API 和 AI Studio 开放。

更该留意的是价格时点:到12月31日音频输出每百万 tokens 为9美元、6美元,2027年1月1日恢复18美元、12美元。促销价低于上一代3.1 Flash TTS Preview的20美元,但标准价几乎翻倍,迁移窗口仅剩一个季度。30秒克隆、逐句情绪和双人剧本把声音变成可编排资产;Mistral Voxtral此前以3秒样本、9语种切入,谷歌用130/101语种与API分发应战。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成