BLOG

热点跟踪 007|Google 发布 Gemini 3.8 Live 与 Extended Thinking:会「出声思考」的语音 Agent,和一张自家监考的答卷

Kael Zhang
AIVoiceGoogle
广告 · Advertisement

热点跟踪:热点发布 × 技术判断 × 实用建议。 作者:永亮


9 月 15 日,Google 官博(署名 Gemini Audio Team 的 Tom Ouyang 与 Malini Jaganathan)一次放出两款语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。前者主打规模与成本效率,强调对话智能和视觉理解;后者瞄准高复杂度任务,卖点是「推理与说话同时进行」——模型一边想一边说,遇到要查证的地方会先说一句「Let me check that…」,然后实时汇报进度。同一天,开发者通过 Gemini API 和 AI Studio 就能调用;个人用户则在 Search Live、Gemini Live 应用和 Workspace 里分批见到新功能;企业版还是私有预览。语音 Agent 这个领域今年很热,各家都在讲「能干活」而不只是「能聊天」。Google 这次把姿态放得很足:官方口径里,Extended Thinking 在第三方榜单 Artificial Analysis 的 Speech to Speech Quality Index 上拿了第一(82.6)。但这份成绩单值得逐行读——因为监考的、答卷的、出考场的,有不少是同一家。

发布了什么

先摆官方口径里的硬信息,全部来自 9 月 15 日的官博:

两款模型分工明确。Gemini 3.8 Live 走规模路线:成本效率优先,支持 97 种语言在对话中自动切换,能接受近实时视觉输入——发布演示里包括看下棋局面、看一张草图直接写出 React 组件。它还能在后台执行工具调用和 API 请求,不打断当前对话。Gemini 3.8 Live Extended Thinking 走高复杂度路线:做多步推理任务,特点是「思考过程说出来」——用户能听到模型什么时候在查资料、什么时候在算,而不是对着一段沉默等结果。

可用性分三层。开发者层当日可用:Gemini API 和 AI Studio 同步开放。个人层按订阅分层:Search Live、Gemini Live 应用、Workspace 里的 Docs Live / Gmail Live / Keep Live,功能跟着 Google AI Pro 和 Ultra 两档订阅走,不是所有人同一天拿到全部功能。企业层还是私有预览:Gemini Enterprise 客户需要申请。

配套也齐:音频输出带 SynthID 水印,官方发布了 model card。合作生态名单列了一串——Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents;客户背书有 Salesforce、Genspark、Lumeris。

官方成绩单怎么读

这部分必须慢读,因为数字的来源不一样,含金量也不一样。

来自第三方榜单的有两个:Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上排第一,分数 82.6;在 Speech Agent Arena 的用户偏好榜上排第二。这两个是外部机构的测试,可以算作独立评价。

来自官方自家口径的有:τ-Voice 智能体任务完成率 68.6%、Sierra τ-Voice-banking 场景 35.1%、Big Bench Audio 97.7%。这组数字目前没有独立第三方复现,正文里只能叫「官方口径」。

最有意思的是 ServiceNow EVA-Bench 那一项。官博的说法是 Extended Thinking「推动了准确率与会话质量的帕累托前沿」,但紧接着有一行自注:测试是在 Gemini Enterprise Agent Platform 的 Live API 上运行的。翻译过来就是——这个企业客服场景的 benchmark,跑在 Google 自家的 Agent 平台上。EVA-Bench 本身是 ServiceNow 的评测框架,这点不假;但运行环境是自家栈,这个限定条件官方自己写了,读者也该自己记住。

所以这份成绩单的读法是:第三方部分可以引用,自家口径部分要挂标签,EVA-Bench 那条要同时记住「第三方框架」和「自家跑道」两半。

冷静的另一半

这才是本期想认真聊的部分。五件事,按分量排。

第一件:自家发布会 + 自家跑分,老实但没完全老实。 AI 厂商用自家平台发布自家成绩是行业惯例,不足为奇。但这次的诚实素材是现成的:EVA-Bench 那行「在 Gemini Enterprise Agent Platform 的 Live API 上运行」的自注,等于官方自己标出了利益相关。这不是作弊——限定条件写在明处;但也不是独立验证。真正的缺口在于:τ-Voice、Big Bench Audio 这些漂亮数字,整个发布材料里没有任何一家外部机构复现过。发布会的热度会过去,这些数字会不会有第三方再测一遍,才是它们能不能站住的关键。

第二件:「Extended Thinking」的命名学——出声思考是推理透明,还是拟人化表演。 文本模型里,思维链可以被逐字审计、被截图、被质疑。语音里不一样:你听到的是一段流畅的「Let me check that…」,但模型是真的在检索、在计算,还是只是在用一个经过训练的口头套路安抚你?语音交互的「思考」无法像文本一样被审计——听众既没有权限看到推理过程,也没有办法区分「真实的多步推理」和「表演出来的多步推理」。把延迟包装成「思考」,在工程上是一个优雅的产品决策;在叙事上,它顺走了「extended thinking」这个词在文本时代积累起来的信任。透明和表演之间隔着一层语音,这层语音目前由厂商自己定义。

第三件:承诺与兑现之间隔着订阅表和预览名单。 发布当天,开发者能用 API,这是真的。但个人侧的 Workspace 全家桶——Docs Live、Gmail Live、Keep Live——是按 Pro / Ultra 订阅分层的,「发布了」和「你能用到」之间隔着一层付费墙;企业侧的核心卖点 Gemini Enterprise 还是私有预览,申请制、不透明、无时间表。这不是 Google 一家的问题,是整个行业「发布会全量、交付分层」的常态。但对读者来说,区分「已发布」的三个层级,比记住发布会上的演示视频重要得多。

第四件:语音 Agent 的老三样,这次仍然没有独立答案。 评价一个语音 Agent 能不能干活,绕不开三个指标:打断处理(用户插话时模型多久能停下)、端到端延迟(开口前要等多久)、工具调用可靠性(说调了 API,到底调没调成)。这次发布材料里,官方没有给出这三个指标的第三方复现数据。演示里下棋和画 React 组件很惊艳,但演示是单次成功,老三样是万次成功率。在独立评测出来之前,「能干活」这三个字要打折听。

第五件:SynthID 是检测水印,不是责任方案。 给 AI 音频加水印是好事,方便事后鉴别。但水印回答的问题是「这段音频是不是 AI 生成的」,回答不了「这段 AI 音频说错了话谁负责」。当语音 Agent 替用户查完资料、念出结论、后台调完工具,出了错的责任链——模型、平台、集成方、客户——目前没有任何一个水印能覆盖。把检测工具当责任框架讲,是发布会叙事的常见滑步。

如果你是开发者

按「现在能用 / 先观望 / 选型看什么」三条说:

现在就能用的:Gemini API 和 AI Studio 当日可用,做语音 Agent 原型可以直接上手。97 种语言的自动切换如果做得到官方口径,对多语言客服和出海产品是实打实的卖点——但请在自己的语料上先测一轮,不要拿发布会演示当验收标准。后台工具调用不打断对话这个设计,值得在原型里重点体验,它决定的是「助手」和「员工」的差别。

先观望的:Gemini Enterprise 私有预览里的 Agent Platform 能力,等公开可用且有独立评测再评估;Workspace 全家桶按订阅分层,采购前先看自己团队实际落在哪一档;对「出声思考」的进度叙述,建议把它当 UI 提示而不是推理证据来设计自己的产品——你的用户同样没法审计一段语音。

选型要看的指标:不管最后选谁,语音 Agent 选型就盯五个数——打断响应时间、端到端延迟、工具调用成功率(分场景统计,不是汇总)、多语言切换的真实可用率(挑你的目标语言测,不挑官方演示语言)、单次任务成本(Extended Thinking 这类多步推理模式的成本是常规模型的几倍,要问清)。这五个数,发布会上一个都不会给你,要自己去 benchmark,或者等第三方机构测。

结语

Google 这次发布的技术含量是真的:推理与说话同时进行、后台工具调用不打断对话、97 种语言切换,任何一条单拎出来都值得同行紧张。但发布会的叙事水分也是真的:自家监考的答卷、无法审计的「思考」、按订阅表分层的「全量发布」、没有第三方复现的老三样、以及被包装成责任框架的检测水印。语音 Agent 竞争进入下半场,比的不是谁的演示更惊艳,而是谁的数字经得起外人复测。Gemini 3.8 Live 的答卷已经交卷,批改权在第三方手里——这一期先把卷子抄下来,答案对不对,等别人改完再谈。

参考来源

  • Google 官博:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 发布文(2026-09-15,署名 Tom Ouyang、Malini Jaganathan,Gemini Audio Team)
  • 官博随附 model card(2026-09-15)
  • 官博引述第三方榜单:Artificial Analysis Speech to Speech Quality Index、Speech Agent Arena(2026-09-15 时点的排名口径)
广告 · Advertisement

常见问题

Google发布的Gemini 3.8 Live和Extended Thinking有哪些特点?

Gemini 3.8 Live主打规模与成本效率,强调对话智能和视觉理解;Extended Thinking则针对高复杂度任务,能推理与说话同时进行。

Extended Thinking在哪些第三方榜单上取得了成绩?

Extended Thinking在Artificial Analysis的Speech to Speech Quality Index上排名第一,在Speech Agent Arena的用户偏好榜上排名第二。

如何解读Google官方发布的成绩单?

第三方榜单的成绩可以引用,但官方自家口径的成绩需标注,特别是EVA-Bench这一项,需注意其测试是在Google自家平台上进行的。