Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。
这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变了语音AI在复杂专业场景下的应用范式。
在此前的主流语音交互架构中,AI系统通常需要在“快速响应的浅层对话”与“耗时较长的深度思考”之间做出妥协,面对高难度问题往往需要用户忍受长时间的静默等待。Google此次推出的Gemini 3.8 Live着重优化了极速对话与日常流式交互体验,能够以更敏锐的语调起伏、自然打断与上下文理解能力,为用户提供极其流畅且具备人类级质感的实时语音交流。而在其基础上推出的Gemini 3.8 Live Extended Thinking,则针对高复杂度业务流进行了根本性升级。该模型赋予了AI“边说边想”(Think as it speaks)的后台扩展推理能力,使系统在维持实时连贯对话的同时,于后台并发执行复杂的多步骤逻辑拆解、代码排错或技术诊断,无需在遇到困难问题时生硬中断对话节奏。
在实际应用落地方面,新一代Live系列模型将大幅拓宽语音助手的服务边界。除了日常的自然交谈外,Gemini 3.8 Live及扩展推理版本在实时步骤排错、复杂数理推导、实时外语同声辅导以及多任务流式指令执行等高智力需求场景中展现出了显著优于以往版本的表现,在多项多模态与语音推理行业基准评测中位居榜首。
对于开发者与企业级用户,Google宣布相关模型能力即日起通过Gemini API及Google AI Studio正式开放接入。开发者可直接调用这一极低延迟的原生音频API接口,在智能硬件、客户服务、实时编程辅助及协同办公等产品形态中快速构建具备高阶推理能力的下一代全双工语音代理服务。
via
cnBeta.COM - 中文业界资讯站 (author:
稿源:cnBeta.COM)