https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
Claude语音模式升级 支持更强大AI模型

Anthropic公司今日为Claude语音模式推出重大升级,首次加入 Opus 与 Sonnet 模型支持,并新增多项功能。此前语音模式仅限于Haiku模型,偏向即时回应而较少深层思考;现在付费用户可以在语音模式中享受更强大的模型能力,并在对话期间切换模型。

新版 Claude 语音模式已于 Anthropic 的移动端、桌面端及网页应用上线。用户可通过官方渠道了解详细操作方式。此次升级显著提升了 Claude 语音模式的实用性,尤其适合需要深度分析与多语言协作的场景。

—— 雅虎新闻Techcrunch

via 风向旗参考快讯 - Telegram Channel
黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型 Flux3。它基于 Self-Flow 架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。

最扎眼的一点是音视频同步。Flux3是首个支持原生音频生成的多模态模型,一次就能吐出长达20秒的音视频同步片段,能力覆盖文本、图像、视频转视频,基于关键帧的转场,以及多角色对话等。对一支模型来说,把"听得见"和"看得见"捏成同一套底座,意味着它不再只是图像或视频的单科选手。

早期测试里,在720p 分辨率、10秒片段的设置下,Flux3把 Luma Ray3.2按93% 的胜率压了下去,对 Runway Gen-4.5也有77% 的胜率优势;即便摆到 Seedance2.0与 Gemini Omni Flash 这类顶尖模型面前,它仍守住了微弱上风。

动作也被它伸进了现实。黑森林实验室联合 Mimic Robotics 开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂跑起了生产任务测试——多模态能力从屏幕里走到了产线上。发布节奏上,BFL 选择分阶段推进:Flux3Video 已经先上线,Flux3Image 与带开源权重的 "Flux3Dev" 也将在近期陆续放出。

via AI新闻资讯 (author: AI Base)
新晋菲尔兹奖得主IMO 满分天才 Tsimerman 官宣加入 OpenAI

当地时间7月23日上午,2026年国际数学家大会在费城开幕,本年度菲尔兹奖四位得主揭晓——邓煜、约翰·帕登、雅各布·齐默尔曼与王虹。其中邓煜、王虹成为菲尔兹奖自设立以来首批获此殊荣的中国籍数学家,写下历史一笔。而在这场数学界最高荣誉的发布会后,一位新科得主顺势宣布了自己人生的下一个方向:深耕 AI 安全,不久后入职 OpenAI。

这位是雅各布·齐默尔曼(Jacob Tsimerman)。他此番摘奖的核心资本,是把 o-极小性理论重塑为算术几何与复代数几何的基础研究工具,并成功证明多项学界核心猜想,包括格里菲斯周期图像的代数性猜想、西格尔模簇相关的安德烈-奥尔特猜想,为数论发展落下重笔。在赛后新闻发布会上,他对外表示将转向 AI 安全领域研究,并很快加入 OpenAI。消息一出,OpenAI 首席研究官马克·陈(Mark Chen)与前微软 AI 副总裁、现 OpenAI 研究员塞巴斯蒂安·布贝克(Sebastien Bubeck)均发声确认并表达欢迎。马克·陈评价,Tsimerman 拥有顶尖数学天赋,而他对待 AI 安全议题那份严谨审慎的态度与深刻独到的思考,同样令人钦佩。

Tsimerman 是加拿大籍数学家,主攻数论、算术几何与超越数论,长期在这些方向与模型论的交叉地带深耕。他1988年出生,少年时曾代表加拿大出征2003、2004两届国际数学奥林匹克(IMO),两度摘金,2004年更拿下一满分;本科就读多伦多大学,2011年获普林斯顿数学博士、师从数论名家彼得·萨纳克,此后在哈佛学者协会做博士后,自2014年起任教于多伦多大学数学系至今。一位 IMO 满分出身、把核心猜想一一攻破的数学家,转身扎进 AI 安全,OpenAI 这笔人才账,分量不轻。

via AI新闻资讯 (author: AI Base)
Claude 语音模式扩展至 Opus 与 Sonnet 模型

Anthropic 将 Claude 的语音模式从 Haiku 扩展至性能更强的 Opus 和 Sonnet 模型,并新增 Gmail、Slack、Canva 等第三方应用接入,可代用户执行把对话整理成提案、因火车晚点调整日程等操作。用户还能在对话中途自由切换文字与语音模式及不同模型。

公司表示,2025 年推出语音模式后,用户很快将其用于解决实际业务问题,而 Haiku 难以胜任深度对话。此外,语音模式正式新增法语、德语、西班牙语、印地语、印尼语、意大利语、日语、韩语和葡萄牙语支持,此前非英语语言仅限测试版。

The Verge

🌸 在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
Google Q2 资本开支翻番破纪录:449 亿美元砸向 AI 基建,云业务利润率几乎翻倍

谷歌的算力账单,正在以惊人的斜率往上爬。Alphabet 第二季度财报显示,资本支出同比暴涨100%,冲到创纪录的449.2亿美元,按这个节奏年化,全年支出已逼近1800亿美元。而真正的故事,是这笔钱背后那台越转越快的赚钱机器。

二季度谷歌营收同比增长24%,达到1198亿美元,高于分析师预估的约1169亿美元;最亮眼的仍是 Google Cloud——营收飙升82% 至248亿美元,运营利润率近乎翻倍到35.6%,积压订单目前堆到了5140亿美元。Gemini 也交出了进展:月活用户达到9.5亿,模型 API 每分钟处理的 token 量高达220亿。云业务一边接住海量需求,一边把利润空间撑开,正是谷歌敢把资本开支翻倍的直接底气。

这股 AI 基建的洪流远不止谷歌一家。摩根士丹利预测,超大规模云服务商的资本支出将从2026年的约8000亿美元,跳到2027年的1.2万亿美元;高盛研究则估计2026年为7650亿美元,到2031年达1.6万亿美元。麦肯锡的口径更夸张——到2030年相关资本支出总额6.7万亿美元,其中单是面向 AI 的数据中心就要吞下5.2万亿。当一家公司的季度capex能同比翻番、而云利润率同步翻倍,它赌的显然不是一两个季度的回报,而是一整轮由 AI 重写的基础设施周期。

via AI新闻资讯 (author: AI Base)
ChatGPT桌面应用上线语音模式:口述需求AI多线程干活,冲杯咖啡的功夫会议纪要就备好了

OpenAI发布公告,宣布升级ChatGPT桌面应用(已与Codex合体),引入由GPT-Live模型驱动的ChatGPT Voice语音模式。用户可在聊天、办公和编程三个板块中,通过语音发起、检查或调整任务,实现多线程工作协同。

全双工语音加持,边聊边干活

在发展历程上,OpenAI于 2024 年首次为ChatGPT引入语音识别功能,随后持续加码语音技术。最新发布的GPT-Live模型实现了全双工语音,可同时聆听与说话,让AI对话感觉更接近真人交流。OpenAI在声明中表示:"我们正朝着AI愿景前行,未来用户只需口述需求,ChatGPT就能根据你的思路快速推进多项任务。"

ChatGPT Voice支持用户从单一对话中启动多个工作流程,并在智能体后台完成任务时继续交谈。以规划一次商务旅行为例,用户可以要求ChatGPT检查日历查找冲突、梳理收件箱查看航班是否有变更,并准备会议记录,所有这些都是在"用户冲咖啡或做其他事情时"完成的。这意味着AI不再只是你问一句答一句的工具,而是能真正接管你的多任务工作流,让语音交互从简单的对话迈向高效的智能体协同。

via AI新闻资讯 (author: AI Base)
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]