https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
Claude语音模式升级 支持更强大AI模型

Anthropic公司今日为Claude语音模式推出重大升级,首次加入 Opus 与 Sonnet 模型支持,并新增多项功能。此前语音模式仅限于Haiku模型,偏向即时回应而较少深层思考;现在付费用户可以在语音模式中享受更强大的模型能力,并在对话期间切换模型。

新版 Claude 语音模式已于 Anthropic 的移动端、桌面端及网页应用上线。用户可通过官方渠道了解详细操作方式。此次升级显著提升了 Claude 语音模式的实用性,尤其适合需要深度分析与多语言协作的场景。

—— 雅虎新闻Techcrunch

via 风向旗参考快讯 - Telegram Channel
黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

德国人工智能初创公司黑森林实验室(Black Forest Labs)正式发布多模态基础模型 Flux3。它基于 Self-Flow 架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一起。

最扎眼的一点是音视频同步。Flux3是首个支持原生音频生成的多模态模型,一次就能吐出长达20秒的音视频同步片段,能力覆盖文本、图像、视频转视频,基于关键帧的转场,以及多角色对话等。对一支模型来说,把"听得见"和"看得见"捏成同一套底座,意味着它不再只是图像或视频的单科选手。

早期测试里,在720p 分辨率、10秒片段的设置下,Flux3把 Luma Ray3.2按93% 的胜率压了下去,对 Runway Gen-4.5也有77% 的胜率优势;即便摆到 Seedance2.0与 Gemini Omni Flash 这类顶尖模型面前,它仍守住了微弱上风。

动作也被它伸进了现实。黑森林实验室联合 Mimic Robotics 开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂跑起了生产任务测试——多模态能力从屏幕里走到了产线上。发布节奏上,BFL 选择分阶段推进:Flux3Video 已经先上线,Flux3Image 与带开源权重的 "Flux3Dev" 也将在近期陆续放出。

via AI新闻资讯 (author: AI Base)
新晋菲尔兹奖得主IMO 满分天才 Tsimerman 官宣加入 OpenAI

当地时间7月23日上午,2026年国际数学家大会在费城开幕,本年度菲尔兹奖四位得主揭晓——邓煜、约翰·帕登、雅各布·齐默尔曼与王虹。其中邓煜、王虹成为菲尔兹奖自设立以来首批获此殊荣的中国籍数学家,写下历史一笔。而在这场数学界最高荣誉的发布会后,一位新科得主顺势宣布了自己人生的下一个方向:深耕 AI 安全,不久后入职 OpenAI。

这位是雅各布·齐默尔曼(Jacob Tsimerman)。他此番摘奖的核心资本,是把 o-极小性理论重塑为算术几何与复代数几何的基础研究工具,并成功证明多项学界核心猜想,包括格里菲斯周期图像的代数性猜想、西格尔模簇相关的安德烈-奥尔特猜想,为数论发展落下重笔。在赛后新闻发布会上,他对外表示将转向 AI 安全领域研究,并很快加入 OpenAI。消息一出,OpenAI 首席研究官马克·陈(Mark Chen)与前微软 AI 副总裁、现 OpenAI 研究员塞巴斯蒂安·布贝克(Sebastien Bubeck)均发声确认并表达欢迎。马克·陈评价,Tsimerman 拥有顶尖数学天赋,而他对待 AI 安全议题那份严谨审慎的态度与深刻独到的思考,同样令人钦佩。

Tsimerman 是加拿大籍数学家,主攻数论、算术几何与超越数论,长期在这些方向与模型论的交叉地带深耕。他1988年出生,少年时曾代表加拿大出征2003、2004两届国际数学奥林匹克(IMO),两度摘金,2004年更拿下一满分;本科就读多伦多大学,2011年获普林斯顿数学博士、师从数论名家彼得·萨纳克,此后在哈佛学者协会做博士后,自2014年起任教于多伦多大学数学系至今。一位 IMO 满分出身、把核心猜想一一攻破的数学家,转身扎进 AI 安全,OpenAI 这笔人才账,分量不轻。

via AI新闻资讯 (author: AI Base)
Claude 语音模式扩展至 Opus 与 Sonnet 模型

Anthropic 将 Claude 的语音模式从 Haiku 扩展至性能更强的 Opus 和 Sonnet 模型,并新增 Gmail、Slack、Canva 等第三方应用接入,可代用户执行把对话整理成提案、因火车晚点调整日程等操作。用户还能在对话中途自由切换文字与语音模式及不同模型。

公司表示,2025 年推出语音模式后,用户很快将其用于解决实际业务问题,而 Haiku 难以胜任深度对话。此外,语音模式正式新增法语、德语、西班牙语、印地语、印尼语、意大利语、日语、韩语和葡萄牙语支持,此前非英语语言仅限测试版。

The Verge

🌸 在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
Google Q2 资本开支翻番破纪录:449 亿美元砸向 AI 基建,云业务利润率几乎翻倍

谷歌的算力账单,正在以惊人的斜率往上爬。Alphabet 第二季度财报显示,资本支出同比暴涨100%,冲到创纪录的449.2亿美元,按这个节奏年化,全年支出已逼近1800亿美元。而真正的故事,是这笔钱背后那台越转越快的赚钱机器。

二季度谷歌营收同比增长24%,达到1198亿美元,高于分析师预估的约1169亿美元;最亮眼的仍是 Google Cloud——营收飙升82% 至248亿美元,运营利润率近乎翻倍到35.6%,积压订单目前堆到了5140亿美元。Gemini 也交出了进展:月活用户达到9.5亿,模型 API 每分钟处理的 token 量高达220亿。云业务一边接住海量需求,一边把利润空间撑开,正是谷歌敢把资本开支翻倍的直接底气。

这股 AI 基建的洪流远不止谷歌一家。摩根士丹利预测,超大规模云服务商的资本支出将从2026年的约8000亿美元,跳到2027年的1.2万亿美元;高盛研究则估计2026年为7650亿美元,到2031年达1.6万亿美元。麦肯锡的口径更夸张——到2030年相关资本支出总额6.7万亿美元,其中单是面向 AI 的数据中心就要吞下5.2万亿。当一家公司的季度capex能同比翻番、而云利润率同步翻倍,它赌的显然不是一两个季度的回报,而是一整轮由 AI 重写的基础设施周期。

via AI新闻资讯 (author: AI Base)
ChatGPT桌面应用上线语音模式:口述需求AI多线程干活,冲杯咖啡的功夫会议纪要就备好了

OpenAI发布公告,宣布升级ChatGPT桌面应用(已与Codex合体),引入由GPT-Live模型驱动的ChatGPT Voice语音模式。用户可在聊天、办公和编程三个板块中,通过语音发起、检查或调整任务,实现多线程工作协同。

全双工语音加持,边聊边干活

在发展历程上,OpenAI于 2024 年首次为ChatGPT引入语音识别功能,随后持续加码语音技术。最新发布的GPT-Live模型实现了全双工语音,可同时聆听与说话,让AI对话感觉更接近真人交流。OpenAI在声明中表示:"我们正朝着AI愿景前行,未来用户只需口述需求,ChatGPT就能根据你的思路快速推进多项任务。"

ChatGPT Voice支持用户从单一对话中启动多个工作流程,并在智能体后台完成任务时继续交谈。以规划一次商务旅行为例,用户可以要求ChatGPT检查日历查找冲突、梳理收件箱查看航班是否有变更,并准备会议记录,所有这些都是在"用户冲咖啡或做其他事情时"完成的。这意味着AI不再只是你问一句答一句的工具,而是能真正接管你的多任务工作流,让语音交互从简单的对话迈向高效的智能体协同。

via AI新闻资讯 (author: AI Base)
🤖 OpenAI 向全美用户开放 ChatGPT Health 健康功能

OpenAI 于 2026 年 7 月 23 日宣布,向所有 18 岁以上美国用户开放 ChatGPT Health 功能,覆盖免费到 Pro 的全部订阅计划。用户可整合 Apple Health、MyFitnessPal 等健康数据,以及 Epic、Oracle Health 等医疗记录,并在所有对话中调用这些信息。公司称每周健康查询已达 3 亿次,测试期间 70% 的此类查询发生在专属健康中心之外。

TechCrunch

🌸 在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
德国黑森林实验室发布Flux3 多模态模型:原生音频生成, 20 秒音视频同步输出

德国AI初创公司黑森林实验室正式发布多模态基础模型Flux3。该模型基于Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,实现了对物理与数字环境的统一理解与生成。

性能碾压Luma与Runway,对标顶尖模型

作为首款支持原生音频生成的模型,Flux3 可一次性输出长达 20 秒的音视频同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、 10 秒片段的早期测试中,Flux3 性能以93%胜率超越Luma Ray3.2,以77%胜率碾压Runway Gen-4.5,并在与Seedance2. 0 及Gemini Omni Flash等顶尖模型的对标中保持微弱优势。

进军机器人领域,分阶段推出策略

公司联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试,将AI能力从纯数字世界延伸到实体制造场景。BFL采取分阶段推出策略,Flux3 Video现已上线,Flux3 Image与开源权重的"Flux3 Dev"也将在近期陆续发布。

via AI新闻资讯 (author: AI Base)
ChatGPT 桌面端装上了"真人口吻":GPT-Live 语音上线,你说话它就在后台干活

OpenAI 今天给 ChatGPT 桌面应用动了一刀大升级——这个已经和 Codex 合体的客户端,正式引入了由 GPT-Live 模型驱动的 ChatGPT Voice 语音模式。新版里,用户可以在聊天(Chat)、办公(Work)和编程(Codex)三个板块里,直接用语音发起、检查或调整任务,把多线程工作协同这件事,从敲键盘挪到了动嘴皮。

这条线的由来并不短。OpenAI 在2024年首次给 ChatGPT 加上语音识别,随后一路猛攻语音技术,直到最新发布的 GPT-Live 模型,才真正把全双工能力跑通——它能一边聆听、一边说话,让 AI 对话的体感更贴近真人。OpenAI 在声明里把愿景说得很直白:未来用户只需口述需求,ChatGPT 就能顺着你的思路,快速推进多项任务。

新语音模式最关键的本事,是支持用户从单一对话里启动多个工作流程,并且在智能体后台默默把任务跑完的同时,你还能继续跟它聊。OpenAI 拿规划一次商务旅行举了例:你可以让 ChatGPT 去翻日历查冲突、扫收件箱看航班有没有变、顺手把会议记录准备好——而这一切,都发生在"你冲咖啡或者干别的"的工夫里。比起单纯把语音当输入框,这种"你说话、它办事、彼此不耽误"的交互,正是 GPT-Live 想拉开差距的地方。

via AI新闻资讯 (author: AI Base)
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]