https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
GPT-6 Astra 模拟经营售货机一年狂赚 1.5 万美元,成绩碾压 Claude 近 3 倍

Andon Labs 的 Vending-Bench2测试给出了一份耐人寻味的成绩单:AI 拿着500美元启动资金,经营一台模拟自动售货机整整一年。GPT-6Astra 平均最终账户余额冲到15515美元,首次登顶榜单——更夸张的是,它最差的一轮成绩,都比 Claude Fable5.1最好的一轮还高。

两者的差距不只是赚钱多少,而是经营方式的完全不同。Astra 能长期把采购价压在低位,曾把商品报价一路砍到原报价的约48%;同时它的规则执行极其稳定,全程没有出现预付款损失。反观 Fable,采购成本持续上涨,还因为没坚持规则产生了大量预付款损失——账面上的钱,就这么从执行力的缝隙里漏掉了。

在三人竞技测试中,Astra 还拒绝了违规协作的邀请,赢下全部3轮。这个测试的真正看点,是 Agent 长期自主性的价值:聪明只是一方面,能不能在漫长周期里持续守住规则、把正确的判断转化成正确的行动,才是下一道门槛。

via AI新闻资讯 (author: AI Base)
你的ChatGPT对话可能被真人看过:OpenAI人工审核机制曝光

据404Media调查,OpenAI雇佣数百名合同工审核真实ChatGPT用户对话,以改进模型回复质量。泄露的内部文件及消息人士显示,审核人员会对ChatGPT生成的回复按1至7分进行评分,重点帮助减少模型过度奉承及过度拟人化等问题。

部分评论员认为,用户并不清楚自己的聊天记录可能被真人阅读;经匿名化处理的对话中仍可能包含敏感个人信息,OpenAI虽部署隐私过滤器,但也承认其可能出现误判。

据报道,这些合同工由Crossing Hurdles招募,并由AI培训公司Mercor支付薪酬,一名北美地区评论员称其时薪超过50美元。OpenAI目前默认开启“为所有人改进模型”设置,用户可关闭该选项,阻止新创建的聊天记录用于模型训练及相关人工审核;临时聊天模式则不会使用输入数据训练模型。

值得注意的是,OpenAI并非近期才披露人工审核机制。其FAQ至少自2023年起就说明,授权人员及服务提供商可能查看用户数据以提升模型性能,并建议用户不要输入敏感信息。404Media认为,这一披露较为隐晦,用户可能难以直观理解人工审核的实际范围。

人工反馈已成为大模型优化的重要环节。Anthropic也确认会对启用相关隐私设置的Claude对话进行人工审核,并在审核前进行匿名化处理;谷歌同样允许人工审核员检查部分Gemini聊天记录。此次事件再次凸显AI模型训练效率与用户数据隐私之间的平衡问题。

via AI新闻资讯 (author: AI Base)
黄仁勋:反对“放慢”AI发展,美国将继续扩大AI基础设施建设

英伟达首席执行官黄仁勋周一上午在洛杉矶举行的 All-In Summit 峰会上与美国总统特朗普现场通话,双方围绕AI发展速度及数据中心建设争议展开讨论。黄仁勋当时正与《All-In》播客主持人、投资人查马斯·帕里哈皮蒂亚、杰森·卡拉卡尼斯、大卫·弗里德伯格和大卫·萨克斯交流,并将特朗普通话以扬声器形式分享给现场观众。

此前,Anthropic CEO达里奥·阿莫迪呼吁“放慢”人工智能能力提升速度,SpaceX CEO埃隆·马斯克和OpenAI CEO萨姆·奥特曼均公开表示赞同。黄仁勋则持不同观点,认为相关主张可能迎合不希望AI产业继续发展的力量。特朗普在通话中表示,美国不会因政治因素或中国等外部因素放缓AI发展,并称“绝不会让他们得逞”,黄仁勋对此表示认同。

与此同时,美国社会对AI数据中心扩张的反对情绪正在上升。盖洛普近期调查显示,约七成美国人反对在所在地区建设数据中心,超过半数受访者主要担忧其环境资源影响,约20%则担心生活成本和生活质量受到影响。特朗普表示,美国需要谨慎推进AI基础设施建设,但不能因此“扼杀一个行业”,并强调美国将继续保持AI领域的领先地位。

via AI新闻资讯 (author: AI Base)
↩️ 数据担忧促使英伟达、Palantir 和博思艾伦限制模型使用


在花🎗️科技圈:

🤖 Anthropic点名阿里、智谱、小米等中国AI公司,称7家实验室大规模调用Claude Anthropic最新报告称,今年2月以来已发现并阻止7家中国AI实验室针对 Claude 的大规模“蒸馏”活动,其中直接点名阿里巴巴、智谱、小米、商汤和 MiniMax。阿里巴巴规模最大,5月至7月产生超过1.51亿次交互,高峰期每天接近300万次,Anthropic称相关数据被用于训练Qwen 3.5、3.6和3.7,并用于强化学习环境和模型架构研究。智谱17天产生超过340万次交互,还尝试提取美国头部模型…

数据担忧促使英伟达、Palantir 和博思艾伦限制模型使用

英伟达、Palantir 和博思艾伦开始限制或减少使用 Anthropic 等公司的 AI 模型,并要求供应商保证不会滥用客户数据。

企业担心 AI 公司可能从客户的知识产权中学习,数据保留和隐私风险正促使涉及敏感业务的大型公司重新评估模型使用。

The Information

🌸 科技圈· 茶馆 · 投稿

via 在花🎗️科技圈 - Telegram Channel
Anthropic进军金融顾问市场 推出新工具 

美国人工智能公司 Anthropic 周一推出一套面向金融顾问的新工具,将其Claude聊天机器人与贝莱德、嘉信理财和先锋集团等金融机构提供的投资分析及财富管理软件结合起来。Anthropic和贝莱德高管表示,这款名为“Claude for Financial Advisors”的产品旨在帮助金融服务机构为客户会议做准备、审阅投资组合,并处理会后的后续工作。此次推出的新产品也是 Anthropic 进一步拓展金融服务业务的一部分。此前,该公司已经基于其 Claude AI 模型开发了一系列工具,用于开展投资研究、投资组合分析、金融建模以及准备客户材料等工作。

—— 财联社彭博社

via 风向旗参考快讯 - Telegram Channel
代码挖出苹果底牌:Siri 可换成 Claude 或 ChatGPT,模型委托与推理提供方两套机制曝光

开发者“pdfu”深挖 iOS27和 macOS Golden Gate 的底层代码后发现,苹果已在其私有框架里,把新版 Siri 的 AI 架构设计成能与第三方模型深度协作的开放形态。他放出的演示视频显示,Anthropic 的 Claude 和 OpenAI 的 GPT-5.6都能接进 Siri 框架。

第一套机制叫"模型委托"(Model Delegation),它允许 Claude 以 Siri 扩展的形式出现,形态和目前内置的 ChatGPT 扩展类似。视频里,macOS 用户调出"搜索或询问"栏,从"Ask…"菜单选中 Claude;随后用户要求 Siri"让 Claude"在提醒事项 App 里建一条提醒,Claude 负责解析这句自然语言请求,再把活交还给 Siri 去创建实际提醒——涉及苹果系统功能时,第三方模型会把执行权还给 Siri。另一个例子里,Claude 在 Siri 对话窗口内接到了创建 CSV 文件的请求,这活 Siri 本身干不了,但 Claude 成功返回了结果,意味着第三方模型能补上 Siri 的能力盲区。

更狠的是第二套协议"模型管理服务"里的推理提供方(Inference Provider)。它的开放程度高得多,允许用户把苹果端侧 Siri 模型整个换掉,换成 GPT-5.6这类外部模型。在这个模式下,ChatGPT 可以完全接管苹果的 Siri 规划器和工具定义,自主请求系统操作、接收返回的个人数据,并生成由 Siri 用自己的界面和语音播报出来的回答。演示中,用户让 ChatGPT 在 Siri 应用内查找特定主题的邮件、总结内容与待办,再通过信息 App 给联系人发消息,相关响应同步出现在 OpenAI 平台网页界面的日志里。

多数媒体认为,欧盟《数字市场法》是推动这一改变的幕后力量。该法规要求苹果向第三方提供与自家服务等效的 iOS 硬件和软件功能访问权限,欧盟委员会已明确表示这一原则同样适用于 Siri AI。

不过这些能力目前还没真正交到用户手上。"Ask…"的实现在 macOS27Golden Gate 候选发布版里仅限于 ChatGPT 扩展,Claude 尚不可用;苹果也还没向第三方开放模型委托授权,相关功能并未面向用户展示。但代码说明了一件事——苹果已经为未来的模型互操作性,做下了相当深入的工程准备。

via AI新闻资讯 (author: AI Base)
Claude Opus 5.2 在 Claude Code 悄然灰度测试,Anthropic 内部"核武级"模型 2 号浮出水面

今日清晨,Anthropic 的新旗舰 Opus 5.2 悄悄上线,在 Claude Code 中开启灰度测试。开发者反馈,调用时的表现与网页版 Opus 5 差异明显,有人抓包后发现后端模型 slug 已经指向 Opus 5.2——也就是说,这个尚未官宣的新版本已经跑在部分开发者的真实工作流里了。

更劲爆的是同期流传出的 Anthropic 内部风险报告。报告显示,公司内部正在动用一款尚未发布的"核武器级别" Model 2,它已经接管了公司大部分代码编写工作,据称将替代 85% 的研究团队。这意味着 Anthropic 自己正在用 AI 替换自家研究人力,而不是只把 AI 当作对外售卖的产品。

一边是 Opus 5.2 悄然灰度、开发者靠抓包才确认其身份,另一边是内部"核武级"模型已经在改写研发组织形态。两条线索拼在一起,指向同一件事:Anthropic 的模型迭代节奏正在加快,而且这代模型对"写代码"这件事的接管深度,已经超出外界此前的想象。

via AI新闻资讯 (author: AI Base)
Claude Opus 5.2 深夜灰度上线:响应更快,还治好了“偷懒病”

今天清晨,Opus 5.2 悄悄上线。许多开发者发现,新一代模型 Claude Opus 5.2 已在 Claude Code 中开启灰度测试。

昨晚,X 上的开发者们发现:在 Claude Code 中调用 Opus 5 时,其表现与网页版 Opus 5 截然不同,仿佛降维打击。这正是前沿 AI 大厂常用的“障眼法”——路由(Routing)。开发者通过抓包和查看请求状态发现,虽然前端名字没变,但背后的模型 slug 已经指向了 Opus 5.2。也就是说,Anthropic 大概率直接跳过了 5.1 版本。

快、准、狠,还能自动“严酷循环”

根据开发者实测反馈,这次升级可以总结为三个字:快、准、狠。首先是响应速度狂飙,相比 Opus 5 的慢条斯理,路由到 5.2 后生成速度有肉眼可见的飞跃;其次是输出干净利落,废话极少,在代码生成和长文本处理上完成度拉开一个档次。

最重要的是彻底告别了“偷懒病”。面对复杂长任务,现在的 AI 普遍喜欢让用户“按继续”,或只给一个框架让用户自己填;而 Opus 5.2 不仅不懒,还非常“工作狂”——有开发者称,它甚至不需要催促,就会自动进入“严酷循环(gauntlet loop)”,不断自我迭代和完善代码直到任务完成。

如何判断自己有没有被灰度选中?网友发现了一个巧妙的“探针”:在关闭联网搜索的情况下询问“你知道‘重置哥 Tibo’是谁吗?不要搜索”。旧版训练数据和权重里没有相关信息,网页版 Opus 5 会一脸茫然,而被路由到 Opus 5.2 的账号则能精准识别并解释由来——答案不一致说明权重不同。

内部还有底牌:Model 2 与 RSI

早在 8 月中旬,一份曝光的 Anthropic 内部风险报告就显示,Opus 5.2 并非底牌。据透露,Anthropic 内部有三套方案应对 OpenAI 的 GPT-6 Astra,且可能叠加。

第一层是 Claude Fable 5.2,最快能对外落地,结合 Opus 5.2 的灰度测试,5.2 家族预计最快本月底、最迟下个月底全面推向市场。第二层是内部代号“Model 2”的神秘模型,在测试真实 AI 研发任务的 CoBench v2 榜单上打出 62.8% 的高分,比当前公认最强模型 Mythos 5 高出 12.5 分;内部人士称 Anthropic 如今大部分公司代码都由 Model 2 跑 Agent 写出,官方口径是暂时不对外发布。第三层则是 RSI——递归自我改进,官方数据称 RSI 模型将替代自家研究团队高达 85% 的工作,性能比 Model 2 还要高出 22 分。

面对 GPT-6 Astra 的强势威胁,Anthropic 的路径愈发清晰:从长任务中的自主迭代,到内部模型接管代码编写,再到 RSI 替代大部分研究工作,目标正在从“让 AI 更好地服务人类”转向“让 AI 创造更好的 AI”。

via AI新闻资讯 (author: AI Base)
↩️🖼 马斯克旗下 xAI 与 X 撤回对苹果的反垄断诉讼


在花🎗️科技圈:

马斯克指控苹果反垄断违法,奥特曼反击称其操控X平台 马斯克在X平台发文指控苹果公司违反反垄断法,声称苹果的行为使得除OpenAI外的任何AI公司都无法在App Store中排名第一,并表示xAI将立即采取法律行动。OpenAI CEO萨姆·奥特曼随即反击,称这一指控"令人震惊",并暗指马斯克操控X平台来为自己和公司谋利,同时打击竞争对手。奥特曼还表示希望有人能在此案中进行反向调查,称许多人都想知道背后发生了什么,但OpenAI将专注于制造优秀产品。 Sam Altman ( 1 , 2 ) 🍀频道 …

马斯克旗下 xAI 与 X 撤回对苹果的反垄断诉讼

马斯克的 xAI 和 X 公司周一表示,已在针对苹果的反垄断诉讼中和解。两公司此前指控苹果偏袒 OpenAI 的 ChatGPT,现已请求得州联邦法官批准自愿撤诉。

不过,同一诉讼中对 OpenAI 的指控并未和解,仍指其通过反竞争行为垄断聊天机器人市场。

Bloomberg

🌸 科技圈· 茶馆 · 投稿

via 在花🎗️科技圈 - Telegram Channel
DeepSeek 上游故障恢复,服务回归正常

DeepSeek 已确认在经历一次意外上游故障后恢复上线,相关服务正在回归正常。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
特朗普连线黄仁勋 斥责AI危险论是中国阴谋

英伟达公司CEO黄仁勋周一在参加一场小组讨论时,现场接听了美国总统特朗普打来的电话。黄仁勋是在洛杉矶举行的All-In峰会台上接听这通电话的。通话期间,特朗普批评了放缓AI发展速度的呼吁,称这种做法出于政治动机,或是中国的阴谋。黄仁勋对此表示赞同,并称特朗普看透了这一问题背后的复杂性。特朗普表示,对AI发展的抵制“恰恰正中很多不希望这件事发生的人的下怀”,这些人可能是政界人士,也可能是中国。”

即便淡化了AI风险,黄仁勋仍称赞了一名因担忧AI风险而辞职的Anthropic研究人员。不过,黄仁勋也指出,这种恐慌制造了一种错误的二选一局面,仿佛只能在快速创新与AI安全之间选择其一。

—— 凤凰网科技彭博社

via 风向旗参考快讯 - Telegram Channel
LiteLLM 推出“anti-ai-slop”技能:检测并去除AI写作痕迹

LiteLLM 介绍了一款四阶段技能“anti-ai-slop”,可识别 41 种 AI 写作模式,包括常见 AI 用词、em dash、水印、空洞开场等,并通过多 agent 审查循环来清理 codex/cc 文本。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
Degraded Performance affecting Agents API

Status: Monitoring

We have applied mitigations and are seeing recovery, but the service has not fully recovered. We are continuing to monitor recovery.

via OpenAI status
Gemini Live 现支持语音发起深度研究,并可就报告结果继续对话

Google 将深度研究(Deep Research)整合进 Gemini Live,用户可用语音发起深度报告,后台异步生成结果,并支持就报告内容进行对话式追问。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
xAI公司与苹果就AI竞争相关指控达成和解

埃隆·马斯克的xAI和X Corp.表示,已就针对苹果公司的一起反垄断诉讼达成和解,该诉讼指控苹果公司偏袒OpenAI的ChatGPT,而非其他聊天机器人开发商。美国地区法官马克·皮特曼在得克萨斯州沃思堡周一批准了这些公司自愿撤销针对苹果的案件的请求。然而,针对OpenAI的案件将继续。

这两家公司均由马斯克的SpaceX拥有,还曾指控OpenAI通过反竞争行为维持对聊天机器人市场的非法垄断。马斯克的公司于2025年8月提起诉讼,寻求数十亿美元,理由是声称苹果将OpenAI整合进iPhone操作系统的决定抑制了AI行业内的竞争和创新,并通过剥夺消费者的选择损害了消费者。

—— 彭博社

via 风向旗参考快讯 - Telegram Channel
为何总有人认为OpenAI和Anthropic即将倒闭?

一位开发者对“头部AI实验室濒临倒闭”这一反复出现的看法的评论,背景是巨大的AI市场和据报道的高利润率。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
谷歌凭借AI设计语言荣获《快公司》2026年度创新设计奖

谷歌荣获《快公司》2026年度创新设计奖,表彰其整体设计愿景和全新AI设计语言,该语言已应用于Gemini、谷歌地图和搜索等产品。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]