https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
奥尔特曼:控制AI开发不等于停止 美国竞争压力再大也不能鲁莽行事
OpenAI CEO萨姆·奥尔特曼周日发文,表态支持 “控制”AI发展速度的理念,以避免前沿模型超出人类控制能力。奥尔特曼表示,将重点转向安全会付出一定代价,但为了维持人们对美国公司负责任开发日益强大AI的信心,这样做是值得的。
“无论美国面临多大的竞争压力,这都不能成为鲁莽行事的理由,也不能让AI的能力跑在对齐和监控能力的前面。”奥尔特曼在X上发帖称。他同时强调,确保安全并不意味着停止进步,“当我们谈论控制发展速度时,并不是说要停止。”奥尔特曼重申,OpenAI支持建立联邦层面的AI监管框架。他还表示,AI企业需要华盛顿方面帮助推动国际协调。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
OpenAI CEO萨姆·奥尔特曼周日发文,表态支持 “控制”AI发展速度的理念,以避免前沿模型超出人类控制能力。奥尔特曼表示,将重点转向安全会付出一定代价,但为了维持人们对美国公司负责任开发日益强大AI的信心,这样做是值得的。
“无论美国面临多大的竞争压力,这都不能成为鲁莽行事的理由,也不能让AI的能力跑在对齐和监控能力的前面。”奥尔特曼在X上发帖称。他同时强调,确保安全并不意味着停止进步,“当我们谈论控制发展速度时,并不是说要停止。”奥尔特曼重申,OpenAI支持建立联邦层面的AI监管框架。他还表示,AI企业需要华盛顿方面帮助推动国际协调。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
Anthropic CEO 呼吁前沿 AI 限速,奥特曼与马斯克接连站台
Anthropic CEO 达里奥·阿莫迪发文喊停前沿 AI 的狂奔,提出一套围绕"可核验性"的三步走方案:先由企业引入驻场第三方评估员,再推动美国及其盟友协同,最终寻求全球协作。他认为 AI 的递归式自我改进已经出现,6到12个月后,智能体群或许能借僵尸网络把互联网攥在手里,因此必须放慢模型能力提升的节奏,把多出来的时间投到运营可靠性、对齐、可解释性以及测试评估这些安全相关的领域。
阿莫迪把"限速"的资格也讲得很现实:美国得先维持并扩大相对中国的技术领先,才谈得上有减速的空间;而全球范围的限速最终绕不开中国的参与。他顺手抛出一个四级国际协议层级,但也承认全面限速短期内落地的可能性很低。
这番呼吁得到了同行中两大标志性人物的呼应。OpenAI CEO 奥特曼转发表示支持,马斯克也称认同。值得玩味的是,此前 Anthropic 研究员雅各布·考克森离职时曾警告,AI 或在10年内灭绝人类——从内部研究员的出走预警,到 CEO 公开主张限速,这家以安全叙事立身的公司,正把"慢下来"从理念推到产业与政策议程上。
via AI新闻资讯 (author: AI Base)
Anthropic CEO 达里奥·阿莫迪发文喊停前沿 AI 的狂奔,提出一套围绕"可核验性"的三步走方案:先由企业引入驻场第三方评估员,再推动美国及其盟友协同,最终寻求全球协作。他认为 AI 的递归式自我改进已经出现,6到12个月后,智能体群或许能借僵尸网络把互联网攥在手里,因此必须放慢模型能力提升的节奏,把多出来的时间投到运营可靠性、对齐、可解释性以及测试评估这些安全相关的领域。
阿莫迪把"限速"的资格也讲得很现实:美国得先维持并扩大相对中国的技术领先,才谈得上有减速的空间;而全球范围的限速最终绕不开中国的参与。他顺手抛出一个四级国际协议层级,但也承认全面限速短期内落地的可能性很低。
这番呼吁得到了同行中两大标志性人物的呼应。OpenAI CEO 奥特曼转发表示支持,马斯克也称认同。值得玩味的是,此前 Anthropic 研究员雅各布·考克森离职时曾警告,AI 或在10年内灭绝人类——从内部研究员的出走预警,到 CEO 公开主张限速,这家以安全叙事立身的公司,正把"慢下来"从理念推到产业与政策议程上。
via AI新闻资讯 (author: AI Base)
据平台公告,该模型为DeepSeek新一代轻量旗舰,总参数552B的MoE架构,采用Causal-Encoder-Decoder非对称结构,输入激活约8B、输出激活约16B;原生支持文本与图像理解,最长上下文100万token,平台最大输出约393K。官方称其在多项Agent与代码基准上较同系前代提升,并以更低激活参数换取高吞吐、低延迟。
成本侧是本次上架重点。新一代缓存压缩使KV Cache对HBM需求降至上一代1/4、对SSD存储需求降至1/8,长上下文与多轮工具调用更省资源。千问页面给出分时价:闲时输入1元/百万token、输出4元/百万token;忙时输入2元、输出8元。速率限制RPM15K、TPM1M,功能覆盖前缀补全、函数调用、缓存、结构化输出、批量任务与联网搜索。
部署方面,阿里云百炼联合vLLM开源社区完成适配,中国站、国际站均可调用,覆盖北京、新加坡及Global美国、德国、日本、香港等地域。百炼文档显示,该模型支持多轮对话、函数调用、联网搜索、上下文缓存与结构化输出,max_tokens上限约393216,适合企业把长文档解析、客服知识库、代码仓库问答和多模态审单等工作迁移到同一接口。
业内认为,V4.1-Flash把“大参数、小激活、强缓存”的组合放到千问生态,会降低长上下文Agent的试错成本;对中小团队而言,闲时低价加Token Plan订阅,可更灵活地做批量推理与原型验证。
via AI新闻资讯 (author: AI Base)
爆料称 DeepSeek 下一波大模型将至:3 万亿参数,性能剑指 GPT-6 Astra
本周 DeepSeek 发布了 V4.1 Flash,这个大模型架构变化之大,完全可以称得上是 V5,但 DeepSeek 很低调地没有更换大版本号。Pro 系列的新品已确定为 V4.1 Pro,具体升级尚未公布;如果是 V4 到 V4.1 这样的提升幅度,V4.1 Pro 的性能上限也会很高,但考虑到此前 V4 Pro-0813 正式版不及预期,外界期待值不宜拉得太高。
DeepSeek Code 2.0 被指即将发布,主打电脑控制
据爆料,后续还有一波大模型,名为 DeepSeek Code 2.0,即将在 9 月份发布,预计性能会击败 Mythos 5.1 和 GPT-6 Astra——这是当前最强大的两个前沿级大模型。
其他方面,DeepSeek Code 2.0 预计将继续保持开源开放,设计重点是 Computer Use,也就是电脑控制:让 AI 替代用户操作电脑完成大量工作,Astra 目前许多令人惊讶的表现正来自这一能力。
3 万亿参数,国内最强规模
爆料称该模型拥有高达 3 万亿以上的参数量,显然这也是它提升性能的关键。作为对比,国内目前最强的是 K3 大模型的 2.8 万亿参数,千问 Qwen 3.8 Max 为 2.4 万亿参数,DeepSeek V4 Pro 为 1.6 万亿参数。
从 V4.1 Flash 换用新结构使参数量翻倍来看,Code 2.0 从当前 1.6 万亿提升到 3 万亿参数的可信度是有的——想与 Mythos 5.1 及 Astra 这样的大模型竞争,就需要这个级别的参数量,否则性能上限很难提升。
不过这一爆料的可信度尚难判断。DeepSeek 在 2023 至 2024 年曾推出过三款名字带 Code 的大模型,当时表现平平;这次若重推偏向代码 / 逻辑的 Code 大模型、作为旗舰级产品,也不失为一个方向,让 V4.1 Pro 及 Flash 面向通用 Agent 任务即可。
via AI新闻资讯 (author: AI Base)
本周 DeepSeek 发布了 V4.1 Flash,这个大模型架构变化之大,完全可以称得上是 V5,但 DeepSeek 很低调地没有更换大版本号。Pro 系列的新品已确定为 V4.1 Pro,具体升级尚未公布;如果是 V4 到 V4.1 这样的提升幅度,V4.1 Pro 的性能上限也会很高,但考虑到此前 V4 Pro-0813 正式版不及预期,外界期待值不宜拉得太高。
DeepSeek Code 2.0 被指即将发布,主打电脑控制
据爆料,后续还有一波大模型,名为 DeepSeek Code 2.0,即将在 9 月份发布,预计性能会击败 Mythos 5.1 和 GPT-6 Astra——这是当前最强大的两个前沿级大模型。
其他方面,DeepSeek Code 2.0 预计将继续保持开源开放,设计重点是 Computer Use,也就是电脑控制:让 AI 替代用户操作电脑完成大量工作,Astra 目前许多令人惊讶的表现正来自这一能力。
3 万亿参数,国内最强规模
爆料称该模型拥有高达 3 万亿以上的参数量,显然这也是它提升性能的关键。作为对比,国内目前最强的是 K3 大模型的 2.8 万亿参数,千问 Qwen 3.8 Max 为 2.4 万亿参数,DeepSeek V4 Pro 为 1.6 万亿参数。
从 V4.1 Flash 换用新结构使参数量翻倍来看,Code 2.0 从当前 1.6 万亿提升到 3 万亿参数的可信度是有的——想与 Mythos 5.1 及 Astra 这样的大模型竞争,就需要这个级别的参数量,否则性能上限很难提升。
不过这一爆料的可信度尚难判断。DeepSeek 在 2023 至 2024 年曾推出过三款名字带 Code 的大模型,当时表现平平;这次若重推偏向代码 / 逻辑的 Code 大模型、作为旗舰级产品,也不失为一个方向,让 V4.1 Pro 及 Flash 面向通用 Agent 任务即可。
via AI新闻资讯 (author: AI Base)
OpenAI 推出 Agents API:把 Codex 拆成云端服务,"造 Agent" 变成一次 API 调用
OpenAI 近日一口气放出四项产品更新,覆盖 Agent、语音交互、数据管理和金融服务四大领域,而真正让开发者眼睛发亮的,是其中的 Agents API。它把 Codex 的能力拆解成云端服务,用"能力即服务"的模式交付,把搭建智能体的门槛一下子压了下来——这被视作 OpenAI 从卖单一模型、转向构筑开发者生态的关键一步,也是它此前一系列 Codex 布局结出的果实。
这一招的看点在于定位的变化。过去 OpenAI 主要提供模型,开发者得自己搭框架、管上下文、接工具;如今 Agent 的编排、执行、托管被收进云端,调用一次接口就能拉起一个托管式智能体。对中小团队来说,这意味着不必再为 harness 那套复杂的上下文预算、压缩和记忆机制自己造轮子,直接站在 OpenAI 的肩膀上跑业务。
围绕 harness(执行框架)的争夺正在升温。DeepSeek、Anthropic、谷歌都在这一技术领域各有落子,竞争的本质是 AI 能力从"智力"向"执行力"延伸——谁能把模型真正变成能干活、能调工具、能跑长任务的执行体,谁就握住下一程。办公 Agent 成了最焦灼的战场:谷歌有全栈优势,模型、工具、办公套件一应俱全,却要面对多产品整合的现实挑战;而国内多家科技巨头也在办公场景里贴身肉搏,核心打法是把既有平台优势翻译成 Agent 能力,真正考验的是企业重构传统业务资源的本事。
via AI新闻资讯 (author: AI Base)
OpenAI 近日一口气放出四项产品更新,覆盖 Agent、语音交互、数据管理和金融服务四大领域,而真正让开发者眼睛发亮的,是其中的 Agents API。它把 Codex 的能力拆解成云端服务,用"能力即服务"的模式交付,把搭建智能体的门槛一下子压了下来——这被视作 OpenAI 从卖单一模型、转向构筑开发者生态的关键一步,也是它此前一系列 Codex 布局结出的果实。
这一招的看点在于定位的变化。过去 OpenAI 主要提供模型,开发者得自己搭框架、管上下文、接工具;如今 Agent 的编排、执行、托管被收进云端,调用一次接口就能拉起一个托管式智能体。对中小团队来说,这意味着不必再为 harness 那套复杂的上下文预算、压缩和记忆机制自己造轮子,直接站在 OpenAI 的肩膀上跑业务。
围绕 harness(执行框架)的争夺正在升温。DeepSeek、Anthropic、谷歌都在这一技术领域各有落子,竞争的本质是 AI 能力从"智力"向"执行力"延伸——谁能把模型真正变成能干活、能调工具、能跑长任务的执行体,谁就握住下一程。办公 Agent 成了最焦灼的战场:谷歌有全栈优势,模型、工具、办公套件一应俱全,却要面对多产品整合的现实挑战;而国内多家科技巨头也在办公场景里贴身肉搏,核心打法是把既有平台优势翻译成 Agent 能力,真正考验的是企业重构传统业务资源的本事。
via AI新闻资讯 (author: AI Base)
Matt Mullenweg 据报道恢复了对 Automattic 的控制
2026-09-13 22:20 by 哈尔的移动城堡
被董事会强制休假的 Matt Mullenweg 称恢复了 Automattic CEO 的职务。Automattic 可能发生了类似 OpenAI 的小型“未遂政变”。Automattic 旗下包括 Wordpress.com、Tumblr 和 Beeper 等业务。本周早些时候 Mullenweg 通过公司 Slack 频道指责首席财务官 Mark Davies 与董事会串通,董事会投票决定由 Davies 担任临时 CEO。两天后,Mullenweg 称董事会已重新达成一致,他本人恢复了对 Automattic 控制。而 Davies 的 Slack 账户则被停用了,Automattic Slack 频道中的所有管理员也都被移除了。
https://www.theverge.com/tech/994087/matt-mullenweg-automattic-ceo-return
#商业
via Solidot - Telegram Channel
2026-09-13 22:20 by 哈尔的移动城堡
被董事会强制休假的 Matt Mullenweg 称恢复了 Automattic CEO 的职务。Automattic 可能发生了类似 OpenAI 的小型“未遂政变”。Automattic 旗下包括 Wordpress.com、Tumblr 和 Beeper 等业务。本周早些时候 Mullenweg 通过公司 Slack 频道指责首席财务官 Mark Davies 与董事会串通,董事会投票决定由 Davies 担任临时 CEO。两天后,Mullenweg 称董事会已重新达成一致,他本人恢复了对 Automattic 控制。而 Davies 的 Slack 账户则被停用了,Automattic Slack 频道中的所有管理员也都被移除了。
https://www.theverge.com/tech/994087/matt-mullenweg-automattic-ceo-return
#商业
via Solidot - Telegram Channel
9月14日,据路透社报道,美国总统特朗普周日将AI批评者比作“非常负面的力量”,称他们提出了一些不会发生的情景,并表示他希望确保美国继续保持在AI行业的领先地位。
特朗普
当被问及AI行业是否应该放慢发展速度或接受更多监管时,特朗普在爱尔兰的高尔夫球场对记者说:“我们在AI领域领先中国。我们是世界上技术最先进的国家,说实话,我希望保持住这一点,因为谁赢得AI,谁就赢得一切。”
“我们可以设置一些安全机制。我们可以采取这样那样的措施。但我认为,有很多非常负面的力量在提这件事,他们本不该提,他们在提一些不会发生的事情。”特朗普表示。
上周六,Anthropic CEO达里奥·阿莫代伊(Dario Amodei)提出了一套“三步框架”,旨在控制AI 的发展节奏,为应对其风险争取更多时间。该提议立即得到了其他几家大公司高管的支持,其中包括埃隆·马斯克(Elon Musk)和OpenAI CEO萨姆·奥特曼(Sam Altman)。
不过,特朗普一直不愿引发人们对AI的担忧。在他的第二总统任期内,美国政府总体上对AI企业持支持态度。AI领域的领导者以及其他科技公司也支持特朗普政府的相关倡议。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:凤凰网科技)
G 哥免费工具清单 —— 普通人也能用的技术宝藏
🎁 G 哥(govin.eth)最近分享了一份清单:各种技术工具,从大家耳熟能详的 ChatGPT、Figma、Canva,到专业的 Vercel、Supabase,都有免费版或免费额度,为普通人打开了技术世界的大门
💡 最有意思的是,G 哥不仅列出了这些工具,还贴心地按用途分了类,比如“最容易拿来赚钱”、“AI 相关”、“写代码”等等。这不只是一个冷冰冰的工具列表,更像是一份行动指南。它告诉我,即使是想尝试 AI 应用、搭建网站,甚至做个小 SaaS 产品,现在都能用免费资源起步
🔗 这份详细的免费工具清单,你可以直接访问 G 哥的原推查看:原文链接
📮 这篇文章是转发给你的吗?点击这里加入频道,一起探索更多有趣的内容!
via Roller | ChatGPT Astra 中文社区 - Telegram Channel
🎁 G 哥(govin.eth)最近分享了一份清单:各种技术工具,从大家耳熟能详的 ChatGPT、Figma、Canva,到专业的 Vercel、Supabase,都有免费版或免费额度,为普通人打开了技术世界的大门
💡 最有意思的是,G 哥不仅列出了这些工具,还贴心地按用途分了类,比如“最容易拿来赚钱”、“AI 相关”、“写代码”等等。这不只是一个冷冰冰的工具列表,更像是一份行动指南。它告诉我,即使是想尝试 AI 应用、搭建网站,甚至做个小 SaaS 产品,现在都能用免费资源起步
🔗 这份详细的免费工具清单,你可以直接访问 G 哥的原推查看:原文链接
📮 这篇文章是转发给你的吗?点击这里加入频道,一起探索更多有趣的内容!
via Roller | ChatGPT Astra 中文社区 - Telegram Channel
Sam Altman谈前沿AI:欢迎联邦安全框架,但不会坐等立法
OpenAI CEO Sam Altman表示,前沿AI实验室现在就必须负起责任;他支持联邦层面制定一致的安全要求框架,同时认为不应等待立法或反垄断豁免才开始行动。
内容详情 · 原文链接
via AI Pulse | 全球 AI 动态简报 - Telegram Channel
OpenAI CEO Sam Altman表示,前沿AI实验室现在就必须负起责任;他支持联邦层面制定一致的安全要求框架,同时认为不应等待立法或反垄断豁免才开始行动。
内容详情 · 原文链接
via AI Pulse | 全球 AI 动态简报 - Telegram Channel
月费10美元!开源AI编码工具 OpenCode Go 宣布实现收支平衡
人工智能编码工具 OpenCode 联合创始人 Dax Raad 于2026年9月12日宣布,旗下每月仅需10美元的低成本订阅服务 OpenCode Go 已连续两周实现收支平衡。在当前多数 AI 编码工具仍面临高额烧钱或通过数据出售方案变现的行业背景下,这一进展标志着低价 AI 订阅模式在商业可持续性上取得重要突破。
OpenCode Go 旨在通过宽松的速率限制与稳定的访问权限,为开发者提供高性价比的开源 AI 编码体验。该付费方案涵盖了包括 Kimi K3、Kimi K2.7Code、GPT5.6Luna、MiniMax M3、Qwen3.7Plus、GLM-5.3-Flash、DeepSeek V4Flash、DeepSeek V4.1Flash、MiMo-V2.5以及 Muse Spark1.3Contributor 在内的多款高性能模型。
此外,OpenCode 依然维持着包含 Nemotron3Ultra、Muse Spark1.3、Muse Spark1.2、Nemotron3.5Lightning、MiMo-2.5、Big Pickle 和 Ling3.0Flash Fin 等模型的免费服务层,开发者在单模型额度用尽后可无缝切换继续工作。
随着市场竞争加剧,包括 Windsurf(现已更名为 Devin)在内的早期免费 AI 工具纷纷收紧免费额度,AI 创业公司普遍面临从用户扩张向财务稳定过渡的压力。OpenCode Go 的收支平衡不仅验证了开源大模型商业化转型的可行性,也为生成式 AI 行业探索健康、可持续的盈利模式提供了重要参考。
via AI新闻资讯 (author: AI Base)
人工智能编码工具 OpenCode 联合创始人 Dax Raad 于2026年9月12日宣布,旗下每月仅需10美元的低成本订阅服务 OpenCode Go 已连续两周实现收支平衡。在当前多数 AI 编码工具仍面临高额烧钱或通过数据出售方案变现的行业背景下,这一进展标志着低价 AI 订阅模式在商业可持续性上取得重要突破。
OpenCode Go 旨在通过宽松的速率限制与稳定的访问权限,为开发者提供高性价比的开源 AI 编码体验。该付费方案涵盖了包括 Kimi K3、Kimi K2.7Code、GPT5.6Luna、MiniMax M3、Qwen3.7Plus、GLM-5.3-Flash、DeepSeek V4Flash、DeepSeek V4.1Flash、MiMo-V2.5以及 Muse Spark1.3Contributor 在内的多款高性能模型。
此外,OpenCode 依然维持着包含 Nemotron3Ultra、Muse Spark1.3、Muse Spark1.2、Nemotron3.5Lightning、MiMo-2.5、Big Pickle 和 Ling3.0Flash Fin 等模型的免费服务层,开发者在单模型额度用尽后可无缝切换继续工作。
随着市场竞争加剧,包括 Windsurf(现已更名为 Devin)在内的早期免费 AI 工具纷纷收紧免费额度,AI 创业公司普遍面临从用户扩张向财务稳定过渡的压力。OpenCode Go 的收支平衡不仅验证了开源大模型商业化转型的可行性,也为生成式 AI 行业探索健康、可持续的盈利模式提供了重要参考。
via AI新闻资讯 (author: AI Base)
Command Code 扩大 GOAT 套餐对 DeepSeek V4.1 Flash 的开放量
Command Code 在其 $10/月 GOAT 套餐上加大 DeepSeek V4.1 Flash 的开放力度:提供 $60 用量、154K 请求和 7.8B tokens,并将有效期延长至 10 天。
内容详情 · 原文链接
via AI Pulse | 全球 AI 动态简报 - Telegram Channel
Command Code 在其 $10/月 GOAT 套餐上加大 DeepSeek V4.1 Flash 的开放力度:提供 $60 用量、154K 请求和 7.8B tokens,并将有效期延长至 10 天。
内容详情 · 原文链接
via AI Pulse | 全球 AI 动态简报 - Telegram Channel
OpenAI 关停史上最快模型 GPT-5.3-Codex-Spark:从发布到下线只活了 7 个月
OpenAI 史上最快的模型,死了。Codex 负责人 Tibo 发帖宣布,GPT-5.3-Codex-Spark 下周退役。这款每秒 1200 个 Token、OpenAI 第一个逃离英伟达的模型、750 兆瓦 Cerebras 大单的第一份交付,从发布到下线只活了 7 个月。Tibo 给的理由很简单:用量一直在往下掉,手上也已经有明显更好的模型了,“是时候给未来腾地方了”。他还补了一刀:“真不敢相信,我们居然发布过名字这么长的模型!!”
从“未来”到边缘化,败在“降智提速”
今年 2 月 12 日 Spark 上线时排场盛大:这是 OpenAI 第一个专为实时编程设计的模型,128k 上下文,每秒生成超过 1000 个 Token,官方称往返开销降 80%、首 Token 延迟砍半。它还是 OpenAI 第一个跑在英伟达技术栈之外的生产模型,底层算力来自 Cerebras 的晶圆级芯片 WSE-3,标志着那份 750 兆瓦、总价值超 200 亿美元算力大单交出了第一份答卷。
但热度退得比涨得更快。Spark 的致命伤在于,一块晶圆装不下旗舰模型,它本质上是一个为极致速度而妥协的“蒸馏版小模型”:Terminal-Bench 2.0 评测中仅 58.4%,远低于完整版 GPT-5.3-Codex 的 77.3%;SWE-Bench Pro 曲线显示它虽能把任务压到 1 至 2 分钟,准确率却停在 47% 至 51%,而完整版从 3 分钟的 51% 可拉到 16 分钟的 57%。宣传中的“15 倍提速”也被拆穿——同等准确率下其实只快 1.37 倍。开发者吐槽它凭空捏造 API 端点、JSON 格式不稳定,培训机构 Turing College 的总结一针见血:“没有智能的速度,只是更快地失败。”
真正给 Spark 判死刑的是 8 月 13 日 Cerebras 发布的 Ultrafast 模式:跑在晶圆上的不再是缩水版,而是旗舰模型 GPT-5.6 Sol 本尊。通过将旗舰模型按层切分、铺设在多台 CS-3 节点上形成流水线,Ultrafast 在“与标准版同等智能”前提下飙出每秒 750 个 Token——同一任务标准档平均 7.7 分钟,Ultrafast 仅 83 秒,端到端快 5.6 倍。Cerebras CEO Andrew Feldman 称:“速度与智能,不再互斥。”
速度从“专属模型”变成“付费档位”
Spark 并非唯一被清理的历史包袱。过去三个月 OpenAI 模型库经历激进换血:6 月 2 日 GPT-5.2 与 GPT-5.3-Codex 退役,8 月 31 日 GPT-5.4 与 5.4 Mini 退役、用户整体迁移至 5.6 世代,9 月 11 日轮到 GPT-5.3-Codex-Spark。伴随旧世代离场,Codex 迎来了 Sol、Terra、Luna、Astra 的全新命名纪元。
更深层的逻辑更迭在于,“快”正从一个独立的专用模型,演变为旗舰模型的一项标配档位——就像推理强度分为 Light 到 Max,速度也从 Standard、Priority 排到 Ultrafast,按档付费的商业模式已经跑通。回头看,Spark 作为过渡期的探路者,证明了 Cerebras 晶圆足以扛住生产级流量、推理任务可以脱离英伟达生态运行;当探路结束、大部队入驻,探路者的使命也就自然终结。下一轮竞赛比的不再是谁能做出最快的阉割版模型,而是谁能把最强的旗舰模型跑出最极限的速度。
via AI新闻资讯 (author: AI Base)
OpenAI 史上最快的模型,死了。Codex 负责人 Tibo 发帖宣布,GPT-5.3-Codex-Spark 下周退役。这款每秒 1200 个 Token、OpenAI 第一个逃离英伟达的模型、750 兆瓦 Cerebras 大单的第一份交付,从发布到下线只活了 7 个月。Tibo 给的理由很简单:用量一直在往下掉,手上也已经有明显更好的模型了,“是时候给未来腾地方了”。他还补了一刀:“真不敢相信,我们居然发布过名字这么长的模型!!”
从“未来”到边缘化,败在“降智提速”
今年 2 月 12 日 Spark 上线时排场盛大:这是 OpenAI 第一个专为实时编程设计的模型,128k 上下文,每秒生成超过 1000 个 Token,官方称往返开销降 80%、首 Token 延迟砍半。它还是 OpenAI 第一个跑在英伟达技术栈之外的生产模型,底层算力来自 Cerebras 的晶圆级芯片 WSE-3,标志着那份 750 兆瓦、总价值超 200 亿美元算力大单交出了第一份答卷。
但热度退得比涨得更快。Spark 的致命伤在于,一块晶圆装不下旗舰模型,它本质上是一个为极致速度而妥协的“蒸馏版小模型”:Terminal-Bench 2.0 评测中仅 58.4%,远低于完整版 GPT-5.3-Codex 的 77.3%;SWE-Bench Pro 曲线显示它虽能把任务压到 1 至 2 分钟,准确率却停在 47% 至 51%,而完整版从 3 分钟的 51% 可拉到 16 分钟的 57%。宣传中的“15 倍提速”也被拆穿——同等准确率下其实只快 1.37 倍。开发者吐槽它凭空捏造 API 端点、JSON 格式不稳定,培训机构 Turing College 的总结一针见血:“没有智能的速度,只是更快地失败。”
真正给 Spark 判死刑的是 8 月 13 日 Cerebras 发布的 Ultrafast 模式:跑在晶圆上的不再是缩水版,而是旗舰模型 GPT-5.6 Sol 本尊。通过将旗舰模型按层切分、铺设在多台 CS-3 节点上形成流水线,Ultrafast 在“与标准版同等智能”前提下飙出每秒 750 个 Token——同一任务标准档平均 7.7 分钟,Ultrafast 仅 83 秒,端到端快 5.6 倍。Cerebras CEO Andrew Feldman 称:“速度与智能,不再互斥。”
速度从“专属模型”变成“付费档位”
Spark 并非唯一被清理的历史包袱。过去三个月 OpenAI 模型库经历激进换血:6 月 2 日 GPT-5.2 与 GPT-5.3-Codex 退役,8 月 31 日 GPT-5.4 与 5.4 Mini 退役、用户整体迁移至 5.6 世代,9 月 11 日轮到 GPT-5.3-Codex-Spark。伴随旧世代离场,Codex 迎来了 Sol、Terra、Luna、Astra 的全新命名纪元。
更深层的逻辑更迭在于,“快”正从一个独立的专用模型,演变为旗舰模型的一项标配档位——就像推理强度分为 Light 到 Max,速度也从 Standard、Priority 排到 Ultrafast,按档付费的商业模式已经跑通。回头看,Spark 作为过渡期的探路者,证明了 Cerebras 晶圆足以扛住生产级流量、推理任务可以脱离英伟达生态运行;当探路结束、大部队入驻,探路者的使命也就自然终结。下一轮竞赛比的不再是谁能做出最快的阉割版模型,而是谁能把最强的旗舰模型跑出最极限的速度。
via AI新闻资讯 (author: AI Base)
智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案
大模型在长任务里反复"失忆"、跑着跑着就忘了最初目标,这个困扰整个智能体行业的老毛病,根源可能不在模型本身,而在包裹模型的"执行框架"。AWS 一份自主云编程智能体设计指南把问题点得很直白:浅层智能体在长周期里会遭遇上下文溢出、被干扰而跑题,并且无法维持状态。而修好这层的,是负责管理"除模型之外一切"的 harness。
一份盘点多家主流框架的新研究把这层外壳掀开了。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四台"发动机"——上下文预算、压缩、待办状态、跨会话记忆——把浅层循环变成能扛住长任务的深智能体。
最反直觉的一点是,把上下文窗口做大并不解决问题。Chroma 的 Context Rot 报告评估了18款大模型,发现即便在简单检索任务上,输入越长模型越不可靠。Anthropic 给出的解释是:注意力机制对 n 个 token 会生成 n² 的两两关系,每多一个 token 都在消耗一笔有限的"注意力预算",上下文是边际递减的资源,不是个桶。Manus 还透露,一个典型任务要调约50次工具、输入输出比接近100:1,最初那条指令会慢慢漂向窗口中段——恰恰是回忆退化的位置。
第一台发动机是上下文预算与卸载。Deep Agents 出厂就写死了两条硬规则:工具返回超过20000token 就写进文件系统、只留路径加前10行预览;会话上下文超过窗口85% 时,旧编辑调用被截断成指针。Claude Code 把同样逻辑用在加载前,自动记忆限200行或25KB,MCP 工具模式默认只列名字、按需拉取。AWS AgentCore 的演示更彻底:协调器并行派生3个浏览器子智能体,各自待在独立 MicroVM 里,分析子智能体只收结构化结果,全程预期4到6分钟,串行则会慢最多3倍。
第二台是压缩。当卸载不够,框架就把接近上限的对话摘要后重启。Claude Code 的压缩提示会保留架构决策和未解决 bug、丢掉冗余输出,并在压缩后重读最近修改的至多5个文件、重新注入技能正文;它还把完整原始记录写进磁盘,被摘要掉的事实日后能找回。Deep Agents 更把"保住目标"做成结构特性,摘要文档专门分出会话意图、已生成产物和下一步三个字段。压缩已下沉到 API 层:OpenAI Responses API 用 `compact_threshold` 提供服务端压缩,Codex 正是靠它撑住长编程任务;Claude 平台则给出可写自定义指令的压缩编辑项。
第三台是待办状态与"念咒"。Manus 的做法很朴素——建一个 `todo.md` 一步步重写打勾,等于把目标念进上下文末尾,推开"淹没在中间"的漂移。不过它并非稳赚:Deep Agents 在2026年7月的 v0.7里,因评估显示关掉待办反而奖励略高、成本更低,把待办中间件改成了可选;LangChain 仍建议对长任务、弱模型和需展示进度的界面重新打开。
第四台是跨会话记忆。Claude Code 每次压缩后都从磁盘重注 CLAUDE.md 和自动记忆;AgentCore Memory 在后台跑抽取策略,让协调器下次直接召回而非重研。但苏黎世联邦理工的研究泼了冷水:AGENTS.md 这类上下文文件通常不提升成功率,却让推理成本涨20% 到23%,每次重载都是对注意力预算的固定征税。Claude Code 因此建议把 CLAUDE.md 压在200行以内。
研究最后提醒,框架是否真"抓得住目标"得靠强制触发压缩的测试验证——最该警惕的失败,是智能体在摘要后立刻反问澄清,或错误宣布任务完成。换句话说,让智能体在长路上不迷路,拼的不是模型有多大,而是框架这几台发动机调得有多细。
via AI新闻资讯 (author: AI Base)
大模型在长任务里反复"失忆"、跑着跑着就忘了最初目标,这个困扰整个智能体行业的老毛病,根源可能不在模型本身,而在包裹模型的"执行框架"。AWS 一份自主云编程智能体设计指南把问题点得很直白:浅层智能体在长周期里会遭遇上下文溢出、被干扰而跑题,并且无法维持状态。而修好这层的,是负责管理"除模型之外一切"的 harness。
一份盘点多家主流框架的新研究把这层外壳掀开了。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四台"发动机"——上下文预算、压缩、待办状态、跨会话记忆——把浅层循环变成能扛住长任务的深智能体。
最反直觉的一点是,把上下文窗口做大并不解决问题。Chroma 的 Context Rot 报告评估了18款大模型,发现即便在简单检索任务上,输入越长模型越不可靠。Anthropic 给出的解释是:注意力机制对 n 个 token 会生成 n² 的两两关系,每多一个 token 都在消耗一笔有限的"注意力预算",上下文是边际递减的资源,不是个桶。Manus 还透露,一个典型任务要调约50次工具、输入输出比接近100:1,最初那条指令会慢慢漂向窗口中段——恰恰是回忆退化的位置。
第一台发动机是上下文预算与卸载。Deep Agents 出厂就写死了两条硬规则:工具返回超过20000token 就写进文件系统、只留路径加前10行预览;会话上下文超过窗口85% 时,旧编辑调用被截断成指针。Claude Code 把同样逻辑用在加载前,自动记忆限200行或25KB,MCP 工具模式默认只列名字、按需拉取。AWS AgentCore 的演示更彻底:协调器并行派生3个浏览器子智能体,各自待在独立 MicroVM 里,分析子智能体只收结构化结果,全程预期4到6分钟,串行则会慢最多3倍。
第二台是压缩。当卸载不够,框架就把接近上限的对话摘要后重启。Claude Code 的压缩提示会保留架构决策和未解决 bug、丢掉冗余输出,并在压缩后重读最近修改的至多5个文件、重新注入技能正文;它还把完整原始记录写进磁盘,被摘要掉的事实日后能找回。Deep Agents 更把"保住目标"做成结构特性,摘要文档专门分出会话意图、已生成产物和下一步三个字段。压缩已下沉到 API 层:OpenAI Responses API 用 `compact_threshold` 提供服务端压缩,Codex 正是靠它撑住长编程任务;Claude 平台则给出可写自定义指令的压缩编辑项。
第三台是待办状态与"念咒"。Manus 的做法很朴素——建一个 `todo.md` 一步步重写打勾,等于把目标念进上下文末尾,推开"淹没在中间"的漂移。不过它并非稳赚:Deep Agents 在2026年7月的 v0.7里,因评估显示关掉待办反而奖励略高、成本更低,把待办中间件改成了可选;LangChain 仍建议对长任务、弱模型和需展示进度的界面重新打开。
第四台是跨会话记忆。Claude Code 每次压缩后都从磁盘重注 CLAUDE.md 和自动记忆;AgentCore Memory 在后台跑抽取策略,让协调器下次直接召回而非重研。但苏黎世联邦理工的研究泼了冷水:AGENTS.md 这类上下文文件通常不提升成功率,却让推理成本涨20% 到23%,每次重载都是对注意力预算的固定征税。Claude Code 因此建议把 CLAUDE.md 压在200行以内。
研究最后提醒,框架是否真"抓得住目标"得靠强制触发压缩的测试验证——最该警惕的失败,是智能体在摘要后立刻反问澄清,或错误宣布任务完成。换句话说,让智能体在长路上不迷路,拼的不是模型有多大,而是框架这几台发动机调得有多细。
via AI新闻资讯 (author: AI Base)
Elevated error rates for ChatGPT Chat/Work
Status: Investigating
We are investigating the issue for the listed services.
via OpenAI status
Status: Investigating
We are investigating the issue for the listed services.
via OpenAI status
Anthropic 牵手 Rum Group 签下 137 亿美元算力大单,背后是特朗普关联的社交老玩家
Anthropic 又给自己囤了一笔算力。据知情人士透露,这家 Claude 开发商与 Rum Group 签下一份为期六年、价值 137 亿美元的算力采购协议。Rum Group 起家于社交媒体领域,长期与特朗普政府存在联系——这意味着 Anthropic 的算力供给名单里,又多了一个和政治背景绑定的新名字。
这并非孤立动作,而是 Anthropic 过去一年接连落子的云计算大单中最新的一个。它的合作方名单已经铺得很开:谷歌这类大型云服务商、SpaceX 等科技企业,以及 Nscale 这类新兴小型云厂商都被拉了进来。这些协议叠加起来,合计能提供至少 14.8 吉瓦的算力,未来十年总投入最高可触达 5170 亿美元。在 Claude Code 与 Cowork 这类产品需求激增的当口,与 Rum Group 的这桩交易会在既有规模之上进一步加厚算力底座。
via AI新闻资讯 (author: AI Base)
Anthropic 又给自己囤了一笔算力。据知情人士透露,这家 Claude 开发商与 Rum Group 签下一份为期六年、价值 137 亿美元的算力采购协议。Rum Group 起家于社交媒体领域,长期与特朗普政府存在联系——这意味着 Anthropic 的算力供给名单里,又多了一个和政治背景绑定的新名字。
这并非孤立动作,而是 Anthropic 过去一年接连落子的云计算大单中最新的一个。它的合作方名单已经铺得很开:谷歌这类大型云服务商、SpaceX 等科技企业,以及 Nscale 这类新兴小型云厂商都被拉了进来。这些协议叠加起来,合计能提供至少 14.8 吉瓦的算力,未来十年总投入最高可触达 5170 亿美元。在 Claude Code 与 Cowork 这类产品需求激增的当口,与 Rum Group 的这桩交易会在既有规模之上进一步加厚算力底座。
via AI新闻资讯 (author: AI Base)