https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
阶跃星辰 Step 5 Preview 全量开放:600B 参数打平 K3 级性能,新用户最长白嫖 75 天

昨天一款名为 Step 5 Preview 的国产大模型突然杀出,仅用 6000 亿参数量就达到了 2.8 万亿参数量 K3 级别的性能,性价比非常高。今天该模型正式全量开放——API 和 Studio 已经可以使用,10 月 15 日还将发布完整权重模型。

Step 5 Preview 是阶跃星辰推出的旗舰模型,采用稀疏 MoE 架构,总参数 600B,每次仅激活 27B,支持 100 万 Token 上下文和图文输入。

跑分与长任务:连续 24 小时自主优化 GPU 内核

性能方面,Step 5 Preview 在 AA 榜单的 Intelligence Index 中得分 44 分,与 Kimi K3 Max 持平;输出速度约 100 Token/s,每项任务成本 0.71 美元,而 Kimi K3 Max 为 2 美元。

它也有不错的长任务能力:连续最多 24 小时自主优化一套 H100 GPU 内核,模型自己改代码、跑测试、比较结果再继续迭代,约 22 小时后达到 508 TFLOPS,同一实验中 Claude Opus 5 为 493 TFLOPS。在另一个 24 小时实验里,Step 5 Preview 自己设计后训练数据,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提升到 60%,与 Claude Opus 5 持平,同时消耗更少的标注 Token。

注册就送套餐,累计最高 75 天

阶跃星辰官方同步开启活动:新用户注册送 99 元套餐,登录即得 15 天,完成首次调用再得 15 天,每邀请 1 位好友注册再获 15 天、累计最高 45 天,总福利可达 75 天。

从目前的反馈看,该模型想真正持平 K3 并不那么容易,但也并非为跑分刷榜而生,整体能力与 DeepSeek V4.1 Flash 接近;不过实际使用速度不算快,若后续免费用户增多,速度可能还会下滑。

via AI新闻资讯 (author: AI Base)
B 站上线“AI 无限竞技场”:百大模型同台 PK,GPT-6 Astra 暂居榜首

9B 站宣布上线“AI 无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得“榜首次数冠军”;前五名中,国产大模型占据三席。

据 B 站介绍,“AI 无限竞技场”是一个汇集 UP 主 AI 大模型测评的竞技广场,由各领域 UP 主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。

不设命题限制,用真实工作流说话

与传统跑分评测不同,B 站“AI 无限竞技场”不设主题或测评维度限制——来自各个分区的 UP 主以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。

榜单涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型的对比测评,排名实时更新,并持续面向全站 UP 主开放报名。

公开信息显示,过去一年 B 站 AI 知识内容消费时长同比增长 72%,月均观看 AI 内容的用户超过 1.9 亿。平台涌现出大量覆盖不同领域、维度与主题的测评内容,形成了从发布到讨论、测评、使用、求助再到共建的内容生态。

via AI新闻资讯 (author: AI Base)
AI情报局新增日报功能:https://rss.bz/zh/digest ,每天北京时间7点精炼前一日AI核心情报和动态,支持历史回溯。
AI情报局
AI 日报 · 9月19日:实测显示不同提供商 DeepSeek V4.1 Flash 吞吐差异达 2.6 倍

今日实测揭示 DeepSeek V4.1 Flash 在不同提供商间有效吞吐最高达 197 token/s,差异 2.6 倍;另有 Qwen 实时同传模型、Grok 语音转录低价上线,以及缓存命中率影响成本的警示。


via AI情报局 | 全球 AI 动态简报 - Telegram Channel
B站上线"AI 无限竞技场"测评榜:上百模型同场厮杀,GPT-6 暂坐头把交椅

B站今天端出了一块大模型擂台——"AI 无限竞技场"测评榜,并同步亮出首轮排行榜。在10位 UP 主的真机实测里,GPT-6Astra 拿下榜首、并且抢下"登顶次数冠军",把 GLM-5.3压在身后;前五名里国产大模型占了三席,和海外巨头贴身肉搏。

这块竞技场和传统跑分榜的玩法不一样。它把 B站 各领域 UP 主对上百个大模型的真实场景实测汇成一个广场,涵盖代码、推理、协作、知识等多种主题,而且不设固定的测评维度限制——来自不同分区的创作者拿真实工作流、专业应用乃至趣味脑洞自主命题,让模型在同题 PK 里把实际差距摊开给人看。DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型都在对比之列,排名实时刷新,并持续向全站 UP 主开放报名。

B站 押注这块榜单,底气来自平台上 AI 内容的爆发。过去一年,B站 AI 知识内容消费时长同比增长72%,月均观看 AI 内容的用户超过1.9亿,围绕模型发布、讨论、测评、使用、求助、共建的内容已经成体系。当模型迭代快到跑分榜追不过发布节奏,把评测权交还给真实创作者和真实工作流,反而更贴近用户心里那句"到底哪个好用"——B站 想做的,是把自家的社区生态变成大模型走向大众的另类裁判台。

via AI新闻资讯 (author: AI Base)
GPT-6 发布当晚,三大 AI 集体宕机 4 小时——我扒完时间线,发现最该慌的不是宕机

昨晚八点半左右,如果你正开着 Cursor 写代码、挂着 Claude Code 跑任务、或者在跟 Grok 对话,大概率经历了同一件事:屏幕上的 AI 一起掉线了。

ChatGPT、Claude、Grok——三家互为死对头的公司,在同一晚集体宕机近 4 个小时。而这天白天,OpenAI 刚刚发布了 GPT-6,宣称"AGI 时代开始了"。

发布史上最强模型的当天晚上,全行业的 AI 一起离线。这事值得从头到尾扒一遍。

先说这篇文章能给什么

我不打算搬运新闻。这篇给三样东西:

一份完整的故障时间线(谁先崩、谁恢复、崩了多久)
疑似根因的分析(为什么三家独立公司会同晚崩溃)
对前端开发者的实际影响(你的 AI 工具全家桶,可能共享同一个单点故障)

看懂第三点,比围观宕机本身重要得多。

完整时间线:那一晚发生了什么

先还原时间线,全部换成北京时间:

几个值得注意的细节:

Gemini 和 Copilot 也有份。 部分媒体只报了三巨头,但 Mashable 的统计里,Gemini 和 Copilot 当晚同样出现了波动。也就是说,受影响的不是"三家公司",而是"几乎所有第一梯队 AI 产品"。

故障不是完全同步的。 各家的开始时间和恢复时间有先后,但高度重叠。这个细节在后面分析根因时会用到。

ChatGPT 最惨。 其他家 4 小时左右基本恢复,ChatGPT 的恢复拖了远不止 4 小时。刚发布 GPT-6 的公司,当晚的表现反而是最差的。

三家一起崩,问题出在哪

官方至今没有给出完整的定论。但多家媒体的报道指向同一个方向:云基础设施层出了问题,尤其是微软 Azure 系

这里要拆开说,因为"三家一起崩"有两种可能,性质完全不同:

可能一:共享上游故障。 OpenAI 的推理全部跑在 Azure 上,这是公开事实。如果故障源头在 Azure 的基础设施层——哪怕是上游的网络、CDN、路由这样的共享环节——依赖它的服务就会成片倒下。历史上 Azure 的大规模故障向来有这个特征:一倒一片,倒的还都是不同公司的产品。

可能二:各自独立故障的巧合。 三家公司在同一晚各自出了不相关的问题,纯属倒霉。概率不高,但也不能完全排除。

说实话,以目前公开的信息,没人能把话说死。但无论最终根因是哪一种,暴露出来的结构性问题是一样的

AI 军备竞赛打了这么多年,看起来是几十家公司在竞争,底层的算力、网络、机房却集中在极少数几家云厂商手里。你在应用层看到的"选择",到了基础设施层可能根本不存在。

表面上有 Claude、ChatGPT、Grok 可以选。往下一层,是几家云厂商。再往下,是更少的机房、光缆和电力系统。互联网时代攒了几十年的去中心化架构,在 AI 时代正在被快速重新中心化。

对前端的实际影响:你的 AI 工具全家桶,可能是同一个单点故障

这才是我真正想说的部分。

复盘一下一个典型前端工程师现在的工作流:Cursor 里写代码、Copilot 补全、Claude Code 跑重构、浏览器里的 AI 助手查文档。看起来用了四五个产品,实际上呢?

Cursor 背后是 OpenAI 和 Anthropic 的模型
Copilot 背后是 OpenAI 的模型,跑在 Azure 上
Claude Code 背后是 Anthropic
各家浏览器 AI 助手,大部分也是这几家的 API

昨晚那 4 个小时里,上面这串工具是成串失效的。 不是你运气不好同时遇到了五个 bug,而是它们本来就长在同一棵树上。

对 C 端用户来说,AI 挂 4 小时是"今天聊不了天"。对把 AI 编进工作流的开发者来说,这是生产线的单点故障。区别在于:前者只能等,后者本来可以设计降级。

代码层面的降级链其实不难写:
// AI 功能的降级链:别让一个供应商挂了带走整个功能
const PROVIDERS = [callClaude, callGLM, callLocalModel];

async function askAI(prompt: string) {
  for (const provider of PROVIDERS) {
    try {
      return await provider(prompt);
    } catch (err) {
      console.warn(`provider failed, falling back`, err);
    }
  }
  throw new Error('所有 AI 供应商不可用');
}

代码是简单的,难的是意识——大多数人从来没把"AI 供应商"当成一个会挂的依赖项去管理。昨晚就是一次免费的压力测试。

值得留的 5 条后路

把这次当教训,清单如下:

1. 画出你自己的依赖链。 拿张纸,写下你每天用的 AI 工具,标注每个工具背后的模型供应商。你会发现"五个工具、两个供应商"是常态,"五个工具、五个供应商"几乎不存在。

2. 关键路径留人工兜底。 Code review、上线前的最后检查、核心逻辑的修改——这些环节的判断权不要完全交给 AI,AI 不可用时要能切换回纯人工流程。

3. 至少准备一个不同阵营的备用供应商。 注意是"不同阵营":主用 OpenAI 系,备用就选非 Azure 托管的;主用云端 API,可以加一个本地小模型兜底。同一棵树上的备份不是备份。

4. 给 AI 依赖加降级策略。 就像上面那段代码——供应商挂了,功能降级而不是整个页面挂掉。你的用户不需要知道你的 AI 供应商昨晚崩了。

5. 把"AI 挂了怎么办"写进项目预案。 昨晚这种级别的集体宕机,第一次是意外,第二次就是预案缺失。团队层面至少要有共识:AI 不可用时的工作模式是什么。

写在最后:AGI 时代的第一晚

最后回到那个讽刺本身。

GPT-6 发布当天,OpenAI 的说辞是"AGI 时代开始了",主打能力是 computer use——让 AI 替你操作电脑。

然后当晚,AI 集体下线了近 4 个小时,无数人第一次意识到:原来自己已经这么依赖这些东西了。

系统卡里那句"推理过程可监控性下降"还没被讨论完,现实先给了一个更直白的提醒:AGI 时代表面上比的是谁更聪明,底座上比的是谁的机房更稳。而全球 AI 的机房,可能比我们以为的集中得多。

昨晚你的 AI 工具崩了吗?崩的时候你第一反应是等恢复,还是发现自己其实有 Plan B?评论区聊聊——你的降级方案,可能正是别人缺的那块。

----------------------

发布信息

标题:GPT-6 发布当晚,三大 AI 集体宕机 4 小时——我扒完时间线,发现最该慌的不是宕机
分类:人工智能
标签:人工智能、ChatGPT、程序员、AI
话题:AI、GPT-6、程序员
摘要:GPT-6 发布当晚,ChatGPT、Claude、Grok 集体宕机近 4 小时。完整时间线、疑似根因分析,以及前端开发者该留的 5 条后路——你的 AI 工具全家桶,可能共享同一个单点故障。

via 掘金人工智能本月最热 (author: kyriewen)
DeepSeek明确调休日计费规则,中秋国庆迎来十天"半价窗口"

9月19日,DeepSeek正式发布API峰谷时间补充说明,明确调休上班的周末以及中国法定节假日全天,均按空闲时段计费。这意味着,9月20日(周日调休上班)、10月10日(周六调休上班)以及中秋、国庆假期,开发者均可享受低谷价格调用API。

根据DeepSeek此前公布的峰谷定价机制,工作日高峰时段(9:00-12:00、14:00-18:00)价格为低谷时段的两倍,而周末全天统一按低谷价计费。此次补充说明进一步堵上了"调休日算工作日还是周末"的模糊地带,明确只要是周末,就按空闲价执行。

按此规则,从9月20日到10月10日,DeepSeek将迎来一段超长优惠期:中秋三天(9月25日-27日)、国庆七天(10月1日-7日),加上两个调休周末,累计超过十天全部按空闲时段结算,堪称全年"半价日"最密集的时段。

与此同时,DeepSeek于9月10日发布的V4.1Flash模型也进一步拉高了性价比。这款552B参数的MoE模型采用非对称架构,输入仅激活8B参数、输出激活16B,在多项基准测试中性能反超自家旗舰V4Pro,价格却按Flash档位定价。空闲时段下,V4.1Flash的缓存命中输入低至0.02元/百万Token,输出仅4元/百万Token。

有开发者调侃:"这感觉就像回到了DeepSeek涨价前。"对于高频调用API的团队来说,接下来的十天,确实是"放心使劲蹬"的好时候。

via AI新闻资讯 (author: AI Base)
📌 官方公告
AI Pulse 正式更名为【AI情报局】,并启用全新域名:
🌐 https://rss.bz/zh
感谢支持,请认准新名称与新域名
AI情报局
AI情报局 - 全球 AI 动态简报:OpenAI、Anthropic、Google 每日更新

AI情报局每天追踪 OpenAI、Anthropic、Google 等 AI 公司的最新动态,把 X 上最值得看的 AI 内容用 AI 整理、打分并翻译成中文简报,已收录 1000+ 条,每 20 分钟更新。支持全文搜索,可用 Telegram 和 RSS 免费订阅。


via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Unity 官宣 Claude Code 与 Codex 插件:31 项开发技能把 AI 代理绑上游戏引擎

Unity 正式发布了由官方编写并维护的 Claude Code 与 OpenAI Codex 两款插件,专门给 AI 代码代理塞进成套的开发技能。其中 Codex 版本一口气装了31项技能,覆盖多个开发领域,既能从零拉起新项目,也能把旧项目往 URP(通用渲染管线)上迁,插件适配 Unity6及更高版本,走各自对应渠道就能装上。

这套官方插件的痛点很明确:通用 AI 代理写 Unity 代码时,常常照着过时的教程和文档生成内容,跑起来效果不佳,俨然一个"背错书本的考生"。Unity 这次把代理直接和成熟游戏引擎的标准开发流程焊在一起,等于给 AI 配了一份随时更新的官方说明书,让它少走弯路。

背后是 AI 代理正加速涌进游戏和3D 内容开发的趋势。当代码智能体从写网页、改后端,一路杀到做游戏、捏场景,引擎厂商亲手下场把工具链接好,既是给开发者减负,也是在这场3D 内容生产的 AI 竞赛里提前卡位——已经有不少相关产品在这条路上探路,而 Unity 用官方姿态把标准立了起来。

via AI新闻资讯 (author: AI Base)
阶跃星辰发布Step5Preview,单任务成本仅为Claude Opus5的1/8

阶跃星辰发布新一代旗舰基座模型Step5Preview,重点面向AI编程、软件工程、专业知识工作及金融等场景,提升模型在真实世界Agentic任务中的综合表现,并进一步优化智能、成本与效率之间的平衡。

该模型在Artificial Analysis Intelligence Index(AA综合智能指数)中跻身全球开源模型前三,单任务成本仅为Claude Opus5的1/8,计划于10月15日正式开源。

架构方面,Step5Preview采用稀疏MoE架构,总参数量600B,激活参数仅27B,支持100万Token上下文窗口,并原生支持文本与视觉输入,在软件工程、专业工作流和金融等场景针对复杂任务进行了优化。

阶跃星辰表示,Step5Preview定位于可持续处理复杂任务的主力工作模型,核心目标是在真实Agentic任务中实现能力与成本的长期平衡。以“帕累托前沿”衡量模型智能与成本关系,该模型试图进一步推动同等成本下的智能水平上限。

via AI新闻资讯 (author: AI Base)
FlappyBench 对决:DeepSeek V4.1 Flash 与 Qwen Omni Flash 在成本和质量上均击败 Gemini 3.8 Flash

FlappyBench 测试显示,DeepSeek V4.1 Flash 和 Qwen 3.8 Omni Flash 以不到 $0.015 的成本获得 9/10 的成绩,而 Gemini 3.8 Flash 得 5/10,成本 $0.205 且仍属硬编码。

内容详情 · 原文链接

via AI Pulse | 全球 AI 动态简报 - Telegram Channel
ChatGPT 正式入驻 Word:免费用户也能用,办公文档里三套 AI 同台厮杀

OpenAI 推出了 ChatGPT 官方 Word 插件,面向全球所有账号计划开放,连免费用户都能直接体验。这意味着最主流的文字处理软件里,AI 助手阵营又多了一个重量级玩家。

这个插件能干的事很贴合写作者日常:把零散笔记攒成初稿、给长报告写摘要、按不同读者调整语气定位、修格式、统一术语。付费和企业账号还能更进一步,接入外部素材、把常用技能存起来反复用。不过权益有分层:免费用户默认调用的是基础模型,企业用户在指定时段能免费预览高级模型;而且 Word 插件的额度是和 Codex 等工具共用的,不是独立一份。

它的边界也得说清楚。模型照样会犯错,插件只读取当前这个文档、不会翻其他文件,和网页版 ChatGPT 的聊天记录也不互通——所以它更像是一个嵌在文档旁边的协作搭档,而不是全知全能的写作大脑。

值得玩味的是格局变化。如今同一个 Word 窗口里,已经同时站着微软自家的 Copilot、Anthropic 的 Claude for Word,以及 OpenAI 的 ChatGPT for Word 三套 AI 工具,办公软件正被 AI 重新洗牌。与此同时,ChatGPT 桌面版新加了 Appshots 功能,能直接截取任意软件窗口的内容丢给 ChatGPT——AI 的调用门槛被继续压低,人在文档撰写里的角色,也正从"亲手敲字"转向"提要求、审改动、做判断、拍板"。

via AI新闻资讯 (author: AI Base)
SpaceXAI 推出 Grok Voice Transcribe 2.0:错误率砍半、价格纹丝不动,流式语音识别登顶榜单

当地时间9月18日,SpaceX 旗下的人工智能部门 SpaceXAI 放出了新一代语音转文本模型 Grok Voice Transcribe2.0,最狠的一招是:在把错误率压低约一半的同时,定价一分没涨。

它扎根于 Grok Voice 底层的音频基础模型,而这套底座如今已经深度嵌入真实业务:每天接住数万通客服电话、转录数百万小时的视频旁白,还驱动着实体硬件里的各类语音智能体,其中就包括特斯拉车机上的 Grok 助手。换句话说,它不是实验室里跑分的模型,而是已经在一线被海量真实语音反复打磨过的产物。

在 Artificial Analysis 的公开榜单上,Grok Voice Transcribe2.0在全部32款流式模型里准确率排到第一,把同赛道对手甩在身后。SpaceXAI 还不满足于公开基准,从自家线上业务里抽样了四个内部数据集做系统评测,涵盖客服电话录音、和 Grok 的日常英语对话、口述的电话号码邮箱地址这类结构化信息,以及多语种短指令——四个数据集上2.0版对1.0版实现了全面碾压。

真正让开发者动心的是价格。批量转录仍是每小时音频0.10美元,实时流式转录每小时0.20美元,和1.0完全相同;更关键的是,说话人分离、精确时间戳和自定义关键词这几项能力已经全部打包进基础价,不再单独收费。等于用旧版的价格,买到了错误率近乎减半、还多了功能的新模型——在语音识别这个价格敏感、调用量巨大的赛道里,这种"加量不加价"的打法,往往会比单纯刷榜更能撬动落地。

via AI新闻资讯 (author: AI Base)
Anthropic考虑推出新模型,拟应对OpenAI GPT-6Astra竞争

据路透社报道,Anthropic正考虑在IPO筹备期间推出一款新AI模型,以应对OpenAI GPT-6Astra近期在企业市场形成的竞争压力。三名知情人士透露,公司目前仍在评估新模型的安全性,尚未确定最终发布时间。(Reuters)

这一计划与Anthropic CEO达里奥·阿莫代近期提出的“放缓AI模型能力迭代”主张形成时间上的对照。9月12日,阿莫代发表3800字文章,呼吁行业降低新能力发布速度并重视安全风险。与此同时,9月3日发布的GPT-6Astra获得企业用户关注,部分投资者开始重新评估Anthropic在企业AI市场的竞争地位。

路透援引Ramp数据称,Astra目前约占企业AI支出的13%,Anthropic的Claude Fable约为8%;截至7月底,Anthropic年化营收运行规模已超过650亿美元,并预计2028年营收达到1900亿至2000亿美元。OpenAI同期年化营收运行规模超过400亿美元。(Reuters)

Anthropic内部目前还在权衡模型研发投入与盈利能力。与此同时,开源、开放权重模型降低AI调用成本,也进一步增加商业模型厂商的竞争压力。知情人士称,Anthropic的IPO可能推迟至美国11月中期选举之后,最早或于10月中旬启动路演。

via AI新闻资讯 (author: AI Base)
中国电信开源 Xing4.0-29B-A4B:从昇腾芯片到框架全栈国产,消费级显卡也能跑长上下文

中国电信在9月17日端出了新一代星辰大模型 Xing4.0-29B-A4B。它总参数29B、激活参数只有4B,原生吃下256K 上下文、还能扩展到512K,是国内第一个从训练芯片到推理部署全程国产、又专门冲着复杂工程任务打磨的百亿参数大模型。

最硬的一点是"全栈国产"四个字。官方把这趟路走成了闭环:昇腾芯片负责训练,国产框架做适配,架构自研,生态开源——从底层算力到上层工具链,没有一处要依赖海外供应链。对动辄被卡脖子的算力赛道来说,这种把整条链路攥在自己手里的姿态,比单纯堆参数更有分量。

成绩单也撑得住门面。SuperCLUE 评测里,它的智能体能力拿到93.52分,排第3,和前两名的头部 Qwen 模型差距都不到1分,说明这个"轻量级"选手在工程任务上已经贴到了第一梯队身后。

更讨开发者喜欢的是它的亲民门槛。经过4-bit 量化后,显存占用压到15GB,比 FP16省了约75%,意味着一块24G 的 RTX3090或 RTX4090这类消费级显卡,就能在本地跑起长上下文任务——不用堆服务器、不用租云卡,个人和中小团队也用得起来。

开源姿态也很彻底。它顺着星辰既有的开源路线,把主流生态全接了一遍:微调上支持 LLaMA-Factory、MindFormers;推理上适配 SGLang、vLLM、KTransformers;Agent 框架更对 OpenCode、Claude Code、OpenClaw、Hermes 做了定向调优,把各家的格式规范对齐到位。模型已经陆续上线 HuggingFace、GitHub、魔搭、Gitee 和魔乐等社区,开发者随时可以拉下来改、拉下来跑。一个全程国产训出来的智能体模型,就这样把自己摆进了和全球开源生态同台竞技的牌桌上。

via AI新闻资讯 (author: AI Base)
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]