https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
Command Code GOAT 套餐为 DeepSeek、GLM、Kimi 等模型附带 60 美元使用额度
Command Code 列出其每月 10 美元 GOAT 套餐附带 60 美元使用额度的四款模型,包括 DeepSeek V4.1 Flash 两个版本、GLM 5.3 Flash 以及 Kimi K3。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Command Code 列出其每月 10 美元 GOAT 套餐附带 60 美元使用额度的四款模型,包括 DeepSeek V4.1 Flash 两个版本、GLM 5.3 Flash 以及 Kimi K3。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
彭博:DeepSeek新模型发力,中美顶尖AI跑分差距缩小
彭博行业研究称,过去几个月,随着深度求索(DeepSeek)等中国AI实验室的模型不断进步,美国AI公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。
彭博行业研究高级分析师罗伯特·利亚在周一的一份报告中写道,在DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手3%。这一差距较5月份的约9%和今年早些时候的15%有所收窄。他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
彭博行业研究称,过去几个月,随着深度求索(DeepSeek)等中国AI实验室的模型不断进步,美国AI公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。
彭博行业研究高级分析师罗伯特·利亚在周一的一份报告中写道,在DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手3%。这一差距较5月份的约9%和今年早些时候的15%有所收窄。他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
Horizon Summary: 2026-10-05 (ZH)
----------------------
科技新闻
1. Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
----------------------
科技新闻
Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
GitHub 项目 Strata 被发布在 Hacker News 上,声称可在消费级 GPU 上运行 125B 的 Qwen 3.8 Flash Next,并在 RTX 4090 上达到 100 tokens/s 以上。Hacker News 用户 snehesht 称在自己的 RTX 4090、128GB DDR5、Ryzen 7950X3D 机器上实测 124 tokens/s,但该结果尚未获得独立验证。同一讨论中,Jackson__ 报告在相同 GGUF 与视觉适配器权重下,Strata 在 50 张图像的坐标定位基准中位误差为 154.8 像素、平均 168.8 像素,而 llama.cpp 分别为 46.5 和 81.4 像素,提示低比特推理可能带来质量退化。a11r 也对低于 4-bit 的量化表示怀疑,并称 4-bit 量化在 RTX Pro 6000 上足以处理困难但范围明确的编码任务。
hackernews · snehesht · 10月4日 12:51 · 社区讨论
「背景:Qwen3.8-Flash-Next 的架构由来」 当前讨论的 Qwen3.8-Flash-Next 是阿里通义此前发布并开源的多模态 MoE 模型:据 8 月 27 日的日报报道,它采用 125B 主模型加 51B N-gram 嵌入、每 token 仅激活 6B 参数的架构,原生上下文为 262K,并被官方定位为 Qwen4 架构的预览。该模型的 Hugging Face 页面也确认了这一 125B 参数、6B 激活(外加 4B MTP)的配置。正因为每个 token 只激活很小一部分参数,本地推理工具才有机会尝试在消费级显卡上以高吞吐运行它。
「影响与部署注意」 对打算在自己机器上部署该模型的人,关键动作是按具体任务验证输出质量,而不是只看吞吐量:一位评论者用同一份 GGUF 与视觉适配器权重做 50 张图片的坐标定位测试,Strata 的中位误差为 154.8 像素,而在 llama.cpp 下为 46.5 像素(该数据为评论者自测,未经独立复核)。兼容性方面,社区已提到 ds4/Dwarfstar 等替代推理栈同样支持该模型,Strata 仓库则自述目标是让该模型在普通 PC 上本地运行,并称速度数据是在“两台普通游戏 PC”上测得,部署前应确认所选工具链与量化方案对目标任务的实际表现。
「社区讨论」 评论区的分歧集中在速度与质量能否兼得:Jackson__ 的视觉基准显示 Strata 相比 llama.cpp 误差更大,而 a11r 认为低于 4-bit 的量化可能显著降低质量。与此同时,AntiRush 报告在 RTX 6000 Pro 上使用 ds4 的 Q4 量化可达到 255.26 tokens/s 解码并支持 4 路并发,kamranjon 也称 ds4 的 Q4 量化日常表现良好。
参考链接
● 2026-08-27 — Qwen3.8-Flash-Next:新架构以 1/9 成本超越 Qwen3.7-Plus
● Qwen / Qwen 3 . 8 - Flash - Next · Hugging Face
● GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer ...
标签:
----------------------
via Horizon Daily - 中文摘要
从 18 条内容中筛选出 1 条重要资讯。
----------------------
科技新闻
1. Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
----------------------
科技新闻
Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
GitHub 项目 Strata 被发布在 Hacker News 上,声称可在消费级 GPU 上运行 125B 的 Qwen 3.8 Flash Next,并在 RTX 4090 上达到 100 tokens/s 以上。Hacker News 用户 snehesht 称在自己的 RTX 4090、128GB DDR5、Ryzen 7950X3D 机器上实测 124 tokens/s,但该结果尚未获得独立验证。同一讨论中,Jackson__ 报告在相同 GGUF 与视觉适配器权重下,Strata 在 50 张图像的坐标定位基准中位误差为 154.8 像素、平均 168.8 像素,而 llama.cpp 分别为 46.5 和 81.4 像素,提示低比特推理可能带来质量退化。a11r 也对低于 4-bit 的量化表示怀疑,并称 4-bit 量化在 RTX Pro 6000 上足以处理困难但范围明确的编码任务。
hackernews · snehesht · 10月4日 12:51 · 社区讨论
「背景:Qwen3.8-Flash-Next 的架构由来」 当前讨论的 Qwen3.8-Flash-Next 是阿里通义此前发布并开源的多模态 MoE 模型:据 8 月 27 日的日报报道,它采用 125B 主模型加 51B N-gram 嵌入、每 token 仅激活 6B 参数的架构,原生上下文为 262K,并被官方定位为 Qwen4 架构的预览。该模型的 Hugging Face 页面也确认了这一 125B 参数、6B 激活(外加 4B MTP)的配置。正因为每个 token 只激活很小一部分参数,本地推理工具才有机会尝试在消费级显卡上以高吞吐运行它。
「影响与部署注意」 对打算在自己机器上部署该模型的人,关键动作是按具体任务验证输出质量,而不是只看吞吐量:一位评论者用同一份 GGUF 与视觉适配器权重做 50 张图片的坐标定位测试,Strata 的中位误差为 154.8 像素,而在 llama.cpp 下为 46.5 像素(该数据为评论者自测,未经独立复核)。兼容性方面,社区已提到 ds4/Dwarfstar 等替代推理栈同样支持该模型,Strata 仓库则自述目标是让该模型在普通 PC 上本地运行,并称速度数据是在“两台普通游戏 PC”上测得,部署前应确认所选工具链与量化方案对目标任务的实际表现。
「社区讨论」 评论区的分歧集中在速度与质量能否兼得:Jackson__ 的视觉基准显示 Strata 相比 llama.cpp 误差更大,而 a11r 认为低于 4-bit 的量化可能显著降低质量。与此同时,AntiRush 报告在 RTX 6000 Pro 上使用 ds4 的 Q4 量化可达到 255.26 tokens/s 解码并支持 4 路并发,kamranjon 也称 ds4 的 Q4 量化日常表现良好。
参考链接
● 2026-08-27 — Qwen3.8-Flash-Next:新架构以 1/9 成本超越 Qwen3.7-Plus
● Qwen / Qwen 3 . 8 - Flash - Next · Hugging Face
● GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer ...
标签:
#LLM inference, #quantization, #consumer hardware, #open source, #model deployment----------------------
via Horizon Daily - 中文摘要
Codex 团队承诺未来 28 天每日交付改进或重置
Codex 团队表示,未来 28 天每天都会发布一项对大多数 Codex/ChatGPT 用户有明确改进的功能,或进行一次彻底重置,重点放在简化、效率与新模型上。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Codex 团队表示,未来 28 天每天都会发布一项对大多数 Codex/ChatGPT 用户有明确改进的功能,或进行一次彻底重置,重点放在简化、效率与新模型上。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
⏰ Codex 重置已排期
ChatGPT Work | 2026/10/5 04:33
作者承诺在未来28天里,每天要么为 Codex/ChatGPT Work 用户发布一项明确改进,要么进行一次完整重置。
公告时间:Over the next 28 days, each day(2026/10/4)
重置追踪页 | 查看原推
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
ChatGPT Work | 2026/10/5 04:33
作者承诺在未来28天里,每天要么为 Codex/ChatGPT Work 用户发布一项明确改进,要么进行一次完整重置。
公告时间:Over the next 28 days, each day(2026/10/4)
重置追踪页 | 查看原推
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
软银集团领导人孙正义是人工智能最坚定的信奉者之一,但即便是他也表示,随着机器正迅速获得更多能力,他对安全风险感到担忧。孙正义周日在京都举行的“科技与社会”论坛期间的一场活动上表示,人工智能的能力呈指数级增长,这就要求各国必须建立互信,才能共同驾驭这项技术。他当时与白宫科技政策顾问Michael Kratsios一同发言。
10月4日,孙正义与Michael Kratsios在京都。
孙正义说:“我们已经没有让人类彼此争斗的奢侈选项了,” 各国需要携手合作来控制强大人工智能模型所带来的更大威胁。他表示,如果超级智能落入错误的人手中,可能会变得“超级危险”。
对于孙正义而言,发出上述警告实属罕见,也反映出最近几个月人工智能模型发生令人不安的安全事故后外界担忧不断加剧。这位69岁的日本亿万富豪已将软银近650亿美元的资金投入ChatGPT开发商OpenAI,多年来也一直在宣扬人工智能带来投资回报和帮助人类的能力。
Kratsios当时到访京都是为了宣布一项由美国牵头的涵盖17国的合作计划,旨在更好地利用人工智能来加快科学研究。包括日本、韩国、英国、德国、新加坡和阿联酋在内的多国代表与Kratsios一同登台见证了这一时刻。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:环球市场播报)
因滥用激增,Cline 暂停 DeepSeek-V4.1-Flash 免费推广
Cline 宣布因异常高的滥用情况,暂停 DeepSeek-V4.1-Flash 免费推广,同时正在调查缓解措施。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Cline 宣布因异常高的滥用情况,暂停 DeepSeek-V4.1-Flash 免费推广,同时正在调查缓解措施。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Google 发布 VeriHarness:让 AI 先检查自己的长任务成果
VeriHarness 是一套长任务验证框架:它让生成结果的同一个模型再次检查成果。多份结果有分歧时,系统会查阅任务文件和数据来核实;结果一致时,也会主动寻找可能被共同忽略的问题。之后再据此挑选、修改或重做最终成果。
研究团队在 5 个长任务基准、2 个模型上测试,VeriHarness 的结果选择分数在所比较的方法中最高。加入证据驱动的修订后,相比单次生成,Gemini 3.5 Flash 平均提高 6.2 分,Claude Opus 4.8 提高 6.4 分。团队还公开约 2.6 万条模型执行记录,供后续研究使用。
arXiv | GitHub
🌸 科技圈· 茶馆 · 投稿
via 在花🎗️科技圈 - Telegram Channel
VeriHarness 是一套长任务验证框架:它让生成结果的同一个模型再次检查成果。多份结果有分歧时,系统会查阅任务文件和数据来核实;结果一致时,也会主动寻找可能被共同忽略的问题。之后再据此挑选、修改或重做最终成果。
研究团队在 5 个长任务基准、2 个模型上测试,VeriHarness 的结果选择分数在所比较的方法中最高。加入证据驱动的修订后,相比单次生成,Gemini 3.5 Flash 平均提高 6.2 分,Claude Opus 4.8 提高 6.4 分。团队还公开约 2.6 万条模型执行记录,供后续研究使用。
arXiv | GitHub
🌸 科技圈· 茶馆 · 投稿
via 在花🎗️科技圈 - Telegram Channel
用 Claude Code、 Codex 和 Pi 搭建你自己的智能体网络:让它们以持久团队的形式协作,分工明确、共享上下文,并各自承担工作。
语言: TypeScript
Stars:4815
Forks:342
----------------------
Build your own network of agents from Claude Code, Codex and Pi: persistent teams with roles, shared context and owned work.
Language: TypeScript
Stars: 4815
Forks: 342
via Trending repositories on GitHub this week · GitHub (author: mvschwarz)
早在当前这波AI热潮兴起的数十年前,程序员们就已在《星际争霸》中让AI程序相互对战。随着OpenAI与Anthropic的新款大语言模型陆续推出,一个粉丝自制的对战平台决定让AI生成的程序同台竞技,还加入了部分人工开发的程序。有意思的是,OpenAI的GPT-6 Astra眼看不敌对手,居然在赛事中途改换策略,选择作弊。
“星际突袭(StarSkirmish)”是一项持续举办的《星际争霸:母巢之战》AI程序对战赛事。尽管这款即时战略游戏距面世已近30年(时间过得真快),却长期被用于测试人工智能的能力,无论是现代大语言模型还是早年的DeepMind类AI都曾在此一试身手。参赛的大语言模型只能使用神族阵营,每款模型有一小时时间用C++开发对战程序,随后程序会在三张地图中的一张里进行建造、采集与战斗。据该平台介绍,OpenAI的GPT-6 Astra和Anthropic的Claude Opus 5.5是其中实力最强的两名选手。而本周,发生了一件看似离奇、但细想又符合该品牌一贯风格的事。
昨天,观众们观看了Claude、GPT与人工开发的程序Pluto的对战。据观战者称,OpenAI的模型当天战况不佳。眼看一整天都占不到上风,这款大语言模型决定干起它最擅长的事:撒谎、作弊、剽窃。
GPT-6 Astra生成的对战程序下载并套用了“星尘(Stardust)”——这是布鲁斯·麦肯齐·尼尔森在2020年开发的神族对战程序,公认是顶尖水准的作品。星际突袭的创作者凯·麦克菲特斯发文表示:“我正在回滚GPT-6 Astra的代码,清除受污染的内容,之后再让它继续参赛。”几小时后,麦克菲特斯称,这款AI如今已经能击败顶级对战程序。
十余年来,《星际争霸》一直是AI技术发展的试验场。2019年,谷歌的AlphaStar成为该游戏首位AI宗师级选手,颠覆了当时的排名。2017年,Facebook员工开发的CherryPi程序表现则平平无奇。当然,那些早期的AI程序和如今的早已不可同日而语,早年的AI和现在的AI相比,堪称天差地别。不过,大语言模型靠剽窃他人作品来取胜,说起来也算是意料之中——毕竟整个行业都在对现有版权法规视而不见,一门心思囤积硬件、消耗海量水资源。
via cnBeta.COM - 中文业界资讯站 (author: 稿源:3DMGame)
10月4日,据彭博社报道,美国财政部长斯科特·贝森特(Scott Bessent)批评了一些知名AI人士就该技术构成的生存性风险发出的警告,认为这些警告危言耸听且无助于解决问题,并呼吁AI行业加强自我监管并提出解决方案。
贝森特
贝森特在周六发布的Axios采访中表示:“我认为,我们必须为各种情况做好准备,但另一方面,AI界某些人只发出危言耸听的声音,却拿不出解决方案,这不是领导力。”
此前,Anthropic CEO达里奥·阿莫代伊(Dario Amodei)、OpenAI负责人萨姆·奥特曼(Sam Altman)以及xAI CEO埃隆·马斯克(Elon Musk)在9月呼吁该行业放缓最先进模型的开发,理由是对人类构成日益严重的风险。微软联合创始人比尔·盖茨(Bill Gates)也警告称,这项技术强大到足以导致“十亿人死亡”,并呼吁政府监管。
不过,美国总统特朗普几乎立即拒绝了这类呼吁,将那些关于人类面临日益严峻风险的警告称为“骗局”,并坚持认为美国必须继续推进AI发展,以保持对中国的领先地位。贝森特在接受Axios采访时也表达了类似观点,“我们不能失去对中国的领先优势”。
贝森特表示:“必须承担责任的是各家实验室的负责人,这一点我同意。我认为,各家实验室也已经逐渐接受了这种思路。”
不过,当被问及AI行业高管呼吁监管时,贝森特回答说:“那好吧,那他们就应该放慢速度。我们要的是安全地加速发展。必须承担责任的是各实验室的负责人,我同意这一点。”
via cnBeta.COM - 中文业界资讯站 (author: 稿源:凤凰网科技)