https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
彭博:DeepSeek新模型发力,中美顶尖AI跑分差距缩小
彭博行业研究称,过去几个月,随着深度求索(DeepSeek)等中国AI实验室的模型不断进步,美国AI公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。
彭博行业研究高级分析师罗伯特·利亚在周一的一份报告中写道,在DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手3%。这一差距较5月份的约9%和今年早些时候的15%有所收窄。他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
彭博行业研究称,过去几个月,随着深度求索(DeepSeek)等中国AI实验室的模型不断进步,美国AI公司相对中国同行的性能领先优势急剧缩小,降至历史最低水平,这让美国的科技主导地位面临威胁。
彭博行业研究高级分析师罗伯特·利亚在周一的一份报告中写道,在DeepSeek 9月发布V4.1 Flash之后,中国顶尖模型在基准测试得分上仅落后美国竞争对手3%。这一差距较5月份的约9%和今年早些时候的15%有所收窄。他表示,这种性能的持续提升意味着中国竞争者将进一步扩大市场份额。
—— 凤凰网科技、彭博社
via 风向旗参考快讯 - Telegram Channel
Horizon Summary: 2026-10-05 (ZH)
----------------------
科技新闻
1. Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
----------------------
科技新闻
Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
GitHub 项目 Strata 被发布在 Hacker News 上,声称可在消费级 GPU 上运行 125B 的 Qwen 3.8 Flash Next,并在 RTX 4090 上达到 100 tokens/s 以上。Hacker News 用户 snehesht 称在自己的 RTX 4090、128GB DDR5、Ryzen 7950X3D 机器上实测 124 tokens/s,但该结果尚未获得独立验证。同一讨论中,Jackson__ 报告在相同 GGUF 与视觉适配器权重下,Strata 在 50 张图像的坐标定位基准中位误差为 154.8 像素、平均 168.8 像素,而 llama.cpp 分别为 46.5 和 81.4 像素,提示低比特推理可能带来质量退化。a11r 也对低于 4-bit 的量化表示怀疑,并称 4-bit 量化在 RTX Pro 6000 上足以处理困难但范围明确的编码任务。
hackernews · snehesht · 10月4日 12:51 · 社区讨论
「背景:Qwen3.8-Flash-Next 的架构由来」 当前讨论的 Qwen3.8-Flash-Next 是阿里通义此前发布并开源的多模态 MoE 模型:据 8 月 27 日的日报报道,它采用 125B 主模型加 51B N-gram 嵌入、每 token 仅激活 6B 参数的架构,原生上下文为 262K,并被官方定位为 Qwen4 架构的预览。该模型的 Hugging Face 页面也确认了这一 125B 参数、6B 激活(外加 4B MTP)的配置。正因为每个 token 只激活很小一部分参数,本地推理工具才有机会尝试在消费级显卡上以高吞吐运行它。
「影响与部署注意」 对打算在自己机器上部署该模型的人,关键动作是按具体任务验证输出质量,而不是只看吞吐量:一位评论者用同一份 GGUF 与视觉适配器权重做 50 张图片的坐标定位测试,Strata 的中位误差为 154.8 像素,而在 llama.cpp 下为 46.5 像素(该数据为评论者自测,未经独立复核)。兼容性方面,社区已提到 ds4/Dwarfstar 等替代推理栈同样支持该模型,Strata 仓库则自述目标是让该模型在普通 PC 上本地运行,并称速度数据是在“两台普通游戏 PC”上测得,部署前应确认所选工具链与量化方案对目标任务的实际表现。
「社区讨论」 评论区的分歧集中在速度与质量能否兼得:Jackson__ 的视觉基准显示 Strata 相比 llama.cpp 误差更大,而 a11r 认为低于 4-bit 的量化可能显著降低质量。与此同时,AntiRush 报告在 RTX 6000 Pro 上使用 ds4 的 Q4 量化可达到 255.26 tokens/s 解码并支持 4 路并发,kamranjon 也称 ds4 的 Q4 量化日常表现良好。
参考链接
● 2026-08-27 — Qwen3.8-Flash-Next:新架构以 1/9 成本超越 Qwen3.7-Plus
● Qwen / Qwen 3 . 8 - Flash - Next · Hugging Face
● GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer ...
标签:
----------------------
via Horizon Daily - 中文摘要
从 18 条内容中筛选出 1 条重要资讯。
----------------------
科技新闻
1. Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
----------------------
科技新闻
Strata 在 RTX 4090 上以 100+ tokens/s 运行 125B Qwen 3.8 Flash Next ⭐️ 7.0/10
GitHub 项目 Strata 被发布在 Hacker News 上,声称可在消费级 GPU 上运行 125B 的 Qwen 3.8 Flash Next,并在 RTX 4090 上达到 100 tokens/s 以上。Hacker News 用户 snehesht 称在自己的 RTX 4090、128GB DDR5、Ryzen 7950X3D 机器上实测 124 tokens/s,但该结果尚未获得独立验证。同一讨论中,Jackson__ 报告在相同 GGUF 与视觉适配器权重下,Strata 在 50 张图像的坐标定位基准中位误差为 154.8 像素、平均 168.8 像素,而 llama.cpp 分别为 46.5 和 81.4 像素,提示低比特推理可能带来质量退化。a11r 也对低于 4-bit 的量化表示怀疑,并称 4-bit 量化在 RTX Pro 6000 上足以处理困难但范围明确的编码任务。
hackernews · snehesht · 10月4日 12:51 · 社区讨论
「背景:Qwen3.8-Flash-Next 的架构由来」 当前讨论的 Qwen3.8-Flash-Next 是阿里通义此前发布并开源的多模态 MoE 模型:据 8 月 27 日的日报报道,它采用 125B 主模型加 51B N-gram 嵌入、每 token 仅激活 6B 参数的架构,原生上下文为 262K,并被官方定位为 Qwen4 架构的预览。该模型的 Hugging Face 页面也确认了这一 125B 参数、6B 激活(外加 4B MTP)的配置。正因为每个 token 只激活很小一部分参数,本地推理工具才有机会尝试在消费级显卡上以高吞吐运行它。
「影响与部署注意」 对打算在自己机器上部署该模型的人,关键动作是按具体任务验证输出质量,而不是只看吞吐量:一位评论者用同一份 GGUF 与视觉适配器权重做 50 张图片的坐标定位测试,Strata 的中位误差为 154.8 像素,而在 llama.cpp 下为 46.5 像素(该数据为评论者自测,未经独立复核)。兼容性方面,社区已提到 ds4/Dwarfstar 等替代推理栈同样支持该模型,Strata 仓库则自述目标是让该模型在普通 PC 上本地运行,并称速度数据是在“两台普通游戏 PC”上测得,部署前应确认所选工具链与量化方案对目标任务的实际表现。
「社区讨论」 评论区的分歧集中在速度与质量能否兼得:Jackson__ 的视觉基准显示 Strata 相比 llama.cpp 误差更大,而 a11r 认为低于 4-bit 的量化可能显著降低质量。与此同时,AntiRush 报告在 RTX 6000 Pro 上使用 ds4 的 Q4 量化可达到 255.26 tokens/s 解码并支持 4 路并发,kamranjon 也称 ds4 的 Q4 量化日常表现良好。
参考链接
● 2026-08-27 — Qwen3.8-Flash-Next:新架构以 1/9 成本超越 Qwen3.7-Plus
● Qwen / Qwen 3 . 8 - Flash - Next · Hugging Face
● GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer ...
标签:
#LLM inference, #quantization, #consumer hardware, #open source, #model deployment----------------------
via Horizon Daily - 中文摘要
Codex 团队承诺未来 28 天每日交付改进或重置
Codex 团队表示,未来 28 天每天都会发布一项对大多数 Codex/ChatGPT 用户有明确改进的功能,或进行一次彻底重置,重点放在简化、效率与新模型上。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Codex 团队表示,未来 28 天每天都会发布一项对大多数 Codex/ChatGPT 用户有明确改进的功能,或进行一次彻底重置,重点放在简化、效率与新模型上。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel