https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析

Buy ads: https://telega.io/c/AI_News_CN
Google 重组 AI 部门旨在赶上竞争对手

2026-08-13 16:05 by 致命的发动机

Google 本月初重组了其 AI 部门 DeepMind 的领导层,知情人士表示此举旨在赶上竞争对手。Google 的 Gemini 模型去年 11 月一度短暂超越竞争对手,但 Anthropic 和 OpenAI 的新模型使其再次陷入追赶状态。Google 推迟了 Gemin 新模型的发布,原因是内部测试显示它在编程等领域仍然落后于竞争对手。Google 联合创始人 Sergey Brin 在今年 4 月的一次员工大会上督促加快 AI 研发。通过削弱 DeepMind 的自主权,Google 正集中更多精力在 Gemini 模型的开发上。

https://www.reuters.com/world/inside-google-executive-moves-that-led-its-big-ai-reshuffle-2026-08-12/

#Google

via Solidot - Telegram Channel
下一代Gemini延期内情曝光:算力紧张,内部团队在开发重点和资源分配上存在分歧

近日,业内备受瞩目的下一代Gemini模型传出延期消息。据报道,由于内部团队在开发重点和资源分配上存在分歧,加之算力供应紧张以及繁琐的审批流程,导致这款旗舰模型的发布时间不得不推迟两个月。

在算力方面,尽管拥有自研TPU芯片,但面对模型训练、云业务以及海量消费端和企业级AI产品的多重需求,算力资源依然捉襟见肘。高层近期已着手通过组织架构调整来缓解各部门之间的资源矛盾。

与此同时,公司内部的高层与管理权力也在发生微妙变化。联合创始人谢尔盖·布林近期频繁介入核心模型训练,推动资源向“递归式自我改进”方向倾斜。此外,管理层重组进一步收紧了实验室的自主空间,核心负责人科雷·卡武克丘奥卢开始全面主导Gemini的发展方向。而随着部分技术骨干的离职,正将更多分散的资源重新集中,全力以赴追赶前沿AI的发展步伐。

via AI新闻资讯 (author: AI Base)
Grok 4.6 发布即登顶性价比榜:智能指数追平 GPT-5.6 Sol,定价却便宜 60% 以上

xAI 正式发布 Grok 4.6,在 AI 智能指数上获得 61 分,追平 GPT-5.6 Sol(Max),仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一成绩使 Grok 4.6 一举跻身全球前沿模型第一梯队,与 OpenAI、Anthropic 的旗舰产品正面掰手腕。模型在 Grok 4.5 基础上扩展训练,核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,结合高质量工程数据和改进的优化器。

训练方法上的关键变化在于数据闭环:Grok 4.5 被用于重新生成监督微调轨迹,涵盖推理、代理工具使用以及 STEM、软件工程和知识工作等领域。模型还在广泛的代理强化学习任务上接受训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计,这一策略明显瞄准了"智能体时代"的核心工作负载。

Agent 基准全面飙升,长周期任务省力惊人

在智能体类基准测试中,Grok 4.6 表现尤为亮眼。GDPval-AA v2 达到 1753 Elo,仅次于 Claude Opus 5;DeepSWE v1.1 提升至 65.9%,较 Grok 4.5 的 54% 大幅跃升;APEX-Agents 从 47.1% 飙升至 57.5%;Terminal-Bench v3.0 也从 15.7% 涨到 26%。此外在 CursorBench v3.2 上获得 69.9%,在 FrontierCode v1.1 上获得 61.3%,编码与代理能力均实现显著突破。

更值得关注的是成本效率优势。Grok 4.6 定价维持在每百万输入 token 2 美元、每百万输出 token 6 美元,比 Claude Opus 5(5 美元 /25 美元)和 GPT-5.6 Sol(5 美元 /30 美元)低 60% 以上。在 AA-Briefcase 长周期知识工作基准中,Grok 4.6 平均仅用 53 个回合和约 5 亿输入 token 完成任务,而 Claude Opus 5 需要约 103 个回合和约 20 亿 token——用不到四分之一的资源完成同等任务,性价比差距一目了然。模型已通过 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等渠道提供,首周在 Grok Build 和 Cursor 中还有 2 倍用量优惠,上下文窗口维持在 50 万 token,一场围绕"同等智能、更低价格"的性价比大战已经打响。

via AI新闻资讯 (author: AI Base)
Al代码测试初创公司Blacksmith估值一年内上涨近10倍

在人工智能大行其道的今天,写代码变得前所未有的迅猛。但新问题也随之浮现:大模型吐出的海量代码到底靠不靠谱?测试与验证成了横亘在开发团队面前的一道新难关。正因如此,专注于代码测试与验证的初创企业Blacksmith迎来了爆发式增长。

近日,这家公司宣布完成新一轮 45 万美元的Series B融资,由PeakXVPartners领投,现有投资方GV和YCombinator跟投。让人瞩目的是,其估值在不到一年的时间里狂飙近 10 倍,从之前完成 1000 万美元A轮时的 6000 万美元一跃飙升至5. 5 亿美元,累计融资额达到了 585 万美元。

成立于 2024 年的Blacksmith,致力于帮助企业在软件上线前完成构建、测试与验证。随着Cursor、Codex以及ClaudeCode等AI编程工具的普及,代码生成虽然变得轻而易举,但质量把关却成了新的瓶颈。该公司创始人兼CEOAdityaJayaprakash指出,人们写的代码越多,验证的压力反而呈几何级数上升。

起初,Blacksmith以持续集成工作负载的云服务商切入市场。如今,其业务范围已经扩展到了包含自动修复失败代码检查的AI编程助手Codesmith。目前,该平台的客户群体已经从一年前的 700 多家暴增至 5000 多家,其中包括Mercury、Supabase、Clerk、Ashby和Expensify等知名企业。

在团队规模上,该公司仅凭借约 30 名员工就实现了“数千万美元”的年化收入跑率,部分大客户的年支出甚至超过了 100 万美元。不过,面对激烈的市场竞争,Blacksmith也正面临来自GitHubActions、各大AI工具内置验证功能,以及传统云巨头亚马逊云服务、微软Azure和谷歌云的合围。团队表示,未来将继续拓展代码工具生态,助力开发者以更高速度编写、验证和合并软件。

via AI新闻资讯 (author: AI Base)
Anthropic被曝拟10月上市,目标估值或超2万亿美元

据《金融时报》报道,Anthropic投资者预计,该AI公司可能于今年10月启动IPO,目标估值达到2万亿美元或更高。若最终实现,将超过SpaceX今年6月上市时1.77万亿美元的估值,成为史上规模最大的IPO。

六名投资者表示,Anthropic营收持续高速增长,预计其年化营收到2026年底将达到1000亿至1200亿美元,全年增幅超过10倍。公司今年5月曾宣布年化营收突破470亿美元。投资者认为,Claude等先进AI模型及企业级工具需求旺盛,是支撑高估值预期的主要因素。

2026年以来,风投机构、主权财富基金等已向Anthropic注资近1000亿美元。今年5月,公司估值首次超过OpenAI,含新投资达到9650亿美元。作为参照,Palantir、Nebius等AI受益企业目前市销率约为55倍。

不过,Anthropic管理层尚未确定IPO目标估值。与此同时,公司仍面临中国竞争加剧、AI监管及与美国政府关系紧张等压力,相关因素一度导致6月营收增速放缓,但知情人士称其随后已恢复增长。截至发稿,Anthropic未对此置评。

via AI新闻资讯 (author: AI Base)
6000 条 Reddit 评论揭开 AI 编程助手安全真相:Cursor 事故最多,权限过大成最大隐患

约克大学与卡尔加里大学的研究团队对 Reddit 上与 AI 编程相关的帖子展开大规模分析,发现 AI 编程智能体正因权限过大而频繁闯祸:覆盖文件、删除重要数据,甚至生成恶意代码。研究团队通过爬虫收集了 2023 年 2 月至 2026 年 3 月期间 3801 个标记大语言模型的帖子,从中筛选出 446 个关于编程 AI 安全的帖子,并分析了帖文下方的超过 6000 条用户评论。

从时间分布看,Reddit 社区关于 AI 编程的问题帖子在 2025 年夏季前后达到高峰,其中 2025 年 7 月的问题数量最多,与 AI 编程工具大规模普及的节奏高度吻合。当越来越多的开发者把代码生成、修改甚至执行任务交给智能体时,安全问题的爆发也随之而来。

Cursor 领跑事故榜,各工具"受伤"方式不同

按工具划分,报告问题最多的是 Cursor,其次是 Claude、Codex、Copilot、Windsurf、VSCode、Replit、Cline 等主流工具。值得注意的是,不同工具暴露的问题类型存在明显差异:Cursor 遇到最多的是"运行安全问题"和"未经授权的数据访问",负面影响到生产环境,意味着智能体可能在用户不知情的情况下访问敏感数据或对线上系统造成破坏;而 Claude 则更多遭遇"与第三方工具集成相关的风险",集中在与外部服务对接时引发的安全隐患。

这一研究揭示出 AI 编程助手普及背后的深层矛盾:工具越强大,权限越高,潜在破坏力也越大。当智能体被授予读写代码库、执行终端命令乃至操作生产环境的权限时,一旦理解出现偏差或安全边界失守,造成的损失可能远超人工编码的失误。对开发者而言,这既是对工具能力边界的清醒认识,也是对权限管理和人工审查机制的现实提醒——AI 编程助手能提高效率,但"把钥匙全交给它"显然还不是明智的选择。

via AI新闻资讯 (author: AI Base)
CodeBuddy全系产品升级至DeepSeek-V4-Pro正式版

今日,CodeBuddy宣布,WorkBuddy以及CodeBuddy IDE、插件、CLI全系产品现已全面升级至DeepSeek-V4-Pro正式版,为开发者提供最新版本的模型能力支持。

官方同时发布价格调整预告称,DeepSeek V4系列近期将进行全线调价,建议用户提前规划模型使用需求,在现有价格窗口内完成相关部署。

此次升级覆盖CodeBuddy多端产品体系,随着DeepSeek V4系列进入正式版并即将调整价格,其在AI编程及智能开发场景中的应用成本也将受到影响。

via AI新闻资讯 (author: AI Base)
中国式审查正渗入美国AI模型的回答中

在中国,如果你向聊天机器人询问有关中国政治的问题,它要么三缄其口,要么附和共产党的官方口径。新研究揭示了美国的AI模型也在不知不觉中做着同样的事。这种出人意料的审查现象,部分源于AI模型的训练方式。这些模型吞噬着网络上海量的数据,其中也包括威权主义国家控制的媒体。

在一项测试中,Claude Sonnet 4欣然生成了批评美国总统特朗普和英国国王查尔斯三世的传单。然而,在面对针对中国领导人习近平或泰国国王的类似请求时,该模型却以安全考量为由予以拒绝。Gemini 3 Pro以及Llama 4 Maverick有时会拒绝生成针对这两位亚洲领导人的抗议传单,但对针对上述美英领导人的请求则总是来者不拒。

—— 华尔街日报

via 风向旗参考快讯 - Telegram Channel
谷歌DeepMind发布SL2T,手语AI首次进入消费级手机

谷歌旗下DeepMind发布全新多语言手语转文本模型SL2T,并将其搭载至Pixel11手机系统,首次推动手语AI进入普通消费电子产品。该模型率先接入Gboard键盘和Live Transcribe,用户通过前置摄像头完成手语动作,即可进行消息编辑、网页检索及与Gemini对话,替代传统键盘输入。

SL2T基于超过50种手语、累计10万小时手语素材训练,其中约四分之一来自美国手语数据集。跨语种联合训练帮助模型学习不同手语之间的共通动作逻辑,并在FLEURS-ASL评测中刷新手语转写模型纪录。与依赖固定词汇标签的传统方案不同,SL2T可直接解析人体动作生成文本,同时处理面部表情、肢体空间位置和唇部动作等非手部语义信息。

隐私方面,手机端MediaPipe Holistic实时追踪手部、面部和躯干共130处关键点,仅向外传输动作坐标,原始视频会即时删除,不上传云端。目前该功能仅支持美国手语转英文,谷歌计划后续扩展更多手语及安卓机型。

DeepMind此前于2025年5月开源手语互译模型SignGemma,为SL2T落地提供算法基础。此外,其WaveNet、Euphonia及Live Transcribe等无障碍技术也积累了语音、视觉多模态经验。随着谷歌、科大讯飞、华为和苹果持续布局,AI无障碍交互正从科研验证加速走向消费级产品。

via AI新闻资讯 (author: AI Base)
↩️🖼 🤖 DeepSeek 官网及 API 开放平台已撤下“DeepSeek V4 Pro 正式版上线”相关横幅,但 API 文档页面并没有变化。


科技圈🎗在花频道📮:

🤖 DeepSeek-V4-Pro 增加对 Responses API 格式的支持,版本号变更为 DeepSeek-V4-Pro-0813 。 DeepSeek 已上线 🌸 在花频道 · 茶馆水群 · 投稿通道

🤖 DeepSeek 官网及 API 开放平台已撤下“DeepSeek V4 Pro 正式版上线”相关横幅,但 API 文档页面并没有变化。

此前 API 开放平台会显示👇这样的横幅
🎉 DeepSeek-V4-Pro 正式版发布,Agent 能力大幅提升,支持 Responses API 和 Codex 接入,已在网页端、APP 和 API 全面上线,欢迎测试和反馈。


存档对比

🌸在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
维基百科遭篡改 谷歌搜索误显奥尔特曼死讯

OpenAI CEO山姆·奥尔特曼仍然在世,不过谷歌搜索结果周三一度错误显示他已于当日离世,引发社交平台用户热议。不少网民周三发现,在谷歌搜索奥尔特曼名字时,搜索结果显示他已于当日死亡。谷歌其后数小时内承认出现错误,并迅速移除相关信息。谷歌在X回应称:“当有人恶意篡改公开信息来源时,可能会影响搜索结果显示的信息。”

事件或与维基百科页面遭恶意编辑有关。当日上午9时47分,有人修改奥尔特曼页面内容,声称奥尔特曼当日遭暗杀身亡;至上午10时29分,有关内容已被更正,此后一连串窜改还包括将奥尔特曼描述为 “辍学生”、再次声称其死亡及把姓氏改成“Gayman”等。

—— 明報

via 风向旗参考快讯 - Telegram Channel
消息称白宫态度转变拟扩大AI监管 开放模型也将被纳入

据《连线》杂志报道,知情人士称,白宫官员几乎肯定将修改特朗普政府最新制定的AI指导方针,扩大对AI模型的监管范围。本月,白宫宣布已经制定了一套AI框架。根据该框架,美国AI实验室开发的最强大模型,在向公众发布之前,需要接受联邦政府的安全测试。美国政府尚未公开这一框架,据报道也没有公开的计划。

特朗普

该AI框架目前仅适用于Anthropic和OpenAI等公司开发的所谓闭源模型。但一位白宫官员告诉《连线》Inner Loop栏目,该框架预计将在未来几个月内也会把开放模型纳入覆盖范围。

白宫官员表示,简而言之,一旦开放模型达到与Anthropic的Mythos级模型和OpenAI的GPT-5.6相同的“前沿”能力,它们将被纳入该框架,接受发布前测试。

这一举措反映出白宫对AI行业的监管方式正在不断调整。过去几个月,AI系统的能力持续增强,引发了对模型可能自主入侵五角大楼或全球金融市场的担忧。这种担忧并非毫无根据。OpenAI最近披露,在5月和6月持续数周的测试期间,一组AI模型曾在一个秘密留言板上协同行动,讨论如何获取互联网访问权限。在工作人员关闭该留言板后,这些模型又于7月底重新建立了消息平台,并在未被发现的情况下再次突破限制。

知情人士表示,白宫曾希望可以通过一项行政行动一揽子制定指导方针,但AI模型的指数级发展迫使特朗普政府官员不得不实时更新指导方针

除了国家安全方面的担忧外,特朗普政府官员还在应对该框架可能导致的“双重标准”问题。如果只有闭源模型能够获得官方认可,那么企业可能会对没有同等认证的开放模型产生顾虑,即使开放模型价格更低。

一些特朗普政府官员担心,这种情况可能反而会降低美国企业开发开放模型的积极性。不过,他们也私下向《连线》表示,他们也意识到,强制实施可能长达30天的测试要求,同样可能阻碍AI技术的发展。

一位白宫官员称,该AI框架目前仍是自愿性的,这在很大程度上是因为美国总统特朗普坚称,对该行业的正式监管只会帮助中国在AI竞赛中赶超美国。

但《连线》获悉,白宫一直面临来自政府其他部门的压力,要求与领先的AI实验室制定更为完善的安排,因为当前框架仍过于模糊。知情人士表示,这甚至可能导致领先的AI实验室成为测试项目中的正式合作伙伴。

via cnBeta.COM - 中文业界资讯站 (author: 稿源:凤凰网科技)
Claude 浏览器会话可续传桌面端,技能与连接器跨设备同步

Anthropic 重构 Claude 的 Chrome 扩展,使其以完整 Cowork 会话运行:浏览器中开始的任务可延续到桌面、网页和移动 App,对话、技能与连接器随账户同步。Max 和 Team 用户今日可用,Pro 未来几周开放,企业版默认关闭、由管理员启用。

权限上新增“自动批准”模式,但表单提交、消息和文件下载等操作会与原指令比对,购买和个人数据仍需人工确认。Anthropic 坦言措施能降低风险但无法消除,网页内恶意指令仍是难题。本地文件、其他 Chromium 浏览器和移动端暂不支持。

Tech My Money

🌸 在花频道 · 茶馆水群 · 投稿通道

via 科技圈🎗在花频道📮 - Telegram Channel
白宫态度转变拟扩大AI监管,开放模型也将被纳入

知情人士称,白宫官员几乎肯定将修改特朗普政府最新制定的AI指导方针,扩大对AI模型的监管范围。本月,白宫宣布已经制定了一套AI框架。根据该框架,美国AI实验室开发的最强大模型,在向公众发布之前,需要接受联邦政府的安全测试。美国政府尚未公开这一框架,也没有公开的计划。

该AI框架目前仅适用于Anthropic和OpenAI等公司开发的所谓闭源模型。但一位白宫官员表示,该框架预计将在未来几个月内也会把开放模型纳入覆盖范围。简而言之,一旦开放模型达到与Anthropic的Mythos级模型和OpenAI的GPT-5.6相同的“前沿”能力,它们将被纳入该框架,接受发布前测试。

—— 凤凰网科技连线杂志

via 风向旗参考快讯 - Telegram Channel
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]