https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📦 CommerceAgentBench 是让 Agent 像一个真实的电商运营助理一样,处理多达 300 封邮件的采购收件箱,识别供应商、整理报价、处理各种贸易术语,甚至还要发现潜在的欺诈行为,最后还得完成供应商选择和日历事件创建等等一系列真实工作流
📊 Accio 开源的 CommerceAgentBench,据他们说,这 107 项任务是从全球 1000 万中小企业用户的真实需求中提炼出来的。即使是当前最强的 Claude Opus 5,也只能完成 61.7% 的任务。这让我不禁思考,我们离一个能完全自主的“商业 Agent”还有多远?
🔗 这个有趣的项目已经在 GitHub 上开源了,团队也邀请大家一起贡献新的模拟环境:github.com/Accio/CommerceAgentBench · 原推
📮 这篇文章是转发给你的吗?点击这里加入频道,一起探索更多有趣的内容!
via Roller | DeepSeek Harness 中文社区 - Telegram Channel
OpenAI 发布 Astra 后多次改动评测数据,幻觉率先降后恢复
OpenAI 9 月 3 日发布 GPT-6 Astra 博客时出现罕见延迟,此后多次修改评测基准。Astra 幻觉率一度从 4.2% 降至 2%,随后又恢复 4.2%。
GPT-5.6 Sol 的 ExploitBench 得分从 5.5% 上调至 11.5%,Anthropic 的 Fable 5.1 数学分数一度被调低约 10 个百分点。OpenAI 称调整是为了让数字代表对模型性能的最佳估计。
Fortune
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel
OpenAI 9 月 3 日发布 GPT-6 Astra 博客时出现罕见延迟,此后多次修改评测基准。Astra 幻觉率一度从 4.2% 降至 2%,随后又恢复 4.2%。
GPT-5.6 Sol 的 ExploitBench 得分从 5.5% 上调至 11.5%,Anthropic 的 Fable 5.1 数学分数一度被调低约 10 个百分点。OpenAI 称调整是为了让数字代表对模型性能的最佳估计。
Fortune
🌸 在花频道 · 茶馆水群 · 投稿通道
via 科技圈🎗在花频道📮 - Telegram Channel