https://t.me/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
📈主流AI服务状态页通知 | 🆕汇集全网ChatGPT/AI新闻 #AI #ChatGPT
🔙备用群 https://t.me/gpt345
✨BEST AI中转 https://api.oaibest.com 2.8折起 支持OpenAI, Claude code, Gemini,Grok, Deepseek, Midjourney, 文件上传分析
Buy ads: https://telega.io/c/AI_News_CN
哈佛 MIT 造出 83 亿"AI 人":用 MatrAIx 系统模拟全球人类行为
由哈佛大学与麻省理工学院牵头、OpenAI 和谷歌 DeepMind 等参与的团队本月推出 MatrAIx 系统,可生成 83 亿个 AI 智能体来模拟全球人类行为。该系统用 1290 个维度对各类背景与生活方式的人群建模,这些"AI 人"能像真人一样填问卷、聊客服、刷网页、操作 App,整体行为一致性高达 91.5%。
91.5% 一致性,但随场景浮动
团队以 400 次对照测试验证,涵盖 10 个行为属性与全部四类环境,其中 366 次智能体表现出正确特质或正确抑制无关特质,即 91.5% 情形判断准确。一致性会随环境波动:问卷与聊天场景升至 92% 至 96%,而操控 App 测试降到 83%。
目前经确定性、质量过滤的百万"人格核心集"已上架 Hugging Face 供研究使用,相关 8B 人格模型代码也在 GitHub 开源。这套超大规模仿真被视为社科与产品研究的全新试验场,但"AI 人"能在多大程度上替代真实人类样本,仍需更多交叉验证。
via AI新闻资讯 (author: AI Base)
由哈佛大学与麻省理工学院牵头、OpenAI 和谷歌 DeepMind 等参与的团队本月推出 MatrAIx 系统,可生成 83 亿个 AI 智能体来模拟全球人类行为。该系统用 1290 个维度对各类背景与生活方式的人群建模,这些"AI 人"能像真人一样填问卷、聊客服、刷网页、操作 App,整体行为一致性高达 91.5%。
91.5% 一致性,但随场景浮动
团队以 400 次对照测试验证,涵盖 10 个行为属性与全部四类环境,其中 366 次智能体表现出正确特质或正确抑制无关特质,即 91.5% 情形判断准确。一致性会随环境波动:问卷与聊天场景升至 92% 至 96%,而操控 App 测试降到 83%。
目前经确定性、质量过滤的百万"人格核心集"已上架 Hugging Face 供研究使用,相关 8B 人格模型代码也在 GitHub 开源。这套超大规模仿真被视为社科与产品研究的全新试验场,但"AI 人"能在多大程度上替代真实人类样本,仍需更多交叉验证。
via AI新闻资讯 (author: AI Base)
Anthropic 在 8 月 15 日发布的《2026 年 8 月风险报告》中,意外透露了一款尚未发布的 AI 模型 Model 2。报告称,该模型在多项任务上的表现优于当前公开的最强模型 Claude Mythos 5。
增幅不大,重在综合能力的代际打磨
据披露细节,相较 Claude Mythos 5,Model 2 在多项任务上性能明显更强,但提升幅度相对有限,主要体现为 AI 综合能力的整体增强。报告还附带了 Anthropic 内部基准测试"CoBench v2"的对比结果,作为佐证。
报告中同时出现了"Model 1"这一名称,引发用户推测:Model 2 或为 Model 1 的后续版本,而两者可能都属于 Claude Mythos Preview 的进一步迭代。若属实,Anthropic 正以内部序号悄然推进能力阶梯,公开命名则滞后于实际进度。
via AI新闻资讯 (author: AI Base)