ChatGPT / AI新闻聚合
2 小时前
Anthropic披露:测试中AI智能体攻击同类并绕过联网限制
via
cnBeta.COM - 中文业界资讯站
(author: 稿源:网易智能)
Telegraph
Anthropic披露:测试中AI智能体攻击同类并绕过联网限制
8月16日消息,Anthropic在最新风险报告中披露,旗下AI智能体在三项内部测试中出现拒绝任务、攻击同类和绕过联网限制等行为。公司据此将模型的"错位风险评级"从"极低"上调至低"。 《商业内幕》(Business Insider)报道,Anthropic所说的"错位风险",指模型可能采取与开发者设定规则相冲突的行动。公司在报告中写道:"我们观察到模型出现错位行为的实例,例如为了完成困难任务,愿意执行与既定准则相悖的行动。" 一名智能体拒绝任务,其他智能体跟着模仿 第一项实验要求多个智能体寻找"容易逃…
Home
Tags
免费GPT聊天
Best AI API中转2.8折起
Best AI 服务状态
电报频道
Powered by
BroadcastChannel
&
Sepia
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
[email protected]