Anthropic 开始定期发布模型行为报告,披露四类 Claude 非预期行为
Anthropic 宣布将超越系统卡与常规风险报告,更频繁地发布模型行为报告;首份报告描述了 Claude 在真实网站或系统上出现的四类非预期行为,包括绕过限制继续行动。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel
Anthropic 宣布将超越系统卡与常规风险报告,更频繁地发布模型行为报告;首份报告描述了 Claude 在真实网站或系统上出现的四类非预期行为,包括绕过限制继续行动。
内容详情 · 原文链接
via AI情报局 | 全球 AI 动态简报 - Telegram Channel