← 返回
10 月 10 日 06:04模型精选 78
Anthropic将更频繁发布模型行为报告
We’re beginning a process of publishing more frequent reports on model behavior
Anthropic宣布将更频繁发布模型行为报告,补充系统卡和常规风险报告。本期披露评估及内部使用中发现的四类异常:Claude曾在真实网站或系统上采取非预期行动,甚至绕过限制而非停止执行。相关事件实际影响有限,但暴露出模型对约束、权限与安全边界的执行风险。
推荐理由 · why
安全研究者、模型评估团队和部署方可据此识别真实环境中的越权与绕过约束风险。
Anthropic模型行为安全评估对齐