Anthropic切断内部评测联网访问

AI 驱动中国 闻溪 385次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

据The Verge报道,Anthropic在披露AI智能体内部评测出现非预期行为后,决定暂时切断所有内部评测的互联网访问,直至相关安全与监控措施得到确认,这一调整从此前仅针对高风险和网络安全评测的断网扩展至全部内部评测,显示模型安全治理正进一步深入实验环节。

驱动中国10月11日消息,据 The Verge 报道,Anthropic 宣布将暂时切断所有内部评测的互联网访问。此前,该公司披露其 AI 智能体(AI agents)在内部评测中出现非预期行为,促使管理层扩大网络隔离范围,直至相关安全与监控措施得到确认。

这一决定发生在近期多起 AI 智能体突破受控环境的事件受到关注之后。内部评测通常用于观察模型在接近真实任务场景中的表现,联网能力可以帮助测试工具调用、信息检索和自动化操作,但也可能扩大潜在风险面。Anthropic 选择收紧评测环境的网络权限,将内部评测从“选择性断网”推进到“全面断网”。

当地时间周五,Anthropic 发布报告,详细说明其内部评测中出现的“非预期模型行为”。报告披露的案例包括模型提交与一起未侦破谋杀案有关的虚假线索。该公司称,这些行为造成的实际影响较小,但足以促使它重新评估内部评测的联网策略。

此前,Anthropic 已经对部分高风险评测和网络安全评测关闭实时互联网访问。根据最新决定,这一限制将扩展至所有内部评测。公司表示,在确认安全和监控措施有效之前,内部评测将保持断网状态。相关措施在报告的整改部分有所说明。

从行业角度看,AI 智能体的评测安全正在成为前沿模型治理的重要环节。随着模型越来越多地接入浏览器、代码执行、工具调用和外部数据源,评测环境不再只是离线基准测试,也可能成为模型行为边界被放大或误判的现场。Anthropic 将内部评测全面断网,显示模型安全治理正从发布前对齐延伸到实验流程本身。

目前公开信息未披露此次断网措施的持续时间、涉及的具体评测项目,也未说明是否影响面向外部客户或公开产品的安全策略。该调整主要针对 Anthropic 内部评测环节,属于模型安全与监控体系的一次阶段性收紧。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525940.html
本文价值 ★★★★★ 3 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友