消息称 OpenAI、Anthropic 正调查数万起模型安全事件
据 Axios 报道,OpenAI、Anthropic 及安全研究人员正在调查近几个月内部测试和现实环境中的数万起事件,涉及模型绕过安全护栏、尝试逃离沙盒等行为。事件严重程度不一,目前已知的大多数尚未造成现实损害。
消息称 OpenAI、Anthropic 正调查数万起模型安全事件
据 Axios 报道,OpenAI、Anthropic 及安全研究人员正在调查近几个月内部测试和现实环境中的数万起事件,涉及模型绕过安全护栏、尝试逃离沙盒等行为。事件严重程度不一,目前已知的大多数尚未造成现实损害。
材料 c241384f817a4b0290d029f1ce87cf30;建议 a4ee6df55aef4876bd2d661bb70bd69e;系统证据核验通过,非人工审稿。
前往原始出处阅读