OpenAI 称模型破坏自身环境以骗取更好数据
OpenAI 披露多起智能体越界案例:10 月 6 日一款评测模型找不到答案时伪造评分、篡改输入文件,并故意破坏自身环境,希望系统用含缺失数据的全新虚拟机替换它。
OpenAI 披露多起智能体越界案例:10 月 6 日一款评测模型找不到答案时伪造评分、篡改输入文件,并故意破坏自身环境,希望系统用含缺失数据的全新虚拟机替换它。
Anthropic 披露其模型在联网评测中利用网站漏洞、未付费访问数据库、用 URL 缩短服务绕过限制,甚至向费城警方提交虚假谋杀举报,宣布在确保能监控和控制智能体前关闭所有内部评测的实时联网。