GPT-Red:解锁自我提升以增强鲁棒性
内容摘要
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
OpenAI、SpaceX投资者资金被用于脱衣舞俱乐部、Bloomingdale's和Amazon购物,SEC指控私人基金顾问 | Fortune
Google推出Guided Vision新功能,可帮助你阅读小字印刷
ChatGPT现在可以为你虚拟试穿衣服
Google认为SpaceX的Starship必须发射1,600次,太空数据中心才能起步
据《华尔街日报》报道,OpenAI与三名安全研究员解除合作关系
法官驳回针对谷歌AI Overviews的反垄断诉讼
Amazon发布自己的Jev克隆版,决策模型泛滥网络
Shopify 推出 Canvas:一种通过与 AI 对话来搭建网店的方式
Google 通过 Project Suncatcher 测试太空AI数据中心计划
Albertsons Companies 如何由内而外地重新构想零售业