GPT-Red:解锁自我提升以增强鲁棒性
内容摘要
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
OpenAI 开发了 GPT-Red,这是一种内部自动红队测试模型,旨在识别漏洞并增强未来 AI 模型的安全性。通过利用自我博弈强化学习,GPT-Red 能生成多样且复杂的对抗性攻击,使 OpenAI 能够训练出 GPT-5.6 等对提示注入更具防御性的模型。这种方法实现了安全性与模型能力同步提升,在确保模型性能的同时降低了被恶意利用的风险。
(来源:OpenAI)
计划中的亚马逊数据中心可能成为美国最大的气候污染源
OpenAI收购演示文稿初创公司NextSlide
An Amazon data center could have the worst polluting power plant in the country
KPMG finds 49% cut AI agent rollouts when costs outran value
Fenix Flexin 甚至不再否认使用人工智能来制作“Rubberz”了
OpenAI 推出“冰球大小”的硬件设备,售价将超过 300 美元
观看 Roku 的人工智能频道就像是从槽里觅食
OpenAI puts the brakes on a new model because it’s supposedly too powerful
Google AI 团队人事地震背后的原因
了解 5 位开发者如何使用 Gemini Omni 进行创作