OpenAI 用自我对弈训练出“红队黑客”GPT-Red,让它自动攻击自家模型找漏洞,发现“伪造思维链”等新攻击,使 GPT-5.6 防御率较上代提升数倍。 当大模型开始自己写代码、自己读邮件、自己在网页上点来点去,它的“攻击面”和“爆炸半径”都在同步膨胀。OpenAI 给出的解法听起来像科幻:造一个专门搞破坏的 AI,让它日日攻击自家其他模型,逼后者在实战里把防御练硬。这个被命名为 GPT-Re ...