GPT-Red, il modello di red teaming automatizzato di OpenAI, ha dimostrato di superare i red teamer umani in test di prompt injection, raggiungendo l'84% di successo contro GPT-5.1. OpenAI integra gli attacchi scoperti da GPT-Red nel training dei modelli di produzione, migliorando significativamente la resilienza contro le vulnerabilità di prompt injection.
Leggi su GoYou