VB,Columbus
Esegui un attacco di iniezione rapida contro Claude Opus 4.6 in un ambiente di programmazione vincolato: fallisce ogni volta, con un tasso di successo dello 0% su 200 tentativi e senza necessità di misure di sicurezza. Se trasferisci lo stesso attacco a un sistema basato su GUI con funzionalità di pensiero esteso abilitata, la situazione cambia rapidamente. Un singolo tentativo riesce nel 17,8% dei casi senza misure di sicurezza. Al 200° tentativo, il tasso di violazione raggiunge il 78,6% senza misure di sicurezza e il 57,1% con misure di sicurezza.La scheda di sistema di 212 pagine degli ultimi modelli , pubblicata il 5 febbraio, suddivide i tassi di successo degli attacchi in base alla superficie, al numero di tentativi e alla configurazione di protezione.
Perché le differenze superficiali determinano il rischio aziendalePer anni, l’iniezione tempestiva è stato un rischio noto che nessuno quantificava. I team di sicurezza lo trattavano come un rischio teorico. Gli sviluppatori di intelligenza artificiale lo consideravano un problema di ricerca. La situazione è cambiata quando Anthropic ha reso l’iniezione tempestiva misurabile su quattro distinte superfici di agenti, con tassi di successo degli attacchi su cui i responsabili della sicurezza possono finalmente basare le decisioni di approvvigionamento.La scheda di sistema GPT-5.2 di OpenAI include i risultati dei benchmark di prompt injection, inclusi i punteggi di valutazioni come Agent JSK e PlugInject, ma non suddivide i tassi di successo degli attacchi in base alla superficie dell’agente né mostra come tali tassi varino nei ripetuti tentativi. La scheda di sistema GPT-5 originale descriveva oltre 5.000 ore di red teaming da parte di oltre 400 tester esterni. La scheda del modello Gemini 3 lo descrive come “il nostro modello più sicuro finora” con “una maggiore resistenza alle prompt injection”, condividendo miglioramenti relativi alla sicurezza rispetto ai modelli precedenti, ma non pubblicando i tassi di successo assoluti degli attacchi in base alla superficie o ai dati di scalabilità della persistenza.Cosa rivela e cosa trattiene ogni sviluppatoreCategoria di divulgazioneAntropico (Opus 4.6)OpenAI (GPT-5.2)Google (Gemelli 3)Percentuali di successo degli attacchi per superficiePubblicato (dallo 0% al 78,6%)Solo punteggi di riferimentoSolo miglioramenti relativiScalabilità della persistenza dell’attaccoPubblicato (da 1 a 200 tentativi)Non pubblicatoNon pubblicatoConfronto tra attivazione e disattivazione della protezionePubblicatoNon pubblicatoNon pubblicatoDati di evasione del monitoraggio degli agentiPubblicato (SHADE-Arena)Non pubblicatoNon pubblicatoConteggi delle scoperte zero-dayOltre 500 con progetti denominatiNon pubblicatoNon pubblicatoRed teaming di terze partiGray Swan, Regno Unito AISI, ApolloOltre 400 tester esterniUK AISI, Apollo, Vaultis, DreadnodeI test di terze parti evidenziano l’importanza delle informazioni granulari fornite dai fornitori. La valutazione indipendente del team rosso di Promptfoo su GPT-5.2 ha rilevato che i tassi di successo del jailbreak sono aumentati da una base del 4,3% al 78,5% in scenari multi-turn, il tipo di dati su scala di persistenza che rivelano come le difese si degradino sotto attacco prolungato. La scheda di sistema di OpenAI non include metriche equivalenti.
comportamento di un modello. I responsabili della sicurezza dovrebbero chiedere a ogni fornitore di agenti di intelligenza artificiale criteri equivalenti, ovvero le condizioni in cui il caso di sicurezza del fornitore non funziona.Tre cose che i responsabili della sicurezza dovrebbero fare subito:Chiedete a ogni fornitore di agenti di intelligenza artificiale nella vostra pipeline di valutazione i tassi di successo degli attacchi per superficie, non solo i punteggi di benchmark. Se non sono in grado di fornire dati sugli errori su scala di persistenza, considerate questa lacuna nel vostro punteggio di rischio.Commissionare valutazioni indipendenti da parte di red team prima di qualsiasi implementazione in produzione. Quando il modello del fornitore ha contribuito a costruire l’infrastruttura di valutazione, i soli dati sulla sicurezza forniti dal fornitore non sono sufficienti.Si consiglia di convalidare le affermazioni sulla sicurezza degli agenti rispetto ai risultati dei red team indipendenti per 30 giorni prima di ampliare l’ambito di distribuzione.