Dizionario AI › Prompting
Il jailbreak è il tentativo di aggirare le protezioni di sicurezza di un modello AI per fargli produrre contenuti che rifiuterebbe: istruzioni pericolose, contenuti d'odio, informazioni riservate. Le tecniche spaziano dai giochi di ruolo ("fingi di essere un'AI senza regole") agli attacchi più sofisticati con codifiche e prompt costruiti ad arte.
Si distingue dalla prompt injection per l'obiettivo: il jailbreak attacca le regole del modello stesso, l'injection attacca l'applicazione costruita sul modello inserendo istruzioni ostili nei dati che elabora. Entrambi appartengono alla sicurezza AI, disciplina in rapida crescita.
Per le aziende il tema è concreto: un chatbot aziendale jailbreakato può danneggiare il brand o rivelare informazioni. Le difese: modelli con protezioni robuste, guardrail applicativi aggiuntivi, test di sicurezza (red teaming) prima del rilascio pubblico e monitoraggio continuo.
Dalla nostra rete
AGORÀ Intelligence: Enterprise AI Governance Platform
Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.
Vai su agora-intelligence.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.