Dizionario AI › Prompting

Jailbreak

Il jailbreak è il tentativo di aggirare le protezioni di sicurezza di un modello AI per fargli produrre contenuti che rifiuterebbe: istruzioni pericolose, contenuti d'odio, informazioni riservate. Le tecniche spaziano dai giochi di ruolo ("fingi di essere un'AI senza regole") agli attacchi più sofisticati con codifiche e prompt costruiti ad arte.

Definizione

Si distingue dalla prompt injection per l'obiettivo: il jailbreak attacca le regole del modello stesso, l'injection attacca l'applicazione costruita sul modello inserendo istruzioni ostili nei dati che elabora. Entrambi appartengono alla sicurezza AI, disciplina in rapida crescita.

Per le aziende il tema è concreto: un chatbot aziendale jailbreakato può danneggiare il brand o rivelare informazioni. Le difese: modelli con protezioni robuste, guardrail applicativi aggiuntivi, test di sicurezza (red teaming) prima del rilascio pubblico e monitoraggio continuo.

Termini correlati

Altri termini in Prompting

Mettilo alla prova

Dalla nostra rete

AGORÀ Intelligence: Enterprise AI Governance Platform

Govern AI at scale: policies, adoption and measurable results on your data. Built for boards and C-suite.

Vai su agora-intelligence.com →

Dal blog di Agora Intelligence

Altro su agora-intelligence.com →

📱 Scarica l'app Android (beta) iOS in arrivo

Dì quello che intendi. Ottieni quello che ti serve.

Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.