Dizionario AI › Prompting
Safety Filter
Un filtro di sicurezza è un componente software, distinto dal modello linguistico stesso, che controlla input e output di un sistema AI alla ricerca di contenuti vietati, pericolosi o non conformi alle policy d'uso. Può bloccare la richiesta prima che raggiunga il modello, oppure intercettare e modificare la risposta prima che venga mostrata all'utente.
Tecnicamente i filtri di sicurezza si basano su classificatori dedicati, spesso modelli più piccoli e veloci addestrati a riconoscere categorie di rischio (violenza, contenuti sessuali, autolesionismo, istruzioni pericolose), oppure su liste di parole ed espressioni regolari per i casi più semplici. Molti sistemi combinano più livelli: un filtro leggero e veloce in ingresso, un controllo più approfondito sull'output generato e talvolta una verifica finale prima della consegna all'utente.
Nell'AI moderna i filtri di sicurezza sono lo strato che separa un modello capace, ma potenzialmente sbagliato o manipolabile, da un prodotto utilizzabile in produzione: le API commerciali dei principali fornitori li applicano di default e spesso li rendono configurabili per settori con esigenze diverse (assistenza sanitaria, contenuti per adulti, applicazioni educative).
Il concetto deriva dai sistemi di moderazione dei contenuti generati dagli utenti, già diffusi sui social media prima dell'era dei grandi modelli linguistici, ed è stato adattato e reso più sofisticato con l'arrivo di sistemi AI generativi capaci di produrre testo, immagini e codice su richiesta.
Dalla nostra rete
HSE Genius: AI for Safety Data Sheets
Extract SDS data, H phrases and ECHA compliance checks in seconds, powered by AI.
Vai su hsegenius.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.