Dizionario AI › Prompting
Toxicity Detection
Il rilevamento della tossicità è il compito specifico, all'interno della moderazione dei contenuti AI, di identificare linguaggio offensivo, aggressivo, discriminatorio o molesto in un testo, assegnandogli tipicamente un punteggio di tossicità su una scala continua anziché una semplice etichetta binaria. Questa granularità permette di calibrare soglie diverse a seconda del contesto: una community per adulti può tollerare un linguaggio più duro rispetto a un'applicazione educativa per minori.
I sistemi di rilevamento della tossicità sono addestrati su dataset di commenti e testi annotati da valutatori umani secondo linee guida che definiscono cosa conta come tossico, spesso distinguendo sotto-categorie come minacce, insulti, linguaggio osceno o attacchi basati su identità. Il modello impara a riconoscere pattern linguistici associati a queste categorie, incluse le varianti che aggirano i filtri più semplici tramite errori di battitura intenzionali o sostituzioni di caratteri.
È ampiamente usato per moderare commenti su piattaforme online, filtrare l'output di chatbot pubblici e valutare la qualità dei dati usati per addestrare nuovi modelli linguistici, dato che testi tossici nel training set tendono a produrre comportamenti indesiderati nel modello finale. Diversi strumenti open source e API commerciali offrono punteggi di tossicità pronti all'uso, integrabili in pipeline di moderazione più ampie.
Il termine e i primi strumenti dedicati risalgono alla fine degli anni 2010, quando aziende tecnologiche che gestivano grandi volumi di commenti generati dagli utenti hanno iniziato a investire in classificatori automatici per affiancare la moderazione umana, non più sufficiente da sola a coprire i volumi in gioco.
Dalla nostra rete
INDACO TMS: Transport Management for European Logistics
Shipment tracking, multi-carrier EDI and automated invoicing in one cloud platform. Invoices generated in under 10 seconds.
Vai su indacotms.com →Dal blog di Agora Intelligence
📱 Scarica l'app Android (beta) iOS in arrivo
Dì quello che intendi. Ottieni quello che ti serve.
Grace Certified, la coach AI che allena e certifica il tuo prompt engineering, di Agora Intelligence.