Funzionalità
Il sidecar privacy per le tue AI e per i flussi RAG. Cosa fa, spiegato semplice: i dettagli tecnici sono nelle Docs.
Due modi di proteggere i dati
Scegli come sostituire i dati sensibili. Cambia modalità e guarda il risultato.
Modalità Tag: i dati diventano segnaposto stabili come [NOME_1]. Perfetti per ritrovarli e ripristinarli quando serve.
Modalità Surrogato: i dati diventano finti ma realistici e format-preserving. Il testo resta naturale e l'AI lavora meglio.
Ti torna il testo pulito, i tag nel JSON
L'API ti restituisce il testo già protetto e, separata, la mappa di cosa è stato sostituito. Il tuo software sa sempre cosa c'era, senza esporre i dati nel testo.
{
"text": "Sono [NOME_1], scrivimi a [EMAIL_1].",
"entities": [
{ "tag": "[NOME_1]", "type": "PERSON", "value": "Marco Rossi" },
{ "tag": "[EMAIL_1]", "type": "EMAIL", "value": "[email protected]" }
],
"reversible": true
}
Una parola configura tutto
Invii un solo campo, context_type, e il sistema imposta da solo policy, modalità e dati da proteggere. Niente regole da riscrivere a ogni chiamata.
Dati finti, ma nel formato giusto
Faker genera valori realistici; per formati italiani come il Codice Fiscale il core usa un encoder dedicato, invece di trattarlo come una stringa casuale.
Regex DB batte i layer ML sugli overlap
Rilevamento a 4 livelli
Il motore combina Presidio + spaCy, privacy-filter, AI4Privacy e regex configurabili da database. Quando due rilevamenti si sovrappongono, prevale il layer più affidabile: le regex DB hanno priorità massima sui formati certi come CF, IBAN, email, telefono e targa.
Tag mode reversibile
I dati personali diventano token stabili nel contesto, come [PERSON_1] o [FISCAL_CODE_1]. La mappa token-valore viene salvata cifrata e può essere usata per ripristinare il testo con /v1/deanonymize.
Stesso valore + stesso context_id = stesso token
Generazione deterministica da valore reale, context_id e lingua
Surrogate mode deterministico
Per RAG, embedding e test, i dati reali vengono sostituiti con valori finti ma realistici e format-preserving. Il risultato resta leggibile per l'AI senza mandare PII reali fuori dal perimetro.
Codice Fiscale format-preserving
Faker italiano può generare codici fiscali validi, ma non li lega automaticamente a un nome generato a parte. Per questo il core include un encoder CF dedicato: quando serve un CF surrogato, viene costruito come codice valido e non come stringa casuale.
Non è una garanzia di Faker vanilla: serve logica applicativa dedicata
Precedenza: inline request > domain policy > registry
Context type e policy di dominio
Una sola proprietà, context_type, seleziona policy, modalità e regole. Un ricorso multa può mantenere data e targa perchè servono al caso, mentre un contratto può proteggere targa, azienda e riferimenti finanziari.
Registro di circa 33 tipi PII
Il registry copre identità, contatti, finanza, legale, veicoli, rete e credenziali. Ogni tipo ha categoria, azione di default, strategia faker, reversibilità e stato enabled.
Governabile da Admin UI senza cambiare codice
Hot reload da database, niente restart
Tuning runtime: regex, denylist e riclassificazione
Gli operatori possono correggere falsi positivi, aggiungere pattern e riclassificare entità in base al contesto. Una data vicino a "nato a ... il", per esempio, può diventare DATE_BORN.
Audit log, API key e ruoli
Ogni chiamata può essere tracciata con azione, numero entità, context type e chiave usata. Le API key supportano ruoli admin, service e auditor, con scadenza opzionale.
Separazione tra integrazione applicativa e accesso amministrativo
Modelli e lingua di default gestibili da UI
Multi-lingua e Admin UI
Il core supporta NER spaCy per IT, EN, DE, FR, ES e PT; i surrogate usano locale coerente con la lingua richiesta. L'Admin UI permette di gestire runtime language, policy, regex, denylist, context type e chiavi.
Mask mode — oscuramento irreversibile
POST /v1/mask sostituisce i dati sensibili senza salvare nessuna mappatura. Lo stile fill preserva la lunghezza del testo (████), lo stile label inserisce il tipo tra parentesi quadre ([PERSON]). Il carattere di mascheratura è configurabile.
Nessuna mappatura salvata — impossibile ripristinare
Azione configurabile per tipo tramite domain policy o inline
Remove mode — cancellazione del dato
Configurando remove_types nella policy di dominio o inline, il valore PII viene sostituito con stringa vuota. Il testo risultante è più corto nelle posizioni rimosse. Nessuna mappatura viene salvata.
Block mode — rifiuto della richiesta
I tipi in block_types causano un HTTP 422 se rilevati nel testo, prima di qualsiasi elaborazione. Il controllo avviene su tutte le entità rilevate, anche quelle non incluse nei protect_types. CREDIT_CARD e SECRET sono bloccati di default.
Configura block_types nella domain policy o in ogni richiesta inline
Stesso valore reale → stesso token (determinismo garantito per contesto + chiave)
Pseudonimizzazione — token reversibili distinti
POST /v1/pseudonymize sostituisce i dati con token deterministici reversibili conservati in un keystore separato dall'anonimizzazione. Utile per pipeline analitiche che richiedono unlinkability ma devono mantenere la possibilità di recupero autorizzato.
Alert e Webhook in tempo reale
Configura regole di alert verso Inbox, Email, Slack e Microsoft Teams, o webhook HTTP che si attivano su qualsiasi evento del motore PII. Filtra per tipo di dato, categoria, contesto o numero minimo di entità rilevate.
Filtri condizionali per tipo PII, categoria, contesto e soglia entità