LEAF Labs · Dati sintetici

Dati sintetici per l'AI quando i dati reali sono scarsi, sensibili o costosi.

Molti progetti AI si bloccano sui dati: troppo pochi esempi, troppo pochi eventi rari, oppure record troppo sensibili per circolare liberamente. LEAF progetta, genera e valuta dataset sintetici per un'attività specifica e ne misura l'utilità e la sicurezza prima che vengano usati.

Parliamo del tuo dataset
Che cosa sono i dati sintetici

Dati generati, misurati rispetto alla fonte.

I dati sintetici sono prodotti da modelli o simulazioni che apprendono la struttura di un dataset o di un dominio reale. I dataset sintetici possono preservare proprietà statistiche e specifiche dell'attività rilevanti, riducendo l'esposizione dei record originali.

Non sono automaticamente accurati né tutelano automaticamente la privacy. I generatori possono perdere alcuni andamenti, inventare combinazioni non plausibili o riprodurre record rari in modo troppo fedele. Privacy e utilità vanno quindi valutate con metriche appropriate per ciascun caso d'uso.

Casi d'uso

Dove i dati sintetici aiutano

Dati scarsi

Ampliare dataset piccoli quando raccogliere altri esempi reali è lento, costoso o impossibile, misurando se i dati aggiuntivi aiutano davvero il modello.

Eventi rari e casi limite

Rappresentare condizioni osservate raramente, come guasti, anomalie o stati operativi insoliti, perché i modelli le incontrino durante l'addestramento e i test.

Dati sensibili

Ridurre l'esposizione dei record originali in sviluppo, analisi e test, con una valutazione del rischio privacy di ogni dataset prima del suo utilizzo.

Squilibrio tra classi

Riequilibrare classi o gruppi sottorappresentati, verificando che gli esempi generati non introducano nuovi artefatti o bias.

Test del software

Fornire dati di test realistici per pipeline di dati, applicazioni e integrazioni, senza copiare record di produzione negli ambienti di test.

Collaborazione

Condividere dati rappresentativi con partner o gruppi di ricerca con un'esposizione minore, subordinatamente alla valutazione del rischio di divulgazione e alla tua valutazione sulla protezione dei dati.

Tipi di dati

I dati con cui lavoriamo

Dati tabellari

Record con campi numerici e categorici misti, in cui vanno preservati le relazioni e i vincoli tra le colonne.

Serie temporali e dati da sensori

Segnali da macchine, sensori e dispositivi IoT, in cui contano gli andamenti temporali, le correlazioni tra canali e gli eventi rari.

Testo

Documenti, messaggi e linguaggio specifico di dominio per addestrare e testare modelli linguistici e pipeline NLP.

Immagini

Dati visivi per la computer vision, incluse variazioni e condizioni difficili o costose da acquisire.

Le tecniche vanno dai modelli statistici e probabilistici alle generative adversarial network, ai variational autoencoder, ai modelli di diffusione, ai modelli basati su transformer e alla simulazione. Le scegliamo in base al tipo di dati, alle dimensioni del dataset di origine e ai vincoli di privacy, e preferiamo metodi più semplici quando bastano.

Il processo

Dai dati di origine a un dataset validato

01

Analisi

Studiamo i dati di origine, l'attività prevista e i requisiti di privacy, e concordiamo che cosa significano utilità e rischio accettabile per questo caso d'uso.

02

Generazione

Selezioniamo e addestriamo l'approccio di generazione. Dove sono richieste garanzie formali di privacy, si può incorporare la differential privacy.

03

Valutazione

Applichiamo metriche di qualità dei dati sintetici per la somiglianza statistica e l'utilità specifica per l'attività, ed eseguiamo una valutazione del rischio di divulgazione, con esperti di dominio che ne verificano la plausibilità.

04

Consegna

Consegniamo il dataset o la pipeline di generazione con la documentazione e un report di qualità, e li integriamo nel tuo flusso di lavoro di addestramento o di test.

Qualità e privacy

Le domande a cui ogni dataset sintetico deve rispondere

Somiglianza statistica

I dati sintetici riproducono le distribuzioni, le correlazioni, i vincoli e gli andamenti temporali che contano nella fonte?

Utilità specifica per l'attività

Funzionano per l'attività prevista? Un test comune consiste nell'addestrare su dati sintetici e valutare su dati reali tenuti da parte.

Rischio privacy

Quanto potrebbero rivelare sui record originali? Valutiamo il rischio di divulgazione con metodi come la distanza dal record più vicino e i test di membership inference.

Queste proprietà si bilanciano a vicenda: una protezione della privacy più forte di solito costa un po' di fedeltà. I dati sintetici da soli non garantiscono la privacy, per questo l'equilibrio viene scelto e documentato per ciascun caso d'uso.

Le pipeline di generazione possono essere distribuite in architetture pensate per supportare specifici requisiti normativi, di sicurezza e di residenza dei dati, anche sulla tua infrastruttura.

Dove si colloca

Parte di LEAF Labs

I dati sintetici sono una competenza Labs: prototipiamo, sviluppiamo e validiamo pipeline di dati che alimentano modelli reali. Spesso il lavoro parte da una valutazione Advisory e si collega ad altre attività Labs su edge AI e dispositivi connessi.

Scopri LEAF Labs
FAQ

Domande e risposte

Domande frequenti sui dati sintetici in LEAF.

Chiedici quello che vuoi

I dati sintetici sono dati generati artificialmente, progettati per riprodurre gli andamenti statistici e la struttura rilevanti di un dataset o di un dominio reale, senza essere una copia dei record originali. Possono assumere la forma di record tabellari, serie temporali, testo o immagini.

Dipende dall'attività. I dataset sintetici possono preservare proprietà statistiche e specifiche dell'attività rilevanti, ma approssimano la fonte invece di sostituirla. LEAF misura l'utilità per l'uso previsto, per esempio addestrando un modello su dati sintetici e testandolo su dati reali tenuti da parte, e indica dove i dati sintetici non sono all'altezza.

No. I dati sintetici possono ridurre l'esposizione dei record originali, ma i modelli generativi possono memorizzare e riprodurre record rari o unici. La privacy va valutata con metriche di rischio di divulgazione per ciascun dataset. Dove sono richieste garanzie formali di privacy, si può incorporare la differential privacy, di solito con un compromesso in termini di utilità.

Non automaticamente. La possibilità di trattare un dataset sintetico come anonimo dipende dal rischio di reidentificazione nel contesto specifico, e generarlo a partire da dati personali è di per sé una forma di trattamento. LEAF fornisce valutazioni del rischio privacy a supporto della tua valutazione sulla protezione dei dati; la determinazione giuridica resta a te e ai tuoi consulenti.

Record tabellari, serie temporali e dati da sensori, testo e immagini. Ogni tipo richiede tecniche di generazione e metriche di valutazione diverse, per questo l'approccio viene scelto per ciascun dataset.

Modelli statistici e probabilistici, generative adversarial network, variational autoencoder, modelli di diffusione, modelli basati su transformer e simulazione. La scelta dipende dal tipo di dati, dalle dimensioni del dataset di origine, dalla fedeltà richiesta e dai vincoli di privacy. Quando bastano, si preferiscono metodi più semplici.

Lungo tre assi: somiglianza statistica (distribuzioni, correlazioni e andamenti temporali), utilità specifica per l'attività (prestazioni sull'attività prevista) e rischio privacy (valutazione del rischio di divulgazione, come la distanza dal record originale più vicino e i test di membership inference). I risultati sono documentati in un report di qualità consegnato insieme al dataset.

Sì. Le pipeline di generazione possono essere distribuite in architetture pensate per supportare specifici requisiti normativi, di sicurezza e di residenza dei dati, anche sulla tua infrastruttura, così i dati di origine non devono uscire dal tuo ambiente.

Possono essere usati per ampliare classi rare o simulare condizioni difficili da osservare, come guasti o anomalie. I casi limite sintetici vanno validati con esperti di dominio, perché un generatore può produrre solo ciò che i suoi dati di addestramento o le sue regole di simulazione rendono plausibile.

Descrivici il tuo caso d'uso, i tuoi dati e i tuoi vincoli. LEAF valuta la fattibilità e propone un approccio, spesso partendo da un progetto pilota su un sottoinsieme rappresentativo dei dati.

Hai un modello che ha bisogno di dati che non puoi raccogliere o condividere facilmente?

Parliamo del tuo dataset