Molti progetti AI si bloccano sui dati: troppo pochi esempi, troppo pochi eventi rari, oppure record troppo sensibili per circolare liberamente. LEAF progetta, genera e valuta dataset sintetici per un'attività specifica e ne misura l'utilità e la sicurezza prima che vengano usati.
Parliamo del tuo datasetI dati sintetici sono prodotti da modelli o simulazioni che apprendono la struttura di un dataset o di un dominio reale. I dataset sintetici possono preservare proprietà statistiche e specifiche dell'attività rilevanti, riducendo l'esposizione dei record originali.
Non sono automaticamente accurati né tutelano automaticamente la privacy. I generatori possono perdere alcuni andamenti, inventare combinazioni non plausibili o riprodurre record rari in modo troppo fedele. Privacy e utilità vanno quindi valutate con metriche appropriate per ciascun caso d'uso.
Ampliare dataset piccoli quando raccogliere altri esempi reali è lento, costoso o impossibile, misurando se i dati aggiuntivi aiutano davvero il modello.
Rappresentare condizioni osservate raramente, come guasti, anomalie o stati operativi insoliti, perché i modelli le incontrino durante l'addestramento e i test.
Ridurre l'esposizione dei record originali in sviluppo, analisi e test, con una valutazione del rischio privacy di ogni dataset prima del suo utilizzo.
Riequilibrare classi o gruppi sottorappresentati, verificando che gli esempi generati non introducano nuovi artefatti o bias.
Fornire dati di test realistici per pipeline di dati, applicazioni e integrazioni, senza copiare record di produzione negli ambienti di test.
Condividere dati rappresentativi con partner o gruppi di ricerca con un'esposizione minore, subordinatamente alla valutazione del rischio di divulgazione e alla tua valutazione sulla protezione dei dati.
Record con campi numerici e categorici misti, in cui vanno preservati le relazioni e i vincoli tra le colonne.
Segnali da macchine, sensori e dispositivi IoT, in cui contano gli andamenti temporali, le correlazioni tra canali e gli eventi rari.
Documenti, messaggi e linguaggio specifico di dominio per addestrare e testare modelli linguistici e pipeline NLP.
Dati visivi per la computer vision, incluse variazioni e condizioni difficili o costose da acquisire.
Le tecniche vanno dai modelli statistici e probabilistici alle generative adversarial network, ai variational autoencoder, ai modelli di diffusione, ai modelli basati su transformer e alla simulazione. Le scegliamo in base al tipo di dati, alle dimensioni del dataset di origine e ai vincoli di privacy, e preferiamo metodi più semplici quando bastano.
Studiamo i dati di origine, l'attività prevista e i requisiti di privacy, e concordiamo che cosa significano utilità e rischio accettabile per questo caso d'uso.
Selezioniamo e addestriamo l'approccio di generazione. Dove sono richieste garanzie formali di privacy, si può incorporare la differential privacy.
Applichiamo metriche di qualità dei dati sintetici per la somiglianza statistica e l'utilità specifica per l'attività, ed eseguiamo una valutazione del rischio di divulgazione, con esperti di dominio che ne verificano la plausibilità.
Consegniamo il dataset o la pipeline di generazione con la documentazione e un report di qualità, e li integriamo nel tuo flusso di lavoro di addestramento o di test.
I dati sintetici riproducono le distribuzioni, le correlazioni, i vincoli e gli andamenti temporali che contano nella fonte?
Funzionano per l'attività prevista? Un test comune consiste nell'addestrare su dati sintetici e valutare su dati reali tenuti da parte.
Quanto potrebbero rivelare sui record originali? Valutiamo il rischio di divulgazione con metodi come la distanza dal record più vicino e i test di membership inference.
Queste proprietà si bilanciano a vicenda: una protezione della privacy più forte di solito costa un po' di fedeltà. I dati sintetici da soli non garantiscono la privacy, per questo l'equilibrio viene scelto e documentato per ciascun caso d'uso.
Le pipeline di generazione possono essere distribuite in architetture pensate per supportare specifici requisiti normativi, di sicurezza e di residenza dei dati, anche sulla tua infrastruttura.
I dati sintetici sono una competenza Labs: prototipiamo, sviluppiamo e validiamo pipeline di dati che alimentano modelli reali. Spesso il lavoro parte da una valutazione Advisory e si collega ad altre attività Labs su edge AI e dispositivi connessi.
Scopri LEAF LabsHai un modello che ha bisogno di dati che non puoi raccogliere o condividere facilmente?
Parliamo del tuo dataset