Più di 350 ore di registrazioni trascritte – raccolte in diverse città, diverse situazioni comunicative e coinvolgendo persone con diversa caratterizzazione sociale – per un totale di 994 parlanti e circa 3,200,000 token.

Il corpus è modulare e incrementale: è stato progettato per crescere nel tempo, aumentando i punti di raccolta, i tipi di situazioni comunicative e di parlanti.

Le trascrizioni sono allineate con l’audio e sono liberamente accessibili e ricercabili tramite l’interfaccia di ricerca No SketchEngine.

Le trascrizioni e la documentazione del corpus sono depositate su GitHub e su CLARIN. Gli audio sono disponibili su richiesta.