Archiviazione dei dataset
datashard
DisponibileUn formato di tabella per dataset e blob che non richiede un database.
Archiviazione per dataset, registrazioni e file di grandi dimensioni che conserva la propria cronologia: i record vengono accodati, vengono acquisite istantanee e un dataset può essere letto come si presentava in qualsiasi momento precedente. Prende il posto di dump CSV e JSON sparsi, cartelle gestite manualmente e database creati solo per contenere file.
A chi è destinato. Progetti Python che persistono registrazioni, dataset o dati analitici e necessitano di uno storage versionato e leggibile.
- Stato
- Disponibile
- Parte di
- Open source
- Licenza
- Open source, Apache 2.0
- Tag
- PythonSnapshotTime travelFormato apertoDisco o archiviazione a oggetti
Cosa fa
-
Solo aggiunta, con snapshot
I record vengono accodati e sottoposti a snapshot, così un dataset può essere letto come si presentava in un determinato momento.
-
Disco o S3
Lo stesso formato di tabella funziona su disco locale o in object storage, quindi passare dall'uno all'altro è una modifica di configurazione.
-
Parquet come base
I dati sono archiviati in formato Parquet, quindi qualsiasi strumento che legge Parquet può leggerli.
Per la documentazione, un pilot o un'integrazione, contattateci.