Vai al contenuto

Archiviazione dei dataset

datashard

Disponibile

Un formato di tabella per dataset e blob che non richiede un database.

Archiviazione per dataset, registrazioni e file di grandi dimensioni che conserva la propria cronologia: i record vengono accodati, vengono acquisite istantanee e un dataset può essere letto come si presentava in qualsiasi momento precedente. Prende il posto di dump CSV e JSON sparsi, cartelle gestite manualmente e database creati solo per contenere file.

A chi è destinato. Progetti Python che persistono registrazioni, dataset o dati analitici e necessitano di uno storage versionato e leggibile.

Stato
Disponibile
Parte di
Open source
Licenza
Open source, Apache 2.0
Tag
PythonSnapshotTime travelFormato apertoDisco o archiviazione a oggetti

Cosa fa

  • Solo aggiunta, con snapshot

    I record vengono accodati e sottoposti a snapshot, così un dataset può essere letto come si presentava in un determinato momento.

  • Disco o S3

    Lo stesso formato di tabella funziona su disco locale o in object storage, quindi passare dall'uno all'altro è una modifica di configurazione.

  • Parquet come base

    I dati sono archiviati in formato Parquet, quindi qualsiasi strumento che legge Parquet può leggerli.

Per la documentazione, un pilot o un'integrazione, contattateci.