Pipeline dichiarative di Apache Spark

Le pipeline di Lakeflow sono basate su pipeline dichiarative di Apache Spark™ (SDP). Le pipeline di Lakeflow vengono eseguite nel runtime di Databricks ottimizzato per le prestazioni e sono interoperabili con SDP. Poiché le pipeline si basano su SDP anziché sulle API proprietarie, il codice di trasformazione scritto rimane portabile in altri runtime SDP.

Che cos'è Spark Declarative Pipelines?

Apache Spark Declarative Pipelines è un framework dichiarativo per lo sviluppo e l'esecuzione di pipeline di dati batch e di streaming in SQL e Python. SDP automatizza l'orchestrazione e organizza le dipendenze tra i flussi nella pipeline. SDP semplifica lo sviluppo di inserimento e trasformazione, in modo che non sia necessario concentrarsi sulla meccanica dell'orchestrazione dei flussi di lavoro dei dati.

I casi d'uso comuni per SDP includono:

  • Inserimento di dati batch da origini come l'archiviazione cloud (Amazon S3, Azure ADLS Gen2 e Google Cloud Storage).
  • Acquisizione incrementale dei dati da bus di messaggistica (ad esempio Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar).
  • Trasformazioni incrementali di batch e streaming con operatori senza stato e con stato.

Per altre informazioni sull'elaborazione dei dati dichiarativa, vedere Elaborazione procedurale e dichiarativa dei dati in Databricks.

In che modo le pipeline di Lakeflow estendono SDP?

Le pipeline di Lakeflow condividono lo stesso modello di creazione dichiarativa di SDP e aggiungono funzionalità di produzione come AUTO CDC, aspettative sulla qualità dei dati e un registro eventi su cui è possibile eseguire query. Questa tabella confronta le funzionalità condivise dalle pipeline di Lakeflow con SDP e le funzionalità di produzione aggiunte da Databricks. Per una mappatura proprietà per proprietà tra la specifica del progetto SDP e la configurazione della pipeline, vedi Riferimento delle proprietà della pipeline.

Capability SDP Pipeline di Lakeflow
Pipeline dichiarative in SQL e Python
Tabelle di streaming
Viste materializzate
Visualizzazioni temporanee
Aggiungi flussi
Sink (Delta, Apache Kafka e Hub eventi di Azure)
Orchestrazione automatica e risoluzione delle dipendenze
Codice della pipeline portabile tra i runtime SDP
AUTO CDC (SCD Type 1 e SCD Type 2) e AUTO CDC dallo snapshot
Aspettative sulla qualità dei dati
Registro eventi su cui è possibile eseguire query
Aggiornamenti di flussi e foreachBatch destinazioni
Modalità continua

Risorse aggiuntive