Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Lakeflow-Pipelines basieren auf Apache Spark™ Declarative Pipelines (SDP). Lakeflow-Pipelines werden auf der leistungsoptimierten Databricks Runtime ausgeführt und sind mit SDP interoperabel. Da Pipelines auf SDP anstelle proprietärer APIs aufbauen, bleibt der von Ihnen geschriebene Transformationscode portabel für andere SDP-Laufzeiten.
Was ist Spark Declarative Pipelines?
Apache Spark Declarative Pipelines ist ein deklaratives Framework für die Entwicklung und Ausführung von Batch- und Streamingdatenpipelines in SQL und Python. SDP automatisiert die Orchestrierung und organisiert die Abhängigkeiten zwischen den Flüssen in Ihrer Pipeline. SDP vereinfacht die Entwicklung von Datenaufnahme- und Transformationsprozessen, sodass Sie sich nicht auf die technischen Details der Orchestrierung Ihrer Datenworkflows konzentrieren müssen.
Zu den gängigen Anwendungsfällen für SDP gehören:
- Batchdatenaufnahme aus Quellen wie Cloudspeicher (Amazon S3, Azure ADLS Gen2 und Google Cloud Storage).
- Inkrementelle Datenaufnahme von Nachrichtenbussen (z. B. Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub und Apache Pulsar).
- Inkrementelle Batch- und Streamingtransformationen mit zustandslosen und zustandsbehafteten Operatoren.
Weitere Informationen zur deklarativen Datenverarbeitung finden Sie unter "Verfahren" im Vergleich zur deklarativen Datenverarbeitung in Databricks.
Wie erweitern Lakeflow-Pipelines SDP?
Lakeflow-Pipelines teilen dasselbe deklarative Erstellungsmodell wie SDP und fügen Produktionsfeatures wie AUTO CDC, Erwartungen an die Datenqualität und ein abfragefähiges Ereignisprotokoll hinzu. Diese Tabelle vergleicht die Funktionen, die Lakeflow-Pipelines mit SDP teilen, und die Produktionsfeatures, die Databricks oben hinzufügt. Eine Eigenschafts-nach-Eigenschaft-Zuordnung zwischen der SDP-Projektspezifikation und der Pipelinekonfiguration finden Sie unter Pipelineeigenschaftenreferenz.
| Capability | SDP | Lakeflow-Pipelines |
|---|---|---|
| Deklarative Pipelines in SQL und Python | ✓ | ✓ |
| Streamingtabellen | ✓ | ✓ |
| Materialisierte Ansichten | ✓ | ✓ |
| Temporäre Ansichten | ✓ | ✓ |
| Anfügen von Flüssen | ✓ | ✓ |
| Sinks (Delta, Apache Kafka und Azure Event Hubs) | ✓ | ✓ |
| Automatische Orchestrierung und Abhängigkeitsauflösung | ✓ | ✓ |
| Pipelinecode, der über SDP-Laufzeiten portierbar ist | ✓ | ✓ |
| AUTO CDC (SCD Type 1 und SCD Type 2) und AUTO CDC aus Snapshot | — | ✓ |
| Erwartungen an die Datenqualität | — | ✓ |
| Abfragefähiges Ereignisprotokoll | — | ✓ |
Aktualisierung von Flows und foreachBatch Sinks |
— | ✓ |
| Fortlaufender Modus | — | ✓ |