Azure Databricks funzionalità di data science e Machine Learning

Azure Databricks dispone di una piattaforma unificata per il ciclo di vita completo di data science (DS) e Machine Learning (ML), dall'inserimento di dati non elaborati tramite progettazione di funzionalità, training dei modelli, distribuzione e monitoraggio della produzione. Azure Databricks si integra con i framework di Machine Learning open source più diffusi, aggiungendo governance di livello aziendale, osservabilità e strumenti operativi, noti collettivamente come MLOps.

Questa pagina elenca le principali funzionalità di DS e ML, organizzate per fase del flusso di lavoro.

Analisi esplorativa dei dati

Azure Databricks semplifica l'analisi esplorativa dei dati (EDA) fornendo strumenti interattivi, collaborativi e di intelligenza artificiale per data scientist. I data scientist possono esplorare i dati usando chat in linguaggio naturale, interfacce utente o codice e possono collaborare usando la condivisione di codice in tempo reale e basata su Git. Genie Code può eseguire operazioni EDA completamente automatizzate o fungere da assistente interattivo.

Categoria Features
Interfaccia utente
Collaboration
Assistenti di intelligenza artificiale

Preparare e gestire le funzionalità

Azure Databricks semplifica i dati per ML unificando la governance dei dati e dei carichi di lavoro ml. Con tutti i dati gestiti in Unity Catalog con controlli di accesso con granularità fine, è possibile modificare i limiti di ingegneria dei dati e ML in base alle esigenze dell'organizzazione. I dati possono essere preparati per ML usando qualsiasi strumento di ingegneria dei dati , ad esempio le pipeline di Lakeflow. Le funzionalità vengono gestite in un Archivio funzionalità per la gestione in batch e in tempo reale, con un'unica fonte di verità regolamentata per le funzionalità.

Genie Code accelera l'individuazione e la preparazione dei dati esplorando Unity Catalog per individuare tabelle pertinenti, suggerire trasformazioni delle funzionalità e generare codice per le pipeline di inserimento e funzionalità.

Tipo di funzionalità Features
Funzionalità di Batch
  • Tabelle delle funzionalità in Unity Catalog archivia funzionalità batch pre-calcolate con derivazione e governance automatica. I team individuano e riutilizzano le funzionalità esistenti anziché ricompilare le pipeline da zero.
  • Le visualizzazioni delle funzionalità forniscono una nuova API per definire le funzionalità che possono quindi essere usate per il calcolo delle funzionalità in batch o in tempo reale.
Funzionalità in tempo reale
  • Per le funzionalità pre-calcolate, gli archivi di funzionalità online servono tabelle delle funzionalità per i casi d'uso del modello in tempo reale.
  • Quando gli input di definizione delle caratteristiche sono disponibili solo in fase di gestione, la funzionalità di servizio include calcoli delle funzionalità su richiesta per integrare le tabelle delle funzionalità. Le funzionalità sono definite come funzioni, anziché precompilate.
  • Le visualizzazioni delle funzionalità forniscono una nuova API per definire le funzionalità che possono quindi essere usate per il calcolo delle funzionalità in batch o in tempo reale.
Dati non strutturati Ricerca di intelligenza artificiale consente di gestire i dati non strutturati ed eseguire la ricerca semantica.

Addestrare modelli di Machine Learning

Azure Databricks offre strumenti flessibili per il training di modelli di Machine Learning e Deep Learning. Gli ambienti preconfigurati e personalizzabili consentono di utilizzare librerie di apprendimento automatico personalizzate, mentre le risorse di calcolo serverless accelerate da CPU e GPU consentono di aumentare la capacità e il numero di istanze su richiesta. Genie Code offre autoML intelligente, accettando richieste in linguaggio naturale e creando flussi di lavoro completi multi-notebook per la definizione delle funzionalità, il training, l'ottimizzazione, la valutazione e la distribuzione.

Categoria Features
Tipi di machine learning Azure Databricks supporta tutti i tipi di Machine Learning, tra cui:
  • ML classico: apprendimento supervisionato e non supervisionato con scikit-learn, XGBoost, LightGBM, Apache Spark MLlib e altri framework ml
  • Deep Learning: training di rete neurale con PyTorch, TensorFlow e Hugging Face Transformers, incluso il training distribuito tra più GPU
  • Ottimizzazione degli iperparametri: ricerca automatizzata tra gli spazi degli algoritmi e degli iperparametri usando strumenti come Optuna e Ray

Per l'intelligenza artificiale generativa, vedere Azure Databricks funzionalità di intelligenza artificiale generative.
Compute
  • Il calcolo serverless viene avviato immediatamente per notebook interattivi e flussi di lavoro pianificati, con scalabilità automatica e nessuna gestione del cluster. Supporta sia cluster con accelerazione CPU che GPU.
  • Il calcolo classico ha una gestione a computer singolo e cluster, sia per carichi di lavoro CPU che GPU.
Ambienti e librerie
Assistenti per la scrittura del codice di intelligenza artificiale

Tenere traccia e gestire gli esperimenti

MLflow gestito da Azure Databricks fornisce la base per uno sviluppo del machine learning riproducibile e verificabile. Le integrazioni con Unity Catalog e Git forniscono funzionalità di rilevamento e derivazione per gli asset di dati e codice. Ogni versione del modello nel Registro di sistema si collega di nuovo all'esecuzione del training, al set di dati, all'ambiente e al commit Git che lo ha prodotto, fornendo un audit trail completo per qualsiasi modello distribuito.

Categoria Features
Monitoraggio degli esperimenti MLflow tracking registra parametri, metriche e artefatti per ogni esecuzione di addestramento. Confrontare le esecuzioni nell'interfaccia utente di MLflow per identificare la configurazione con prestazioni migliori.
Registro dei modelli I modelli nel catalogo unity forniscono un registro dei modelli MLflow integrato con il catalogo Unity. Gli artefatti dei modelli con controllo delle versioni sono gestiti tramite alias del ciclo di vita (Staging, Production), controllo degli accessi, tracciabilità e condivisione tra aree di lavoro.
Riproducibilità I notebook e il codice possono essere versionati usando le cartelle Git di Databricks e integrati con qualsiasi provider Git.

Distribuire e gestire modelli

Azure Databricks supporta sia l'inferenza batch che la gestione in tempo reale. L'inferenza batch applica i modelli in modo efficiente ai set di dati di grandi dimensioni, mentre la gestione in tempo reale fornisce modelli come endpoint API a bassa latenza. Genie Code può generare codice per la distribuzione del modello e diagnosticare problemi e prestazioni per la gestione degli endpoint del modello.

Modello di gestione Features
Inferenza batch
Servizio in tempo reale Model Serving offre endpoint REST gestiti a bassa latenza e con elevata disponibilità, con scalabilità automatica serverless. Ciò supporta la gestione della CPU e della GPU per qualsiasi framework di Machine Learning ed è possibile usare Genie per valutare e risolvere i problemi relativi agli endpoint di gestione.
Inferenza nativa per SQL

Valutare e monitorare

Azure Databricks fornisce una valutazione flessibile per il training e il monitoraggio continuo per la produzione. La gestione in tempo reale dei log per le tabelle di inferenza regolate in Unity Catalog e il monitoraggio della qualità dei dati fornisce il monitoraggio con metriche, dashboard e avvisi personalizzati.

Categoria Features
Evaluation
Registrazione delle previsioni Tabelle di inferenza registrano le richieste e le risposte, consentendo il monitoraggio, l'analisi e la creazione di set di addestramento.
Monitoraggio e avvisi

MLOps e governance

Azure Databricks offre una suite completa di strumenti per le operazioni di Machine Learning (MLOps) e la governance. MlOps Stacks fornisce modelli per abilitare l'innalzamento di livello automatizzato e ripetibile dallo sviluppo all'ambiente di produzione usando l'infrastruttura come codice. I dati, le funzionalità, i modelli e gli endpoint sono completamente regolati dal catalogo unity e dal gateway di intelligenza artificiale.

Categoria Features
CI/CD per il machine learning Gli stack MLOps, basati su bundle di automazione dichiarativa, forniscono la gestione e la distribuzione basata su codice dell'infrastruttura e dei flussi di lavoro di ML. Sono inclusi i modelli CI/CD per automatizzare il training, la valutazione e la distribuzione.
Orchestrazione del flusso di lavoro I processi Lakeflow orchestrano flussi di lavoro ml in più passaggi come pipeline pianificate o attivate.
Governance delle risorse di dati e dei modelli Unity Catalog offre una governance unificata per dati, funzionalità e modelli registrati. I controlli di accesso con granularità fine, il rilevamento della derivazione e i log di controllo si applicano a tutti gli asset.
Gestione degli endpoint del modello Il gateway di intelligenza artificiale offre governance e monitoraggio centralizzati per gli endpoint del modello, inclusi limiti di frequenza, rilevamento dell'utilizzo e registrazione del payload.

Supporto open source

Azure Databricks fornisce supporto completo per l'ecosistema di Machine Learning open source.

È possibile usare qualsiasi framework di Machine Learning open source in Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray e altro ancora. MLflow o gli strumenti personalizzati possono archiviare gli artefatti del modello in formati aperti che possono essere esportati ed eseguiti all'esterno di Azure Databricks.

MLflow è open source, creato da Azure Databricks e usato da 10.000 organizzazioni. I dati di rilevamento dell'esperimento, gli artefatti del modello e le definizioni di pipeline vengono archiviati in formati aperti.

La governance dei dati e dell'intelligenza artificiale si basa sulle API del catalogo Unity open source e l'archiviazione dei dati si basa sul formato Delta Lake aperto. I dati delle funzionalità e i set di dati di training rimangono in file aperti e portabili.

Risorse aggiuntive