Monitorare i servizi del modello usando le tabelle di inferenza

Importante

Questa funzionalità è in versione beta. Gli amministratori dell'account possono controllare l'accesso a questa funzionalità dalla pagina Anteprime della console dell'account. Vedere Gestire le anteprime di Azure Databricks.

Questa pagina descrive come usare le tabelle di inferenza per monitorare i servizi del modello di Gateway di intelligenza artificiale Unity .

Che cosa sono le tabelle di inferenza di Unity AI Gateway?

Le tabelle di inferenza di Unity AI Gateway registrano le richieste e le risposte dei tuoi servizi di modelli nelle tabelle Delta di Unity Catalog. È possibile usare questi dati per il monitoraggio, il debug e l'ottimizzazione dei modelli.

I casi d'uso comuni includono:

  • Debug: analizzare i payload delle richieste e delle risposte per risolvere i problemi.
  • Monitoraggio: tenere traccia delle prestazioni del modello e identificare le anomalie.
  • Ottimizzazione: esaminare le interazioni per migliorare le richieste e le configurazioni del modello.
  • Conformità: mantieni i log di controllo di tutte le interazioni del modello.

Requirements

  • Anteprima del Gateway di Intelligenza Artificiale Unity abilitata per l'account. Vedere Gestire le anteprime di Azure Databricks.

  • Un'area di lavoro Azure Databricks in un'area Unity AI Gateway supportata.

  • Catalogo Unity abilitato per l'area di lavoro. Vedere Abilitare un'area di lavoro per il Catalogo Unity.

  • Il privilegio MANAGE sul servizio modello. Sia l'autore che il modificatore del servizio modello devono avere questo privilegio.

  • Privilegio CREATE TABLE nel catalogo e nello schema di Unity Catalog specificati.

  • Privilegio USE CATALOG nel catalogo specificato.

  • Il privilegio USE SCHEMA nello schema specificato.

  • Il catalogo non può essere un catalogo OpenSharing nel metastore corrente.

  • Databricks consiglia di abilitare l'ottimizzazione predittiva per migliorare le prestazioni.

Abilitare le tabelle di inferenza

Le tabelle di inferenza possono essere configurate solo dopo la creazione di un servizio modello.

Per abilitare le tabelle di inferenza:

  1. Nella barra laterale fare clic su Gateway di intelligenza artificiale.
  2. Fare clic sul nome del servizio modello per aprire la pagina del servizio modello.
  3. Fare clic su Configura accanto a Tabelle di inferenza.
  4. Specificare il catalogo e lo schema in cui archiviare la tabella di inferenza.
  5. Fare clic su Salva.

Il proprietario della tabella di inferenza è l'utente che ha creato il servizio modello. Tutti gli elenchi di controllo di accesso seguono le autorizzazioni standard del catalogo Unity e possono essere modificati dal proprietario della tabella.

Annotazioni

La specifica di una tabella esistente non è supportata. Azure Databricks crea automaticamente una nuova tabella di inferenza quando si abilitano le tabelle di inferenza.

Avvertimento

La tabella di inferenza potrebbe arrestare la registrazione dei dati o essere danneggiata se si esegue una delle operazioni seguenti:

  • Modificare lo schema della tabella.
  • Modificare il nome della tabella.
  • Eliminare la tabella.

Disabilitare le tabelle di inferenza

Per disabilitare le tabelle di inferenza:

  1. Nella barra laterale fare clic su Gateway di intelligenza artificiale.
  2. Fare clic sul nome del servizio modello per aprire la pagina del servizio modello.
  3. Fare clic sull'icona di modifica accanto a Tabelle di inferenza.
  4. Fare clic su Disabilita tabelle di inferenza.

Eseguire una query sulla tabella di inferenza

È possibile visualizzare la tabella nell'interfaccia utente oppure eseguire query sulla tabella da Databricks SQL o da un notebook.

Per visualizzare la tabella nell'interfaccia utente, fare clic sul collegamento tabella di inferenza nella pagina del servizio modello per aprire la tabella in Esplora cataloghi.

Per eseguire query sulla tabella da Databricks SQL o da un notebook:

SELECT * FROM <catalog>.<schema>.<payload_table>

Sostituire <catalog>, <schema>e <payload_table> con la posizione della tabella.

Schema della tabella di inferenza

Le tabelle di inferenza di Unity AI Gateway hanno lo schema seguente:

Nome colonna Tipo Descrizione Example
request_id filo Identificatore univoco per la richiesta. 7a99b43cb46c432bb0a7814217701909
invocation_id filo Identificatore univoco per ogni singola chiamata di inferenza. Più chiamate possono condividere lo stesso request_id, ad esempio controlli di protezione o chiamate di agenti a più turni. Usare invocation_id per distinguerli. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
request_tags MAP Tag associati alla richiesta. {"team": "engineering"}
event_time TIMESTAMP Timestamp in cui è stata ricevuta la richiesta. 2024-05-17T13:47:13.282-07:00
status_code INT Il codice di stato HTTP della risposta. 200
sampling_fraction DOPPIO Frazione di campionamento se è stato usato il campionamento verso il basso. Un valore pari a 1 indica che non viene eseguito alcun campionamento. 1
latency_ms LUNGO Latenza totale in millisecondi. 300
time_to_first_byte_ms LUNGO Tempo di primo byte in millisecondi. 200
request filo Payload della richiesta JSON non elaborato. {"messages": [...], ...}
response filo Payload della risposta JSON grezzo. {"choices": [...], ...}
destination_type filo Tipo di destinazione, ad esempio modello esterno o modello di base. PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name filo Nome del modello o del provider di destinazione. databricks-gpt-5-2
destination_model filo Modello specifico utilizzato per la richiesta. GPT-5.2
logging_error_codes ARRAY Codici di errore se la registrazione non è riuscita , ad esempio MAX_REQUEST_SIZE_EXCEEDED. ["MAX_RESPONSE_SIZE_EXCEEDED"]
requester filo ID dell'utente o dell'entità servizio che ha effettuato la richiesta. databricks.engineer@databricks.com
schema_version filo Versione dello schema del record della tabella di inferenza. 0

Limitations

  • Solo cataloghi di archiviazione esterni: le tabelle di inferenza possono essere create solo in cataloghi di archiviazione esterni. I cataloghi di archiviazione predefiniti non sono attualmente supportati.
  • Endpoint privati non supportati: le tabelle di inferenza non possono essere create nell'archiviazione protetta tramite un endpoint privato. Vedere Limitazioni del connettore di ingestione Zerobus.
  • Recapito ottimale: i log sono in genere disponibili entro pochi minuti da una richiesta, ma il recapito non è garantito.
  • Dimensioni massime del payload: le richieste e le risposte superiori a 10 MiB non vengono registrate. La logging_error_codes colonna indica quando si verifica con MAX_REQUEST_SIZE_EXCEEDED o MAX_RESPONSE_SIZE_EXCEEDED.
  • Risposte di errore: i log potrebbero non essere popolati per le richieste che restituiscono errori 401, 403, 429 o 500.

Risorse aggiuntive