Configurare agenti vocali in tempo reale

[Questo articolo è una documentazione preliminare ed è soggetto a modifiche.]

Configurare un agente vocale in tempo reale attivando la voce in tempo reale, impostando le opzioni di base e configurando funzionalità come argomenti, supporto multilingue, DTMF e rilevamento del silenzio.

Configurare e abilitare la voce in tempo reale

  1. Creare un nuovo agente e configurarne i dettagli di base, ad esempio un nome descrittivo e lo scopo dell'agente nella descrizione.

  2. Passare alle impostazioni voce dell'agente e attivare Abilita voce e quindi in Tipo voce selezionare Voce in tempo reale. Per altre informazioni, vedere Scegliere come gestire la voce.

    Importante

    Questa impostazione è una selezione una tantum. Dopo aver selezionato Voce in tempo reale, non è possibile tornare alla voce Basic. Per usare la voce Basic, creare un nuovo agente.

    Schermata delle impostazioni di un agente che evidenzia l'impostazione della voce in tempo reale.

  3. Selezionare il modello vocale in tempo reale che si vuole usare, **GPT-Realtime o GPT-Realtime-Mini. Per altre informazioni sulle differenze tra questi modelli, vedere Prerequisiti regionali.

  4. Passare alle impostazioni di sicurezza dell'agente e selezionare Nessuna autenticazione.

Conoscenza e strumenti

È possibile configurare l'agente per l'uso di informazioni e strumenti. Per altre informazioni, vedere Riepilogo delle origini delle informazioni, Aggiungere strumenti a agenti personalizzati e strumenti, conoscenza, MCP e API.

Agenti annidati (anteprima)

Gli agenti vocali in tempo reale supportano solo gli agenti figlio.

Importante

Assicurati che le descrizioni degli agenti figli non si sovrappongano alle descrizioni degli argomenti. Definire in modo esplicito l'ordine di chiamata nelle istruzioni dell'agente.

Argomenti

Gli agenti vocali in tempo reale supportano tutti gli argomenti configurati in Copilot Studio. Usare argomenti per definire comportamenti deterministici, ad esempio saluti, regole business ed escalation, mentre il modello vocale in tempo reale gestisce le risposte conversazionali in fase di esecuzione. Per altre informazioni, vedere Scegliere come controllare la conversazione.

Procedure consigliate quando si usano argomenti con agenti vocali in tempo reale

  • Usare gli argomenti solo quando è necessario un comportamento deterministico.

  • Usare il testo statico nei messaggi di saluto per la prima risposta più veloce. I messaggi dinamici con variabili ed espressioni aumentano la latenza iniziale.

  • Disabilitare l'argomento Avvio conversazione se si vuole che il modello vocale in tempo reale gestisca il messaggio di saluto. In caso contrario, il messaggio di saluto configurato nell'argomento Avvio conversazione viene riprodotto anziché il messaggio di saluto del modello vocale.

  • Consentire al modello vocale in tempo reale di gestire la conversazione generale e le domande di completamento.

  • Includi un'azione esplicita nella sezione On Error, ad esempio il trasferimento o la terminazione della chiamata. La gestione degli errori basata solo su messaggi non è sufficiente. Senza un passaggio successivo deterministico, i clienti potrebbero sperimentare il silenzio o le chiamate bloccate, causando confusione e scarse esperienze vocali.

  • Usare descrizioni esplicite di argomenti e strumenti per dichiarare la proprietà della raccolta dati. Per altre informazioni, vedere Scrivere descrizioni di strumenti e argomenti efficaci.

Supporto per i nodi tematici

L'elenco seguente descrive il supporto degli argomenti negli agenti vocali in tempo reale:

Nodo di condizione

Feature Assistenza
Diramazione if/Else Supportato
Espressioni Power Fx Supportato
Rielaborazione del riempimento degli slot Supportato

Nodo messaggio

Feature Assistenza
Messaggio di base Supportato
Varianti dei messaggi Supportato
Inserimento di variabili Supportato
SSML Supportato
Contenuti multimediali/schede adattive Non applicabile
Risposte rapide Non applicabile

Nodo di domanda

Feature Assistenza
Testo prompt Supportato
Blocco automatico Non supportato
Riempimento slot Supportato
Ignora comportamento/riempimento dello slot Greedy Supportato
Esegui prompt nuovamente/Riprova Supportato
Gestione delle risposte non valida Supportato
Interruzione dell'argomento Supportato
Intrusione Supportato
Messaggio di ripetizione personalizzato Supportato
Input DTMF Supportato
Rilevamento del silenzio Supportato

Nodo HTTP

Feature Assistenza
Metodi HTTP: GET, POST, PUT, PATCH, DELETE Supportato
Endpoint URL Supportato
Intestazioni e payload Supportato
Analisi e schema delle risposte Supportato
Mapping delle variabili Supportato
Gestione degli errori Supportato

Nodo dello strumento

Feature Assistenza
Flusso di Power Automate Supportato
Chiamata allo strumento Supportato
Mappatura di input/output Supportato
Nuovo prompt Supportato

Imposta il valore della variabile nodo

Feature Assistenza
Assegnazione letterale Supportato
Assegnazione di espressione Supportato
Variabile a variabile Supportato

Nodo di gestione degli argomenti

Feature Assistenza
Terminare l'argomento corrente Supportato
Terminare tutti gli argomenti Supportato
Terminare la conversazione Supportato
Vai alla fase Supportato
Input dell'utente per riconoscere la finalità Supportato
Passare a un altro argomento Supportato

Trasferire il nodo della conversazione

Feature Assistenza
Trasferisci ad agente Supportato
Trasferimento di numeri di telefono esterni Supportato

Advanced

Feature Assistenza
Creare risposte generative Supportato

Supporto del trigger di sistema

Trigger Assistenza dettagli
All'inizio della conversazione Supportato Viene generato quando inizia una nuova conversazione
Parla con un rappresentante Supportato Trasferimento a un agente umano
Argomento sconosciuto/Su finalità sconosciuta Non supportato Fallback quando nessun argomento corrisponde
OnSelectIntent (più argomenti corrispondenti) Non supportato Disambiguazione tra argomenti simili
Reimposta conversazione (OnSystemRedirect) Supportato Cancella le variabili e riavvia il flusso
Al momento dell'accesso Non supportato
Tasto DTMF sconosciuto Supportato Input del tastierino non mappato
L'agente sceglie/L'utente dice una frase Supportato Agent seleziona l'argomento in base alla finalità
Viene ricevuto un messaggio Non supportato Aumenta la latenza
Si verifica un evento client personalizzato Non supportato Solo all'avvio della sessione
Aggiornamento della conversazione Non supportato Membri aggiunti o rimossi, modifiche alla sessione
Viene richiamato Non supportato Richiede l'interfaccia utente sincrona
Viene reindirizzato Supportato
L'utente è inattivo da un po'/Rilevamento del silenzio Supportato Timeout di inattività dell'utente
Viene completato un piano Non supportato
Risposta di intelligenza artificiale generata Non supportato
In caso di errore Supportato Gestisce gli errori di orchestrazione

Trasferire variabili tra argomenti e il modello linguistico

Quando usi argomenti in un flusso di conversazione ibrida, comprendere come passare variabili tra argomenti e il modello linguistico in tempo reale è fondamentale per la creazione di interazioni affidabili e con stato.

Questa funzionalità funziona tramite il processo seguente:

  • Le variabili di input definite in un argomento vengono passate all'argomento in fase di chiamata, in modo che il modello linguistico possa fornire dati strutturati al flusso deterministico.

  • Le variabili di output definite in un argomento vengono restituite al modello linguistico alla fine dell'esecuzione dell'argomento come coppie chiave-valore strutturate. Il modello linguistico include questi output nel contesto della conversazione ed è possibile farvi riferimento nei turni successivi.

  • Gli output delle chiamate degli strumenti seguono lo stesso modello: si inviano output al modello linguistico alla fine dell'esecuzione dello strumento e sono disponibili per un uso futuro all'interno della finestra del contesto della conversazione.

  • Il modello linguistico viene popolato con il contesto conversazionale, comprese le coppie chiave-valore di output delle chiamate dello strumento. Tuttavia, si restituiscono solo variabili di output definite in modo esplicito come dati strutturati. È possibile raccogliere un valore all'interno di un argomento, ad esempio un numero di account verificato. Definire tale valore come output. In caso contrario, il modello linguistico non può accedervi. L'agente potrebbe chiedere nuovamente al chiamante le stesse informazioni in un secondo momento.

Per altre informazioni, vedere Gestire gli input e gli output degli argomenti.

Supporto multilingue

Aggiungere tutte le lingue secondarie desiderate. Le stringhe di localizzazione non sono necessarie per i flussi in tempo reale. Tuttavia, per i messaggi degli argomenti deterministici, è necessario fornire i messaggi tradotti. Per altre informazioni, vedere Configurare e creare agenti multilingue.

Il modello in tempo reale può comprendere e rispondere in molte lingue. Tuttavia, Microsoft non convalida formalmente tutte le lingue per la disponibilità generale.

A partire da aprile 2026, le lingue seguenti vengono convalidate formalmente:

  • inglese (stati uniti) (en-us)
  • Spagnolo (Stati Uniti) (es-US)
  • Arabo
  • Portoghese (Brasile) (pt-BR)
  • Italiano (Italia) (it-IT)
  • Tedesco (Germania) (de-DE)
  • Olandese (Paesi Bassi) (nl-NL)
  • Francese (Canada) (fr-CA)

Microsoft continua a convalidare altre lingue e aggiungerle dopo il completamento della certificazione. È possibile aggiungere qualsiasi lingua supportata da Copilot Studio. Tuttavia, le lingue non completamente certificate per la qualità a livello di GA devono essere testate accuratamente prima della distribuzione in produzione.

Importante

La funzionalità del linguaggio tecnico non è uguale a un linguaggio supportato o certificato. Se si prevede di distribuire agenti in lingue diverse dall'inglese, è consigliabile eseguire test estesi con chiamanti e flussi di chiamata reali prima di andare in tempo reale.

Variabili del contesto

Un agente vocale in tempo reale supporta variabili di contesto che consentono di comportarsi in modo più intelligente trasportando informazioni sulla chiamata, sul chiamante e sulla conversazione corrente. Il sistema fornisce automaticamente un set limitato di chiamate e contesto di conversazione al modello in fase di esecuzione. Questo set include:

Variabile di contesto Descrizione
ID canale Identifica il canale di comunicazione usato per l'interazione. Questa identificazione consente al modello di comprendere che la conversazione si sta verificando su un canale vocale.
Numero di telefono chiamante (ANI) Numero di telefono di origine del chiamante. Il sistema può usare queste informazioni per supportare scenari di identificazione chiamante.
Numero del chiamato (DNIS) Numero di telefono di destinazione composto dal chiamante. Queste informazioni consentono di distinguere il numero aziendale o il punto di ingresso raggiunto.
ID conversazione Identificatore univoco per la sessione di chiamata attiva. Usare questo valore per correlare e mantenere la continuità all'interno di una singola conversazione.
Intestazioni SIP Insieme di coppie chiave-valore delle intestazioni SIP supportate associate alla chiamata. L'insieme include solo intestazioni non sensibili e supportate.
Data corrente (UTC) Data corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento della data.
Ora corrente (UTC) Ora corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento dell'ora.

Per tutte le altre variabili di contesto, seguire la procedura descritta in Configurare le variabili di contesto per gli agenti.

Voce agente

Selezionare la voce usata dall'agente selezionando l'agente e passare a Impostazioni>Voce>Seleziona voce. Gli agenti vocali in tempo reale supportano le voci seguenti:

  • Lega
  • Cenere
  • Ballata
  • Corallo
  • Echo
  • Sage
  • Shimmer
  • Verso
  • Marin
  • Cedar

Note

  • La voce dell'agente è destinata all'agente vocale in tempo reale e non è quella configurata nell'interfaccia di amministrazione del servizio Copilot.
  • Per abbinare le voci dei messaggi di sistema Dynamics con l'agente vocale in tempo reale, usare solo le voci supportate seguenti: Alloy, Echo, Shimmer o Ash.

Sensibilità vocale

Il rilevamento delle attività vocali con sensibilità vocale (VAD) determina quando l'agente deve rispondere dopo che il chiamante ha terminato di parlare.

Informazioni sui tipi VAD

Gli agenti vocali in tempo reale supportano due approcci VAD:

Screenshot della finestra di dialogo Sensibilità del discorso.

VAD basato su server - Basato sul suono (silenzio)

  • Rileva la fine del parlato in base ai segnali audio (durata del silenzio, volume)

  • Risponde rapidamente una volta rilevato il silenzio

  • Comportamento deterministico e prevedibile

  • Ideale per interazioni strutturate, risposte brevi, ambienti rumorosi

VAD semantico - Basato sul contesto della frase

  • Determina il completamento dei turni in base al significato di ciò che è stato detto

  • Valuta se il chiamante ha completato il loro pensiero

  • Si adatta alle pause naturali, alle parole riempitrici, al parlato finale

  • Ideale per: interazioni conversazionali, domande complesse, discussioni aperte

Selezionare il VAD corretto

Usare VAD basato su server quando tutte le condizioni seguenti sono vere:

  • Le interazioni sono strutturate (spostamento tramite menu in stile IVR).

  • Le risposte sono brevi e prevedibili.

  • Il rumore di fondo è un problema (il VAD semantico potrebbe aspettare troppo a lungo).

  • Vuoi un turno veloce e dinamico.

Usare VAD semantico quando tutte le condizioni seguenti sono vere:

  • Le conversazioni sono aperte.

  • I chiamanti potrebbero esitare o usare parole riempitive ("um", "lasciami pensare...").

  • Le domande sono complesse (i chiamanti spiegano le situazioni).

  • Il flusso di conversazione naturale è prioritario.

Configurare il vaD basato su server

Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>Basata sul suono (silenzio).

Screenshot della finestra di dialogo Sensibilità vocale quando è impostata su In base al suono (silenzio).

Parametro Descrizione Valore predefinito Intervallo consigliato
Soglia Sensibilità alla voce e rumore (scala 0-1) 0,6 0.5-0.7
Riempimento del prefisso (ms) Audio acquisito prima dell'avvio del riconoscimento vocale 300 ms 200-500 ms
Durata silenzio (ms) Silenzio necessario per terminare il turno 750 millisecondi 750-1000 ms

Soglia

  • Inferiore (0,3-0,4): più sensibile; raccoglie il parlato silenzioso, potrebbe attivare il rumore di fondo.

  • Superiore (0,7-0,9): meno sensibile; richiede un parlato più forte, riduce le falsi attivazioni.

  • Consigliato: iniziare con 0,5; aumentare se il rumore di fondo causa trigger falsi.

Spaziatura prefisso

  • Acquisisce l'audio prima del rilevamento vocale (impedisce di tagliare la prima parola).

  • Inferiore (200 ms): risposta più veloce; potrebbe perdere la prima sillaba.

  • Superiore (500 ms): acquisizione più sicura; lieve ritardo.

  • Consigliato: 300 ms (buon equilibrio).

Durata silenzio

  • Per quanto tempo il chiamante deve essere invisibile all'utente prima che l'agente risponda.

  • Inferiore (500 ms): rapido cambio di turno; potrebbe interrompere se il chiamante fa una pausa a metà pensiero.

  • Superiore (1000 ms): più paziente; potrebbe sentirsi lento.

  • Consigliato: iniziare con 750 ms.

Configurare il VAD semantico

Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>In base al contesto della frase.

Screenshot della finestra di dialogo Sensibilità vocale quando è impostata su In base al contesto della frase.

Parametro: Zelo (la velocità con cui l'agente risponde dopo il completamento semantico)

Impostazione Behavior Ideale per
Low Attende più a lungo, molto paziente Chiamanti che pensano ad alta voce, pause frequenti
Medium Bilanciato (impostazione predefinita) Conversazioni generali
Alto Risponde rapidamente Interazioni veloci, domande semplici

Configurazione DTMF

DTMF (Dual-Tone Multi-Frequency) consente ai chiamanti di immettere informazioni utilizzando il tastierino del telefono.

È possibile attivare DTMF per l'agente sia a livello di argomento che a livello globale. Per impostarlo a livello globale, selezionare l'agente e passare a Impostazioni>Comportamento> conversazionevocale>DTMF.

Per impostarlo per il nodo relativo all'argomento, per maggiori informazioni, consulta Attivare il supporto DTMF per l'agente abilitato per la voce.

Per supportare il completamento affidabile dell'input, è possibile configurare la temporizzazione e il comportamento di terminazione DTMF. Questa configurazione include un timeout tra cifre, che definisce per quanto tempo il sistema attende tra le pressioni dei tasti e un carattere di terminazione facoltativo (ad esempio # o *) che segnala in modo esplicito la fine dell'input. Quando si usa un carattere di terminazione, il sistema elabora immediatamente l'input senza attendere un timeout.

Rilevamento del silenzio

Il rilevamento del silenzio consente agli agenti vocali in tempo reale di riconoscere quando un chiamante non fornisce input per un periodo specificato. Configura il rilevamento del silenzio come impostazione vocale globale per l'agente andando su Impostazioni>Voce>Comportamento della conversazione>Rilevamento del silenzio.

Il timer di silenzio inizia quando l'agente termina la pronuncia e non rileva alcun input vocale o DTMF dal chiamante. Se viene raggiunto il timeout del silenzio, l'agente segue l'argomento di rilevamento del silenzio configurato.

Importante

  • Il rilevamento del silenzio non è attivato per impostazione predefinita. Se l'utente non parla, l'agente attende un tempo illimitato senza chiedere conferma. Attivare in modo esplicito il rilevamento del silenzio e configurare un messaggio di ripetizione per gestire i chiamanti silenziosi.

  • Il timeout di rilevamento del silenzio predefinito è 7.000 ms (7 secondi). Convalidare questo valore in base al caso d'uso specifico e all'ambiente chiamante prima della distribuzione nell'ambiente di produzione. Sette secondi potrebbero sembrare troppo lunghi per alcuni chiamanti o troppo brevi per altri a seconda della natura dell'interazione, ad esempio domande complesse o ambienti rumorosi. Testare con i dati delle chiamate reali per determinare la soglia appropriata per lo scenario.

  • Prima di abilitare il rilevamento del silenzio, assicurati che il comportamento configurato nell'argomento di rilevamento silenzio (ad esempio, Escalation, Interrompi, Richiedi) sia intenzionale e appropriato per il caso d'uso. Il comportamento di fallback configurato in modo errato, come impostare per errore il fallback su Escalare quando l'intenzione è di terminare la chiamata, o viceversa, può portare a risultati imprevisti delle chiamate.

Messaggi di latenza

Aggiungere messaggi di latenza o musica all'agente quando le operazioni in background richiedono più tempo del previsto. Per configurare la messaggistica di latenza, passare a Impostazioni>Voce>Comportamento conversazione>Messaggi di latenza.

Screenshot della finestra di dialogo di messaggistica sulla latenza.

Valutazione dell'agente vocale in tempo reale (anteprima)

Gli agenti vocali in tempo reale supportano l'invio di testo durante la valutazione, ma l'elaborazione audio non è supportata.