Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
[Questo articolo è una documentazione preliminare ed è soggetto a modifiche.]
Configurare un agente vocale in tempo reale attivando la voce in tempo reale, impostando le opzioni di base e configurando funzionalità come argomenti, supporto multilingue, DTMF e rilevamento del silenzio.
Configurare e abilitare la voce in tempo reale
Creare un nuovo agente e configurarne i dettagli di base, ad esempio un nome descrittivo e lo scopo dell'agente nella descrizione.
Passare alle impostazioni voce dell'agente e attivare Abilita voce e quindi in Tipo voce selezionare Voce in tempo reale. Per altre informazioni, vedere Scegliere come gestire la voce.
Importante
Questa impostazione è una selezione una tantum. Dopo aver selezionato Voce in tempo reale, non è possibile tornare alla voce Basic. Per usare la voce Basic, creare un nuovo agente.
Selezionare il modello vocale in tempo reale che si vuole usare, **GPT-Realtime o GPT-Realtime-Mini. Per altre informazioni sulle differenze tra questi modelli, vedere Prerequisiti regionali.
Passare alle impostazioni di sicurezza dell'agente e selezionare Nessuna autenticazione.
Conoscenza e strumenti
È possibile configurare l'agente per l'uso di informazioni e strumenti. Per altre informazioni, vedere Riepilogo delle origini delle informazioni, Aggiungere strumenti a agenti personalizzati e strumenti, conoscenza, MCP e API.
Agenti annidati (anteprima)
Gli agenti vocali in tempo reale supportano solo gli agenti figlio.
Importante
Assicurati che le descrizioni degli agenti figli non si sovrappongano alle descrizioni degli argomenti. Definire in modo esplicito l'ordine di chiamata nelle istruzioni dell'agente.
Argomenti
Gli agenti vocali in tempo reale supportano tutti gli argomenti configurati in Copilot Studio. Usare argomenti per definire comportamenti deterministici, ad esempio saluti, regole business ed escalation, mentre il modello vocale in tempo reale gestisce le risposte conversazionali in fase di esecuzione. Per altre informazioni, vedere Scegliere come controllare la conversazione.
Procedure consigliate quando si usano argomenti con agenti vocali in tempo reale
Usare gli argomenti solo quando è necessario un comportamento deterministico.
Usare il testo statico nei messaggi di saluto per la prima risposta più veloce. I messaggi dinamici con variabili ed espressioni aumentano la latenza iniziale.
Disabilitare l'argomento Avvio conversazione se si vuole che il modello vocale in tempo reale gestisca il messaggio di saluto. In caso contrario, il messaggio di saluto configurato nell'argomento Avvio conversazione viene riprodotto anziché il messaggio di saluto del modello vocale.
Consentire al modello vocale in tempo reale di gestire la conversazione generale e le domande di completamento.
Includi un'azione esplicita nella sezione On Error, ad esempio il trasferimento o la terminazione della chiamata. La gestione degli errori basata solo su messaggi non è sufficiente. Senza un passaggio successivo deterministico, i clienti potrebbero sperimentare il silenzio o le chiamate bloccate, causando confusione e scarse esperienze vocali.
Usare descrizioni esplicite di argomenti e strumenti per dichiarare la proprietà della raccolta dati. Per altre informazioni, vedere Scrivere descrizioni di strumenti e argomenti efficaci.
Supporto per i nodi tematici
L'elenco seguente descrive il supporto degli argomenti negli agenti vocali in tempo reale:
Nodo di condizione
| Feature | Assistenza |
|---|---|
| Diramazione if/Else | Supportato |
| Espressioni Power Fx | Supportato |
| Rielaborazione del riempimento degli slot | Supportato |
Nodo messaggio
| Feature | Assistenza |
|---|---|
| Messaggio di base | Supportato |
| Varianti dei messaggi | Supportato |
| Inserimento di variabili | Supportato |
| SSML | Supportato |
| Contenuti multimediali/schede adattive | Non applicabile |
| Risposte rapide | Non applicabile |
Nodo di domanda
| Feature | Assistenza |
|---|---|
| Testo prompt | Supportato |
| Blocco automatico | Non supportato |
| Riempimento slot | Supportato |
| Ignora comportamento/riempimento dello slot Greedy | Supportato |
| Esegui prompt nuovamente/Riprova | Supportato |
| Gestione delle risposte non valida | Supportato |
| Interruzione dell'argomento | Supportato |
| Intrusione | Supportato |
| Messaggio di ripetizione personalizzato | Supportato |
| Input DTMF | Supportato |
| Rilevamento del silenzio | Supportato |
Nodo HTTP
| Feature | Assistenza |
|---|---|
| Metodi HTTP: GET, POST, PUT, PATCH, DELETE | Supportato |
| Endpoint URL | Supportato |
| Intestazioni e payload | Supportato |
| Analisi e schema delle risposte | Supportato |
| Mapping delle variabili | Supportato |
| Gestione degli errori | Supportato |
Nodo dello strumento
| Feature | Assistenza |
|---|---|
| Flusso di Power Automate | Supportato |
| Chiamata allo strumento | Supportato |
| Mappatura di input/output | Supportato |
| Nuovo prompt | Supportato |
Imposta il valore della variabile nodo
| Feature | Assistenza |
|---|---|
| Assegnazione letterale | Supportato |
| Assegnazione di espressione | Supportato |
| Variabile a variabile | Supportato |
Nodo di gestione degli argomenti
| Feature | Assistenza |
|---|---|
| Terminare l'argomento corrente | Supportato |
| Terminare tutti gli argomenti | Supportato |
| Terminare la conversazione | Supportato |
| Vai alla fase | Supportato |
| Input dell'utente per riconoscere la finalità | Supportato |
| Passare a un altro argomento | Supportato |
Trasferire il nodo della conversazione
| Feature | Assistenza |
|---|---|
| Trasferisci ad agente | Supportato |
| Trasferimento di numeri di telefono esterni | Supportato |
Advanced
| Feature | Assistenza |
|---|---|
| Creare risposte generative | Supportato |
Supporto del trigger di sistema
| Trigger | Assistenza | dettagli |
|---|---|---|
| All'inizio della conversazione | Supportato | Viene generato quando inizia una nuova conversazione |
| Parla con un rappresentante | Supportato | Trasferimento a un agente umano |
| Argomento sconosciuto/Su finalità sconosciuta | Non supportato | Fallback quando nessun argomento corrisponde |
| OnSelectIntent (più argomenti corrispondenti) | Non supportato | Disambiguazione tra argomenti simili |
| Reimposta conversazione (OnSystemRedirect) | Supportato | Cancella le variabili e riavvia il flusso |
| Al momento dell'accesso | Non supportato | |
| Tasto DTMF sconosciuto | Supportato | Input del tastierino non mappato |
| L'agente sceglie/L'utente dice una frase | Supportato | Agent seleziona l'argomento in base alla finalità |
| Viene ricevuto un messaggio | Non supportato | Aumenta la latenza |
| Si verifica un evento client personalizzato | Non supportato | Solo all'avvio della sessione |
| Aggiornamento della conversazione | Non supportato | Membri aggiunti o rimossi, modifiche alla sessione |
| Viene richiamato | Non supportato | Richiede l'interfaccia utente sincrona |
| Viene reindirizzato | Supportato | |
| L'utente è inattivo da un po'/Rilevamento del silenzio | Supportato | Timeout di inattività dell'utente |
| Viene completato un piano | Non supportato | |
| Risposta di intelligenza artificiale generata | Non supportato | |
| In caso di errore | Supportato | Gestisce gli errori di orchestrazione |
Trasferire variabili tra argomenti e il modello linguistico
Quando usi argomenti in un flusso di conversazione ibrida, comprendere come passare variabili tra argomenti e il modello linguistico in tempo reale è fondamentale per la creazione di interazioni affidabili e con stato.
Questa funzionalità funziona tramite il processo seguente:
Le variabili di input definite in un argomento vengono passate all'argomento in fase di chiamata, in modo che il modello linguistico possa fornire dati strutturati al flusso deterministico.
Le variabili di output definite in un argomento vengono restituite al modello linguistico alla fine dell'esecuzione dell'argomento come coppie chiave-valore strutturate. Il modello linguistico include questi output nel contesto della conversazione ed è possibile farvi riferimento nei turni successivi.
Gli output delle chiamate degli strumenti seguono lo stesso modello: si inviano output al modello linguistico alla fine dell'esecuzione dello strumento e sono disponibili per un uso futuro all'interno della finestra del contesto della conversazione.
Il modello linguistico viene popolato con il contesto conversazionale, comprese le coppie chiave-valore di output delle chiamate dello strumento. Tuttavia, si restituiscono solo variabili di output definite in modo esplicito come dati strutturati. È possibile raccogliere un valore all'interno di un argomento, ad esempio un numero di account verificato. Definire tale valore come output. In caso contrario, il modello linguistico non può accedervi. L'agente potrebbe chiedere nuovamente al chiamante le stesse informazioni in un secondo momento.
Per altre informazioni, vedere Gestire gli input e gli output degli argomenti.
Supporto multilingue
Aggiungere tutte le lingue secondarie desiderate. Le stringhe di localizzazione non sono necessarie per i flussi in tempo reale. Tuttavia, per i messaggi degli argomenti deterministici, è necessario fornire i messaggi tradotti. Per altre informazioni, vedere Configurare e creare agenti multilingue.
Il modello in tempo reale può comprendere e rispondere in molte lingue. Tuttavia, Microsoft non convalida formalmente tutte le lingue per la disponibilità generale.
A partire da aprile 2026, le lingue seguenti vengono convalidate formalmente:
- inglese (stati uniti) (en-us)
- Spagnolo (Stati Uniti) (es-US)
- Arabo
- Portoghese (Brasile) (pt-BR)
- Italiano (Italia) (it-IT)
- Tedesco (Germania) (de-DE)
- Olandese (Paesi Bassi) (nl-NL)
- Francese (Canada) (fr-CA)
Microsoft continua a convalidare altre lingue e aggiungerle dopo il completamento della certificazione. È possibile aggiungere qualsiasi lingua supportata da Copilot Studio. Tuttavia, le lingue non completamente certificate per la qualità a livello di GA devono essere testate accuratamente prima della distribuzione in produzione.
Importante
La funzionalità del linguaggio tecnico non è uguale a un linguaggio supportato o certificato. Se si prevede di distribuire agenti in lingue diverse dall'inglese, è consigliabile eseguire test estesi con chiamanti e flussi di chiamata reali prima di andare in tempo reale.
Variabili del contesto
Un agente vocale in tempo reale supporta variabili di contesto che consentono di comportarsi in modo più intelligente trasportando informazioni sulla chiamata, sul chiamante e sulla conversazione corrente. Il sistema fornisce automaticamente un set limitato di chiamate e contesto di conversazione al modello in fase di esecuzione. Questo set include:
| Variabile di contesto | Descrizione |
|---|---|
| ID canale | Identifica il canale di comunicazione usato per l'interazione. Questa identificazione consente al modello di comprendere che la conversazione si sta verificando su un canale vocale. |
| Numero di telefono chiamante (ANI) | Numero di telefono di origine del chiamante. Il sistema può usare queste informazioni per supportare scenari di identificazione chiamante. |
| Numero del chiamato (DNIS) | Numero di telefono di destinazione composto dal chiamante. Queste informazioni consentono di distinguere il numero aziendale o il punto di ingresso raggiunto. |
| ID conversazione | Identificatore univoco per la sessione di chiamata attiva. Usare questo valore per correlare e mantenere la continuità all'interno di una singola conversazione. |
| Intestazioni SIP | Insieme di coppie chiave-valore delle intestazioni SIP supportate associate alla chiamata. L'insieme include solo intestazioni non sensibili e supportate. |
| Data corrente (UTC) | Data corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento della data. |
| Ora corrente (UTC) | Ora corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento dell'ora. |
Per tutte le altre variabili di contesto, seguire la procedura descritta in Configurare le variabili di contesto per gli agenti.
Voce agente
Selezionare la voce usata dall'agente selezionando l'agente e passare a Impostazioni>Voce>Seleziona voce. Gli agenti vocali in tempo reale supportano le voci seguenti:
- Lega
- Cenere
- Ballata
- Corallo
- Echo
- Sage
- Shimmer
- Verso
- Marin
- Cedar
Note
- La voce dell'agente è destinata all'agente vocale in tempo reale e non è quella configurata nell'interfaccia di amministrazione del servizio Copilot.
- Per abbinare le voci dei messaggi di sistema Dynamics con l'agente vocale in tempo reale, usare solo le voci supportate seguenti: Alloy, Echo, Shimmer o Ash.
Sensibilità vocale
Il rilevamento delle attività vocali con sensibilità vocale (VAD) determina quando l'agente deve rispondere dopo che il chiamante ha terminato di parlare.
Informazioni sui tipi VAD
Gli agenti vocali in tempo reale supportano due approcci VAD:
VAD basato su server - Basato sul suono (silenzio)
Rileva la fine del parlato in base ai segnali audio (durata del silenzio, volume)
Risponde rapidamente una volta rilevato il silenzio
Comportamento deterministico e prevedibile
Ideale per interazioni strutturate, risposte brevi, ambienti rumorosi
VAD semantico - Basato sul contesto della frase
Determina il completamento dei turni in base al significato di ciò che è stato detto
Valuta se il chiamante ha completato il loro pensiero
Si adatta alle pause naturali, alle parole riempitrici, al parlato finale
Ideale per: interazioni conversazionali, domande complesse, discussioni aperte
Selezionare il VAD corretto
Usare VAD basato su server quando tutte le condizioni seguenti sono vere:
Le interazioni sono strutturate (spostamento tramite menu in stile IVR).
Le risposte sono brevi e prevedibili.
Il rumore di fondo è un problema (il VAD semantico potrebbe aspettare troppo a lungo).
Vuoi un turno veloce e dinamico.
Usare VAD semantico quando tutte le condizioni seguenti sono vere:
Le conversazioni sono aperte.
I chiamanti potrebbero esitare o usare parole riempitive ("um", "lasciami pensare...").
Le domande sono complesse (i chiamanti spiegano le situazioni).
Il flusso di conversazione naturale è prioritario.
Configurare il vaD basato su server
Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>Basata sul suono (silenzio).
| Parametro | Descrizione | Valore predefinito | Intervallo consigliato |
|---|---|---|---|
| Soglia | Sensibilità alla voce e rumore (scala 0-1) | 0,6 | 0.5-0.7 |
| Riempimento del prefisso (ms) | Audio acquisito prima dell'avvio del riconoscimento vocale | 300 ms | 200-500 ms |
| Durata silenzio (ms) | Silenzio necessario per terminare il turno | 750 millisecondi | 750-1000 ms |
Soglia
Inferiore (0,3-0,4): più sensibile; raccoglie il parlato silenzioso, potrebbe attivare il rumore di fondo.
Superiore (0,7-0,9): meno sensibile; richiede un parlato più forte, riduce le falsi attivazioni.
Consigliato: iniziare con 0,5; aumentare se il rumore di fondo causa trigger falsi.
Spaziatura prefisso
Acquisisce l'audio prima del rilevamento vocale (impedisce di tagliare la prima parola).
Inferiore (200 ms): risposta più veloce; potrebbe perdere la prima sillaba.
Superiore (500 ms): acquisizione più sicura; lieve ritardo.
Consigliato: 300 ms (buon equilibrio).
Durata silenzio
Per quanto tempo il chiamante deve essere invisibile all'utente prima che l'agente risponda.
Inferiore (500 ms): rapido cambio di turno; potrebbe interrompere se il chiamante fa una pausa a metà pensiero.
Superiore (1000 ms): più paziente; potrebbe sentirsi lento.
Consigliato: iniziare con 750 ms.
Configurare il VAD semantico
Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>In base al contesto della frase.
Parametro: Zelo (la velocità con cui l'agente risponde dopo il completamento semantico)
| Impostazione | Behavior | Ideale per |
|---|---|---|
| Low | Attende più a lungo, molto paziente | Chiamanti che pensano ad alta voce, pause frequenti |
| Medium | Bilanciato (impostazione predefinita) | Conversazioni generali |
| Alto | Risponde rapidamente | Interazioni veloci, domande semplici |
Configurazione DTMF
DTMF (Dual-Tone Multi-Frequency) consente ai chiamanti di immettere informazioni utilizzando il tastierino del telefono.
È possibile attivare DTMF per l'agente sia a livello di argomento che a livello globale. Per impostarlo a livello globale, selezionare l'agente e passare a Impostazioni>Comportamento> conversazionevocale>DTMF.
Per impostarlo per il nodo relativo all'argomento, per maggiori informazioni, consulta Attivare il supporto DTMF per l'agente abilitato per la voce.
Per supportare il completamento affidabile dell'input, è possibile configurare la temporizzazione e il comportamento di terminazione DTMF. Questa configurazione include un timeout tra cifre, che definisce per quanto tempo il sistema attende tra le pressioni dei tasti e un carattere di terminazione facoltativo (ad esempio # o *) che segnala in modo esplicito la fine dell'input. Quando si usa un carattere di terminazione, il sistema elabora immediatamente l'input senza attendere un timeout.
Rilevamento del silenzio
Il rilevamento del silenzio consente agli agenti vocali in tempo reale di riconoscere quando un chiamante non fornisce input per un periodo specificato. Configura il rilevamento del silenzio come impostazione vocale globale per l'agente andando su Impostazioni>Voce>Comportamento della conversazione>Rilevamento del silenzio.
Il timer di silenzio inizia quando l'agente termina la pronuncia e non rileva alcun input vocale o DTMF dal chiamante. Se viene raggiunto il timeout del silenzio, l'agente segue l'argomento di rilevamento del silenzio configurato.
Importante
Il rilevamento del silenzio non è attivato per impostazione predefinita. Se l'utente non parla, l'agente attende un tempo illimitato senza chiedere conferma. Attivare in modo esplicito il rilevamento del silenzio e configurare un messaggio di ripetizione per gestire i chiamanti silenziosi.
Il timeout di rilevamento del silenzio predefinito è 7.000 ms (7 secondi). Convalidare questo valore in base al caso d'uso specifico e all'ambiente chiamante prima della distribuzione nell'ambiente di produzione. Sette secondi potrebbero sembrare troppo lunghi per alcuni chiamanti o troppo brevi per altri a seconda della natura dell'interazione, ad esempio domande complesse o ambienti rumorosi. Testare con i dati delle chiamate reali per determinare la soglia appropriata per lo scenario.
Prima di abilitare il rilevamento del silenzio, assicurati che il comportamento configurato nell'argomento di rilevamento silenzio (ad esempio, Escalation, Interrompi, Richiedi) sia intenzionale e appropriato per il caso d'uso. Il comportamento di fallback configurato in modo errato, come impostare per errore il fallback su Escalare quando l'intenzione è di terminare la chiamata, o viceversa, può portare a risultati imprevisti delle chiamate.
Messaggi di latenza
Aggiungere messaggi di latenza o musica all'agente quando le operazioni in background richiedono più tempo del previsto. Per configurare la messaggistica di latenza, passare a Impostazioni>Voce>Comportamento conversazione>Messaggi di latenza.
Valutazione dell'agente vocale in tempo reale (anteprima)
Gli agenti vocali in tempo reale supportano l'invio di testo durante la valutazione, ma l'elaborazione audio non è supportata.