Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Questo articolo contiene un riferimento rapido e una descrizione dettagliata delle quote e dei limiti per Azure OpenAI.
Ambito della quota
Le quote e i limiti non vengono applicati a livello di tenant. Al contrario, il livello massimo di restrizioni di quota è ambito al livello di abbonamento di Azure.
Allocazione della quota a livello di area
I token al minuto (TPM) e le richieste al minuto (RPM) sono definiti per area, per sottoscrizione e per modello o tipo di distribuzione.
Ad esempio, se il modello gpt-4.1 Global Standard è elencato con una quota di 5 milioni di TPM e 5.000 RPM, ogni regione in cui è disponibile il modello o tipo di distribuzione ha un proprio pool di quote dedicato per ciascuna delle sottoscrizioni Azure. All'interno di una singola sottoscrizione Azure, è possibile usare una quantità maggiore di quote TPM e RPM totali per un determinato modello e tipo di distribuzione, purché si disponga di risorse e distribuzioni di modelli distribuite in più aree.
Livelli di quota
Sono stati introdotti modelli di quota per migliorare l'esperienza dei modelli Foundry e ridurre le difficoltà man mano che i carichi di lavoro aumentano. Le quote aumentano automaticamente con l'utilizzo, consentendo di evitare errori di limite di velocità, creando anche un ambiente più equo per tutti gli utenti. Verranno resi disponibili sette livelli: livello gratuito e livelli da 1 a 6, con il livello 6 che offre le quote più elevate. Il livello assegnato iniziale di un cliente si basa sull'utilizzo corrente di tale modello e sulla relazione corrente con Microsoft, ad esempio lo stato contratto Enterprise (EA o MCA-E).
Cosa cambia per me?
In precedenza, Foundry offriva solo i livelli di quota Predefinita ed Enterprise per le offerte 'pay as you go', con un grande divario tra ciascun livello e un processo più lungo per richiedere incrementi. Con i livelli di quota, a tutti gli utenti viene assegnato un livello con quote uguali o superiori ai livelli precedenti. Eventuali aumenti di quota approvati in precedenza vengono mantenuti e non verranno ridotti. Con l'aumentare dell'utilizzo, Foundry aumenta automaticamente le quote spostando gli utenti a livelli più elevati e la quota aggiuntiva può comunque essere richiesta tramite il modulo di quota.
In che modo un cliente passerà automaticamente da un livello a un altro, ad esempio quali sono i criteri di modifica del livello?
Gli aggiornamenti automatici dei livelli si basano principalmente sulle tendenze di consumo dei clienti nei modelli Foundry nel corso del tempo. Se l'utilizzo di un cliente aumenta in modo che il livello di quota corrente limiti la possibilità di usare i modelli Foundry, il sistema aggiornerà automaticamente il cliente al livello superiore successivo. Viene presa in considerazione anche la relazione di un cliente con Microsoft. Ai clienti con relazioni Enterprise (inclusi EA e MCA-E) con Microsoft vengono assegnati livelli di quota più elevati. Inoltre, Microsoft considererà anche la cronologia dei pagamenti di un cliente per determinare l'idoneità per gli aggiornamenti automatici.
È possibile rifiutare esplicitamente gli aggiornamenti automatici?
Sì, è possibile rifiutare esplicitamente gli aggiornamenti automatici e rimanere nel livello corrente indipendentemente dalle modifiche apportate all'utilizzo. Alcuni clienti usano la quota per gestire la fatturazione. Questa non è la Azure procedura consigliata, tuttavia, sappiamo che se il sistema è configurato in questo modo non vogliamo interromperlo. Per altre informazioni sulla gestione della fatturazione e sulle procedure consigliate, vedere Gestione costi.
Per rifiutare esplicitamente, è possibile impostare il flag seguente su NoAutoUpgrade:
curl -X PATCH \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
-H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"properties": {
"tierUpgradePolicy": "NoAutoUpgrade"
}
}'
Nota
La funzionalità di rifiuto esplicito è in anteprima e potrebbe essere soggetta a modifiche/rimozione in futuro.
È possibile richiedere più quote?
Sì, usando il modulo di richiesta di quota è sempre possibile richiedere più quota. Se la richiesta viene approvata, il livello corrente rimarrà invariato, ma con più quote assegnate.
Come è possibile controllare il livello di quota della sottoscrizione?
È attualmente possibile controllare il livello di quota con l'API del piano di controllo:
curl -X GET \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
-H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
-H "Content-Type: application/json"
Riferimento ai livelli di quota
Livello 1
| Nome modello | Tipo di distribuzione | Richieste al minuto (RPM) | Token Per Minuto (TPM) |
|---|---|---|---|
| codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| computer-use-preview | GlobalStandard | 4,500 | 450.000 |
| gpt-4.1 | DataZoneStandard | 300 | 300,000 |
| gpt-4.1 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-4.1-mini | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-mini | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4.1-mini | Standard | 6,000 | 6,000,000 |
| gpt-4.1-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4o | DataZoneStandard | 300 / 10 secondi | 300,000 |
| gpt-4o-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini | DataZoneStandard | 10.000 | 1,000,000 |
| gpt-4o-mini | GlobalStandard | 20,000 | 2,000,000 |
| gpt-4o-mini-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini-anteprima-in-tempo-reale | GlobalStandard | 36 | 6,000 |
| gpt-4o-realtime-preview | GlobalStandard | 36 | 6,000 |
| gpt-5 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-mini | DataZoneStandard | 300 | 300,000 |
| gpt-5-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5-pro | GlobalStandard | 1,600 | 160,000 |
| gpt-5.1 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1 | Standard | 3,000 | 300,000 |
| gpt-5.1-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.1-codex-max | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.2 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.2-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4 | DataZoneStandard | 300 | 300,000 |
| gpt-5.4 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4-pro | GlobalStandard | 160 | 160,000 |
| gpt-5.4-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.4-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5.4-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5.5 | DataZoneStandard | 0 | 0 |
| gpt-5.5 | GlobalStandard | 0 | 0 |
| gpt-5.6-luna | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-luna | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-sol | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-sol | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-terra | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-terra | GlobalStandard | 1,000 | 1,000,000 |
| gpt-chat-latest | GlobalStandard | 10.000 | 1,000,000 |
| gpt-audio | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-image-1 | GlobalStandard | 9 | - |
| gpt-image-1-mini | GlobalStandard | 12 | - |
| gpt-image-1.5 | DataZoneStandard | 3 | - |
| gpt-image-1.5 | GlobalStandard | 9 | - |
| gpt-image-2 | DataZoneStandard | 2 | - |
| gpt-image-2 | GlobalStandard | 6 | - |
| gpt-realtime | GlobalStandard | 200 | 100,000 |
| modello-router | DataZoneStandard | 300 | 300,000 |
| modello-router | GlobalStandard | 1,000 | 1,000,000 |
| o1 | DataZoneStandard | 100 | 600,000 |
| o1 | GlobalStandard | 500 | 3,000,000 |
| o3 | DataZoneStandard | 300 | 300,000 |
| o3 | GlobalStandard | 1,000 | 1,000,000 |
| o3-deep-research | GlobalStandard | 3,000 | 3,000,000 |
| o3-mini | DataZoneStandard | 200 | 2,000,000 |
| o3-mini | GlobalStandard | 500 | 5,000,000 |
| o3-pro | GlobalStandard | 160 | 1,600,000 |
| o4-mini | DataZoneStandard | 300 / 10 secondi | 300,000 |
| o4-mini | GlobalStandard | 1,000 | 1,000,000 |
| text-embedding-3-large | DataZoneStandard | 1,000 | 1,000,000 |
| text-embedding-3-large | GlobalStandard | 1000 / 10 secondi | 1,000,000 |
| text-embedding-3-small | DataZoneStandard | 1,000 | 1,000,000 |
| text-embedding-3-small | GlobalStandard | 1000 / 10 secondi | 1,000,000 |
Informazioni di riferimento su quote e limiti
La sezione seguente fornisce una guida rapida alle quote e ai limiti predefiniti applicabili a Azure OpenAI:
| Nome limite | Valore limite |
|---|---|
| Risorse di Azure OpenAI per regione, per sottoscrizione Azure | 30. |
| Limiti di quota GPT-image-1 predefiniti | 9 richieste al minuto |
| Limiti predefiniti di quota GPT-image-1-mini | 12 richieste al minuto |
| Limiti di quota GPT-image-1.5 predefiniti | 9 richieste al minuto |
| Limiti di quota GPT-image-2 predefiniti | 9 richieste al minuto |
| Limiti di quota Sora predefiniti | 60 richieste al minuto. |
| Limiti di quota di Sora 2 predefiniti | 2 richieste di lavoro1 al minuto |
| Limiti predefiniti per la quota di utilizzo dell'API audio da voce a testo | 3 richieste al minuto. |
| Numero massimo di token del prompt per richiesta | Varia per modello. Per altre informazioni, vedere Azure modelli OpenAI. |
| Numero massimo di distribuzioni standard per risorsa | 32. |
| Numero massimo di distribuzioni di modelli finemente ottimizzati | 10. |
| Numero totale di processi di training per risorsa | 100. |
| Numero massimo di lavori di addestramento contemporaneamente in esecuzione per risorsa | Formazione standard e globale: 3; Formazione per sviluppatori: 5 |
| Numero massimo di processi di training in coda | 20. |
| Numero massimo di file per risorsa (ottimizzazione) | 100. |
| Dimensioni totali di tutti i file per risorsa (ottimizzazione) | 1 GB. |
| Tempo massimo del compito di addestramento (il lavoro viene interrotto se superato) | 720 ore. |
Dimensioni massime del processo di training (tokens in training file) x (# of epochs) |
2 miliardi. |
| Dimensioni massime di tutti i file per ogni caricamento (Azure OpenAI sui tuoi dati) | 16 MB. |
Numero massimo di input nella matrice con /embeddings |
2,048. |
Massimo numero di token per richiesta /embeddings (somma su tutti gli input) |
300,000. |
Numero massimo di /chat/completions messaggi |
2,048. |
Numero massimo di /chat/completions funzioni |
128. |
Numero massimo di /chat/completions strumenti |
128. |
| Numero massimo di unità elaborate con provisioning per distribuzione | 100,000. |
| Numero massimo di file per assistente o thread | 10.000 quando si usa l'API o il portale Microsoft Foundry. |
| Dimensioni massime dei file per assistenti e ottimizzazione | 512 MB tramite l'API 200 MB tramite il portale Foundry. |
| Numero massimo di richieste di caricamento file per risorsa | 30 richieste al secondo. |
| Dimensioni massime per tutti i file caricati per gli assistenti | 200 GB. |
| Limite di token degli assistenti | Limite di 2.000.000 token. |
GPT-4o e GPT-4.1 numero massimo di immagini per richiesta (numero di immagini nella matrice di messaggi o nella cronologia delle conversazioni) |
50. |
GPT-4 vision-preview and GPT-4 turbo-2024-04-09 massimi token predefiniti |
16. Aumentare il valore del max_tokens parametro per evitare risposte troncate.
GPT-4o il valore predefinito del massimo dei token è impostato a 4.096. |
| Numero massimo di intestazioni personalizzate nelle richieste API2 | 10. |
| Limite di caratteri del messaggio | 1,048,576. |
| Dimensioni dei messaggi per i file audio | 20 MB. |
1 La quota Sora 2 RPM conta solo le richieste di elaborazione video. Altri tipi di richieste non sono limitati a livello di frequenza.
2 Le API correnti consentono fino a 10 intestazioni personalizzate, che vengono passate attraverso la pipeline e restituite. Alcuni clienti ora superano il limite di questo numero di intestazioni, causando errori HTTP 431. Non esiste alcuna soluzione per questo errore, ad eccezione di ridurre il volume dell'intestazione. Nelle versioni future dell'API non verranno passate intestazioni personalizzate. È consigliabile che i clienti non dipendano dalle intestazioni personalizzate nelle future architetture di sistema.
Nota
I limiti di quota sono soggetti a modifiche.
Limiti relativi a Batch
| Nome limite | Valore limite |
|---|---|
| Numero massimo di file di input batch - (nessuna scadenza) | 500 |
| Numero massimo di file di input batch - (scadenza impostata) | 10.000 |
| Dimensioni massime del file di input | 200 MB |
| Dimensioni massime del file di input - Bring Your Own Storage (BYOS) | 1 GB |
| Numero massimo di richieste per file | 100,000 |
Nota
I limiti dei file batch non si applicano ai file di output ( ad esempio , result.jsonle error.jsonl). Per rimuovere i limiti dei file di input batch, usare Batch con Archiviazione BLOB di Azure.
Quota batch
La tabella mostra il limite di quota batch. I valori delle quote per il batch globale sono rappresentati in termini di token accodati. Quando si invia un file per l'elaborazione batch, viene conteggiato il numero di token nel file. Fino a quando il processo batch non raggiunge uno stato terminale, questi token vengono conteggiati rispetto al limite totale di token accodati.
Batch globale
| Modello | Enterprise e MCA-E | Predefinito | Sottoscrizioni mensili basate su carta di credito | Sottoscrizioni MSDN | Azure per studenti, versioni di valutazione gratuite |
|---|---|---|---|---|---|
gpt-4.1 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-4.1 mini |
15B | 1B | 50M | 90.000 | N/D |
gpt-4.1-nano |
15B | 1B | 50M | 90.000 | N/D |
gpt-4o |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-4o-mini |
15B | 1B | 50M | 90.000 | N/D |
gpt-4-turbo |
300 milioni | 80M | 40M | 90.000 | N/D |
gpt-4 |
150 milioni | 30 milioni | 5M | 100.000 | N/D |
o3-mini |
15B | 1B | 50M | 90.000 | N/D |
o4-mini |
15B | 1B | 50M | 90.000 | N/D |
gpt-5 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-5.1 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-5.2 |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.4 |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.4-mini |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.4-nano |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.5 |
5B | 200 mil. | 50M | 90.000 | N/D |
B = miliardi | M = milioni | K = migliaia
Batch zona dati
| Modello | Enterprise e MCA-E | Predefinito | Sottoscrizioni mensili basate su carta di credito | Sottoscrizioni MSDN | Azure per studenti, versioni di valutazione gratuite |
|---|---|---|---|---|---|
gpt-4.1 |
500 milioni | 30 milioni | 30 milioni | 90.000 | N/D |
gpt-4.1-mini |
1,5 miliardi | 100 milioni | 50M | 90.000 | N/D |
gpt-4o |
500 milioni | 30 milioni | 30 milioni | 90.000 | N/D |
gpt-4o-mini |
1,5 miliardi | 100 milioni | 50M | 90.000 | N/D |
o3-mini |
1,5 miliardi | 100 milioni | 50M | 90.000 | N/D |
gpt-5 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-5.1 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-5.4 |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.4-mini |
5B | 200 mil. | 50M | N/D | N/D |
gpt-5.5 |
5B | 200 mil. | 50M | 90.000 | N/D |
gpt-oss
| Modello | Token al minuto (TPM) | Richieste al minuto (RPM) |
|---|---|---|
gpt-oss-120b |
5 milioni | 5 K |
Livelli di utilizzo
Le distribuzioni standard globali usano l'infrastruttura globale di Azure. Instradano dinamicamente il traffico dei clienti al data center con la migliore disponibilità per le richieste di inferenza del cliente. Analogamente, le distribuzioni di Data Zone Standard consentono di usare l'infrastruttura globale di Azure per instradare dinamicamente il traffico al data center all'interno della zona dati definita dall'Microsoft con la migliore disponibilità per ogni richiesta. Questa pratica consente una latenza più coerente per i clienti con livelli di traffico da basso a medio. I clienti con elevati livelli di utilizzo sostenuti potrebbero riscontrare una maggiore variabilità nella latenza di risposta.
Azure livelli di utilizzo OpenAI sono progettati per offrire prestazioni coerenti per la maggior parte dei clienti con livelli di traffico da basso a medio. Ogni livello di utilizzo definisce la velocità effettiva massima (token al minuto) che è possibile prevedere con una latenza prevedibile. Quando l'utilizzo rimane entro il livello assegnato, la latenza rimane stabile e i tempi di risposta sono coerenti.
Cosa accade se si supera il livello di utilizzo?
- Se la velocità effettiva della richiesta supera il livello di utilizzo, soprattutto durante i periodi di domanda elevata, la latenza della risposta può aumentare significativamente.
- La latenza può variare e, in alcuni casi, può essere più di due volte superiore rispetto a quando si opera all'interno del livello di utilizzo.
- Questa variabilità è più evidente per i clienti con un uso elevato costante o modelli di traffico a scatti.
Azioni consigliate se si supera il livello di utilizzo
Se si verificano errori 429 o si nota un aumento della variabilità della latenza, ecco le operazioni da eseguire:
- Richiedere un aumento della quota: visitare il portale di Azure per richiedere una quota superiore per la sottoscrizione.
- Provare a eseguire l'aggiornamento a un'offerta premium (PTU): per carichi di lavoro critici in termini di latenza o con volumi elevati, eseguire l'aggiornamento alle unità elaborate con provisioning (PTU). PTU offre risorse dedicate, capacità garantita e latenza prevedibile, anche su larga scala. Questa è la scelta migliore per le applicazioni cruciali che richiedono prestazioni coerenti.
- Monitorare l'utilizzo: esaminare regolarmente le metriche di utilizzo nel portale di Azure per assicurarsi di operare entro i limiti del livello. Modificare il carico di lavoro o la strategia di distribuzione in base alle esigenze.
È possibile ricevere risposte 429 (troppe richieste) anche quando le metriche di utilizzo dei token vengono visualizzate sotto la quota. Per una spiegazione del motivo, vedere Perché potrebbero essere visualizzati 429 anche quando le metriche di utilizzo dei token sono inferiori alla quota.
Il limite di utilizzo determina il livello di utilizzo superiore al quale i clienti potrebbero riscontrare una maggiore variabilità nella latenza di risposta. L'utilizzo di un cliente è definito per modello. È il numero totale di token utilizzati in tutte le distribuzioni in tutte le sottoscrizioni in tutte le aree per un determinato tenant.
Nota
I livelli di utilizzo si applicano solo ai tipi di distribuzione Standard, Data Zone Standard e Standard globale. I livelli di utilizzo non si applicano alle distribuzioni globali in batch e con velocità effettiva con provisioning.
Standard globale, Standard della zona dati e Standard
| Modello | Livelli di utilizzo al mese |
|---|---|
gpt-5 |
32 miliardi di token |
gpt-5-mini |
160 miliardi di token |
gpt-5-nano |
800 miliardi di token |
gpt-5-chat |
32 miliardi di token |
gpt-4
+
gpt-4-32k (tutte le versioni) |
6 miliardi di token |
gpt-4o |
12 miliardi di token |
gpt-4o-mini |
85 miliardi di token |
o3-mini |
50 miliardi di token |
o1 |
4 miliardi di token |
o4-mini |
50 miliardi di token |
o3 |
5 miliardi di token |
gpt-4.1 |
30 miliardi di token |
gpt-4.1-mini |
150 miliardi di token |
gpt-4.1-nano |
550 miliardi di token |
Procedure consigliate generali per rimanere entro i limiti di velocità
Per ridurre al minimo i problemi relativi ai limiti di frequenza, è consigliabile usare le tecniche seguenti:
- Implementare la logica di ripetizione dei tentativi nell'applicazione.
- Evitare modifiche nitide nel carico di lavoro. Aumentare gradualmente il carico di lavoro.
- Testare modelli di aumento del carico diversi.
- Aumentare la quota assegnata alla distribuzione. Spostare la quota da un'altra distribuzione, se necessario.
Per linee guida dettagliate sulle procedure consigliate, esempi di codice per il meccanismo di retry con backoff e una guida alla risoluzione dei problemi relativi all'errore 429, consulta Manage Azure OpenAI in Microsoft Foundry Models quota.
Aumento della quota richiesta
Invia il modulo di richiesta di aumento della quota per richiedere aumenti della quota per i Modelli Foundry venduti da Azure, i modelli Azure OpenAI e i modelli Anthropic. Ad eccezione dei modelli Anthropic, i modelli di partner e community non supportano gli aumenti di quota.
Le richieste di aumento della quota vengono elaborate nell'ordine in cui vengono ricevute e la priorità passa ai clienti che usano attivamente l'allocazione di quote esistente. Le richieste che non soddisfano questa condizione potrebbero essere negate.
Limiti di capacità della quota a livello di area
È possibile visualizzare la disponibilità del limite per regione per la sottoscrizione nel portale Foundry.
Per controllare la quota e la capacità a livello di codice, vedere Controllare a livello di codice la quota e la capacità nella guida alla gestione delle quote. Questa sezione illustra due API REST complementari: l'API Usages per controllare l'utilizzo rispetto ai limiti e l'API Capacità del modello per verificare la capacità di distribuzione disponibile in base al modello e all'area.
Nota
Attualmente, sia il portale foundry che le API di capacità restituiscono informazioni sulla quota e sulla capacità per i modelli ritirati e non più disponibili per le nuove distribuzioni.
Contenuto correlato
- Informazioni su come gestisci quota per le distribuzioni OpenAI Azure.
- Scopri di più sui modelli sottostanti che alimentano Azure OpenAI.