Azure OpenAI nei modelli Microsoft Foundry: quote e limiti

Questo articolo contiene un riferimento rapido e una descrizione dettagliata delle quote e dei limiti per Azure OpenAI.

Ambito della quota

Le quote e i limiti non vengono applicati a livello di tenant. Al contrario, il livello massimo di restrizioni di quota è ambito al livello di abbonamento di Azure.

Allocazione della quota a livello di area

I token al minuto (TPM) e le richieste al minuto (RPM) sono definiti per area, per sottoscrizione e per modello o tipo di distribuzione.

Ad esempio, se il modello gpt-4.1 Global Standard è elencato con una quota di 5 milioni di TPM e 5.000 RPM, ogni regione in cui è disponibile il modello o tipo di distribuzione ha un proprio pool di quote dedicato per ciascuna delle sottoscrizioni Azure. All'interno di una singola sottoscrizione Azure, è possibile usare una quantità maggiore di quote TPM e RPM totali per un determinato modello e tipo di distribuzione, purché si disponga di risorse e distribuzioni di modelli distribuite in più aree.

Livelli di quota

Sono stati introdotti modelli di quota per migliorare l'esperienza dei modelli Foundry e ridurre le difficoltà man mano che i carichi di lavoro aumentano. Le quote aumentano automaticamente con l'utilizzo, consentendo di evitare errori di limite di velocità, creando anche un ambiente più equo per tutti gli utenti. Verranno resi disponibili sette livelli: livello gratuito e livelli da 1 a 6, con il livello 6 che offre le quote più elevate. Il livello assegnato iniziale di un cliente si basa sull'utilizzo corrente di tale modello e sulla relazione corrente con Microsoft, ad esempio lo stato contratto Enterprise (EA o MCA-E). 

Cosa cambia per me?

In precedenza, Foundry offriva solo i livelli di quota Predefinita ed Enterprise per le offerte 'pay as you go', con un grande divario tra ciascun livello e un processo più lungo per richiedere incrementi. Con i livelli di quota, a tutti gli utenti viene assegnato un livello con quote uguali o superiori ai livelli precedenti. Eventuali aumenti di quota approvati in precedenza vengono mantenuti e non verranno ridotti. Con l'aumentare dell'utilizzo, Foundry aumenta automaticamente le quote spostando gli utenti a livelli più elevati e la quota aggiuntiva può comunque essere richiesta tramite il modulo di quota.

In che modo un cliente passerà automaticamente da un livello a un altro, ad esempio quali sono i criteri di modifica del livello? 

Gli aggiornamenti automatici dei livelli si basano principalmente sulle tendenze di consumo dei clienti nei modelli Foundry nel corso del tempo. Se l'utilizzo di un cliente aumenta in modo che il livello di quota corrente limiti la possibilità di usare i modelli Foundry, il sistema aggiornerà automaticamente il cliente al livello superiore successivo. Viene presa in considerazione anche la relazione di un cliente con Microsoft. Ai clienti con relazioni Enterprise (inclusi EA e MCA-E) con Microsoft vengono assegnati livelli di quota più elevati. Inoltre, Microsoft considererà anche la cronologia dei pagamenti di un cliente per determinare l'idoneità per gli aggiornamenti automatici. 

È possibile rifiutare esplicitamente gli aggiornamenti automatici?

Sì, è possibile rifiutare esplicitamente gli aggiornamenti automatici e rimanere nel livello corrente indipendentemente dalle modifiche apportate all'utilizzo. Alcuni clienti usano la quota per gestire la fatturazione. Questa non è la Azure procedura consigliata, tuttavia, sappiamo che se il sistema è configurato in questo modo non vogliamo interromperlo. Per altre informazioni sulla gestione della fatturazione e sulle procedure consigliate, vedere Gestione costi.

Per rifiutare esplicitamente, è possibile impostare il flag seguente su NoAutoUpgrade:

curl -X PATCH \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "properties": {
      "tierUpgradePolicy": "NoAutoUpgrade"
    }
  }'

Nota

La funzionalità di rifiuto esplicito è in anteprima e potrebbe essere soggetta a modifiche/rimozione in futuro.

È possibile richiedere più quote?

Sì, usando il modulo di richiesta di quota è sempre possibile richiedere più quota. Se la richiesta viene approvata, il livello corrente rimarrà invariato, ma con più quote assegnate.

Come è possibile controllare il livello di quota della sottoscrizione?

È attualmente possibile controllare il livello di quota con l'API del piano di controllo:

curl -X GET \
  "https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
  -H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
  -H "Content-Type: application/json"

Riferimento ai livelli di quota

Livello 1

Nome modello Tipo di distribuzione Richieste al minuto (RPM) Token Per Minuto (TPM)
codex-mini GlobalStandard 1,000 1,000,000
computer-use-preview GlobalStandard 4,500 450.000
gpt-4.1 DataZoneStandard 300 300,000
gpt-4.1 GlobalStandard 1,000 1,000,000
gpt-4.1-mini DataZoneStandard 2.000 2,000,000
gpt-4.1-mini GlobalStandard 5,000 5,000,000
gpt-4.1-mini Standard 6,000 6,000,000
gpt-4.1-nano DataZoneStandard 2.000 2,000,000
gpt-4.1-nano GlobalStandard 5,000 5,000,000
gpt-4o DataZoneStandard 300 / 10 secondi 300,000
gpt-4o-audio-preview GlobalStandard 30000 / 10s 30,000,000
gpt-4o-mini DataZoneStandard 10.000 1,000,000
gpt-4o-mini GlobalStandard 20,000 2,000,000
gpt-4o-mini-audio-preview GlobalStandard 30000 / 10s 30,000,000
gpt-4o-mini-anteprima-in-tempo-reale GlobalStandard 36 6,000
gpt-4o-realtime-preview GlobalStandard 36 6,000
gpt-5 DataZoneStandard 3,000 300,000
gpt-5 GlobalStandard 10.000 1,000,000
gpt-5-chat GlobalStandard 1,000 1,000,000
gpt-5-codex GlobalStandard 1,000 1,000,000
gpt-5-mini DataZoneStandard 300 300,000
gpt-5-mini GlobalStandard 1,000 1,000,000
gpt-5-nano DataZoneStandard 2.000 2,000,000
gpt-5-nano GlobalStandard 5,000 5,000,000
gpt-5-pro GlobalStandard 1,600 160,000
gpt-5.1 DataZoneStandard 3,000 300,000
gpt-5.1 GlobalStandard 10.000 1,000,000
gpt-5.1 Standard 3,000 300,000
gpt-5.1-chat GlobalStandard 10.000 1,000,000
gpt-5.1-codex DataZoneStandard 3,000 300,000
gpt-5.1-codex GlobalStandard 1,000 1,000,000
gpt-5.1-codex-max GlobalStandard 10.000 1,000,000
gpt-5.1-codex-mini GlobalStandard 1,000 1,000,000
gpt-5.2 DataZoneStandard 3,000 300,000
gpt-5.2 GlobalStandard 10.000 1,000,000
gpt-5.2-chat GlobalStandard 10.000 1,000,000
gpt-5.3-chat GlobalStandard 1,000 1,000,000
gpt-5.2-codex GlobalStandard 10.000 1,000,000
gpt-5.3-codex GlobalStandard 10.000 1,000,000
gpt-5.4 DataZoneStandard 300 300,000
gpt-5.4 GlobalStandard 10.000 1,000,000
gpt-5.4-pro GlobalStandard 160 160,000
gpt-5.4-mini GlobalStandard 1,000 1,000,000
gpt-5.4-nano DataZoneStandard 2.000 2,000,000
gpt-5.4-nano GlobalStandard 5,000 5,000,000
gpt-5.5 DataZoneStandard 0 0
gpt-5.5 GlobalStandard 0 0
gpt-5.6-luna DataZoneStandard 333 333,000
gpt-5.6-luna GlobalStandard 1,000 1,000,000
gpt-5.6-sol DataZoneStandard 333 333,000
gpt-5.6-sol GlobalStandard 1,000 1,000,000
gpt-5.6-terra DataZoneStandard 333 333,000
gpt-5.6-terra GlobalStandard 1,000 1,000,000
gpt-chat-latest GlobalStandard 10.000 1,000,000
gpt-audio GlobalStandard 30000 / 10s 30,000,000
gpt-image-1 GlobalStandard 9 -
gpt-image-1-mini GlobalStandard 12 -
gpt-image-1.5 DataZoneStandard 3 -
gpt-image-1.5 GlobalStandard 9 -
gpt-image-2 DataZoneStandard 2 -
gpt-image-2 GlobalStandard 6 -
gpt-realtime GlobalStandard 200 100,000
modello-router DataZoneStandard 300 300,000
modello-router GlobalStandard 1,000 1,000,000
o1 DataZoneStandard 100 600,000
o1 GlobalStandard 500 3,000,000
o3 DataZoneStandard 300 300,000
o3 GlobalStandard 1,000 1,000,000
o3-deep-research GlobalStandard 3,000 3,000,000
o3-mini DataZoneStandard 200 2,000,000
o3-mini GlobalStandard 500 5,000,000
o3-pro GlobalStandard 160 1,600,000
o4-mini DataZoneStandard 300 / 10 secondi 300,000
o4-mini GlobalStandard 1,000 1,000,000
text-embedding-3-large DataZoneStandard 1,000 1,000,000
text-embedding-3-large GlobalStandard 1000 / 10 secondi 1,000,000
text-embedding-3-small DataZoneStandard 1,000 1,000,000
text-embedding-3-small GlobalStandard 1000 / 10 secondi 1,000,000

Informazioni di riferimento su quote e limiti

La sezione seguente fornisce una guida rapida alle quote e ai limiti predefiniti applicabili a Azure OpenAI:

Nome limite Valore limite
Risorse di Azure OpenAI per regione, per sottoscrizione Azure 30.
Limiti di quota GPT-image-1 predefiniti 9 richieste al minuto
Limiti predefiniti di quota GPT-image-1-mini 12 richieste al minuto
Limiti di quota GPT-image-1.5 predefiniti 9 richieste al minuto
Limiti di quota GPT-image-2 predefiniti 9 richieste al minuto
Limiti di quota Sora predefiniti 60 richieste al minuto.
Limiti di quota di Sora 2 predefiniti 2 richieste di lavoro1 al minuto
Limiti predefiniti per la quota di utilizzo dell'API audio da voce a testo 3 richieste al minuto.
Numero massimo di token del prompt per richiesta Varia per modello. Per altre informazioni, vedere Azure modelli OpenAI.
Numero massimo di distribuzioni standard per risorsa 32.
Numero massimo di distribuzioni di modelli finemente ottimizzati 10.
Numero totale di processi di training per risorsa 100.
Numero massimo di lavori di addestramento contemporaneamente in esecuzione per risorsa Formazione standard e globale: 3;
Formazione per sviluppatori: 5
Numero massimo di processi di training in coda 20.
Numero massimo di file per risorsa (ottimizzazione) 100.
Dimensioni totali di tutti i file per risorsa (ottimizzazione) 1 GB.
Tempo massimo del compito di addestramento (il lavoro viene interrotto se superato) 720 ore.
Dimensioni massime del processo di training (tokens in training file) x (# of epochs) 2 miliardi.
Dimensioni massime di tutti i file per ogni caricamento (Azure OpenAI sui tuoi dati) 16 MB.
Numero massimo di input nella matrice con /embeddings 2,048.
Massimo numero di token per richiesta /embeddings (somma su tutti gli input) 300,000.
Numero massimo di /chat/completions messaggi 2,048.
Numero massimo di /chat/completions funzioni 128.
Numero massimo di /chat/completions strumenti 128.
Numero massimo di unità elaborate con provisioning per distribuzione 100,000.
Numero massimo di file per assistente o thread 10.000 quando si usa l'API o il portale Microsoft Foundry.
Dimensioni massime dei file per assistenti e ottimizzazione 512 MB tramite l'API

200 MB tramite il portale Foundry.
Numero massimo di richieste di caricamento file per risorsa 30 richieste al secondo.
Dimensioni massime per tutti i file caricati per gli assistenti 200 GB.
Limite di token degli assistenti Limite di 2.000.000 token.
GPT-4o e GPT-4.1 numero massimo di immagini per richiesta (numero di immagini nella matrice di messaggi o nella cronologia delle conversazioni) 50.
GPT-4 vision-preview and GPT-4 turbo-2024-04-09 massimi token predefiniti 16.

Aumentare il valore del max_tokens parametro per evitare risposte troncate. GPT-4o il valore predefinito del massimo dei token è impostato a 4.096.
Numero massimo di intestazioni personalizzate nelle richieste API2 10.
Limite di caratteri del messaggio 1,048,576.
Dimensioni dei messaggi per i file audio 20 MB.

1 La quota Sora 2 RPM conta solo le richieste di elaborazione video. Altri tipi di richieste non sono limitati a livello di frequenza.

2 Le API correnti consentono fino a 10 intestazioni personalizzate, che vengono passate attraverso la pipeline e restituite. Alcuni clienti ora superano il limite di questo numero di intestazioni, causando errori HTTP 431. Non esiste alcuna soluzione per questo errore, ad eccezione di ridurre il volume dell'intestazione. Nelle versioni future dell'API non verranno passate intestazioni personalizzate. È consigliabile che i clienti non dipendano dalle intestazioni personalizzate nelle future architetture di sistema.

Nota

I limiti di quota sono soggetti a modifiche.

Limiti relativi a Batch

Nome limite Valore limite
Numero massimo di file di input batch - (nessuna scadenza) 500
Numero massimo di file di input batch - (scadenza impostata) 10.000
Dimensioni massime del file di input 200 MB
Dimensioni massime del file di input - Bring Your Own Storage (BYOS) 1 GB
Numero massimo di richieste per file 100,000

Nota

I limiti dei file batch non si applicano ai file di output ( ad esempio , result.jsonle error.jsonl). Per rimuovere i limiti dei file di input batch, usare Batch con Archiviazione BLOB di Azure.

Quota batch

La tabella mostra il limite di quota batch. I valori delle quote per il batch globale sono rappresentati in termini di token accodati. Quando si invia un file per l'elaborazione batch, viene conteggiato il numero di token nel file. Fino a quando il processo batch non raggiunge uno stato terminale, questi token vengono conteggiati rispetto al limite totale di token accodati.

Batch globale

Modello Enterprise e MCA-E Predefinito Sottoscrizioni mensili basate su carta di credito Sottoscrizioni MSDN Azure per studenti, versioni di valutazione gratuite
gpt-4.1 5B 200 mil. 50M 90.000 N/D
gpt-4.1 mini 15B 1B 50M 90.000 N/D
gpt-4.1-nano 15B 1B 50M 90.000 N/D
gpt-4o 5B 200 mil. 50M 90.000 N/D
gpt-4o-mini 15B 1B 50M 90.000 N/D
gpt-4-turbo 300 milioni 80M 40M 90.000 N/D
gpt-4 150 milioni 30 milioni 5M 100.000 N/D
o3-mini 15B 1B 50M 90.000 N/D
o4-mini 15B 1B 50M 90.000 N/D
gpt-5 5B 200 mil. 50M 90.000 N/D
gpt-5.1 5B 200 mil. 50M 90.000 N/D
gpt-5.2 5B 200 mil. 50M N/D N/D
gpt-5.4 5B 200 mil. 50M N/D N/D
gpt-5.4-mini 5B 200 mil. 50M N/D N/D
gpt-5.4-nano 5B 200 mil. 50M N/D N/D
gpt-5.5 5B 200 mil. 50M 90.000 N/D

B = miliardi | M = milioni | K = migliaia

Batch zona dati

Modello Enterprise e MCA-E Predefinito Sottoscrizioni mensili basate su carta di credito Sottoscrizioni MSDN Azure per studenti, versioni di valutazione gratuite
gpt-4.1 500 milioni 30 milioni 30 milioni 90.000 N/D
gpt-4.1-mini 1,5 miliardi 100 milioni 50M 90.000 N/D
gpt-4o 500 milioni 30 milioni 30 milioni 90.000 N/D
gpt-4o-mini 1,5 miliardi 100 milioni 50M 90.000 N/D
o3-mini 1,5 miliardi 100 milioni 50M 90.000 N/D
gpt-5 5B 200 mil. 50M 90.000 N/D
gpt-5.1 5B 200 mil. 50M 90.000 N/D
gpt-5.4 5B 200 mil. 50M N/D N/D
gpt-5.4-mini 5B 200 mil. 50M N/D N/D
gpt-5.5 5B 200 mil. 50M 90.000 N/D

gpt-oss

Modello Token al minuto (TPM) Richieste al minuto (RPM)
gpt-oss-120b 5 milioni 5 K

Livelli di utilizzo

Le distribuzioni standard globali usano l'infrastruttura globale di Azure. Instradano dinamicamente il traffico dei clienti al data center con la migliore disponibilità per le richieste di inferenza del cliente. Analogamente, le distribuzioni di Data Zone Standard consentono di usare l'infrastruttura globale di Azure per instradare dinamicamente il traffico al data center all'interno della zona dati definita dall'Microsoft con la migliore disponibilità per ogni richiesta. Questa pratica consente una latenza più coerente per i clienti con livelli di traffico da basso a medio. I clienti con elevati livelli di utilizzo sostenuti potrebbero riscontrare una maggiore variabilità nella latenza di risposta.

Azure livelli di utilizzo OpenAI sono progettati per offrire prestazioni coerenti per la maggior parte dei clienti con livelli di traffico da basso a medio. Ogni livello di utilizzo definisce la velocità effettiva massima (token al minuto) che è possibile prevedere con una latenza prevedibile. Quando l'utilizzo rimane entro il livello assegnato, la latenza rimane stabile e i tempi di risposta sono coerenti.

Cosa accade se si supera il livello di utilizzo?

  • Se la velocità effettiva della richiesta supera il livello di utilizzo, soprattutto durante i periodi di domanda elevata, la latenza della risposta può aumentare significativamente.
  • La latenza può variare e, in alcuni casi, può essere più di due volte superiore rispetto a quando si opera all'interno del livello di utilizzo.
  • Questa variabilità è più evidente per i clienti con un uso elevato costante o modelli di traffico a scatti.

Se si verificano errori 429 o si nota un aumento della variabilità della latenza, ecco le operazioni da eseguire:

  • Richiedere un aumento della quota: visitare il portale di Azure per richiedere una quota superiore per la sottoscrizione.
  • Provare a eseguire l'aggiornamento a un'offerta premium (PTU): per carichi di lavoro critici in termini di latenza o con volumi elevati, eseguire l'aggiornamento alle unità elaborate con provisioning (PTU). PTU offre risorse dedicate, capacità garantita e latenza prevedibile, anche su larga scala. Questa è la scelta migliore per le applicazioni cruciali che richiedono prestazioni coerenti.
  • Monitorare l'utilizzo: esaminare regolarmente le metriche di utilizzo nel portale di Azure per assicurarsi di operare entro i limiti del livello. Modificare il carico di lavoro o la strategia di distribuzione in base alle esigenze.

È possibile ricevere risposte 429 (troppe richieste) anche quando le metriche di utilizzo dei token vengono visualizzate sotto la quota. Per una spiegazione del motivo, vedere Perché potrebbero essere visualizzati 429 anche quando le metriche di utilizzo dei token sono inferiori alla quota.

Il limite di utilizzo determina il livello di utilizzo superiore al quale i clienti potrebbero riscontrare una maggiore variabilità nella latenza di risposta. L'utilizzo di un cliente è definito per modello. È il numero totale di token utilizzati in tutte le distribuzioni in tutte le sottoscrizioni in tutte le aree per un determinato tenant.

Nota

I livelli di utilizzo si applicano solo ai tipi di distribuzione Standard, Data Zone Standard e Standard globale. I livelli di utilizzo non si applicano alle distribuzioni globali in batch e con velocità effettiva con provisioning.

Standard globale, Standard della zona dati e Standard

Modello Livelli di utilizzo al mese
gpt-5 32 miliardi di token
gpt-5-mini 160 miliardi di token
gpt-5-nano 800 miliardi di token
gpt-5-chat 32 miliardi di token
gpt-4 + gpt-4-32k (tutte le versioni) 6 miliardi di token
gpt-4o 12 miliardi di token
gpt-4o-mini 85 miliardi di token
o3-mini 50 miliardi di token
o1 4 miliardi di token
o4-mini 50 miliardi di token
o3 5 miliardi di token
gpt-4.1 30 miliardi di token
gpt-4.1-mini 150 miliardi di token
gpt-4.1-nano 550 miliardi di token

Procedure consigliate generali per rimanere entro i limiti di velocità

Per ridurre al minimo i problemi relativi ai limiti di frequenza, è consigliabile usare le tecniche seguenti:

  • Implementare la logica di ripetizione dei tentativi nell'applicazione.
  • Evitare modifiche nitide nel carico di lavoro. Aumentare gradualmente il carico di lavoro.
  • Testare modelli di aumento del carico diversi.
  • Aumentare la quota assegnata alla distribuzione. Spostare la quota da un'altra distribuzione, se necessario.

Per linee guida dettagliate sulle procedure consigliate, esempi di codice per il meccanismo di retry con backoff e una guida alla risoluzione dei problemi relativi all'errore 429, consulta Manage Azure OpenAI in Microsoft Foundry Models quota.

Aumento della quota richiesta

Invia il modulo di richiesta di aumento della quota per richiedere aumenti della quota per i Modelli Foundry venduti da Azure, i modelli Azure OpenAI e i modelli Anthropic. Ad eccezione dei modelli Anthropic, i modelli di partner e community non supportano gli aumenti di quota.

Le richieste di aumento della quota vengono elaborate nell'ordine in cui vengono ricevute e la priorità passa ai clienti che usano attivamente l'allocazione di quote esistente. Le richieste che non soddisfano questa condizione potrebbero essere negate.

Limiti di capacità della quota a livello di area

È possibile visualizzare la disponibilità del limite per regione per la sottoscrizione nel portale Foundry.

Per controllare la quota e la capacità a livello di codice, vedere Controllare a livello di codice la quota e la capacità nella guida alla gestione delle quote. Questa sezione illustra due API REST complementari: l'API Usages per controllare l'utilizzo rispetto ai limiti e l'API Capacità del modello per verificare la capacità di distribuzione disponibile in base al modello e all'area.

Nota

Attualmente, sia il portale foundry che le API di capacità restituiscono informazioni sulla quota e sulla capacità per i modelli ritirati e non più disponibili per le nuove distribuzioni.