Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Modelleinheiten sind eine Durchsatzeinheit, die bestimmt, wie viel Arbeit Ihr Endpunkt pro Minute verarbeiten kann. Wenn Sie einen neuen bereitgestellten Durchsatzendpunkt erstellen, geben Sie an, wie viele Modelleinheiten für jedes bereitgestellte Modell bereitgestellt werden sollen.
Die Für die Verarbeitung jeder Anforderung an Ihren Endpunkt erforderliche Arbeitsaufwand hängt von der Größe der Eingabe und der generierten Ausgabe ab. Da sich die Anzahl der Eingabe- und Ausgabetoken erhöht, erhöht sich auch die Arbeitsmenge, die zum Verarbeiten einer Anforderung erforderlich ist. Das Generieren von Ausgabetoken ist ressourcenintensiver als die Verarbeitung von Eingabetoken. Die für jede Anforderung erforderliche Arbeit wächst in nicht linearer Weise, da die Anzahl der Eingabe- oder Ausgabetoken erhöht wird, was bedeutet, dass Ihr Endpunkt für eine bestimmte Menge von Modelleinheiten eine der folgenden Aktionen verarbeiten kann:
- Mehrere kleine Anforderungen gleichzeitig.
- Weniger Anfragen mit langem Kontext auf einmal, bevor die Kapazität erschöpft ist.
Beispielsweise können Sie mit einer mittleren Arbeitslast bestehend aus 3500 Eingabetoken und 300 Ausgabetoken den Durchsatz in Token pro Sekunde für eine bestimmte Anzahl von Modelleinheiten schätzen.
| Model | Modelleinheiten | Geschätzte Token pro Sekunde |
|---|---|---|
| Llama 4 Maverick | 50 | 3250 |
Modelle, die Modelleinheiten verwenden
Alle Basismodelle, die für bereitgestellten Durchsatz unterstützt werden, stellen Inferenzkapazität mithilfe von Modelleinheiten bereit, mit Ausnahme der unten aufgeführten Legacy-Modelle.
Hinweis
Modelldienste-Endpunkte, die Modelle aus den folgenden Legacymodellfamilien bedienen, stellen die Inferenzkapazität auf Basis von Token-pro-Sekunde-Bereichen bereit, die während der Endpunkterstellung konfiguriert wurden:
- Meta Llama 3.3
- Meta Llama 3.2 3B
- Meta Llama 3.2 1B
- Meta Llama 3.1
- GTE v1.5 (Englisch)
- BGE v1.5 (Englisch)
- DeepSeek R1 (im Unity-Katalog nicht verfügbar)
- Meta Llama 3
- Meta Llama 2
- DBRX
- Mistral
- Mixtral
- MPT