Bereitstellung skalierbarer Agenten mit Microsoft Foundry
Begleitfähigkeiten für Lektion 16 – Bereitstellung skalierbarer Agenten.
Verwenden Sie diese, um einem Lernenden zu helfen, einen Agenten vom Prototypen zur skalierbaren, beobachtbaren
Produktionsbereitstellung zu bringen. Begründen Sie jede Empfehlung durch die Lektionen und
das ausführbare Notizbuch; erfinden Sie keine Foundry-APIs.
Auslöser
Aktivieren Sie diese Fähigkeit, wenn ein Lernender:
- Einen Agenten als gehosteten Agenten bei Microsoft Foundry bereitstellen und versionieren/beobachtbar machen möchte.
- Zwischen den Bereitstellungsmustern client-hosted, hosted-agent und agent-workflow wählen möchte.
- Modell-Routing, Response Caching oder begrenzte Parallelität hinzufügen will, um Latenz und Kosten zu steuern.
- Ein Bewertungstor hinzufügen möchte, damit keine schlechte Agentenversion ausgeliefert wird.
- Einen Schritt zur menschlichen Genehmigung für risikoreiche Aktionen einfügen möchte.
- Einen Agenten mit OpenTelemetry Trace-Instrumentierung für Produktionsbeobachtbarkeit ausstatten möchte.
- Einen bereitgestellten Agenten als schnellen Post-Deploy-Gate Smoketesten möchte.
Kern-Mentales Modell
Ein Produktionsagent ist meist das operative Gerüst um das Modell (~80%),
nicht das Modell selbst. Ordnen Sie jede Empfehlung einer dieser Anliegen zu:
| Anliegen |
Prototyp → Produktion |
| Hosting |
Notebook → versionierter gehosteter Dienst |
| Identität |
Ihr az login → Managed Identity + abgegrenztes RBAC |
| Zustand |
Im Speicher → externalisierter Thread-/Speicher-Store |
| Fehler |
Traceback → Wiederholungen, Fallbacks, Alarme |
| Kosten |
„ein paar Cent“ → verfolgt, geroutet, zwischengespeichert, budgetiert |
| Qualität |
Auge messen → automatisiertes Bewertungstor |
| Vertrauen |
Ihre Freigabe → Richtlinie + Mensch-in-der-Schleife |
Bereitstellungsmuster (eins wählen oder kombinieren)
- Client-hosted — die Reasoning-Schleife läuft in Ihrem Prozess. Maximale Kontrolle; Sie besitzen Skalierung/Zustand.
- Hosted agent (Foundry Agent Service) — Foundry hostet die Schleife, speichert Threads, setzt RBAC/Content-Sicherheit durch und zeigt den Agenten im Portal. Weniger Kontrolle, weitaus geringere operative Oberfläche.
- Agent Workflow — mehrere Agenten/Tools, die zu einem Graph mit Verzweigungen, Genehmigungsknoten und dauerhaften Checkpoints zusammengesetzt sind.
Lebenszyklus (die Schleife, die einen Agenten ausliefert)
create → version → evaluate (gate) → deploy hosted → observe online → collect failures → repeat.
Offline-Bewertung ist ein Tor, kein Nachgedanke — eine Version wird nicht ausgeliefert,
wenn sie die Schwelle nicht überschreitet. Online-Beobachtbarkeit speist reale Fehler
zurück in das Offline-Testset.
Skalierungs- und Kostenhebel (in Prioritätsreihenfolge)
- Modell passend dimensionieren — verwenden Sie das kleinste Modell, das das Bewertungstor besteht.
- Routing nach Komplexität — kleines/schnelles Modell für einfache Anfragen, großes Modell für echtes Reasoning (DIY-Klassifizierer oder Foundry Model Router).
- Caching — bediene fast identische Anfragen ohne Modellaufruf.
- Zustandsloses Design + begrenzte Parallelität — Zustand externalisieren; mit Backoff neu versuchen.
Schlüsselmuster zum Nachahmen
Verweisen Sie den Lernenden im Notebook auf diese
16-python-agent-framework.ipynb:
- Request-Handler: Cache → Routing nach Komplexität → Trace-Span → Ausführen → Cache.
- Bewertungstor: Bewerte ein Offline-Testset; gib
pass_rate >= threshold zurück und deploye nur, wenn true.
- Menschliche Genehmigung:
@tool(approval_mode="always_require") für Aktionen wie große Rückerstattungen.
- Tracing: Kapsle jede Anfrage in
tracer.start_as_current_span(...) und setze Attribute wie routed.model, customer.id.
Smoketesten eines bereitgestellten Agenten
Nach der Bereitstellung überprüfen, ob der Endpunkt tatsächlich antwortet (ein grüner Deploy kann
stumm bleiben). Verwenden Sie die AI Smoke Test
Aktion über .github/workflows/smoke-test.yml
mit dem Katalog in tests/. Der Runner sendet jede
Eingabe an POST {project_endpoint}/agents/{agent_name}/endpoint/protocols/openai/responses
und prüft die Antwort. Die Identität benötigt die Azure AI User-Rolle im
Foundry-Projektumfang; das Token-Audience muss https://ai.azure.com/ sein.
Kombinieren Sie die Tore: Smoketest (erreichbar/antwortend, bei jeder Bereitstellung) → Offline-Bewertung (gut genug für Auslieferung, vor Promotion) → Online-Bewertung (wie es sich in der Praxis schlägt, kontinuierlich).
Unternehmenssteuerungen
- RBAC: Geben Sie jedem gehosteten Agenten eine Managed Identity mit minimalen Rechten.
- MCP in Produktion: Behandeln Sie jeden MCP-Server als unvertrauenswürdige Grenze — fixieren Sie die Version, begrenzen Sie die Identität, validieren Sie Ausgaben, limitieren Sie die Rate, geben Sie niemals Geheimnisse preis.
Schutzmaßnahmen für den Assistenten
- Bevorzugen Sie das kanonische
FoundryChatClient(...) + provider.as_agent(...) Muster, das im gesamten Kurs verwendet wird.
- Versprechen Sie keine Live-Azure-Ergebnisse, die Sie nicht verifiziert haben; empfehlen Sie den Smoketest-Workflow zur Bestätigung einer Bereitstellung.
- Halten Sie Evaluations- und Kostenhinweise zusammen: Evaluation setzt die Qualitätsuntergrenze, Routing/Caching halten die Kosten nahe dieser Untergrenze.
Haftungsausschluss:
Dieses Dokument wurde mit dem KI-Übersetzungsdienst Co-op Translator übersetzt. Obwohl wir uns um Genauigkeit bemühen, beachten Sie bitte, dass automatisierte Übersetzungen Fehler oder Ungenauigkeiten enthalten können. Das Originaldokument in seiner Ursprungssprache gilt als maßgebliche Quelle. Bei kritischen Informationen wird eine professionelle menschliche Übersetzung empfohlen. Wir übernehmen keine Haftung für Missverständnisse oder Fehlinterpretationen, die aus der Verwendung dieser Übersetzung entstehen.
Source: microsoft/ai-agents-for-beginners → translations/de/.agents/skills/deploying-scalable-agents/SKILL.md
1---2name: deploying-scalable-agents-73description: Aktivieren Sie diese Fähigkeit, wenn ein Lernender: - Einen Agenten als gehosteten Agenten bei Microsoft Foundry bereitstellen und versionieren/beobachtbar machen möchte. - Zwischen den Bereitstellungsmustern client-hosted, hosted-agent und agent-workflow wählen möchte. - Modell-Routing, Response Caching oder begrenzte Parallelität hinzufügen will, um Latenz und Kosten zu steuern. - Ein Bewertungstor hinzufügen möchte, damit keine schlechte Agentenversion ausgeliefert wird.4---5# Bereitstellung skalierbarer Agenten mit Microsoft Foundry
6
7> Begleitfähigkeiten für [Lektion 16 – Bereitstellung skalierbarer Agenten](../../../16-deploying-scalable-agents/README.md).
8> Verwenden Sie diese, um einem Lernenden zu helfen, einen Agenten vom Prototypen zur skalierbaren, beobachtbaren
9> Produktionsbereitstellung zu bringen. Begründen Sie jede Empfehlung durch die Lektionen und
10> das ausführbare Notizbuch; erfinden Sie keine Foundry-APIs.
11
12## Auslöser
13
14Aktivieren Sie diese Fähigkeit, wenn ein Lernender:
15- Einen Agenten als **gehosteten Agenten** bei Microsoft Foundry bereitstellen und versionieren/beobachtbar machen möchte.
16- Zwischen den Bereitstellungsmustern **client-hosted, hosted-agent und agent-workflow** wählen möchte.
17- **Modell-Routing**, **Response Caching** oder **begrenzte Parallelität** hinzufügen will, um Latenz und Kosten zu steuern.
18- Ein **Bewertungstor** hinzufügen möchte, damit keine schlechte Agentenversion ausgeliefert wird.
19- Einen **Schritt zur menschlichen Genehmigung** für risikoreiche Aktionen einfügen möchte.
20- Einen Agenten mit **OpenTelemetry** Trace-Instrumentierung für Produktionsbeobachtbarkeit ausstatten möchte.
21- Einen bereitgestellten Agenten als schnellen Post-Deploy-Gate **Smoketesten** möchte.
22
23## Kern-Mentales Modell
24
25Ein Produktionsagent ist meist das operative Gerüst *um* das Modell (~80%),
26nicht das Modell selbst. Ordnen Sie jede Empfehlung einer dieser Anliegen zu:
27
28| Anliegen | Prototyp → Produktion |
29|---------|------------------------|
30| Hosting | Notebook → versionierter gehosteter Dienst |
31| Identität | Ihr `az login` → Managed Identity + abgegrenztes RBAC |
32| Zustand | Im Speicher → externalisierter Thread-/Speicher-Store |
33| Fehler | Traceback → Wiederholungen, Fallbacks, Alarme |
34| Kosten | „ein paar Cent“ → verfolgt, geroutet, zwischengespeichert, budgetiert |
35| Qualität | Auge messen → automatisiertes Bewertungstor |
36| Vertrauen | Ihre Freigabe → Richtlinie + Mensch-in-der-Schleife |
37
38## Bereitstellungsmuster (eins wählen oder kombinieren)
39
401. **Client-hosted** — die Reasoning-Schleife läuft in Ihrem Prozess. Maximale Kontrolle; Sie besitzen Skalierung/Zustand.
412. **Hosted agent (Foundry Agent Service)** — Foundry hostet die Schleife, speichert Threads, setzt RBAC/Content-Sicherheit durch und zeigt den Agenten im Portal. Weniger Kontrolle, weitaus geringere operative Oberfläche.
423. **Agent Workflow** — mehrere Agenten/Tools, die zu einem Graph mit Verzweigungen, Genehmigungsknoten und dauerhaften Checkpoints zusammengesetzt sind.
43
44## Lebenszyklus (die Schleife, die einen Agenten ausliefert)
45
46`create → version → evaluate (gate) → deploy hosted → observe online → collect failures → repeat`.
47**Offline-Bewertung ist ein Tor, kein Nachgedanke** — eine Version wird nicht ausgeliefert,
48wenn sie die Schwelle nicht überschreitet. Online-Beobachtbarkeit speist reale Fehler
49zurück in das Offline-Testset.
50
51## Skalierungs- und Kostenhebel (in Prioritätsreihenfolge)
52
531. **Modell passend dimensionieren** — verwenden Sie das kleinste Modell, das das Bewertungstor besteht.
542. **Routing nach Komplexität** — kleines/schnelles Modell für einfache Anfragen, großes Modell für echtes Reasoning (DIY-Klassifizierer oder Foundry Model Router).
553. **Caching** — bediene fast identische Anfragen ohne Modellaufruf.
564. **Zustandsloses Design + begrenzte Parallelität** — Zustand externalisieren; mit Backoff neu versuchen.
57
58## Schlüsselmuster zum Nachahmen
59
60Verweisen Sie den Lernenden im Notebook auf diese
61[`16-python-agent-framework.ipynb`](../../../16-deploying-scalable-agents/code_samples/16-python-agent-framework.ipynb):
62
63- **Request-Handler**: Cache → Routing nach Komplexität → Trace-Span → Ausführen → Cache.
64- **Bewertungstor**: Bewerte ein Offline-Testset; gib `pass_rate >= threshold` zurück und deploye nur, wenn true.
65- **Menschliche Genehmigung**: `@tool(approval_mode="always_require")` für Aktionen wie große Rückerstattungen.
66- **Tracing**: Kapsle jede Anfrage in `tracer.start_as_current_span(...)` und setze Attribute wie `routed.model`, `customer.id`.
67
68## Smoketesten eines bereitgestellten Agenten
69
70Nach der Bereitstellung überprüfen, ob der Endpunkt tatsächlich antwortet (ein grüner Deploy kann
71stumm bleiben). Verwenden Sie die [AI Smoke Test](https://github.com/marketplace/actions/ai-smoke-test)
72Aktion über [`.github/workflows/smoke-test.yml`](../../../../../.github/workflows/smoke-test.yml)
73mit dem Katalog in [`tests/`](../../../tests/README.md). Der Runner sendet jede
74Eingabe an `POST {project_endpoint}/agents/{agent_name}/endpoint/protocols/openai/responses`
75und prüft die Antwort. Die Identität benötigt die **Azure AI User**-Rolle im
76Foundry-Projektumfang; das Token-Audience muss `https://ai.azure.com/` sein.
77
78Kombinieren Sie die Tore: **Smoketest** (erreichbar/antwortend, bei jeder Bereitstellung) → **Offline-Bewertung** (gut genug für Auslieferung, vor Promotion) → **Online-Bewertung** (wie es sich in der Praxis schlägt, kontinuierlich).
79
80
81
82## Unternehmenssteuerungen
83
84- **RBAC**: Geben Sie jedem gehosteten Agenten eine Managed Identity mit minimalen Rechten.
85- **MCP in Produktion**: Behandeln Sie jeden MCP-Server als unvertrauenswürdige Grenze — fixieren Sie die Version, begrenzen Sie die Identität, validieren Sie Ausgaben, limitieren Sie die Rate, geben Sie niemals Geheimnisse preis.
86
87## Schutzmaßnahmen für den Assistenten
88
89- Bevorzugen Sie das kanonische `FoundryChatClient(...)` + `provider.as_agent(...)` Muster, das im gesamten Kurs verwendet wird.
90- Versprechen Sie keine Live-Azure-Ergebnisse, die Sie nicht verifiziert haben; empfehlen Sie den Smoketest-Workflow zur Bestätigung einer Bereitstellung.
91- Halten Sie Evaluations- und Kostenhinweise zusammen: Evaluation setzt die Qualitätsuntergrenze, Routing/Caching halten die Kosten nahe dieser Untergrenze.
92
93---
94
95<!-- CO-OP TRANSLATOR DISCLAIMER START -->
96**Haftungsausschluss**:
97Dieses Dokument wurde mit dem KI-Übersetzungsdienst [Co-op Translator](https://github.com/Azure/co-op-translator) übersetzt. Obwohl wir uns um Genauigkeit bemühen, beachten Sie bitte, dass automatisierte Übersetzungen Fehler oder Ungenauigkeiten enthalten können. Das Originaldokument in seiner Ursprungssprache gilt als maßgebliche Quelle. Bei kritischen Informationen wird eine professionelle menschliche Übersetzung empfohlen. Wir übernehmen keine Haftung für Missverständnisse oder Fehlinterpretationen, die aus der Verwendung dieser Übersetzung entstehen.
98<!-- CO-OP TRANSLATOR DISCLAIMER END -->
99
100---
101
102**Source:** [`microsoft/ai-agents-for-beginners`](https://github.com/microsoft/ai-agents-for-beginners) → `translations/de/.agents/skills/deploying-scalable-agents/SKILL.md`