AutoGen lokal: Was funktioniert und was casse
AutoGen funktioniert lokal über einen OpenAI-kompatiblen Endpunkt (Ollama, vLLM), aber Microsoft hat das Projekt am 2. Oktober 2025 in den Wartungsmodus versetzt: Es gibt keine neuen Funktionen mehr, und Microsoft empfiehlt die Migration zu Microsoft Agent Framework. AG2, der unter Apache-2.0 lizenzierte Fork der ursprünglichen Entwickler, ist heute die aktiv weiterentwickelte Version, die Sie für ein neues Projekt in Betracht ziehen sollten.
AutoGen baut Systeme aus Agenten auf, die miteinander sprechen. An ein lokales Modell angebunden, funktioniert es – bis zu einer Grenze, die fast vollständig von der Modellgröße und davon abhängt, wie viel Spielraum man dem Gespräch lässt. Im lokalen Betrieb ist jeder Gesprächsbeitrag eine Generierung auf Ihrer eigenen Grafikkarte: Für Disziplin sorgen nicht die Prompts, sondern die gesetzten Grenzen. Seit Ende 2025 hat sich noch etwas geändert, das bisher nur wenige Tutorials erwähnen: Der Name „AutoGen“ bezeichnet nicht mehr ein einziges aktives Projekt, sondern drei unterschiedliche Entwicklungswege, die Sie auseinanderhalten müssen, bevor Sie entscheiden, worin Sie Ihre Zeit investieren.
#Das Konversationsmodell
Während ein Framework für Verarbeitungsketten die Definition von Schritten verlangt, verlangt AutoGen die Definition von Teilnehmern. Ein Assistenten-Agent macht Vorschläge; ein stellvertretender Agent vertritt Sie, führt gegebenenfalls Code aus und gibt das Ergebnis zurück; in einer Gruppendiskussion kommen mehrere Spezialisten unter der Leitung eines Managers zu Wort, der entscheidet, wer spricht. Das Verhalten ergibt sich aus diesem Austausch.
Das ist wirklich leistungsfähig für offene Aufgaben – Fehler beheben, eine Analyse iterativ weiterentwickeln – und genau das macht die Kosten unvorhersehbar. Eine feste Kette führt N Modellaufrufe aus. Ein Gespräch führt so viele aus, wie nötig sind, und wie viele nötig sind, entscheidet ausgerechnet das Modell, an dem Sie zweifeln.
Diese Konzeption hat eine direkte Konsequenz für die Rollenwahl: Je mehr unterschiedliche Agenten an der Unterhaltung beteiligt sind, desto mehr Gesprächsrunden sind möglich, bevor eine endgültige Antwort entsteht, und desto größer wird das Risiko, vom Ziel abzuweichen. Zwei Agenten, die sich in einer Schleife gegenseitig antworten, ohne jemals zu einer Schlussfolgerung zu gelangen, sind beim lokalen Betrieb das häufigste Symptom – gerade weil vor dem ersten Versuch keine Grenzen gesetzt wurden. Die Anzahl der Agenten ist daher nicht nur eine Architekturentscheidung, sondern ein direkter Multiplikator für die auf Ihrer eigenen Grafikkarte verbrauchte Rechenzeit.
#AutoGen im Wartungsmodus: was sich geändert hat
Agenten, die auf Ihrem Rechner handeln: agentisches Cline, MCP, n8n + Ollama und lokale Automatisierungen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Diesen Punkt verschweigen die meisten Tutorials, die noch online sind. Das offizielle Repository microsoft/autogen erklärt es selbst seit dem 2. Oktober 2025 schwarz auf weiß: Das Projekt befindet sich im Wartungsmodus, wird keine neuen Funktionen mehr erhalten und wird von der Community betreut. Microsoft empfiehlt, neue Projekte direkt mit Microsoft Agent Framework (MAF) zu beginnen. Dieser Nachfolger vereint die Bausteine von AutoGen und Semantic Kernel in einem einzigen Entwicklungskit und wurde Anfang April 2026 allgemein verfügbar (General Availability).
Die ursprünglichen Entwickler von AutoGen, Chi Wang und Qingyun Wu, verließen Microsoft Ende 2024 und führten die Entwicklung unter dem Namen AG2 fort, einem Fork unter der Apache-2.0-Lizenz, der von der Organisation ag2ai gehostet wird. AG2 versteht sich als aktive Fortsetzung des Projekts statt als Bruch damit: Die bisherige Basis bleibt unter dem Namen AG2 Classic für alle verfügbar, die nichts an ihrem Code ändern möchten, während AG2 1.0 die Architektur hin zu einem expliziteren Protokoll zwischen Agenten weiterentwickelt. Für ein Projekt, das heute startet, ist AG2 die naheliegendste Wahl, wenn Sie nahe an der ursprünglichen AutoGen-API bleiben möchten; Microsoft Agent Framework sollten Sie sich ansehen, wenn Sie bereits im Microsoft-Ökosystem arbeiten und die Zusammenführung mit den Semantic-Kernel-Tools Sie unmittelbar betrifft.
#Es mit einem lokalen Modell verbinden
- 01Modell bereitstellenÜber einen OpenAI-kompatiblen Endpunkt. Wenn mehrere Agenten gleichzeitig kommunizieren, arbeitet ein für gleichzeitige Anfragen ausgelegter Server deutlich besser als ein Server, der für einen einzelnen Arbeitsplatz konzipiert wurde.
- 02Den Client konfigurierenBasis-URL (zum Beispiel http://localhost:11434/v1 für Ollama), Modellname exakt so, wie das Modell lokal heruntergeladen wurde, Dummy-Schlüssel. Lokale Server ignorieren den Schlüssel; die Clientbibliothek verlangt häufig, dass er vorhanden ist.
- 03Die Fähigkeiten ehrlich angebenDie Frameworks fragen ab, ob das Modell Funktionsaufrufe oder den JSON-Modus unterstützt. Eine Fähigkeit anzugeben, die das Modell nicht besitzt, führt später zu unverständlichen Fehlern statt zu einem sauber abgefangenen Fehlschlag.
- 04Das Kontextfenster vergrößernDer Verlauf wächst mit jeder Runde. Bei der standardmäßigen Kontextlänge wird der Anfang ohne Hinweis abgeschnitten, und die Agenten erledigen dann bereits abgeschlossene Arbeit erneut.
#Code-Ausführung: in einer isolierten Umgebung ausführen
Der Ablauf, der AutoGen attraktiv macht – ein Agent schreibt Code, ein Stellvertreter führt ihn aus, die Fehlermeldung kommt zurück, der Agent korrigiert –, ist zugleich der Ablauf, bei dem von einem Modell geschriebener Code auf Ihrem Rechner ausgeführt wird. Dieser Code wird in einem Container ausgeführt, ohne Zugangsdaten, ohne Netzwerkzugriff, sofern die Aufgabe ihn nicht erfordert, und niemals mit Zugriff auf Ihr persönliches Verzeichnis. Alle von außen abgerufenen Inhalte – ein Ticket, eine Webseite, eine Dokumentationsdatei – müssen als potenziell feindselig betrachtet werden.
Beobachtbarkeit ist genauso wichtig wie Isolation. Bei einer Unterhaltung mit drei oder vier Agenten lässt sich ein Vorfall diagnostizieren, indem man den exakten Prompt nachliest, den jeder Agent in jeder Runde erhalten hat – nicht anhand einer nachträglichen Zusammenfassung. Ohne vollständige Aufzeichnungen weiß man nie, ob ein Agent eine Anweisung falsch interpretiert oder lediglich einen wegen Speichermangels gekürzten Kontext erhalten hat. Jeden Austausch zu protokollieren, einschließlich der Tool-Aufrufe und ihrer exakten Argumente, kostet wenig und erspart das Rätselraten darüber, was passiert ist, sobald die Grafikkarte wieder still geworden ist.
#Die Größe des Modells, noch einmal
| Modellklasse | Verhalten |
|---|---|
| 3 bis 8 Milliarden | Flüssige Nachrichten, unzuverlässige Tool-Aufrufe, keine Abbruchdisziplin. Schleife. |
| 12 bis 14 Milliarden | Der Austausch zwischen zwei Agenten mit klaren Rollen funktioniert; Gruppendiskussionen schweifen ab. |
| 24 bis 32 Milliarden | Die praktikable Untergrenze für Gruppendiskussionen und Schleifen zur Codeausführung. |
| 70 Milliarden und mehr | Das Verhalten kommt dem in der Cloud am nächsten, ist aber so langsam, dass lange Gespräche zur Stapelverarbeitung werden. |
Bevorzugen Sie Modelle, die für Tool-Aufrufe und strukturierte Ausgaben trainiert wurden. An dieselbe Grenze stoßen alle Frameworks für lokale Agenten: Fließtext ist einfach, strikte Formate sind es nicht. Für die Rolle des Managers in einer Gruppendiskussion sollten Sie in der Regel das leistungsfähigste Modell einsetzen, das Ihnen zur Verfügung steht: Es entscheidet, wer als Nächstes spricht. Jede falsche Routing-Entscheidung kostet eine ganze Gesprächsrunde – und das wiederholt sich, solange sich das Gespräch weiter im Kreis dreht, ohne zu einem Ergebnis zu kommen.
- CrewAI: geordnete Rollen und Arbeitsergebnisse
- Architektur eines lokalen Agents
- Erstellen Sie einen lokalen Agenten mit Python und LangChain
- Das QuelLLM-Kit zum Aufsetzen lokaler Agenten
- Offizielles Repository: Ankündigung des Wartungsmodus
- AG2: der aktiv entwickelte Fork
- Die offizielle OpenAI-kompatible API von Ollama
#AutoGen, AG2 oder CrewAI
| Sie möchten | Wählen Sie |
|---|---|
| Definierte Rollen, geordnete Übergaben, vorhersehbare Kosten | CrewAI |
| Ein offenes Gespräch, Iteration, Schleifen aus Korrigieren und erneutem Ausprobieren | AG2 (der aktive Fork des früheren AutoGen) |
| Ein expliziter Graph mit einem Zustand, den Sie selbst steuern | Ein graphorientiertes Framework |
| Ein einziger Agent, der ein Repository ändert | Ein dedizierter Code-Agent |
| Ein Projekt, das bereits auf dem Microsoft-Ökosystem aufbaut | Microsoft Agent Framework |
Bei bestehendem Code, der mit der ursprünglichen AutoGen-API geschrieben wurde, erfordert die Migration zu AG2 in der Regel nur geringfügige Änderungen: Der ursprüngliche Namensraum autogen.* bleibt in einem eigenen Branch (AG2 Classic) verfügbar, sodass Sie den Wechsel in Ihrem eigenen Tempo vornehmen können. Heute von Grund auf neu zu beginnen, ist eine andere Entscheidung: Dann bietet es sich an, direkt AG2 zu wählen oder Microsoft Agent Framework zu prüfen, statt sich in eine Codebasis einzuarbeiten, die ihr eigener Herausgeber selbst als von der Community betreut bezeichnet.
#Der tatsächliche Preis einer Konversation
Bei einer kostenpflichtigen API macht sich ein Gespräch mit drei Agenten, das sich über zwanzig Runden hinzieht, auf der Rechnung bemerkbar. Im lokalen Betrieb merken Sie es am Gehäuselüfter und an der Wanduhr. Jede Runde ist eine vollständige Generierung: Wenn eine Runde auf Ihrer Karte durchschnittlich fünf Sekunden dauert, bedeuten zwanzig Runden ohne Abbruchbedingung mindestens eine Minute und vierzig Sekunden ununterbrochene Rechenarbeit. Oft dauert es deutlich länger, sobald der Kontext gewachsen ist und bei jeder Generierung ein längerer Verlauf erneut gelesen wird als bei der vorherigen. Währenddessen warnt Sie nichts – kein Zähler, kein Schwellenwert, nur eine GPU, die heiß bleibt.
Deshalb ist die Begrenzung der Gesprächsrunden kein Konfigurationsdetail unter vielen: Sie ist der einzige Mechanismus, der potenziell unbegrenzte Kosten in begrenzte und vorhersehbare Kosten verwandelt, genau wie ein Token-Budget bei einer kommerziellen API. Diese Grenze vor dem ersten Versuch festzulegen, statt sie erst im Nachhinein zu entdecken, macht den Unterschied zwischen einem fünfminütigen Test und einer Grafikkarte, die einen ganzen Abend lang für ein Gespräch belegt ist, das seit der zehnten Nachricht zu nichts mehr geführt hat. Auf einem Rechner, der auch für andere Zwecke genutzt wird — einem Arbeitsplatzrechner, keinem dedizierten Server —, hat diese vollständige Belegung auch konkrete Opportunitätskosten: Solange ein Gespräch zwischen mehreren Agenten unbegrenzt im Hintergrund läuft, lässt sich keine andere GPU-intensive Aufgabe starten.
#FAQ
Wird AutoGen weiterhin von Microsoft entwickelt?+
Was ist AG2, und sollte man es stattdessen verwenden?+
Funktioniert AutoGen mit Ollama?+
Warum sprechen meine Agenten ohne Ende?+
Ist es sicher, einen Agenten Code ausführen zu lassen?+
Was ist das kleinste nutzbare Modell?+
AutoGen (AG2) oder CrewAI?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.