Fortgeschritten 11 Min.Agenten

AutoGen lokal: Was funktioniert und was casse

Direkte Antwort

AutoGen funktioniert lokal über einen OpenAI-kompatiblen Endpunkt (Ollama, vLLM), aber Microsoft hat das Projekt am 2. Oktober 2025 in den Wartungsmodus versetzt: Es gibt keine neuen Funktionen mehr, und Microsoft empfiehlt die Migration zu Microsoft Agent Framework. AG2, der unter Apache-2.0 lizenzierte Fork der ursprünglichen Entwickler, ist heute die aktiv weiterentwickelte Version, die Sie für ein neues Projekt in Betracht ziehen sollten.

AutoGen baut Systeme aus Agenten auf, die miteinander sprechen. An ein lokales Modell angebunden, funktioniert es – bis zu einer Grenze, die fast vollständig von der Modellgröße und davon abhängt, wie viel Spielraum man dem Gespräch lässt. Im lokalen Betrieb ist jeder Gesprächsbeitrag eine Generierung auf Ihrer eigenen Grafikkarte: Für Disziplin sorgen nicht die Prompts, sondern die gesetzten Grenzen. Seit Ende 2025 hat sich noch etwas geändert, das bisher nur wenige Tutorials erwähnen: Der Name „AutoGen“ bezeichnet nicht mehr ein einziges aktives Projekt, sondern drei unterschiedliche Entwicklungswege, die Sie auseinanderhalten müssen, bevor Sie entscheiden, worin Sie Ihre Zeit investieren.

Von Mohamed Meguedmi·Aktualisierung 2026-09-28·Unter Windows, macOS und Linux getestet

#Das Konversationsmodell

Während ein Framework für Verarbeitungsketten die Definition von Schritten verlangt, verlangt AutoGen die Definition von Teilnehmern. Ein Assistenten-Agent macht Vorschläge; ein stellvertretender Agent vertritt Sie, führt gegebenenfalls Code aus und gibt das Ergebnis zurück; in einer Gruppendiskussion kommen mehrere Spezialisten unter der Leitung eines Managers zu Wort, der entscheidet, wer spricht. Das Verhalten ergibt sich aus diesem Austausch.

Das ist wirklich leistungsfähig für offene Aufgaben – Fehler beheben, eine Analyse iterativ weiterentwickeln – und genau das macht die Kosten unvorhersehbar. Eine feste Kette führt N Modellaufrufe aus. Ein Gespräch führt so viele aus, wie nötig sind, und wie viele nötig sind, entscheidet ausgerechnet das Modell, an dem Sie zweifeln.

Diese Konzeption hat eine direkte Konsequenz für die Rollenwahl: Je mehr unterschiedliche Agenten an der Unterhaltung beteiligt sind, desto mehr Gesprächsrunden sind möglich, bevor eine endgültige Antwort entsteht, und desto größer wird das Risiko, vom Ziel abzuweichen. Zwei Agenten, die sich in einer Schleife gegenseitig antworten, ohne jemals zu einer Schlussfolgerung zu gelangen, sind beim lokalen Betrieb das häufigste Symptom – gerade weil vor dem ersten Versuch keine Grenzen gesetzt wurden. Die Anzahl der Agenten ist daher nicht nur eine Architekturentscheidung, sondern ein direkter Multiplikator für die auf Ihrer eigenen Grafikkarte verbrauchte Rechenzeit.

#AutoGen im Wartungsmodus: was sich geändert hat

Das Kit für lokale Agenten

Agenten, die auf Ihrem Rechner handeln: agentisches Cline, MCP, n8n + Ollama und lokale Automatisierungen.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Diesen Punkt verschweigen die meisten Tutorials, die noch online sind. Das offizielle Repository microsoft/autogen erklärt es selbst seit dem 2. Oktober 2025 schwarz auf weiß: Das Projekt befindet sich im Wartungsmodus, wird keine neuen Funktionen mehr erhalten und wird von der Community betreut. Microsoft empfiehlt, neue Projekte direkt mit Microsoft Agent Framework (MAF) zu beginnen. Dieser Nachfolger vereint die Bausteine von AutoGen und Semantic Kernel in einem einzigen Entwicklungskit und wurde Anfang April 2026 allgemein verfügbar (General Availability).

Die ursprünglichen Entwickler von AutoGen, Chi Wang und Qingyun Wu, verließen Microsoft Ende 2024 und führten die Entwicklung unter dem Namen AG2 fort, einem Fork unter der Apache-2.0-Lizenz, der von der Organisation ag2ai gehostet wird. AG2 versteht sich als aktive Fortsetzung des Projekts statt als Bruch damit: Die bisherige Basis bleibt unter dem Namen AG2 Classic für alle verfügbar, die nichts an ihrem Code ändern möchten, während AG2 1.0 die Architektur hin zu einem expliziteren Protokoll zwischen Agenten weiterentwickelt. Für ein Projekt, das heute startet, ist AG2 die naheliegendste Wahl, wenn Sie nahe an der ursprünglichen AutoGen-API bleiben möchten; Microsoft Agent Framework sollten Sie sich ansehen, wenn Sie bereits im Microsoft-Ökosystem arbeiten und die Zusammenführung mit den Semantic-Kernel-Tools Sie unmittelbar betrifft.

!
Was sich konkret für Sie ändert
Der bisherige AutoGen-Code funktioniert weiterhin: Er erhält Sicherheitskorrekturen, aber keine neuen Funktionen. Nichts von dem, was im weiteren Verlauf dieses Leitfadens folgt (Ollama-Konfiguration, Abschottung der Codeausführung, Modellgrößen), ändert sich mit AG2, dessen API weiterhin sehr ähnlich ist. Doch heute auf „AutoGen“ zu setzen, ohne zu wissen, dass der Name inzwischen drei unterschiedliche Projekte umfasst – das eingefrorene Microsoft-Repository, den aktiven AG2-Fork und Microsoft Agent Framework –, ist genau die Art von Fehler bei der Tool-Auswahl, die sechs Monate später teuer wird, wenn der Code weiterentwickelt werden soll.

#Es mit einem lokalen Modell verbinden

  1. 01
    Modell bereitstellen
    Über einen OpenAI-kompatiblen Endpunkt. Wenn mehrere Agenten gleichzeitig kommunizieren, arbeitet ein für gleichzeitige Anfragen ausgelegter Server deutlich besser als ein Server, der für einen einzelnen Arbeitsplatz konzipiert wurde.
  2. 02
    Den Client konfigurieren
    Basis-URL (zum Beispiel http://localhost:11434/v1 für Ollama), Modellname exakt so, wie das Modell lokal heruntergeladen wurde, Dummy-Schlüssel. Lokale Server ignorieren den Schlüssel; die Clientbibliothek verlangt häufig, dass er vorhanden ist.
  3. 03
    Die Fähigkeiten ehrlich angeben
    Die Frameworks fragen ab, ob das Modell Funktionsaufrufe oder den JSON-Modus unterstützt. Eine Fähigkeit anzugeben, die das Modell nicht besitzt, führt später zu unverständlichen Fehlern statt zu einem sauber abgefangenen Fehlschlag.
  4. 04
    Das Kontextfenster vergrößern
    Der Verlauf wächst mit jeder Runde. Bei der standardmäßigen Kontextlänge wird der Anfang ohne Hinweis abgeschnitten, und die Agenten erledigen dann bereits abgeschlossene Arbeit erneut.
!
Legen Sie vor dem ersten Versuch eine maximale Anzahl von Gesprächsrunden fest
Nicht erst danach. Die typische erste Erfahrung mit einer lokalen Multi-Agenten-Unterhaltung besteht darin, zwanzig Minuten später festzustellen, dass sich zwei Agenten seit der dritten Nachricht gegenseitig gratulieren, während die Grafikkarte auf Hochtouren läuft.

#Code-Ausführung: in einer isolierten Umgebung ausführen

Der Ablauf, der AutoGen attraktiv macht – ein Agent schreibt Code, ein Stellvertreter führt ihn aus, die Fehlermeldung kommt zurück, der Agent korrigiert –, ist zugleich der Ablauf, bei dem von einem Modell geschriebener Code auf Ihrem Rechner ausgeführt wird. Dieser Code wird in einem Container ausgeführt, ohne Zugangsdaten, ohne Netzwerkzugriff, sofern die Aufgabe ihn nicht erfordert, und niemals mit Zugriff auf Ihr persönliches Verzeichnis. Alle von außen abgerufenen Inhalte – ein Ticket, eine Webseite, eine Dokumentationsdatei – müssen als potenziell feindselig betrachtet werden.

Beobachtbarkeit ist genauso wichtig wie Isolation. Bei einer Unterhaltung mit drei oder vier Agenten lässt sich ein Vorfall diagnostizieren, indem man den exakten Prompt nachliest, den jeder Agent in jeder Runde erhalten hat – nicht anhand einer nachträglichen Zusammenfassung. Ohne vollständige Aufzeichnungen weiß man nie, ob ein Agent eine Anweisung falsch interpretiert oder lediglich einen wegen Speichermangels gekürzten Kontext erhalten hat. Jeden Austausch zu protokollieren, einschließlich der Tool-Aufrufe und ihrer exakten Argumente, kostet wenig und erspart das Rätselraten darüber, was passiert ist, sobald die Grafikkarte wieder still geworden ist.

#Die Größe des Modells, noch einmal

Was tatsächlich in einer Konversation passiert
ModellklasseVerhalten
3 bis 8 MilliardenFlüssige Nachrichten, unzuverlässige Tool-Aufrufe, keine Abbruchdisziplin. Schleife.
12 bis 14 MilliardenDer Austausch zwischen zwei Agenten mit klaren Rollen funktioniert; Gruppendiskussionen schweifen ab.
24 bis 32 MilliardenDie praktikable Untergrenze für Gruppendiskussionen und Schleifen zur Codeausführung.
70 Milliarden und mehrDas Verhalten kommt dem in der Cloud am nächsten, ist aber so langsam, dass lange Gespräche zur Stapelverarbeitung werden.

Bevorzugen Sie Modelle, die für Tool-Aufrufe und strukturierte Ausgaben trainiert wurden. An dieselbe Grenze stoßen alle Frameworks für lokale Agenten: Fließtext ist einfach, strikte Formate sind es nicht. Für die Rolle des Managers in einer Gruppendiskussion sollten Sie in der Regel das leistungsfähigste Modell einsetzen, das Ihnen zur Verfügung steht: Es entscheidet, wer als Nächstes spricht. Jede falsche Routing-Entscheidung kostet eine ganze Gesprächsrunde – und das wiederholt sich, solange sich das Gespräch weiter im Kreis dreht, ohne zu einem Ergebnis zu kommen.

#AutoGen, AG2 oder CrewAI

Zwei unterschiedliche mentale Modelle
Sie möchtenWählen Sie
Definierte Rollen, geordnete Übergaben, vorhersehbare KostenCrewAI
Ein offenes Gespräch, Iteration, Schleifen aus Korrigieren und erneutem AusprobierenAG2 (der aktive Fork des früheren AutoGen)
Ein expliziter Graph mit einem Zustand, den Sie selbst steuernEin graphorientiertes Framework
Ein einziger Agent, der ein Repository ändertEin dedizierter Code-Agent
Ein Projekt, das bereits auf dem Microsoft-Ökosystem aufbautMicrosoft Agent Framework

Bei bestehendem Code, der mit der ursprünglichen AutoGen-API geschrieben wurde, erfordert die Migration zu AG2 in der Regel nur geringfügige Änderungen: Der ursprüngliche Namensraum autogen.* bleibt in einem eigenen Branch (AG2 Classic) verfügbar, sodass Sie den Wechsel in Ihrem eigenen Tempo vornehmen können. Heute von Grund auf neu zu beginnen, ist eine andere Entscheidung: Dann bietet es sich an, direkt AG2 zu wählen oder Microsoft Agent Framework zu prüfen, statt sich in eine Codebasis einzuarbeiten, die ihr eigener Herausgeber selbst als von der Community betreut bezeichnet.

#Der tatsächliche Preis einer Konversation

Bei einer kostenpflichtigen API macht sich ein Gespräch mit drei Agenten, das sich über zwanzig Runden hinzieht, auf der Rechnung bemerkbar. Im lokalen Betrieb merken Sie es am Gehäuselüfter und an der Wanduhr. Jede Runde ist eine vollständige Generierung: Wenn eine Runde auf Ihrer Karte durchschnittlich fünf Sekunden dauert, bedeuten zwanzig Runden ohne Abbruchbedingung mindestens eine Minute und vierzig Sekunden ununterbrochene Rechenarbeit. Oft dauert es deutlich länger, sobald der Kontext gewachsen ist und bei jeder Generierung ein längerer Verlauf erneut gelesen wird als bei der vorherigen. Währenddessen warnt Sie nichts – kein Zähler, kein Schwellenwert, nur eine GPU, die heiß bleibt.

Deshalb ist die Begrenzung der Gesprächsrunden kein Konfigurationsdetail unter vielen: Sie ist der einzige Mechanismus, der potenziell unbegrenzte Kosten in begrenzte und vorhersehbare Kosten verwandelt, genau wie ein Token-Budget bei einer kommerziellen API. Diese Grenze vor dem ersten Versuch festzulegen, statt sie erst im Nachhinein zu entdecken, macht den Unterschied zwischen einem fünfminütigen Test und einer Grafikkarte, die einen ganzen Abend lang für ein Gespräch belegt ist, das seit der zehnten Nachricht zu nichts mehr geführt hat. Auf einem Rechner, der auch für andere Zwecke genutzt wird — einem Arbeitsplatzrechner, keinem dedizierten Server —, hat diese vollständige Belegung auch konkrete Opportunitätskosten: Solange ein Gespräch zwischen mehreren Agenten unbegrenzt im Hintergrund läuft, lässt sich keine andere GPU-intensive Aufgabe starten.

#FAQ

Wird AutoGen weiterhin von Microsoft entwickelt?+
Nein, nicht mehr aktiv. Microsoft hat das Repository microsoft/autogen am 2. Oktober 2025 in den Wartungsmodus versetzt: nur Sicherheitskorrekturen, keine neuen Funktionen; alles Weitere übernimmt die Community. Microsoft empfiehlt ausdrücklich, bei neuen Projekten auf Microsoft Agent Framework zu setzen, den offiziellen Nachfolger, der Anfang April 2026 allgemein verfügbar wurde. Dazu gibt es einen eigenen Migrationsleitfaden.
Was ist AG2, und sollte man es stattdessen verwenden?+
AG2 ist der unter Apache 2.0 lizenzierte Fork, den Chi Wang und Qingyun Wu, die ursprünglichen Autoren von AutoGen, nach ihrem Weggang von Microsoft Ende 2024 erstellt haben. Heute ist er die aktiv entwickelte Version, die der ursprünglichen AutoGen-API am nächsten kommt: eine vernünftige Wahl für ein neues Projekt, das diesem Ansatz treu bleiben möchte, ohne vom Microsoft-Ökosystem abhängig zu sein.
Funktioniert AutoGen mit Ollama?+
Ja, über den OpenAI-kompatiblen Endpunkt von Ollama unter http://localhost:11434/v1: die Basisadresse, der Modellname genau so, wie das Modell lokal abgerufen wurde, und ein Dummy-Schlüssel, da Ollama ihn nicht überprüft. Für mehrere gleichzeitig arbeitende Agenten verhält sich ein auf parallele Anfragen ausgelegter Server deutlich besser als Ollama allein auf einem herkömmlichen Arbeitsplatzrechner.
Warum sprechen meine Agenten ohne Ende?+
Es wurde keine wirksame Abbruchbedingung festgelegt, und oft ist das Modell zu klein, um sie zu erkennen, selbst wenn sie im Prompt steht. Legen Sie vor dem ersten Versuch eine maximale Anzahl von Runden fest, definieren Sie eine explizite und getestete Abbruchphrase und setzen Sie für die Rolle des Managers, der entscheidet, wer als Nächstes spricht, ein größeres Modell ein.
Ist es sicher, einen Agenten Code ausführen zu lassen?+
Nur in einem Container, ohne Zugangsdaten und mit einem auf das unbedingt Notwendige beschränkten Netzwerkzugriff. Die Ausführungskomponente führt Code aus, den ein Modell geschrieben hat, das im Laufe des Gesprächs möglicherweise von einem Dritten kontrollierten Text gelesen hat. Dadurch entsteht ein klassisches Einfallstor für indirekte Prompt-Injektion in einer lokalen Installation.
Was ist das kleinste nutzbare Modell?+
Etwa 12 bis 14 Milliarden Parameter für einen einfachen Austausch zwischen zwei Agenten mit klar definierten Rollen und 24 bis 32 Milliarden für Gruppendiskussionen oder Schleifen zur Codeausführung. Unterhalb dieser Schwelle wirken die Nachrichten weiterhin flüssig, aber das zuverlässige Beenden und die Tool-Aufrufe werden unzuverlässig.
AutoGen (AG2) oder CrewAI?+
CrewAI eignet sich besser für im Voraus definierte Rollen und vorhersehbare Übergaben von einem Agenten an den anderen; AG2 für offene Gespräche und iterative Problemlösung, bei der der Weg zu Beginn noch nicht bekannt ist. Bei lokalem Betrieb hängen beide gleichermaßen von der Qualität des Modells ab.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.