So senken Sie den Token-Verbrauch von KI-Coding-Agenten
Senken Sie den Tokenverbrauch von KI-Coding-Agenten: Begrenzen Sie den Dateizugriff, formulieren Sie kurze Anweisungen, planen Sie vorab und starten Sie Sitzungen neu.
Um den Token-Verbrauch eines KI-Coding-Agenten zu senken, reduzieren Sie, was in seinen Kontext gelangt. Nennen Sie ihm die Dateien, die er lesen soll, halten Sie die Projektanweisungsdatei kurz, lassen Sie sich vor dem Code einen Plan vorlegen, führen Sie Suchen selbst aus, starten Sie Sessions häufig neu und deaktivieren Sie Tools, die die Aufgabe nicht benötigt.
Die meisten beschäftigen sich mit diesem Thema, nachdem eine Session mitten in einem Refactoring ihr Nutzungslimit erreicht hat oder sich eine Rechnung verdoppelt hat, obwohl der Arbeitsumfang gleich geblieben ist.
Diese Gewohnheiten funktionieren in Claude Code, Codex, Cursor und ähnlichen Agenten auf dieselbe Weise. Jeder Abschnitt erklärt, warum die jeweilige Gewohnheit wirkt, liefert ein kurzes Beispiel zum Kopieren und gibt an, ob die Belege auf einer Messung oder auf begründeter Praxis beruhen.
Das Wichtigste in Kürze
- Jede Datei, die ein Agent liest, und jeder frühere Gesprächsschritt, den er behält, bleibt in seinem Kontext. Der günstigste Token ist der, den der Agent nie zu sehen bekommt.
- In einer Studie mit 124 Pull Requests, die mit OpenAI Codex bearbeitet wurden, ging das Hinzufügen einer AGENTS.md-Datei mit einem Rückgang der medianen Output-Tokens um 16,58 % und der medianen Laufzeit um 28,64 % einher. Die medianen Gesamt-Tokens blieben nahezu unverändert (etwa 1 % höher).
- Ein Beitrag von Spotify Engineering ermittelte in einem Java-Monorepo durchschnittlich rund 90 % Einsparung bei umfangreichen Dateilesevorgängen, indem Claude statt der Dateien die Zusammenfassung eines günstigeren Modells erhielt. Diese Zahl bezieht sich ausschließlich auf Claudes Kontext.
- Laut der Claude-Code-Dokumentation von Anthropic liegt die Ursache, wenn die Kosten bei einem API- oder Cloud-Provider-Tarif höher ausfallen als erwartet, meist in einer langen Session, die nie geleert wurde, oder darin, dass Opus als Standardmodell eingestellt blieb.
Warum ist es wichtig, den Token-Verbrauch von KI-Coding-Agenten zu senken?
Tokens kosten doppelt: einmal auf Ihrer Rechnung bzw. bei Ihrem Nutzungslimit und ein zweites Mal bei der Qualität der Ergebnisse. Jede Datei, die ein KI-Coding-Agent liest, und jeder frühere Gesprächsschritt, den er behält, bleibt in seinem Kontext – der günstigste Token ist also der, den der Agent nie zu sehen bekommt. Ein kleinerer, relevanterer Kontext bietet dem Modell zudem weniger irrelevantes Material, das es ablenken kann. Eine schlanke Session ist in der Regel günstiger und präziser als eine aufgeblähte.
Ein Beispiel: Eine Debugging-Session, die mit „Sieh dir das Repo an“ beginnt, kann Dutzende nicht zusammenhängender Dateien einlesen, bevor der Agent beim eigentlichen Bug ankommt. Sie zahlen für jede einzelne davon, und das Modell muss sich durch alle hindurcharbeiten.
Begrenzen Sie, was der Agent sehen kann
Um explorative Lesevorgänge eines KI-Coding-Agenten zu reduzieren, sagen Sie ihm, welche Dateien er lesen soll, statt ihn auf das gesamte Repository anzusetzen. Andernfalls muss der Agent erst danach suchen, und jede Datei, die er dabei öffnet, landet im Kontext. Sobald Sie die Dateien benennen, beschränkt sich das Lesen des Agenten auf das, was die Aufgabe tatsächlich erfordert.
# Before
Why is the checkout total wrong? Look through the repo.
# After
The total in src/cart/total.ts is wrong when a discount code is applied.
Read src/cart/total.ts and src/cart/discounts.ts only. Do not open other files
without asking.
Sie können auch von vornherein einschränken, worauf der Agent zugreifen kann. Läuft er auf einer dedizierten Maschine, etwa in einem Remote-Box-Setup für agentenbasiertes Programmieren, klonen Sie nur die Repositories, die für die jeweilige Aufgabe nötig sind.
Pflegen Sie eine Projektanweisungsdatei
Eine Projektanweisungsdatei, meist AGENTS.md oder CLAUDE.md genannt, erspart es einem KI-Coding-Agenten, Ihre Konventionen in jeder Session neu zu erschließen. Die meisten Agenten unterstützen eine solche Datei. Prüfen Sie in der Dokumentation Ihres Agenten, welchen Dateinamen er einliest. Claude Code liest CLAUDE.md, und laut seiner Memory-Dokumentation liest es ab v2.1.277 auch direkt AGENTS.md, wenn ein Repository keine CLAUDE.md enthält.
Die Beleglage ist hier konkret. In einer Studie mit 124 Pull Requests aus 10 Repositories unter Verwendung von OpenAI Codex wiesen Durchläufe mit einer AGENTS.md-Datei eine um 28,64 % geringere mediane Laufzeit und eine um 16,58 % geringere mediane Anzahl an Output-Tokens auf. Dieselbe Ergebnistabelle zeigt, dass die medianen Gesamt-Tokens in etwa gleich blieben – mit der Datei sogar rund 1 % höher lagen. In der Praxis sorgt die Datei also vor allem dafür, dass der Agent weniger schreibt und schneller fertig wird. Sie verringert nicht alles, was er liest. Die Studie hat zudem Einschränkungen: Sie verwendete nur einen Agenten (Codex mit gpt-5.2-codex), umfasste ausschließlich kleine, gemergte PRs (höchstens 100 geänderte Zeilen und fünf Dateien pro PR) und bewertete nicht vollständig, ob die Ergebnisse korrekt waren.
Halten Sie die Datei kurz. Claude Code lädt CLAUDE.md zu Beginn jeder Session in den Kontext, Sie zahlen also in jeder Unterhaltung für jede einzelne Zeile. Anthropic empfiehlt, unter 200 Zeilen zu bleiben, und weist darauf hin, dass Claude kurze, konkrete Anweisungen zuverlässiger befolgt als lange oder vage.
# AGENTS.md
## Project
Web API for order processing. Entry point: src/server.ts.
## Structure
- src/routes/: HTTP handlers, one file per resource
- src/services/: business logic; handlers never touch the DB directly
- tests/: mirrors src/; test files end in .test.ts
## Conventions
- Run `npm test` before proposing changes; run `npm run lint` on touched files
- Use the logger in src/lib/log.ts, never console.log
- Do not edit generated files in src/generated/
Lassen Sie sich vor dem Code einen Plan vorlegen
Wenn Sie einen KI-Coding-Agenten um einen Plan bitten, bevor er Code schreibt, können Sie eine falsche Richtung erkennen, bevor er Dateien gelesen und umgeschrieben hat. Einen Plan zu verwerfen kostet so gut wie nichts. Eine falsche Implementierung hat dagegen bereits Tokens für jede berührte Datei verbraucht, bevor Sie es bemerken. Der Plan liefert Ihnen außerdem eine Dateiliste, die Sie zusammenstreichen können, bevor die Arbeit beginnt.
Before writing any code: list the files you intend to read and change, and
the steps you will take, in under 10 bullets. Wait for my approval.
Enthält der Plan eine irrelevante Datei, entfernen Sie sie aus der Liste, bevor Sie ihn freigeben.
Führen Sie Suchen selbst aus und übergeben Sie die Ergebnisse
Wenn Sie grep selbst ausführen und die passenden Zeilen einfügen, zahlt der Agent nur für diese Zeilen. Bitten Sie dagegen den Agenten, dasselbe zu finden, kann ihn das jede Datei kosten, die er unterwegs öffnet. Tools wie git grep und git diff sind schnell und verbrauchen bei der Ausführung keine Tokens – überlassen Sie ihnen also die Suche und geben Sie dem Modell nur die Ergebnisse.
# Find every call site yourself
git grep -n "applyDiscount(" -- '*.ts'
# See only what changed, not whole files
git diff --stat
git diff -- src/cart/total.ts
Fügen Sie anschließend die Ausgabe ein: „Hier sind die 4 Aufrufstellen von applyDiscount: [eingefügte Zeilen]. Passe sie so an, dass sie das currency-Argument übergeben.“
Spotify hat eine automatisierte Variante dieser Gewohnheit entwickelt. Das Setup leitet umfangreiche Dateilesevorgänge von Claude Code an ein günstigeres Worker-Modell weiter und übergibt Claude nur die Zusammenfassung. Ein Spotify-Engineer testete es an einem Java-Monorepo in vier Szenarien. Für jedes Szenario stellte er die Tokens, die Claude beim eigenen Lesen der Dateien verbrauchen würde, den Tokens gegenüber, die es zum Lesen der Worker-Zusammenfassung benötigte; die Einsparung bei den umfangreichen Lesevorgängen lag im Durchschnitt bei rund 90 %. Dieser Wert gilt für diese eine Codebasis, berücksichtigt nur Claudes Kontext und nicht die Tokens des Worker-Modells und umfasst ausschließlich die Szenarien mit umfangreichen Lesevorgängen. Der Beitrag von Spotify Engineering nennt außerdem Einschränkungen: Für Änderungen sind weiterhin direkte Lesevorgänge nötig, da die Zusammenfassungen keine verlässlichen Zeilennummern enthalten, Reasoning und Debugging verbleiben bei Claude, und jede Delegation erhöht die Latenz.
Halten Sie Sessions kurz und starten Sie neu
Beginnen Sie zwischen Aufgaben eine neue Session, statt eine einzige Unterhaltung immer weiter wachsen zu lassen. Eine lange Unterhaltung trägt ihren gesamten Verlauf in jede neue Nachricht mit; wer einen veralteten Thread fortsetzt, zahlt also weiterhin für Kontext, den er nicht mehr braucht. Laut Anthropics Leitfaden zu den Kosten von Claude Code liegt die Ursache, wenn die Kosten bei einem API- oder Cloud-Provider-Tarif höher ausfallen als erwartet, meist in einer Session, die nie geleert wurde, oder darin, dass Opus als Standardmodell eingestellt blieb. Das Leeren zwischen nicht zusammenhängenden Aufgaben zählt der Leitfaden zu den Gewohnheiten mit der größten Wirkung.
# End of session 1
Summarize in under 15 lines: what we changed, what we decided, what is left.
Write it to NOTES.md.
# Start of session 2 (new chat/session)
Read NOTES.md, then continue with the first remaining item.
Die Zusammenfassung bewahrt Ihre Entscheidungen. Die neue Session verwirft den Verlauf, der zu ihnen geführt hat.
Deaktivieren Sie Tools und Integrationen, die die Aufgabe nicht benötigt
Jede aktivierte Integration erweitert, was der Agent lädt und worauf er zugreifen kann. Benötigt die Aufgabe eine Integration nicht, deaktivieren Sie sie. MCP-Server sind dabei die üblichen Verdächtigen. Claude Code hält vollständige MCP-Tool-Definitionen inzwischen zurück, bis Claude eine davon benötigt; ein ungenutzter Server kostet daher weniger als früher, seine Tool-Namen und Anweisungen stehen aber weiterhin im Kontext. Anthropics Leitfaden zu den Kosten von Claude Code empfiehlt nach wie vor, /mcp auszuführen und nicht genutzte Server abzuschalten. Ein Datenbankserver, ein Server für Browser-Automatisierung und eine Ticketing-Integration, die Sie letzten Monat eingebunden haben, belasten allesamt eine Session, die nur CSS anfasst.
Öffnen Sie für ein Refactoring an einer einzelnen Datei die Einstellungen Ihres Agenten und deaktivieren Sie die Server für Datenbank, Browser und Issue-Tracker. Schalten Sie sie wieder ein, wenn eine Aufgabe sie erfordert. Falls Sie nicht sicher sind, was die einzelnen Server bereitstellen, erklärt der Leitfaden zum MCP-Ökosystem, wie Clients und Server zusammenspielen. Wenn Sie einen eigenen Server betreiben, zeigt Schritt für Schritt einen MCP-Server erstellen, wie Sie nur die von Ihnen definierten Tools bereitstellen.
Zusammenfassung
| Gewohnheit | Was sie aus dem Kontext entfernt | Beleg |
|---|---|---|
| Dateien benennen | Explorative Dateilesevorgänge | Begründete Praxis |
| Anweisungsdatei | Erneutes Erschließen von Konventionen; überflüssiger Output | arXiv 2601.20404 |
| Plan vor dem Code | Lese- und Schreibvorgänge in falscher Richtung | Begründete Praxis |
| Selbst suchen | Ganze Dateien, die geöffnet werden, um wenige Zeilen zu finden | Spotify Engineering, ein Java-Monorepo |
| Kurze Sessions | Veralteter Gesprächsverlauf | Anthropics Leitfaden zu den Kosten von Claude Code |
| Ungenutzte Tools deaktivieren | Integrationen, die die Aufgabe nie aufruft | Anthropics Leitfaden zu den Kosten von Claude Code |
Fazit
Die Token-Kosten wachsen mit der Größe des Kontexts, und ein Agent wie Claude Code sendet bei jeder Anfrage die gesamte Unterhaltung erneut – der Kontext, den er liest und dann wieder und wieder liest, summiert sich also schnell. Jede der oben genannten Gewohnheiten wirkt, indem sie diesen Kontext klein und fokussiert hält. Wählen Sie eine aus, fügen Sie dann den Prompt und die Dateien, die Sie senden wollen, in einen LLM-Token-Zähler ein und zählen Sie vor und nach der Änderung. Ohne Messung ist eine Einsparung nur eine Vermutung.
FAQs
Was ist der Unterschied zwischen dem Komprimieren und dem Leeren einer Agenten-Session?
Beim Komprimieren (Compacting) wird der ältere Gesprächsverlauf durch eine Zusammenfassung ersetzt und die Session fortgesetzt, beim Leeren (Clearing) wird der Verlauf verworfen und ein frischer Kontext gestartet. In Claude Code muss das Modell die gesamte Unterhaltung lesen, um sie zusammenzufassen; das Komprimieren eines großen Kontexts ist daher selbst eine umfangreiche Anfrage, während das Leeren nichts kostet. Komprimieren Sie mitten in einer Aufgabe, wenn frühere Entscheidungen noch relevant sind, und leeren Sie zwischen nicht zusammenhängenden Aufgaben.
Kosten MCP-Server, die ich nicht nutze, in Claude Code trotzdem Tokens?
Weniger als früher. Standardmäßig verwendet Claude Code die Tool-Suche: Beim Start sieht das Modell die Tool-Namen und Anweisungen jedes Servers, und das vollständige Schema eines Tools wird erst abgerufen, wenn eine Aufgabe es erfordert. Claude Code lädt stattdessen alles vorab, wenn ANTHROPIC_BASE_URL auf einen Host verweist, der nicht von Anthropic selbst betrieben wird, bei auf Azure gehosteten Microsoft-Foundry-Deployments sowie bei Modellen auf Google Clouds Agent Platform, die älter als die Claude-4.5-Generation sind. Auch Server, die mit alwaysLoad markiert sind, werden vollständig geladen. Die Tool-Ausgaben jedes Servers gelangen weiterhin in den Kontext.
Senkt der Wechsel zu einem günstigeren Modell den Token-Verbrauch?
Nein. Ein günstigeres Modell ändert den Preis pro Token, nicht die Anzahl der Tokens. Der Agent liest weiterhin dieselben Dateien und sendet denselben Verlauf erneut. Beide Hebel lassen sich jedoch kombinieren: Anthropics Leitfaden zu den Kosten von Claude Code nennt die Wahl des passenden Modells für die jeweilige Aufgabe und das Leeren zwischen nicht zusammenhängenden Aufgaben als die wirkungsvollsten Gewohnheiten zur Kostensenkung.
Wie kann ich den Token-Verbrauch direkt in Claude Code prüfen?
Führen Sie /usage aus, um Session-Kosten, Nutzungslimits Ihres Tarifs und Aktivitätsstatistiken zu sehen, und /context für eine Aufschlüsselung dessen, was das aktuelle Kontextfenster füllt. In den Tarifen Pro, Max, Team und Enterprise weist /usage zudem auf Verhaltensmuster hin – etwa lange Kontexte –, die 10 % oder mehr Ihrer jüngsten Nutzung ausmachen, und schlägt vor, wie Sie diese reduzieren können. Der angezeigte Dollarbetrag ist stets eine Schätzung auf Basis von Listenpreisen. Bei einem Abonnement zeigt er nicht, was Sie tatsächlich bezahlen.