Cómo reducir el consumo de tokens en los agentes de programación con IA
Reduce el uso de tokens en agentes de programación con IA: limita los archivos, escribe instrucciones concisas, planifica antes de programar y reinicia sesiones.
Para reducir el consumo de tokens de un agente de programación con IA, limita lo que entra en su contexto. Indícale qué archivos debe leer, mantén un archivo de instrucciones del proyecto breve, pídele un plan antes de que escriba código, ejecuta tú mismo las búsquedas, reinicia las sesiones con frecuencia y desactiva las herramientas que la tarea no necesite.
La mayoría llega a este tema después de que una sesión alcanzara su límite de uso a mitad de una refactorización, o después de recibir una factura que se duplicó aunque el volumen de trabajo no cambió.
Estos hábitos funcionan igual en Claude Code, Codex, Cursor y otros agentes similares. Cada sección explica por qué funciona el hábito, ofrece un ejemplo breve que puedes copiar e indica si la evidencia proviene de una medición o de una práctica razonada.
Puntos clave
- Cada archivo que lee un agente y cada turno anterior que conserva permanecen en su contexto. El token más barato es el que el agente nunca llega a ver.
- En un estudio de 124 pull requests ejecutados con OpenAI Codex, añadir un archivo AGENTS.md se asoció con una reducción del 16,58 % en la mediana de tokens de salida y del 28,64 % en la mediana del tiempo de ejecución. La mediana de tokens totales apenas varió (aproximadamente un 1 % más).
- Una publicación de Spotify Engineering midió un ahorro medio de alrededor del 90 % en lecturas masivas de archivos en un monorepo de Java, al proporcionar a Claude un resumen generado por un modelo más barato en lugar de los archivos. Esa cifra solo contabiliza el contexto de Claude.
- La documentación de Claude Code de Anthropic indica que, cuando el gasto en un plan de API o de un proveedor cloud es mayor de lo esperado, la causa suele ser una sesión larga que nadie limpió o haber dejado Opus como modelo predeterminado.
¿Por qué es importante reducir el consumo de tokens en los agentes de programación con IA?
Los tokens cuestan dos veces: una en tu factura o tu límite de uso, y otra en la calidad del resultado. Cada archivo que lee un agente de programación con IA y cada turno anterior que conserva permanecen en su contexto, así que el token más barato es el que el agente nunca tiene que ver. Un contexto más reducido y pertinente también ofrece al modelo menos material irrelevante con el que distraerse. Una sesión ligera suele ser más barata y más precisa que una sobrecargada.
Por ejemplo, una sesión de depuración que empieza con «revisa el repositorio» puede cargar decenas de archivos no relacionados antes de que el agente llegue al bug real. Pagas por cada uno de ellos, y el modelo tiene que razonar descartándolos todos.
Limita lo que el agente puede ver
Para reducir las lecturas exploratorias de un agente de programación con IA, dile qué archivos leer en lugar de dirigirlo al repositorio completo. De lo contrario, el agente tiene que buscarlos, y cada archivo que abre por el camino acaba en el contexto. Cuando nombras los archivos, la lectura del agente se limita a lo que la tarea realmente necesita.
# Before
Why is the checkout total wrong? Look through the repo.
# After
The total in src/cart/total.ts is wrong when a discount code is applied.
Read src/cart/total.ts and src/cart/discounts.ts only. Do not open other files
without asking.
También puedes limitar a qué tiene acceso el agente desde el principio. Si se ejecuta en una máquina dedicada, como en una configuración de máquina remota para programación agéntica, clona solo los repositorios que necesite esa tarea.
Mantén un archivo de instrucciones del proyecto
Un archivo de instrucciones del proyecto, normalmente llamado AGENTS.md o CLAUDE.md, evita que un agente de programación con IA tenga que deducir de nuevo tus convenciones en cada sesión. La mayoría de los agentes lo admiten. Consulta la documentación de tu agente para saber qué nombre de archivo lee. Claude Code lee CLAUDE.md, y su documentación sobre memoria explica que, a partir de la v2.1.277, también lee AGENTS.md directamente cuando un repositorio no tiene CLAUDE.md.
En este caso, la evidencia es concreta. En un estudio de 124 pull requests en 10 repositorios con OpenAI Codex, las ejecuciones con un archivo AGENTS.md tuvieron una mediana de tiempo de ejecución un 28,64 % menor y una mediana de tokens de salida un 16,58 % menor. La misma tabla de resultados muestra que la mediana de tokens totales se mantuvo prácticamente igual; de hecho, fue alrededor de un 1 % mayor con el archivo. En la práctica, el archivo hace sobre todo que el agente escriba menos y termine antes, pero no reduce todo lo que lee. El estudio también tiene limitaciones: utilizó un solo agente (Codex con gpt-5.2-codex), abarcó solo PR pequeños ya fusionados (como máximo 100 líneas modificadas y cinco archivos cada uno) y no evaluó por completo si el resultado era correcto.
Mantén el archivo breve. Claude Code carga CLAUDE.md en el contexto al inicio de cada sesión, así que pagas por cada línea en cada conversación. Anthropic recomienda no superar las 200 líneas y señala que Claude sigue con más fiabilidad las instrucciones breves y concretas que las largas o ambiguas.
# AGENTS.md
## Project
Web API for order processing. Entry point: src/server.ts.
## Structure
- src/routes/: HTTP handlers, one file per resource
- src/services/: business logic; handlers never touch the DB directly
- tests/: mirrors src/; test files end in .test.ts
## Conventions
- Run `npm test` before proposing changes; run `npm run lint` on touched files
- Use the logger in src/lib/log.ts, never console.log
- Do not edit generated files in src/generated/
Pide un plan antes del código
Pedirle a un agente de programación con IA un plan antes de que escriba código te permite detectar una dirección equivocada antes de que haya leído y reescrito archivos. Descartar un plan no cuesta casi nada. Una implementación equivocada, en cambio, ya ha gastado tokens en cada archivo que tocó antes de que te dieras cuenta. El plan también te proporciona una lista de archivos que puedes recortar antes de que empiece el trabajo.
Before writing any code: list the files you intend to read and change, and
the steps you will take, in under 10 bullets. Wait for my approval.
Si el plan incluye un archivo que no es relevante, elimínalo de la lista antes de aprobarlo.
Ejecuta tú mismo las búsquedas y entrega los resultados
Cuando ejecutas grep tú mismo y pegas las líneas coincidentes, el agente solo paga por esas líneas. Pedirle al agente que encuentre lo mismo puede costarle cada archivo que abra por el camino. Herramientas como git grep y git diff son rápidas y no consumen tokens al ejecutarse, así que deja que ellas hagan la búsqueda y entrega al modelo solo los resultados.
# Find every call site yourself
git grep -n "applyDiscount(" -- '*.ts'
# See only what changed, not whole files
git diff --stat
git diff -- src/cart/total.ts
Después, pega la salida: «Estas son las 4 llamadas a applyDiscount: [líneas pegadas]. Actualízalas para que pasen el argumento de moneda».
Spotify creó una versión automatizada de este hábito. Su configuración deriva las lecturas masivas de archivos de Claude Code a un modelo auxiliar más barato y entrega a Claude solo el resumen. Un ingeniero de Spotify lo probó en un monorepo de Java en cuatro escenarios. En cada uno comparó los tokens que Claude habría usado para leer los archivos por sí mismo con los que usó para leer el resumen del modelo auxiliar, y el ahorro en lecturas masivas promedió alrededor del 90 %. Esa cifra se aplica a esa base de código concreta, solo contabiliza el contexto de Claude (no los tokens del modelo auxiliar) y abarca únicamente los escenarios de lectura masiva. La publicación de Spotify Engineering también enumera sus limitaciones: las ediciones siguen requiriendo lecturas directas porque los resúmenes no incluyen números de línea fiables, el razonamiento y la depuración siguen a cargo de Claude, y cada delegación añade latencia.
Mantén las sesiones cortas y empieza de cero
Inicia una sesión nueva entre tareas en lugar de dejar que una misma conversación siga creciendo. Una conversación larga arrastra todo su historial a cada nuevo mensaje, así que continuar un hilo obsoleto te sigue cobrando por un contexto que ya no necesitas. La guía de costes de Claude Code de Anthropic indica que, cuando el gasto en un plan de API o de un proveedor cloud es mayor de lo esperado, la causa habitual es una sesión que nunca se limpió o haber dejado Opus como modelo predeterminado. Además, incluye limpiar la sesión entre tareas no relacionadas entre los hábitos de mayor impacto.
# End of session 1
Summarize in under 15 lines: what we changed, what we decided, what is left.
Write it to NOTES.md.
# Start of session 2 (new chat/session)
Read NOTES.md, then continue with the first remaining item.
El resumen conserva tus decisiones. La nueva sesión descarta el historial que condujo a ellas.
Desactiva las herramientas e integraciones que la tarea no necesita
Cada integración que habilitas aumenta lo que el agente carga y lo que tiene a su alcance. Si la tarea no necesita una integración, desactívala. Los servidores MCP suelen ser los principales responsables. Claude Code ahora retiene las definiciones completas de las herramientas MCP hasta que Claude necesita una, así que un servidor inactivo cuesta menos que antes, pero los nombres y las instrucciones de sus herramientas siguen ocupando contexto. La guía de costes de Claude Code de Anthropic sigue recomendando ejecutar /mcp y desactivar los servidores que no estés usando. Un servidor de base de datos, uno de automatización del navegador y una integración con el sistema de tickets que conectaste el mes pasado suman peso a una sesión que solo toca CSS.
Para una refactorización de un solo archivo, abre la configuración de tu agente y desactiva los servidores de base de datos, navegador y gestor de incidencias. Vuelve a activarlos cuando una tarea los necesite. Si no sabes con certeza qué expone cada servidor, la guía del ecosistema MCP explica cómo encajan clientes y servidores. Si mantienes tu propio servidor, cómo crear un servidor MCP paso a paso muestra cómo exponer solo las herramientas que definas.
Resumen
| Hábito | Qué elimina del contexto | Evidencia |
|---|---|---|
| Nombrar los archivos | Lecturas exploratorias de archivos | Práctica razonada |
| Archivo de instrucciones | Redescubrir convenciones; salida innecesaria | arXiv 2601.20404 |
| Plan antes del código | Lecturas y escrituras gastadas en direcciones equivocadas | Práctica razonada |
| Buscar tú mismo | Archivos completos abiertos para encontrar unas pocas líneas | Spotify Engineering, un monorepo de Java |
| Sesiones cortas | Historial de conversación obsoleto | Guía de costes de Claude Code de Anthropic |
| Desactivar herramientas no usadas | Integraciones que la tarea nunca invoca | Guía de costes de Claude Code de Anthropic |
Conclusión
El coste en tokens crece con el tamaño del contexto, y un agente como Claude Code reenvía la conversación completa en cada solicitud, así que el contexto que lee y vuelve a leer se acumula rápidamente. Todos los hábitos anteriores funcionan manteniendo ese contexto reducido y centrado en la tarea. Elige uno y, a continuación, pega el prompt y los archivos que vas a enviar en un contador de tokens para LLM y cuéntalos antes y después del cambio. Sin una medición, un ahorro no es más que una suposición.
Preguntas frecuentes
¿Qué diferencia hay entre compactar y limpiar una sesión de un agente?
Compactar sustituye el historial de conversación más antiguo por un resumen y mantiene la sesión activa, mientras que limpiar descarta el historial e inicia un contexto nuevo. En Claude Code, el modelo tiene que leer toda la conversación para resumirla, así que compactar un contexto grande es, de por sí, una solicitud grande, mientras que limpiar no cuesta nada. Compacta a mitad de una tarea cuando las decisiones anteriores sigan siendo relevantes y limpia entre tareas no relacionadas.
¿Los servidores MCP que no estoy usando siguen consumiendo tokens en Claude Code?
Menos que antes. De forma predeterminada, Claude Code utiliza la búsqueda de herramientas: al iniciar, el modelo ve los nombres de las herramientas y las instrucciones de cada servidor, y el esquema completo de una herramienta solo se obtiene cuando una tarea lo requiere. Claude Code vuelve a cargarlo todo desde el inicio cuando ANTHROPIC_BASE_URL apunta a un host que no es de Anthropic, en despliegues de Microsoft Foundry alojados en Azure y con modelos de Agent Platform de Google Cloud anteriores a la generación Claude 4.5. Los servidores marcados con alwaysLoad también se cargan por completo. La salida de las herramientas de cualquier servidor sigue entrando en el contexto.
¿Cambiar a un modelo más barato reduce el consumo de tokens?
No. Un modelo más barato cambia el precio de cada token, no la cantidad de tokens. El agente sigue leyendo los mismos archivos y reenviando el mismo historial. Ambas palancas se complementan: la guía de costes de Claude Code de Anthropic señala elegir el modelo adecuado para cada tarea y limpiar la sesión entre tareas no relacionadas como los hábitos de mayor impacto para reducir el gasto.
¿Cómo puedo consultar el consumo de tokens desde Claude Code?
Ejecuta /usage para ver el coste de la sesión, los límites de uso del plan y las estadísticas de actividad, y /context para obtener un desglose de lo que ocupa la ventana de contexto actual. En los planes Pro, Max, Team y Enterprise, /usage también señala cualquier comportamiento, como el uso de contextos largos, que represente el 10 % o más de tu uso reciente, y sugiere cómo reducirlo. La cifra en dólares es siempre una estimación calculada a precio de lista. Con una suscripción, no refleja lo que realmente pagas.