← Claude Code Hub
✦ Tip #044 Apr 8, 2026

Cómo ahorrar tokens en Claude Code: 10 hábitos de la documentación oficial

Si tu sesión de Claude Code se acaba antes que hace unos meses, no eres solo tú. Anthropic tiene una página entera en la docs con 10 hábitos verificables para ahorrar tokens. Aquí están los 10.

Misma sesión, distintos hábitos — antes y después de aplicar 10 hábitos para ahorrar tokens

TL;DR Si tu sesión de Claude Code se acaba antes que hace unos meses, no eres solo tú — hay quejas reales por todos lados. Pero parte de la solución sí depende de ti. Anthropic tiene una página entera en la docs ("Manage costs effectively") con 10 hábitos verificables. Aquí están los 10, con la cita exacta cuando aplica.

Lo curioso de estos 10 hábitos es que ninguno es esotérico. Son sentido común. Y precisamente por eso son los primeros que se pasan por alto: cuando algo es obvio, lo descartas como "ya lo sé" antes de aplicarlo.

Los 10 hábitos

1. Monitoriza dónde se te van los tokens

/context desglosa cada categoría: system prompt, MCP tools, mensajes, free space. Si no lo miras periódicamente, conduces a ciegas. Tip dedicado: /context para monitorizar el uso de tokens. Para tendencias a largo plazo y límites del plan, ver /usage y /stats. Y para saber qué skill, qué plugin o qué servidor MCP se lleva cada porcentaje de tu límite, el desglose de /usage.

Falta un instrumento más, y mide la otra mitad: la línea Prompt cache (main) de /cost te dice qué porcentaje de tu entrada llega desde la caché y, cuando no llega, qué la rompió. Contexto pequeño y caché sana son dos cosas distintas, y las dos deciden tu factura.

2. Limpia entre tareas

/clear cuando cambies de tarea. Antes, /rename para encontrar la sesión después con /resume.

"Stale context wastes tokens on every subsequent message."

De los diez es el que más rinde, y por una razón concreta: cada turno reenvía la conversación entera, así que lo que arrastras de la tarea anterior lo vuelves a pagar en todos los turnos que le queden a la sesión.

3. Compacta con instrucciones explícitas

/compact no es solo "resume". Le puedes decir exactamente qué preservar:

/compact Focus on code samples and API usage

También puedes meter las instrucciones en CLAUDE.md bajo # Compact instructions. Y ojo: no todo vuelve igual tras compactar — mira qué sobrevive a /compact. La otra mitad de este hábito es el momento: compactar antes de una pausa larga cuesta una décima parte que compactar al volver, porque el resumen se paga leyendo la conversación entera y esa lectura solo sale de la caché si la caché sigue viva.

4. Sonnet por defecto. Opus solo para arquitectura

/model para cambiar al vuelo. Subagents simples con model: haiku en su configuración.

"Sonnet handles most coding tasks well and costs less than Opus. Reserve Opus for complex architectural decisions or multi-step reasoning."

Tip dedicado: Cómo elegir el modelo adecuado en Claude Code. Y con el ajuste nuevo /advisor puedes tener a Opus como asesor puntual mientras Sonnet sigue ejecutando — el mismo ahorro sin cambiar de modelo.

5. Desactiva MCP servers que no uses, prefiere CLI tools nativas

/mcp para ver y desactivar servers. Cada server activo deja sus tool names en el contexto, aunque las definiciones estén deferred. Prefiere gh, aws, gcloud, sentry-cli antes que MCP servers — las CLI tools no añaden ni siquiera el listing. Si vas a quedarte con un grupo pequeño, empieza por los cinco MCPs que se ganan el slot y quita el resto.

6. Preprocesa output verboso con hooks

Un PreToolUse hook intercepta el comando antes de ejecutarlo y puede reescribirlo via updatedInput. Convierte 10.000 líneas de test output en las 50 que importan. Claude solo ve el output filtrado. Tip dedicado: Hooks en Claude Code: automatiza tu flujo de trabajo. Y si el output crece tanto que el comando muere por volumen en vez de por lento, eso es uno de los tres finales posibles de un comando largo.

Antes incluso de morir, un output verboso ya te está costando información: cuando el comando falla, Claude solo llega a leer unos 10.000 caracteres, y el motivo del fallo se queda fuera. Por eso el hábito más económico de todos es que el comando no imprima de más, con su flag silencioso escrito en el CLAUDE.md.

7. Mueve instrucciones de CLAUDE.md a Skills

CLAUDE.md se carga al inicio de la sesión. Esos tokens están en tu contexto desde el primer turno hasta el último. Las Skills cargan on-demand solo cuando se invocan. Mueve todo lo específico de un workflow a una Skill. Objetivo de la docs: CLAUDE.md por debajo de 200 líneas.

8. Baja el thinking en tareas simples

Los thinking tokens se facturan como output, y el budget por defecto puede ser decenas de miles de tokens por request. /effort low cuando no haces razonamiento profundo. Tip dedicado: Cómo ajustar el effort level en Claude Code.

Corrección (julio 2026): aquí recomendábamos también MAX_THINKING_TOKENS=8000 para topar el budget global. Eso ya no aplica: los modelos adaptativos (Fable 5, Sonnet 5 y todos los Opus desde el 4.7) ignoran cualquier valor distinto de 0. El effort es el único mando que sigue conectado, y el mapa completo está en tocas mandos que no están conectados a nada.

9. Delega operaciones verbosas a subagents

npm test, gh pr view, procesar logs: todo eso quema contexto en tu conversación principal. Delegado a un subagent, el output verboso se queda en su contexto — solo vuelve el resumen. Y ojo a los gotchas: los subagents pierden contexto.

"the verbose output stays in the subagent's context while only a summary returns to your main conversation."

10. Plan mode antes de implementar

Shift+Tab cicla entre los modos de permisos — plan es uno de seis. Claude explora el codebase y propone un approach antes de tocar nada. Si la dirección inicial es la equivocada, lo descubres en plan mode (barato) en vez de a mitad de implementación (caro y con re-trabajo). Para el deep dive del modo — incluido el combo con /evaluate antes y después — ver Plan Mode te obliga a entender tú.

"preventing expensive re-work when the initial direction is wrong."

Por qué importa ahora

Hay un volumen creciente de quejas sobre sesiones que se acaban antes. La parte estructural no la controlas — pero la parte de hábitos sí. Y la docs oficial te dice cómo arreglarla en 10 puntos concretos.

A los diez se les ha sumado una palanca que actúa sobre la misma factura por el otro lado: el output style Concise recorta la narración de las respuestas, y esa narración también son tokens de salida.

Ninguno es magia. Todos son sentido común. Y como son sentido común, son los primeros que se pasan por alto. Si prefieres entender el mecanismo antes que aplicar la receta, por qué Claude Code consume tantos tokens es el porqué que hay debajo de estos diez.

Documentación oficial: Manage costs effectively · Ver también: /context · 1M tokens · Cuándo se cargan las features · Prompt caching · Qué te rompió la caché · Qué sobrevive a /compact · Cómo funcionan tus límites de uso · El effort que crees tener

Guía gratuita

Los 51 esenciales, en una guía.

Una página por tip. Cinco capítulos. Lo que de verdad uso a diario en producción. Sin teoría, sin humo.

  • I. Empieza bien 10 tips
  • II. Conciencia 3 tips
  • III. Maestría 22 tips
  • IV. Autonomía 10 tips
  • V. Comparativa 6 tips
¿Eres desarrollador/a Web profesional?

Recibirás la guía por email · Te unes a la newsletter Gravitas · Cancela cuando quieras

de 51
#

Wmedia · 51 Tips
Guía gratuita · 51 tips · 5 capítulos

Los 51 esenciales, en una guía.

¿Eres desarrollador/a Web profesional? · Cancela cuando quieras
Workshop para equipos

Multiplica el output de tu equipo sin sacrificar calidad: workshop AI First de 6 a 8 horas, online, sobre la plataforma Claude.

Ver el workshop

¿Quieres los 51 esenciales de Claude Code en una guía?