Claude Token Limits: context rot, no un límite duro
La factura que finalmente me hizo sentarme y hacer los cálculos fue de 73,41 dólares, por un solo martes por la tarde de Claude Code. No había hecho nada inusual. Una rama característica. Un puñado de ediciones de archivos. Algo de depuración. El tipo de sesión que debería haberme costado ocho o nueve dólares.
Abrí el desglose de costos esperando encontrar un agente fuera de control o un bucle olvidado. Lo que encontré fue peor. Cada mensaje que envié esa tarde había releído todo el historial de conversaciones. No lo resumió. No saltado a las partes relevantes. Vuelve a leerlo. En el mensaje treinta, el modelo estaba procesando más tokens para comprender lo que ya habíamos discutido que para generar la siguiente respuesta.
Fue entonces cuando me di cuenta de algo que creo que la mayoría de las personas que usan Claude (incluidos muchos desarrolladores experimentados) tienen completamente al revés. El "límite de tokens" del que se queja la gente no es un límite que Anthropic impone para estrangularte. No es un truco de facturación. Ni siquiera es realmente un límite en la forma en que la mayoría de nosotros pensamos sobre los límites.
Es context rot. Y una vez que comprendes lo que realmente sucede dentro de una sesión Claude, las estrategias para solucionarlo dejan de ser consejos aleatorios que lees en Twitter y comienzan a ser un sistema coherente.
He estado ejecutando ese sistema durante aproximadamente ocho semanas en cuatro proyectos diferentes. Mi costo diario promedio cayó aproximadamente un 60%. La calidad de salida aumentó, no disminuyó. Y la parte más contradictoria (lo que me llevó más tiempo aceptar) es que casi ninguna de las victorias se debió a "usar menos Claude". Provienen del uso de Claude limpiador.
Este es el desglose completo. Las matemáticas. La investigación. Los comandos de barra exactos que uso, cuándo los uso y los que tuve que desaprender. Al final, podrá ver cualquier sesión de Claude y saber, en treinta segundos, si está en buen estado o si está a punto de comenzar a perder tokens.
Las matemáticas que nadie te muestra
Esto es lo que todos los tutoriales de Claude bailan pero nunca dicen claramente: cada vez que envías un mensaje nuevo, el modelo reprocesa toda la conversación hasta ese punto. Aviso del sistema. Cada archivo al que has hecho referencia. Cada llamada de herramienta. Cada asistente responde. Todo ello, en cada paso.
Eso suena caro. Es.
Déjame mostrarte cómo se ve realmente con números realistas. Supongamos que cada intercambio de mensajes (su mensaje + la respuesta de Claude + cualquier resultado de la herramienta) agrega aproximadamente 500 tokens a la conversación. Modesto. Razonable. Probablemente menos de conteo si estás trabajando con código.
| Mensaje # | Nuevos tokens agregados | Relectura del contexto total | Tokens acumulados procesados |
|---|---|---|---|
| 1 | 500 | 500 | 500 |
| 5 | 500 | 2.500 | 7.500 |
| 10 | 500 | 5.000 | 27.500 |
| 20 | 500 | 10.000 | 105.000 |
| 30 | 500 | 15.000 | 232.500 |
| 50 | 500 | 25.000 | 637.500 |
| 100 | 500 | 50.000 | 2.525.000 |
Mire el mensaje 10 versus el mensaje 1. Mensaje del mismo tamaño. Diez veces el costo. Para el mensaje 30, ya has quemado más tokens acumulativos que los primeros quince combinados. En el mensaje 100, el modelo ha releído la conversación tantas veces que el 98,5% de los tokens que procesó para esa sesión se gastaron en volver a comprender el contexto anterior, sin generar nuevos resultados.
Este no es un problema de Claude. Es una propiedad de arquitectura de transformador. Cada LLM de frontera funciona de esta manera. Pero Claude hace que el costo sea visible de una manera que la mayoría de la gente no nota hasta que llega la factura.
Y aquí es donde la cosa empeora: porque el costo no es lo único que agrava la situación.
Cómo se ve realmente la descomposición del contexto
En 2025, Chroma publicó una investigación que silenciosamente rompió muchas suposiciones sobre cómo se comportan los modelos de contexto largo. Probaron 18 LLM de frontera, incluido Claude, en tareas de recuperación con diferentes longitudes de entrada. La sabiduría convencional decía: ventana de contexto más grande = mejor rendimiento, punto.
Los datos decían algo más.
Cada modelo funcionó peor a medida que crecía la longitud de la entrada. Algunos se mantuvieron estables con una precisión del 95% y luego cayeron en picada a alrededor del 60% una vez que la entrada cruzó un cierto umbral. La caída no fue gradual. Era un acantilado. Y no sucedió en el límite de la ventana de contexto comercializado; sucedió mucho antes, a menudo entre 200.000 y 300.000 tokens, incluso en modelos que anuncian un contexto de 1 millón.
El mecanismo es algo que los investigadores llaman efecto perdido en el medio. La atención del transformador tiene forma de U. El modelo atiende bien al inicio del contexto (el mensaje del sistema, su configuración inicial) y al final (su mensaje más reciente). ¿El medio? Cada vez más confuso. Un estudio de Stanford de 2023 encontró que con solo veinte documentos recuperados (alrededor de 4000 tokens), la precisión en las tareas de control de calidad cayó del 70-75 % al 55-60 %. Y eso es antes de agregar el historial de conversaciones de varios turnos en la parte superior.
Combine eso con la curva de costos que acabamos de ver y obtendrá una imagen real de lo que sucede en una sesión larga de Claude:
- Fichas 1 a ~50k: el modelo es nítido, preciso y relativamente barato por turno.
- Fichas de 50.000 a ~200.000: el costo aumenta rápidamente, la precisión comienza a desviarse, aparecen alucinaciones
- Tokens 200k+: estás pagando tarifas superiores por la producción degradada
Es por eso que "seguir en el mismo chat" es el hábito más costoso que puedes tener con Claude. No sólo estás pagando más, estás pagando más por peor.
La solución no es limitar la cantidad de uso de Claude. Es reconocer que su conversación tiene una vida media de calidad y gestionarla deliberadamente. Higiene del contexto, no estrangulamiento.
Déjame mostrarte exactamente cómo hago eso.
Nueve consejos que reducen mis costos generales de Claude a la mitad
Estos son los hábitos que utilizo en las aplicaciones Claude habituales: claude.ai, móvil, API. Todavía no es Claude Code. Llegaremos allí.
1. Editar y regenerar en lugar de escribir correcciones de seguimiento
Esto parece obvio en retrospectiva y lo perdí durante meses. Cuando Claude hace algo mal, mi instinto solía ser escribir un mensaje de seguimiento: "en realidad, quise decir X, no Y". Ese seguimiento crea dos nuevos giros en la conversación que se releerán en cada mensaje futuro.
El movimiento más limpio es editar el mensaje original y regenerarlo. Mismo resultado. Peso de contexto añadido cero. Si hace esto cinco veces durante una sesión larga, se habrá ahorrado entre 3000 y 5000 tokens de gastos generales permanentes (cada mensaje posterior a ese punto).
2. Agrupar varias solicitudes en un solo mensaje
Tres mensajes, cada uno de los cuales pregunta una cosa, cuestan aproximadamente tres veces la sobrecarga de contexto de un mensaje que pregunta tres cosas. El modelo es realmente bueno manejando indicaciones de varias partes. Usa eso.
En lugar de:
- "Escriba el punto final API".
- "Ahora escribe la prueba".
- "Ahora escribe la sección README".
Enviar: "Escriba el punto final API, la prueba correspondiente y una sección README que explique el punto final. Utilice encabezados H2 para cada uno".
Obtendrás la misma calidad. Un giro del contexto cuesta. Este es el cambio de comportamiento más importante que hice y probablemente represente un tercio de mis ahorros.
3. Inicie nuevos chats cada 15-20 mensajes
Considero que entre 15 y 20 mensajes son el límite máximo para una sola conversación. Más allá de eso, tanto el costo como la precisión comienzan a disminuir notablemente. Cuando lo golpeo, hago un traspaso deliberado:
"Resume todo lo que hemos establecido en esta conversación: el objetivo, las decisiones tomadas, los archivos tocados, los bloqueadores actuales y lo que sigue. Formatéalo como un resumen que pueda pegar en una nueva sesión".
Luego abro un chat nuevo y pego ese resumen como primer mensaje. Nueva sesión, mismo contexto, fracción del peso del token.
4. Elija el modelo adecuado para la tarea
Lista actual de Claude — Haiku 4.5, Sonnet 4.6 y Opus 4.7 — no es una jerarquía de "bueno, mejor, mejor". Es un espectro de velocidad versus profundidad, y usar Opus para lo que Haiku puede manejar es un pozo de dinero silencioso.
Una rúbrica aproximada:
- Haiku 4.5 ($1/$5 por millón de tokens): clasificación, enrutamiento, resumen, búsquedas simples, tareas de pegado. Cualquier cosa en la que digas "esto es molesto pero no difícil".
- Sonnet 4.6 ($3/$15): el predeterminado. Código, redacción, análisis, razonamiento de varios pasos. Según las cifras de BenchLM de 2026, Sonnet 4.6 se sitúa a 1,2 puntos de Opus en SWE-bench al 60 % del coste.
- Opus 4.7 ($5/$25): razonamiento realmente difícil, problemas novedosos, especificaciones ambiguas, cosas en las que necesitas que el modelo piense, no solo produzca.
La mayoría de las personas que vigilo en las pantallas compartidas de Discord ejecutan Opus de forma predeterminada para tareas que Sonnet aplastaría. Esto supone una prima del 67% por una producción que, en muchos casos, es funcionalmente idéntica.
5. Mantenga el pensamiento prolongado desactivado de forma predeterminada
El pensamiento extendido genera tokens de razonamiento interno antes de que el modelo produzca su resultado visible. Útil para problemas difíciles. Caro para todo lo demás, porque los tokens de pensamiento se facturan a tasas de producción y la producción es 5 veces el costo de la entrada en Opus y Sonnet.
Una respuesta con 500 fichas visibles y 2000 fichas de pensamiento cuesta aproximadamente 5 veces lo que costaría la misma respuesta sin pensar. Ese es el multiplicador real. Para la mayoría de las tareas (redacción, resúmenes, refactorización), el pensamiento extendido está pagando tarifas superiores por ganancias marginales de precisión.
Lo dejo apagado y lo enciendo deliberadamente cuando la tarea lo amerita. Decisiones de arquitectura. Depurando errores extraños. Cualquier cosa en la que una respuesta incorrecta me cueste tiempo real.
6. Convierta archivos a Markdown antes de cargarlos
Un PDF de 30 páginas puede ejecutar más de 40.000 tokens. El mismo contenido que el Markdown limpio suele caber entre 8.000 y 12.000. Los archivos PDF conllevan una enorme cantidad de formato y peso de metadatos que no añaden nada a lo que el modelo puede extraer. Lo mismo ocurre con HTML: la mitad de los tokens son sopa de etiquetas.
Si voy a hacer referencia a un documento repetidamente durante una sesión, lo convierto una vez con una herramienta como pdftotext o markitdown y subo la versión Markdown. En realidad, la precisión aumenta porque el modelo no combate el ruido del diseño.
7. Utilice Proyectos para almacenar en caché documentos repetidos
Si accede a la misma documentación, contexto de base de código o material de referencia en muchas sesiones, Proyectos permite que ese material viva en la base de conocimientos del proyecto en lugar de volver a pegarlo en cada chat. La parte almacenada en caché se reinyecta de manera eficiente. La misma idea que almacenamiento en caché rápido en API: las lecturas de caché cuestan aproximadamente el 10 % del precio de entrada estándar.
Tengo un proyecto "Contexto de base de código de Mejba" que contiene mis estándares de codificación, patrones arquitectónicos y algunas docenas de archivos de referencia. Cada chat relacionado con el código ocurre dentro de ese proyecto. La modelo entra sabiendo cómo trabajo.
8. El truco para restablecer la sesión de 5 horas
Las ventanas de uso de Claude.ai se reinician cada 5 horas consecutivas y el cronómetro comienza con el primer mensaje de una sesión. Si se despierta a las 8 a.m. y su primer mensaje es una sesión de trabajo real, entonces comienza la siguiente ventana de reinicio. Si envía un pequeño mensaje descartable a las 7 a. m. ("buenos días" o lo que sea), el reinicio cambia y puede incluir dos sesiones de trabajo completas en su día en lugar de una.
¿Insignificante? Tal vez. Pero en las semanas en las que trabajo duro, me ha ganado una ventana de trabajo adicional más de una vez.
9. Trabaja fuera de las horas pico cuando puedas
Anthropic, en ocasiones, ha estrangulado las respuestas o ralentizado la inferencia durante las horas pico. No tengo datos concretos sobre esto (Anthropic no los publica), pero el patrón anecdótico en mis propias sesiones es claro. Las sesiones temprano en la mañana y al final de la tarde se sienten más ágiles. Las sesiones del mediodía en horario comercial en Estados Unidos a veces resultan lentas.
Si su trabajo lo permite, programe trabajos intensos de Claude fuera del horario de 10 a. m. a 4 p. m. en el Pacífico. En el peor de los casos, obtienes la misma velocidad. En el mejor de los casos, terminarás un 20% más rápido.
Esos nueve consejos por sí solos moverán la aguja. Pero si usa Claude Code, hay un conjunto separado de movimientos que son más importantes, porque Claude Code tiene un perfil de costos diferente y un conjunto diferente de herramientas para administrarlo.
Ocho consejos de Claude Code que importan más que los generales
Claude Code es donde los costos de los tokens se vuelven realmente aterradores si no los administras, porque el área de superficie del contexto es mayor. CLAUDE.md se inyecta en cada turno. Los esquemas de herramientas MCP se inyectan en cada turno. Las lecturas de archivos se acumulan. Las llamadas de subagente devuelven su resultado completo a su contexto principal. La combinación es real.
Estos son los ocho hábitos que convirtieron mis facturas de Claude Code de "probablemente debería mirar esto" a "gastos aburridos".
1. Ejecute /context temprano, antes de comenzar a trabajar.
El comando más útil que se envió, Claude Code, y probablemente el que la mayoría de la gente no usa. /context le muestra una cuadrícula coloreada de su uso de contexto actual: qué está cargado, cuánto consume cada pieza y hacia dónde se dirige el presupuesto.
Ejecútelo como lo primero que haga en una sesión nueva. No después de haber trabajado durante una hora. Lo primero.
Lo que encontrarás a menudo es algo como esto:
System prompt: 4,200 tokens
CLAUDE.md: 18,400 tokens
MCP tool schemas: 47,300 tokens
Loaded files: 0 tokens
---
Total: 69,900 tokens (35% of 200k context window)
Eso significa que se habrá gastado el 35 % de su presupuesto antes de haber escrito una sola instrucción. Si su CLAUDE.md está inflado y tiene cuatro servidores MCP cargados, puede estar entre el 22% y el 40% incluso antes de que comience la sesión. Según el análisis de contexto de MCP de Scott Spence, un desarrollador midió que solo sus herramientas MCP consumían más de 66 000 tokens de sobrecarga de contexto.
Conocer este número cambia tu forma de trabajar. Dejas de sorprenderte con los billetes simbólicos.
2. Desconecte los servidores MCP que no esté utilizando activamente
Cada servidor MCP conectado inyecta su esquema de herramienta completo (cada nombre de herramienta, cada descripción, cada definición de parámetro) en el contexto de cada mensaje. Ni una sola vez al inicio. Cada. Doblar.
Si tiene un servidor MCP con 20 herramientas y no lo está utilizando para la tarea actual, de todos modos está pagando por su esquema en cada mensaje. Desconéctalo. Puede volver a conectarse con un comando cuando realmente lo necesite. Los ahorros pueden ser enormes: fácilmente entre 15 000 y 40 000 tokens por sesión para alguien con varios servidores cargados.
El equipo de Anthropic ha estado trabajando en esquemas de herramientas de carga diferida (solo carga el esquema de una herramienta cuando realmente se llama) y, a partir del uso avanzado de herramientas, se han logrado algunos avances. Pero la suposición segura, hasta que haya verificado lo contrario en su propia configuración con /context, es que MCP conectado = tokens consumidos.
3. Reemplace los servidores MCP con CLI donde pueda
Este me tomó un tiempo interiorizarlo. Los servidores MCP son convenientes pero detallados. Una herramienta CLI que hace lo mismo (invocada a través de la herramienta bash de Claude Code) generalmente usa mucho menos contexto, porque solo envía el comando y analiza la salida, no carga una definición de esquema completa.
Reemplacé tres servidores MCP con flujos de trabajo CLI equivalentes. El ahorro de tokens promedió entre el 35% y el 40% por sesión. La desventaja: un poco más de fricción al invocar la herramienta, porque Claude tiene que construir el comando en lugar de llamar a una función escrita. Para mí, esa compensación vale la pena nueve de cada diez veces.
Si ya cubrió los conceptos básicos, mi guía más profunda para la administración de tokens Claude Code explica los intercambios específicos de MCP a CLI que me reportaron más beneficios.
4. Utilice /clear entre tareas no relacionadas
/clear borra el historial de conversaciones y comienza de nuevo. La mayoría de la gente lo utiliza como botón para "empezar de nuevo" cuando algo sale mal. Ese no es el uso de mayor valor.
El uso de mayor valor es entre tareas no relacionadas. Terminas de refactorizar el módulo de autenticación. Lo siguiente en su lista es actualizar el archivo README. No hay superposición. La conversación de autenticación no aporta nada a la tarea README, pero se volverá a leer en cada turno README si no la borra.
Pulsa /clear. Inicie la tarea README de nuevo. Acabas de ahorrarte miles de tokens de contexto irrelevante, además de restablecer la degradación de precisión perdida en el medio que estaba a punto de morderte.
5. /compact de forma proactiva con un uso de contexto de ~50 %
/compact resume su historial de conversaciones y reemplaza la transcripción completa con una versión condensada. La guía oficial dice que se use cuando el contexto supere el 80%. Lo uso antes, normalmente alrededor del 50%.
¿Por qué antes? Porque cuando llegas al 80%, ya estás en la zona de peligro de descomposición del contexto. La precisión ya está a la deriva. Compactar al 80% es control de daños. Compactar al 50% es mantenimiento.
Puede pasar instrucciones a /compact para controlar lo que conserva: /compact focus on the auth module decisions and current test failures. Usa eso. El resumen predeterminado está bien para la mayoría de los casos, pero para sesiones complejas, decirle qué conservar marca una diferencia real.
Si /compact comete un error (deja caer algo importante), /resume le permite retroceder a un estado de sesión anterior. No tengas miedo de /compact por errores; El camino de rebobinado es real.
6. Transferencia de sesión a ~60%: resumen completo, nuevo comienzo
Para sesiones de trabajo realmente largas, /compact no siempre es suficiente. Llega un punto en el que la conversación ha acumulado tantas decisiones, referencias de archivos y cambios de contexto que ni siquiera un resumen puede desenredarla por completo.
Cuando llego a ~60% de uso en algo complejo, hago una transferencia manual:
"Genere un documento de transferencia completo para esta sesión. Incluya: el objetivo, todas las decisiones arquitectónicas tomadas, todos los archivos modificados, el estado actual del trabajo, los bloqueadores y las próximas 3 a 5 acciones. Formatéelo como un resumen Markdown que pueda pegar en una nueva sesión".
Luego guardo ese resumen, ejecuto /clear y lo pego como mensaje de apertura de una nueva sesión. La nueva sesión comienza con el contexto completo con unos 8.000 tokens de gastos generales en lugar de 120.000.
7. Utilice subagentes para tareas pesadas
Los subagentes se ejecutan en ventanas de contexto separadas. Si envío a un subagente para "investigar los patrones de integración del webhook de Stripe e informar con tres opciones", toda esa investigación (cada página de documento, cada ejemplo, cada exploración sin salida) ocurre en el contexto del subagente, no en el mío. Recibo el resumen. El peso de la investigación queda fuera de mi sesión principal.
Este es uno de los mayores desbloqueos que ofrece Claude Code. Para cualquier tarea que implique mucha lectura, exploración o investigación antes de producir un producto, los subagentes son casi siempre la respuesta correcta.
8. Configuración limpia: CLAUDE.md con menos de 200 líneas, settings.json ajustado
La mayor sobrecarga constante en cualquier sesión Claude Code es CLAUDE.md. Se inyecta en cada giro. Si el suyo es de 600 líneas, pagará por esas 600 líneas en cada mensaje de cada sesión durante el resto del proyecto.
El análisis de Prompt Shelf recomienda mantener CLAUDE.md por debajo de 200 líneas. Yo diría que menos de 150 si puedes hacerlo. Cinco reglas. Tres punteros de archivos. La forma del proyecto, no la documentación del mismo.
Combínelo con un settings.json bien ajustado:
autocompact_thresholdconfigurado en su disparador preferido (yo uso 0,65)- Reglas
denyparanode_modules,.next/cache,dist,buildy cualquier otro directorio que nunca desee que Claude lea en contexto
Esta configuración por sí sola (lean CLAUDE.md más reglas de denegación agresivas) redujo los gastos generales de mi sesión de referencia de alrededor de 35 000 tokens a alrededor de 9 000.
Ése es el trabajo diario de la gestión de costes. Pero hay una capa por encima de todas estas tácticas que, una vez que se adopta, hace que la mayoría de ellas parezcan automáticas.
Cuatro hábitos de colaboración que se agravan con el tiempo
Los consejos anteriores son tácticos. Estos cuatro son estructurales. Cambian la forma de cómo trabaja con Claude, no solo los parámetros.
1. Apunte Claude a una carpeta limpia y dedicada
Esto suena trivial. Que no es. Si apunta Claude Code a la raíz de un monorepo de 40.000 archivos, incluso con reglas de denegación, está provocando ruido. Claude ocasionalmente leerá directorios que no deseaba. Las llamadas a herramientas devolverán cargas útiles mayores de lo esperado. Las búsquedas mostrarán coincidencias irrelevantes.
La versión limpia: cree una carpeta de trabajo para la tarea específica. Enlace simbólico solo en lo que se necesita. Apunte Claude a esa carpeta. Ahora cada lectura, cada búsqueda, cada pegote opera en una superficie enfocada.
2. Archivos de memoria local: instructions.md + memory.md
CLAUDE.md es global para el proyecto. Pero para trabajos de larga duración, comencé a mantener dos archivos adicionales en el directorio de trabajo:
instructions.md: reglas, tono, preferencias de formato, "haz siempre X, nunca Y". Actualizado raramente. Así es como me gusta trabajar.memory.md: hechos específicos del proyecto, decisiones tomadas, estado actual, qué sigue. Actualizado al final de cada sesión.
Al comienzo de cada nueva sesión, mi mensaje de apertura es aproximadamente: "Lea instrucciones.md y memoria.md, luego espere mi siguiente mensaje". Costo total: ~2000–4000 tokens. Lo que recibo: un Claude que entra sabiendo el estado del proyecto, las convenciones y en qué estuvimos trabajando por última vez. No hay que volver a dar explicaciones. No volver a decidir. La memoria sobrevive a los límites de la sesión.
Este patrón se agrava. Tres semanas después de iniciado un proyecto, su memory.md está haciendo el trabajo que, de otro modo, se necesitaría para recrear una conversación de 50 mensajes.
3. Descargar la investigación a otras herramientas
No todo lo que Claude puede hacer es algo que Claude debería hacer. Investigación web intensa, scraping, comparación de múltiples fuentes: estas tareas consumen enormes cantidades de contexto para resultados que otras herramientas producen de manera más económica.
Ahora dirijo la mayor parte del trabajo de estilo de investigación a través de Perplexity o Gemini, luego envío el resultado destilado a Claude para el trabajo de construcción real. Una sesión de investigación de 40.000 tokens se convierte en un resumen de 3.000 tokens. Claude se centra en lo que hace mejor (código, resultados estructurados, razonamiento técnico) en lugar de analizar tokens en tareas para las que no es la herramienta óptima.
Este es uno de esos movimientos que parece herético hasta que lo intentas. Entonces parece obvio.
4. Codifique tareas repetibles como habilidades
Todo lo que hago más de tres veces en diferentes sesiones (revisión de código, auditorías de contenido, listas de verificación de implementación, revisiones de seguridad) se codifica como una habilidad Claude con el proceso precargado. La habilidad conlleva su propio contexto mínimo: los pasos, los estándares, el formato de salida.
En lugar de explicar el proceso cada vez, activo la habilidad. La habilidad sabe qué hacer. Mi contexto principal sigue siendo ligero. Obtengo resultados consistentes. Y la habilidad sigue mejorando: cada sesión en la que surge un mejor enfoque se incluye nuevamente en la definición de la habilidad.
Aquí es donde el sistema obtiene rendimientos compuestos. La primera vez que desarrollas una habilidad, es una inversión de 30 minutos para lograr ahorros marginales. La centésima vez que lo usa, le ahorra diez minutos y 20 000 tokens por invocación, además de producir resultados mejores y más consistentes que los que jamás lograron las instrucciones ad-hoc.
Charla real: en qué me equivoqué en todo esto
Quiero ser honesto sobre algo. Durante los primeros seis meses usé Claude en serio, traté todo esto como contabilidad. Optimización de costes. Escatimar un centavo. El lado aburrido del uso de herramientas AI.
Ese encuadre estaba mal y me costó dinero real y una calidad de salida real antes de darme cuenta.
La higiene del contexto no es contabilidad. Es control de calidad. Las mismas tácticas que redujeron mis costos (sesiones limpias, CLAUDE.md eficiente, /clear y /compact agresivos, subagentes para trabajos pesados) también hicieron que el modelo fuera dramáticamente más preciso. Porque las mismas condiciones que aumentan los costos (contexto extenso, basura acumulada, temas a la deriva) reducen la precisión.
Lo tenía al revés en mi cabeza. Pensé que había una compensación: gastar más y obtener mejores resultados. La relación real, en mi experiencia, es la contraria. Las sesiones que costaban mucho casi siempre eran sesiones en las que el resultado empeoraba y yo simplemente estaba arrojando más fichas al problema tratando de compensar.
Ahora trato un billete simbólico en ascenso de la misma manera que un médico trata la fiebre: como un síntoma. Algo anda mal con la sesión. Compactarlo. Límpielo. Entrégalo. La factura baja y la producción aumenta al mismo tiempo.
Hay límites para esto y quiero nombrarlos. La higiene del contexto no lo salvará si su problema es realmente difícil y requiere un razonamiento de nivel Opus en una base de código grande. Algunas sesiones son caras porque el trabajo es caro. Está bien. El objetivo no es minimizar el gasto, sino asegurarse de que cuando gaste, lo haga en señal, no en releer viejos ruidos de conversaciones.
Cómo se ve esto dentro de ocho semanas
Esto es lo que cambió para mí, concretamente, después de ejecutar este sistema en cuatro proyectos durante dos meses.
El gasto promedio diario de Claude Code cayó aproximadamente un 60%. Algunos días más, otros menos. La variación también se redujo: menos días sorpresa de $70.
La duración de la sesión en una sola conversación disminuyó de "hasta que algo se rompe" a "hasta que /context muestre ~50%". Eso suena como una rebaja. No lo es. Las nuevas sesiones son más nítidas de principio a fin. Las viejas sesiones largas tuvieron un acantilado de calidad en la segunda mitad que simplemente estaba absorbiendo.
CLAUDE.md en todos mis proyectos se redujo de un promedio de alrededor de 400 líneas a menos de 150. No se perdió nada importante. Muchas cosas que pensaba que eran importantes resultaron ser tonterías por las que había estado pagando para inyectarme en todo momento.
La cantidad de servidores MCP que mantengo conectados de forma predeterminada pasó de seis a dos. Los otros cuatro se conectan según demanda para tareas específicas y se desconectan cuando finaliza la tarea.
Y la parte que realmente no esperaba: el trabajo que produzco en Claude Code es notablemente mejor. Código más limpio. Menos alucinaciones. Decisiones arquitectónicas más enfocadas. No porque el modelo haya mejorado: Sonnet 4.6 y Opus 4.7 son los mismos modelos que usaba antes. Porque las sesiones mejoraron. Menos context rot. Menos deriva en el medio de la ventana. Más señal, menos ruido.
Esa es la parte de esto que quiero dejarles. Los límites de tokens no son un presupuesto bajo el cual tengas que vivir. Son una señal de calidad que debes escuchar. Cuando la factura sube, el modelo le está diciendo algo: que la sesión ha superado su vida útil, que el contexto ha acumulado más de lo que puede manejar limpiamente, que es hora de realizar un reinicio completo.
Escúchalo. Compacto. Claro. Manos libres. Empiece de nuevo.
El costo baja. La producción aumenta. Y eventualmente, después de suficientes ciclos, dejas de pensar en esto como "administrar tokens". Lo consideras simplemente: trabajar bien con Claude.
Preguntas frecuentes
¿Por qué Claude relee toda la conversación en cada mensaje?
Los LLM basados en transformadores procesan la ventana de contexto completa en cada llamada de inferencia: no hay memoria interna de turnos anteriores como los humanos recuerdan las conversaciones. Cada nuevo mensaje reprocesa el mensaje del sistema, todos los turnos anteriores y cualquier archivo cargado como una sola entrada. Esta es una propiedad arquitectónica, no una elección de diseño específica de Claude. Para conocer las matemáticas completas de los tokens, consulte "Las matemáticas que nadie le muestra" más arriba.
¿Cuál es la diferencia entre /clear y /compact en Claude Code?
/clear borra el historial de conversaciones por completo y comienza de nuevo; úselo entre tareas no relacionadas. /compact resume el historial existente en una versión condensada y al mismo tiempo conserva los datos clave; utilícelo de forma proactiva con un uso de contexto de alrededor del 50 % para ampliar una sesión productiva. Ambos están documentados en la referencia de comandos Claude Code.
¿Vale la pena usar la ventana de contexto del token de 1M en Claude Code?
A veces, pero rara vez de forma predeterminada. La investigación sobre context rot muestra que la precisión se degrada mucho antes del límite de 1 millón, a menudo entre 200.000 y 300.000 tokens, incluso en modelos que anuncian un contexto de 1 millón. Utilice la ventana más grande para entradas realmente grandes (bases de código completas, documentos extensos), pero espere que la calidad disminuya en el medio del contexto. Para la mayoría de las sesiones de trabajo, un contexto limpio de 50k supera a uno extenso de 800k.
¿Debo usar siempre Opus 4.7 para codificar?
No. Sonnet 4.6 se encuentra a ~1,2 puntos de referencia SWE de Opus al 60 % del costo, según los puntos de referencia de BenchLM para 2026. Utilice Sonnet como opción predeterminada y reserve Opus para razonamientos realmente difíciles: problemas novedosos, especificaciones ambiguas, depuración compleja. La mayoría de las tareas de codificación no necesitan una profundidad de nivel Opus.
¿Cómo verifico cuántos tokens está usando mi sesión Claude Code?
Ejecute /context en Claude Code. Muestra una cuadrícula coloreada del uso del contexto actual, desglosada por mensaje del sistema, CLAUDE.md, esquemas de herramientas MCP y archivos cargados. Ejecútelo como lo primero que haga en una sesión, no después de una hora de trabajo. Conocer sus gastos generales iniciales cambia su forma de trabajar.
Trabajemos juntos
¿Quiere crear sistemas AI, automatizar flujos de trabajo o ampliar su infraestructura tecnológica? Me encantaría ayudar.
- Fiverr (compilaciones e integraciones personalizadas): fiverr.com/s/EgxYmWD
- Cartera: mejba.me
- Ramlit Limited (soluciones empresariales): ramlit.com
- ColorPark (diseño y marca): colorpark.io
- xCyberSecurity (servicios de seguridad): xcybersecurity.io