Cómo hacer que los tokens de Claude Code sean 20 veces más baratos (y 4 trucos de uso más)

CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Podrías estar pagando 20 veces más por tus tokens de Cloud Code de lo necesario sin siquiera saberlo.
00:00:05Entender cómo aprovechar al máximo tus tokens de Cloud Code es una de las habilidades más importantes
00:00:08que puedes dominar, y va mucho más allá de simplemente poner una línea en tu archivo Cloud.md
00:00:14que diga: sé breve. Porque si no entiendes cosas como cómo funciona el almacenamiento en caché de prompts,
00:00:19puedes terminar pagando mucho más de lo necesario. Así que en este video te daré cinco
00:00:23formas distintas de administrar mejor tus tokens de Cloud para que realmente puedas aprovechar al máximo
00:00:27estos modelos de primera categoría. El consejo número uno es el más importante. Esto te ahorrará más dinero
00:00:31y uso que todos los demás consejos combinados por mucho, y se trata de entender cómo funciona realmente
00:00:37el almacenamiento en caché de prompts. Para entenderlo, primero debes comprender cómo funcionan los tokens en general. Así que haremos
00:00:43un repaso muy rápido, de unos 60 segundos, para estar todos en la misma página. Los tokens son la moneda de
00:00:47los grandes modelos de lenguaje, y para todos los efectos prácticos (aunque esto está algo simplificado), cada
00:00:52palabra equivale a un token. Así que cuando tú, el usuario, en tu primer mensaje a Fable dices: qué tal estás hoy,
00:01:00has enviado cinco tokens de entrada. Cuando Fable te responde y dice: estoy muy bien, gracias,
00:01:09te ha dado cuatro tokens de salida. Estos tienen precios diferentes. De hecho, los tokens de salida, por lo general,
00:01:16cuestan cinco veces lo que cuesta un token de entrada. Estos cinco tokens de entrada y estos cuatro tokens de salida ahora
00:01:23se acumulan dentro de la ventana de contexto. Si los tokens son la moneda, entonces la ventana de contexto es nuestro presupuesto.
00:01:31Opus, Fable, Sonnet, todos tienen un presupuesto de un millón de tokens, así que en este punto hemos usado
00:01:37nueve de nuestro millón, no es gran cosa. Lo interesante ocurre cuando enviamos mensajes posteriores
00:01:43después del primero. En nuestro segundo mensaje, yo, el usuario, digo: constrúyeme una aplicación, sin errores,
00:01:50seis tokens de entrada, ¿verdad? Solo voy a enviar a Anthropic y Fable seis tokens de entrada. Bueno,
00:01:56no exactamente. Lo que realmente voy a enviar es todo. Voy a enviarle a Anthropic
00:02:04toda esta conversación hasta ese punto. Así que en realidad no estoy enviando seis tokens de entrada, sino
00:02:1116 tokens de entrada, porque voy a enviarles los cinco de aquí y los cuatro de allá, ya que
00:02:16se enviará el mensaje completo para que pueda entender el contexto. Y para cada uno de los
00:02:20mensajes siguientes será el caso; siempre envío la totalidad de la conversación
00:02:26anterior a ese último mensaje. Y puedes ver rápidamente cómo esto se acumula muy, muy rápido hasta el punto en que
00:02:32hablas de 5,000, 10,000, 100,000 tokens de entrada enviados en cada mensaje. Y estás
00:02:37pagando por ello. Ahora, si ese es el caso, ¿por qué no agotamos todo nuestro uso
00:02:43de inmediato? ¿Por qué no paga todo el mundo mil millones de dólares cada vez que intenta usar estos sistemas de IA?
00:02:47Porque obviamente enviamos mensaje tras mensaje. Así que hay una gran cantidad de
00:02:51mensajes acumulados que se envían a los servidores. Bueno, la solución aquí es el sistema de caché. Así que sí,
00:02:57cuando envío el mensaje número dos aquí, en realidad estoy enviando todo esto. Pero lo que se ha creado
00:03:05en este punto es la caché de mensajes. Y para nuestro segundo mensaje, esa caché de mensajes son estos primeros
00:03:12dos mensajes. Quiero que pienses en la caché de mensajes simplemente como un documento que Claude tiene delante
00:03:17y que contiene toda tu conversación hasta ese momento. Así que te tenemos hablando con Claude aquí mismo,
00:03:23ahora estás enviando el mensaje número dos, que es constrúyeme una aplicación, sin errores. Pero tenemos el sistema
00:03:30de caché. Así que toda esta sección, estos primeros dos mensajes, ahora están en este documento. Por lo que
00:03:36Claude y Anthropic pueden hacer es leer ese documento, pueden leer la caché,
00:03:42revisar todo el historial de mensajes hasta ese punto a una tarifa mucho más económica que si estuvieras
00:03:47enviándolo todo de golpe sin la caché. Y así es como calcula el costo. Y este costo
00:03:54es importante porque este sistema de caché no dura para siempre. Lo que debes entender es que cuando
00:04:00tú y Claude están hablando entre sí, y tenemos este documento de caché entre nosotros, que tiene todo
00:04:06nuestro historial de conversación, el cual se puede leer de forma muy económica, este solo se retiene durante una hora.
00:04:11Así que si tú y Claude están teniendo esta charla, van y vienen una y otra vez,
00:04:16ya sabes, de ida y vuelta constantemente, y luego te vas por una hora. Y tienes
00:04:21un documento que mide 500,000 tokens de largo, una conversación de 500,000 tokens. Después de una hora, esto desaparece.
00:04:29Esto se borra. Y entonces cuando envías un mensaje, digamos el 500,001, adivina qué, ahora
00:04:38se te cobrará la tarifa completa por un mensaje de 500,000 tokens, incluso si lo único que dijiste fue: “Hola, ¿qué tal?”
00:04:46Ahora comprende que cuando digo que esta caché solo dura una hora, me refiero a una hora sin actividad. Así que se
00:04:52actualiza con cada mensaje. Por lo tanto, si han pasado 59 minutos desde nuestro último mensaje y vuelvo a escribir,
00:04:56ese contador de una hora se reinicia. Ahora, ¿por qué es tan importante? Bueno, es por el costo. Hablé
00:05:01en la introducción sobre la diferencia entre una lectura en caché (es decir, leer todo este historial) frente a leer los 500,000
00:05:08mensajes sin caché, que es literalmente una diferencia de 20 veces. Y esto se refleja en la documentación
00:05:16de aumentos de precios. Recuerda que los tokens de salida, lo que Claude nos da, nunca cambian.
00:05:22Para Fable, hablamos de $50 por millón de tokens y $25 en el caso de Opus. Pero los tokens de entrada
00:05:27es donde ha estado ocurriendo toda esta conversación. Siempre hablamos de tokens de entrada base
00:05:33de $10 por millón, pero eso es un poco impreciso porque en realidad siempre estamos haciendo escrituras en caché.
00:05:40Así que una escritura en caché de una hora, que es lo que haces en un plan de suscripción, de hecho cuesta el doble.
00:05:47Por lo tanto, cuando escribimos en esa caché por primera vez para ese primer mensaje, son $20 por
00:05:54millón de tokens. Notarás una escritura en caché de cinco minutos aquí, pero eso es realmente solo para personas que
00:05:59están en la API. Ahora compáralo con los aciertos de caché, es decir, cuando Anthropic simplemente lee ese documento que está
00:06:05frente a él, que ha estado acumulando cada hora y se actualiza. Cuesta $1, 20 veces más barato. Esa es
00:06:13una diferencia abismal. Y es por eso que todo esto, este consejo en particular, entender el almacenamiento en caché de prompts y
00:06:18cómo funciona el sistema de tokens es tan importante. No hay nada de lo que vaya a hablar más allá de este punto
00:06:22que te vaya a dar ningún tipo de ganancia de eficiencia cercana a esta. Nada.
00:06:29Ahora volvamos a nuestro ejemplo de esa conversación de 500,000 tokens que estamos teniendo
00:06:35con Claude Code y estamos a punto de enviar un mensaje posterior. En el escenario número uno, vamos a
00:06:40imaginar que tenemos el sistema de caché. Así que este historial de conversación de 500k está en caché y estoy enviando
00:06:46ese nuevo mensaje. La forma en que funcionarán los precios es que todavía tiene que leer todo este historial
00:06:51de conversación. Y eso es a una tarifa de $1 por millón de tokens. Así que me costará 50 centavos en ese
00:06:58siguiente mensaje leer todo más el mensaje nuevo. Así que imagina que ese mensaje nuevo tenía mil
00:07:05tokens de longitud. Ese mensaje posterior de mil tokens no se cobra a $1 por millón. Se cobra a $20
00:07:14por millón. Así que para mil tokens, ¿cuánto es eso, como dos centavos o algo así? No lo sé.
00:07:18Mis matemáticas probablemente estén mal, pero el punto es que el historial está a $1. El nuevo está a $20 al mes porque está en caché.
00:07:26Ahora, la próxima vez que enviemos un mensaje, mismo escenario, excepto que estos mil tokens ahora formarán parte de ese
00:07:32documento de caché. Tiene algo de sentido. De acuerdo. Ese es el escenario uno. Escenario dos, no tenemos caché. Esperamos una hora
00:07:40para enviarlo. Así es para enviarlo. Bueno, en lugar de costar 50 centavos, ahora se nos va a
00:07:47cobrar a una tarifa de lectura en caché, perdón, a una tarifa de escritura en caché, que recuerda es de $20 por millón. Así que, ¿cuánto
00:07:54va a costar esto? Bueno, ahora este único mensaje nos está costando unos 10 dólares. Así que pasamos de 50 centavos a
00:08:0010 dólares solo porque esperamos una hora. Esas son las consecuencias de no entender
00:08:05esto. Ahora bien, el tiempo no es lo único en lo que debemos pensar cuando se trata de perder la caché. Hay
00:08:10otras cosas que la restablecerán por completo. Y esto viene directamente de la documentación de Cloud Code.
00:08:14Si cambias de modelo, ya sabes, estás en Fable y cambias a Opus y llevas 500,000 tokens,
00:08:20eso se pierde. La caché se reinicia. Nivel de esfuerzo, si vas a cambiarlo. Modo rápido, conectar o desconectar
00:08:26un servidor MCP, plugins, denegar herramientas, compactar la conversación o simplemente actualizar Cloud Code en
00:08:32general. Cualquiera de estas cosas restablecerá la caché y tu próximo mensaje será 20 veces más caro
00:08:38de lo necesario. Dicho todo esto, ¿qué puedes hacer realmente con esta información?
00:08:42¿Qué haces cuando te encuentras en una posición en la que necesitas alejarte de una conversación
00:08:46que tiene mucha información importante, pero vas a estar ausente por más de una hora,
00:08:50o te alejaste por más de una hora y simplemente regresas dándote cuenta de que, rayos, como
00:08:54que no pensé en esto de antemano. Bueno, de eso hablaremos en el consejo número dos.
00:08:59Pero primero, unas breves palabras del patrocinador de hoy, yo mismo. Así que esta semana voy a lanzar una versión completamente actualizada
00:09:06de mi Cloud Code Masterclass dentro de Chase AI+. Un montón ha cambiado desde que salí por primera vez
00:09:12con esto. Lo actualizo todo el tiempo. Pero fundamentalmente, hemos recorrido un largo camino desde marzo cuando publiqué
00:09:19esta cosa. Así que si eres alguien que está intentando mejorar su nivel con la IA, alguien que definitivamente
00:09:24no proviene de un entorno técnico y quieres una hoja de ruta para saber realmente cómo usar esta herramienta
00:09:28desde cero y algo que se centre en casos de uso reales, entonces esto es para ti. Está dentro
00:09:33de Chase AI+. Hay un enlace en el comentario fijado. Ahora, el consejo número dos se trata de tus
00:09:37opciones cuando perdemos la caché. Nos hemos alejado por demasiado tiempo. Tenemos una conversación que tiene dos,
00:09:42tres, cuatro, quinientos mil tokens de longitud. Y queremos saber cuál debería ser el siguiente paso
00:09:47en lugar de pagar esos costos exorbitantes. Y depende un poco de cuál sea tu situación.
00:09:52Ahora bien, nuestra primera opción es algo así como la opción nuclear, y consiste simplemente en usar la barra diagonal clear.
00:09:58Forward slash clear va a borrar todo el historial de la conversación. Y esto no siempre es algo
00:10:04De hecho, si estás trabajando en algún tipo de código base, algún tipo de proyecto con
00:10:10un montón de archivos y mucho contexto, probablemente solo quieras usar la barra diagonal clear.
00:10:15Lo que sea en lo que estuvieras trabajando, de lo que estuvieras hablando, es muy probable que haya rastros en el propio proyecto
00:10:20como referencia de lo que ha sucedido. Cloud Code puede echarle un vistazo a eso. Y cuando inicias una nueva conversación
00:10:25desde cero, puede retomar los cabos sueltos y devolverte al punto en el que estabas. No necesitas ser esclavo
00:10:31de la conversación anterior. Ahora, tu segunda opción es usar la compactación. Hay una función de compactación automática
00:10:38dentro de Cloud Code una vez que alcanzas cierta cantidad de tokens. Sugiero no esperar a llegar
00:10:42a ese punto porque cuando trabajamos en el rango de los seiscientos, setecientos u ochocientos mil tokens, empezamos
00:10:47a lidiar con la degradación del contexto. Sigue siendo un problema con estos modelos más grandes y potentes,
00:10:51pero podemos usar la barra diagonal compact en cualquier momento. Y lo que eso hará por nosotros es crear un
00:10:57resumen de lo que hemos hablado. Y luego, a todos los efectos prácticos, aplicará la barra diagonal
00:11:03clear, pero iniciará una nueva conversación con ese resumen, un poco como si estuviera en la memoria. Así que
00:11:10si tenías cosas importantes en esa conversación y crees que lo que está en el código base no va a ser
00:11:15suficiente para que lo entienda, entonces simplemente haz una compactación con la barra diagonal compact. Iniciará una nueva
00:11:20conversación con ese resumen. Y ese resumen simplemente vive en el historial de mensajes. Ahora bien, tu tercera opción
00:11:26es muy similar a la compactación y consiste en utilizar algún tipo de herramienta de transferencia personalizada. Hay un montón de habilidades
00:11:32de transferencia personalizadas por ahí. Yo mismo tengo una. Puedes conseguirla dentro de mi comunidad gratuita. Y la diferencia
00:11:38entre la transferencia y la compactación es dónde vive ese resumen. Así que si estoy usando la transferencia, lo que va a hacer
00:11:46es guardarlo directamente en mi disco. Va a crear un archivo Markdown real con el resumen y con
00:11:51lo que yo quiera que contenga. Y luego puedo iniciar una nueva conversación y decir: Oye, Claude Code, echa un vistazo
00:11:59a ese documento de transferencia en el disco para que te pongas al día con lo que necesitas saber. En contraste con la compactación,
00:12:04no crea ningún tipo de archivo. Es solo un mensaje en el historial de mensajes de esa conversación
00:12:10en particular; hay una diferencia sutil. Pero para algunas personas, tener algún tipo de archivo en el
00:12:15disco es importante. Y a menudo es un documento vivo que se actualiza constantemente.
00:12:20Así que estas son realmente tus tres opciones. ¿Quieres simplemente borrar todo y empezar desde cero?
00:12:26A menudo, esto está perfectamente bien. ¿Quieres usar la función nativa de Claude y compactarlo para
00:12:31que el resumen se inyecte directamente? ¿O prefieres que el resumen sea un documento real que Claude pueda consultar?
00:12:37En ese caso, usa la transferencia. Esas son tus tres opciones. Y a menudo son mejores que simplemente
00:12:42enviando un mensaje nuevo porque, por lo general, realmente no deberías operar en rangos de 400, 500 o 600 000
00:12:48tokens de todos modos. Ahora bien, el consejo número tres trata sobre el enrutamiento de modelos. ¿Cómo elegimos el modelo correcto
00:12:53para el trabajo? Así no usamos siempre a Fable para todo. ¿Podemos usar un modelo más pequeño, más barato y menos inteligente
00:12:59para las tareas más simples? La respuesta es sí. Y podemos abordar esto de diferentes maneras.
00:13:04Podemos usar modelos externos. Podríamos recurrir a GPT, Sol. Podríamos recurrir a GPT, Luna y Terra, que acaban de volverse
00:13:10súper baratos. Podemos usar modelos locales, o tenemos opciones si queremos quedarnos en el ecosistema de Anthropic.
00:13:16Y la forma más fácil de hacer esto, creo, es el modo asesor. Ahora bien, lo que ves aquí es de la publicación de blog
00:13:22original
00:13:29del asesor que salió hace varios meses. Y muestra a Opus y Sonnet, pero el mismo sistema
00:13:37se mantiene con modelos como Fable. Y la idea es que tenemos un modelo inteligente como Fable o incluso Opus asesorando a
00:13:43un modelo más pequeño como Sonnet cuando se trata de ejecutar tareas. Así que el modelo grande elabora un plan, el
00:13:50modelo pequeño lo ejecuta, y el modelo pequeño puede compartir su contexto con el modelo más grande cada vez
00:13:54que surgen problemas. Y este modelo ha presumido de mejores resultados a menores costos. Y para retomar nuestra
00:14:01discusión anterior sobre el almacenamiento en caché de prompts, tanto el asesor como el ejecutor tienen su propio caché de prompts
00:14:06funcionando al mismo tiempo. Ahora bien, tu segunda opción es delegar tareas a modelos fuera de Claude
00:14:12Code. Una opción fácil de usar es Codex. Hay un plugin de Codex para Claude Code, lo que hace muy sencillo
00:14:18recurrir a Codex desde la interfaz de Claude Code. Así que podrías tener a Fable haciendo esencialmente ese mismo
00:14:24tipo de modo asesor, pero en lugar de recurrir a Opus o Sonnet, recurre a los modelos GPT. Hay
00:14:31otros repositorios como este asesor de Fable que hacen exactamente eso. Y en última instancia, es bastante trivial configurar tu
00:14:36propia habilidad que haga precisamente esto. Y si estás buscando esos modelos más baratos, de nuevo, sugiero encarecidamente
00:14:41echarle un vistazo a los de GPT, específicamente Luna y Terra, porque A, sus costos se redujeron significativamente,
00:14:48y B, realmente no hay ningún modelo en la familia de Anthropic que haga lo que ellos hacen
00:14:53a ese precio. Incluso puedes dar un paso más e incorporar algunos modelos locales si las
00:14:57tareas lo ameritan. Ahora bien, el consejo número cuatro trata sobre tu higiene con Claude. Puede que hayas visto
00:15:01recientemente este video circulando de Boris Cherney, el creador de Claude Code, diciendo:
00:15:07necesitas eliminar tu archivo Claude.md. Bueno, ¿necesitas realmente eliminar ese archivo Claude.md? En realidad,
00:15:12no necesariamente, pero lo que sí debes hacer, y esto ha tenido algunos cambios recientes en las últimas
00:15:18semanas, es ejecutar el comando barra diagonal doctor. ¿Y qué tiene esto que ver con los tokens?
00:15:23Bueno, primero que nada, lo que este comando va a hacer, entre otras cosas, aunque mantenemos esto relacionado con los tokens,
00:15:30es revisar tu archivo Claude.md y recortarlo.
00:15:36La forma en que funcionan estos modelos, especialmente estos modelos de la serie five, es que no necesitan tantas
00:15:42instrucciones. Si miras lo que la gente creaba para los archivos Claude.md hace tres, seis o nueve meses,
00:15:46eran muy prescriptivos y extremadamente detallados. Y tal vez en ese momento se podría argumentar que lo necesitaban.
00:15:53Ese ya no es el caso. Y por lo tanto, un Claude.md saturado no solo lo hace más lento, sino que literalmente te está costando tokens.
00:15:59Y la barra diagonal doctor va a revisar eso y eliminar las cosas de tu Claude.md que simplemente no necesitan estar ahí. En segundo lugar,
00:16:04va a revisar aquellas cosas que están perjudicando tu contexto o saturando tu ventana de contexto.
00:16:10Porque incluso cuando inicias una nueva conversación y ejecutas la barra diagonal context, hay elementos
00:16:15que lo están llenando. Ahora bien, recientemente ejecuté la barra diagonal doctor, así que me deshice de gran parte de la saturación,
00:16:20pero así es como se ve mi ventana de contexto justo al principio de una conversación sin que se haya enviado ningún mensaje.
00:16:25Ya hemos usado 40,000 tokens. ¿Y qué es lo que está consumiendo gran parte de esto? Bueno, una parte proviene de
00:16:31cosas como las habilidades, como puedes ver aquí. Otra parte incluye elementos como el prompt del sistema, así como
00:16:36archivos de memoria. Lo que la barra diagonal doctor va a hacer es revisar cosas como tus
00:16:41habilidades y tus MCPs, y comenzar a recortar aquellos que simplemente no has estado usando. ¿Es esto un ahorro masivo de tokens?
00:16:47No, pero es algo, es un pequeño detalle y es una solución muy sencilla. No hay razón
00:16:53para no hacerlo, especialmente si eres alguien que se ha dedicado a acumular 10 millones de habilidades durante
00:16:58los últimos seis meses y en realidad no te has tomado el tiempo de revisarlas y empezar a eliminarlas, ya que hacer esto
00:17:03también hará que tus habilidades se activen de manera más efectiva. Y Claude no tendrá ninguna confusión sobre
00:17:08qué habilidad necesita invocar. Apuesto a que probablemente tienes unas 10 habilidades por ahí que tienen que ver
00:17:12con el diseño frontend y no necesitas todas ellas. Así que este consejo tan simple y fácil de ejecutar
00:17:17en lo que respecta a tu higiene con Claude es uno que no debes dejar pasar. Solo ejecuta doctor. Y eso
00:17:22nos lleva a nuestro consejo final, que creo que es el menos efectivo de todos estos hoy en día, pero se trata
00:17:28de las habilidades adicionales y el andamiaje que ves por todas partes.
00:17:33El más popular hoy en día es ponytail y básicamente reduce la cantidad de código
00:17:38que Claude escribe mientras mantiene su efectividad y, por lo tanto, lo hace más barato y rápido. Ahora bien,
00:17:44hice un video sobre esto comparando estos números con lo que realmente sucede en la realidad, porque el repositorio
00:17:51de GitHub solo muestra haiku 4.5, lo cual obviamente está muy desactualizado. Cuando ejecuté esto usando Fable, los números
00:17:56se mantuvieron. De hecho, los números se ven aún mejores con mejores modelos. Usé los puntos de referencia que se
00:18:01proporcionaban con este repositorio de GitHub. Lo que te funcione en la realidad puede ser un poco diferente dependiendo de la
00:18:06complejidad de tu proyecto. Pero esto es algo que puedes añadir a todo lo que hemos comentado hasta
00:18:11ahora si quieres seguir reduciendo tu consumo de tokens. Otro que verás mucho es Caveman,
00:18:18el cual hoy en día afirma que reduce tus tokens de salida en un 65%. Hay muchas personas por ahí
00:18:25que también hablan de usar simplemente oraciones de una sola línea en Claude MD, algo tan simple como decir sé breve,
00:18:30lo cual también reducirá tus tokens de salida. Pero recuerda, los tokens de salida son solo una parte del rompecabezas.
00:18:36Y ese rompecabezas, para volver a nuestra discusión original, está dominado por el almacenamiento en caché de prompts. Así que
00:18:41si no obtuviste nada más de este video, espero que hayas podido llevártelo, porque ahí es donde
00:18:46vamos a terminar hoy. Así que, como siempre, háganme saber qué opinan. Asegúrense de revisar
00:18:50ChaseAI Plus si quieren tener en sus manos la Masterclass de Claude Code. Nuevamente, lanzando una gran
00:18:55actualización de eso esta semana. Y aparte de eso, nos vemos luego.

핵심 요약

Comprender y proteger el almacenamiento en caché de prompts evita costos de tokens hasta veinte veces mayores en Claude Code.

하이라이트

  • Los tokens de entrada no almacenados en caché cuestan veinte veces más que las lecturas en caché, lo que representa el factor económico más determinante en el uso de Claude Code.

  • El almacenamiento en caché de prompts se restablece tras una hora sin actividad o al cambiar de modelo, modificar servidores MCP, conectar plugins o ejecutar comandos de actualización.

  • Las opciones para recuperar conversaciones extensas sin pagar costos excesivos incluyen el uso de la barra diagonal clear, la compactación nativa o herramientas de transferencia personalizada.

  • El comando de la barra diagonal doctor revisa y recorta el archivo Claude.md y elimina habilidades o configuraciones obsoletas que saturan la ventana de contexto.

  • El uso de andamiajes adicionales como ponytail y Caveman reduce la cantidad de código de salida generado por Claude para disminuir los costos operativos.

타임라인

Funcionamiento y costos del almacenamiento en caché de prompts

  • Los tokens de entrada y salida se acumulan en la ventana de contexto y se envían de forma completa en cada mensaje posterior.
  • El sistema de caché retiene el historial de conversación durante una hora sin actividad antes de borrarlo por completo.
  • Las lecturas en caché cuestan un dólar por millón de tokens, mientras que las lecturas sin caché o las escrituras iniciales alcanzan los veinte dólares por millón.

El video detalla la diferencia económica masiva entre utilizar el sistema de caché y enviar mensajes sin optimización. Cada interacción envía el historial completo a los servidores, pero el documento de caché permite procesar los datos a una fracción del costo habitual. Esperar más de una hora o realizar acciones específicas reinicia este contador y dispara los gastos operativos de forma drástica.

Alternativas para gestionar la pérdida de caché

  • La barra diagonal clear borra todo el historial de la conversación cuando el proyecto cuenta con suficientes referencias en los archivos locales.
  • La función de compactación nativa genera un resumen del diálogo previo para iniciar una nueva conversación con el contexto esencial.
  • Las herramientas de transferencia personalizada almacenan un archivo Markdown en el disco para que Claude consulte el estado actual del proyecto.

Cuando una sesión supera los quinientos mil tokens y la caché se pierde, existen tres vías principales para evitar facturas elevadas. Borrar el historial por completo resulta útil si el código base ya registra los avances. La compactación y los documentos de transferencia permiten conservar las decisiones clave sin arrastrar un historial de tokens obsoleto.

Enrutamiento de modelos y optimización de tokens

  • El modo asesor permite que un modelo inteligente elabore planes mientras modelos más pequeños y económicos ejecutan las tareas.
  • Los plugins de Codex integran modelos alternativos dentro de la interfaz de Claude Code para diversificar las opciones de procesamiento.
  • Los modelos externos como Luna y Terra ofrecen alternativas económicas para tareas específicas que no requieren la arquitectura de Anthropic.

Delegar operaciones sencillas en modelos secundarios optimiza el presupuesto general del flujo de trabajo. La estrategia de asesor y ejecutor aprovecha las fortalezas de cada arquitectura sin comprometer la calidad del resultado final ni saturar la ventana de contexto principal.

Higiene del entorno y herramientas de andamiaje

  • El comando barra diagonal doctor analiza y reduce el contenido innecesario del archivo Claude.md y de las habilidades instaladas.
  • Las herramientas auxiliares como ponytail y Caveman disminuyen el volumen de código de salida generado por el modelo.
  • Los tokens de salida representan solo una parte del gasto total, por lo que la gestión de la caché mantiene la prioridad en el ahorro.

Una correcta higiene del entorno de desarrollo elimina instrucciones redundantes que consumen espacio en la ventana de contexto desde el inicio de la sesión. Combinar estas limpiezas con andamiajes que reducen la verbosidad del modelo asegura un control riguroso sobre el consumo total de tokens.

커뮤니티 글

모든 글 보기