Cómo hacer que los tokens de Claude Code sean 20 veces más baratos (y 4 trucos de uso más)
CChase AI
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Podrías estar pagando 20 veces más por tus tokens de Cloud Code de lo necesario sin siquiera saberlo.
00:00:05Entender cómo aprovechar al máximo tus tokens de Cloud Code es una de las habilidades más importantes
00:00:08que puedes dominar, y va mucho más allá de simplemente poner una línea en tu archivo Cloud.md
00:00:14que diga: sé breve. Porque si no entiendes cosas como cómo funciona el almacenamiento en caché de prompts,
00:00:19puedes terminar pagando mucho más de lo necesario. Así que en este video te daré cinco
00:00:23formas distintas de administrar mejor tus tokens de Cloud para que realmente puedas aprovechar al máximo
00:00:27estos modelos de primera categoría. El consejo número uno es el más importante. Esto te ahorrará más dinero
00:00:31y uso que todos los demás consejos combinados por mucho, y se trata de entender cómo funciona realmente
00:00:37el almacenamiento en caché de prompts. Para entenderlo, primero debes comprender cómo funcionan los tokens en general. Así que haremos
00:00:43un repaso muy rápido, de unos 60 segundos, para estar todos en la misma página. Los tokens son la moneda de
00:00:47los grandes modelos de lenguaje, y para todos los efectos prácticos (aunque esto está algo simplificado), cada
00:00:52palabra equivale a un token. Así que cuando tú, el usuario, en tu primer mensaje a Fable dices: qué tal estás hoy,
00:01:00has enviado cinco tokens de entrada. Cuando Fable te responde y dice: estoy muy bien, gracias,
00:01:09te ha dado cuatro tokens de salida. Estos tienen precios diferentes. De hecho, los tokens de salida, por lo general,
00:01:16cuestan cinco veces lo que cuesta un token de entrada. Estos cinco tokens de entrada y estos cuatro tokens de salida ahora
00:01:23se acumulan dentro de la ventana de contexto. Si los tokens son la moneda, entonces la ventana de contexto es nuestro presupuesto.
00:01:31Opus, Fable, Sonnet, todos tienen un presupuesto de un millón de tokens, así que en este punto hemos usado
00:01:37nueve de nuestro millón, no es gran cosa. Lo interesante ocurre cuando enviamos mensajes posteriores
00:01:43después del primero. En nuestro segundo mensaje, yo, el usuario, digo: constrúyeme una aplicación, sin errores,
00:01:50seis tokens de entrada, ¿verdad? Solo voy a enviar a Anthropic y Fable seis tokens de entrada. Bueno,
00:01:56no exactamente. Lo que realmente voy a enviar es todo. Voy a enviarle a Anthropic
00:02:04toda esta conversación hasta ese punto. Así que en realidad no estoy enviando seis tokens de entrada, sino
00:02:1116 tokens de entrada, porque voy a enviarles los cinco de aquí y los cuatro de allá, ya que
00:02:16se enviará el mensaje completo para que pueda entender el contexto. Y para cada uno de los
00:02:20mensajes siguientes será el caso; siempre envío la totalidad de la conversación
00:02:26anterior a ese último mensaje. Y puedes ver rápidamente cómo esto se acumula muy, muy rápido hasta el punto en que
00:02:32hablas de 5,000, 10,000, 100,000 tokens de entrada enviados en cada mensaje. Y estás
00:02:37pagando por ello. Ahora, si ese es el caso, ¿por qué no agotamos todo nuestro uso
00:02:43de inmediato? ¿Por qué no paga todo el mundo mil millones de dólares cada vez que intenta usar estos sistemas de IA?
00:02:47Porque obviamente enviamos mensaje tras mensaje. Así que hay una gran cantidad de
00:02:51mensajes acumulados que se envían a los servidores. Bueno, la solución aquí es el sistema de caché. Así que sí,
00:02:57cuando envío el mensaje número dos aquí, en realidad estoy enviando todo esto. Pero lo que se ha creado
00:03:05en este punto es la caché de mensajes. Y para nuestro segundo mensaje, esa caché de mensajes son estos primeros
00:03:12dos mensajes. Quiero que pienses en la caché de mensajes simplemente como un documento que Claude tiene delante
00:03:17y que contiene toda tu conversación hasta ese momento. Así que te tenemos hablando con Claude aquí mismo,
00:03:23ahora estás enviando el mensaje número dos, que es constrúyeme una aplicación, sin errores. Pero tenemos el sistema
00:03:30de caché. Así que toda esta sección, estos primeros dos mensajes, ahora están en este documento. Por lo que
00:03:36Claude y Anthropic pueden hacer es leer ese documento, pueden leer la caché,
00:03:42revisar todo el historial de mensajes hasta ese punto a una tarifa mucho más económica que si estuvieras
00:03:47enviándolo todo de golpe sin la caché. Y así es como calcula el costo. Y este costo
00:03:54es importante porque este sistema de caché no dura para siempre. Lo que debes entender es que cuando
00:04:00tú y Claude están hablando entre sí, y tenemos este documento de caché entre nosotros, que tiene todo
00:04:06nuestro historial de conversación, el cual se puede leer de forma muy económica, este solo se retiene durante una hora.
00:04:11Así que si tú y Claude están teniendo esta charla, van y vienen una y otra vez,
00:04:16ya sabes, de ida y vuelta constantemente, y luego te vas por una hora. Y tienes
00:04:21un documento que mide 500,000 tokens de largo, una conversación de 500,000 tokens. Después de una hora, esto desaparece.
00:04:29Esto se borra. Y entonces cuando envías un mensaje, digamos el 500,001, adivina qué, ahora
00:04:38se te cobrará la tarifa completa por un mensaje de 500,000 tokens, incluso si lo único que dijiste fue: “Hola, ¿qué tal?”
00:04:46Ahora comprende que cuando digo que esta caché solo dura una hora, me refiero a una hora sin actividad. Así que se
00:04:52actualiza con cada mensaje. Por lo tanto, si han pasado 59 minutos desde nuestro último mensaje y vuelvo a escribir,
00:04:56ese contador de una hora se reinicia. Ahora, ¿por qué es tan importante? Bueno, es por el costo. Hablé
00:05:01en la introducción sobre la diferencia entre una lectura en caché (es decir, leer todo este historial) frente a leer los 500,000
00:05:08mensajes sin caché, que es literalmente una diferencia de 20 veces. Y esto se refleja en la documentación
00:05:16de aumentos de precios. Recuerda que los tokens de salida, lo que Claude nos da, nunca cambian.
00:05:22Para Fable, hablamos de $50 por millón de tokens y $25 en el caso de Opus. Pero los tokens de entrada
00:05:27es donde ha estado ocurriendo toda esta conversación. Siempre hablamos de tokens de entrada base
00:05:33de $10 por millón, pero eso es un poco impreciso porque en realidad siempre estamos haciendo escrituras en caché.
00:05:40Así que una escritura en caché de una hora, que es lo que haces en un plan de suscripción, de hecho cuesta el doble.
00:05:47Por lo tanto, cuando escribimos en esa caché por primera vez para ese primer mensaje, son $20 por
00:05:54millón de tokens. Notarás una escritura en caché de cinco minutos aquí, pero eso es realmente solo para personas que
00:05:59están en la API. Ahora compáralo con los aciertos de caché, es decir, cuando Anthropic simplemente lee ese documento que está
00:06:05frente a él, que ha estado acumulando cada hora y se actualiza. Cuesta $1, 20 veces más barato. Esa es
00:06:13una diferencia abismal. Y es por eso que todo esto, este consejo en particular, entender el almacenamiento en caché de prompts y
00:06:18cómo funciona el sistema de tokens es tan importante. No hay nada de lo que vaya a hablar más allá de este punto
00:06:22que te vaya a dar ningún tipo de ganancia de eficiencia cercana a esta. Nada.
00:06:29Ahora volvamos a nuestro ejemplo de esa conversación de 500,000 tokens que estamos teniendo
00:06:35con Claude Code y estamos a punto de enviar un mensaje posterior. En el escenario número uno, vamos a
00:06:40imaginar que tenemos el sistema de caché. Así que este historial de conversación de 500k está en caché y estoy enviando
00:06:46ese nuevo mensaje. La forma en que funcionarán los precios es que todavía tiene que leer todo este historial
00:06:51de conversación. Y eso es a una tarifa de $1 por millón de tokens. Así que me costará 50 centavos en ese
00:06:58siguiente mensaje leer todo más el mensaje nuevo. Así que imagina que ese mensaje nuevo tenía mil
00:07:05tokens de longitud. Ese mensaje posterior de mil tokens no se cobra a $1 por millón. Se cobra a $20
00:07:14por millón. Así que para mil tokens, ¿cuánto es eso, como dos centavos o algo así? No lo sé.
00:07:18Mis matemáticas probablemente estén mal, pero el punto es que el historial está a $1. El nuevo está a $20 al mes porque está en caché.
00:07:26Ahora, la próxima vez que enviemos un mensaje, mismo escenario, excepto que estos mil tokens ahora formarán parte de ese
00:07:32documento de caché. Tiene algo de sentido. De acuerdo. Ese es el escenario uno. Escenario dos, no tenemos caché. Esperamos una hora
00:07:40para enviarlo. Así es para enviarlo. Bueno, en lugar de costar 50 centavos, ahora se nos va a
00:07:47cobrar a una tarifa de lectura en caché, perdón, a una tarifa de escritura en caché, que recuerda es de $20 por millón. Así que, ¿cuánto
00:07:54va a costar esto? Bueno, ahora este único mensaje nos está costando unos 10 dólares. Así que pasamos de 50 centavos a
00:08:0010 dólares solo porque esperamos una hora. Esas son las consecuencias de no entender
00:08:05esto. Ahora bien, el tiempo no es lo único en lo que debemos pensar cuando se trata de perder la caché. Hay
00:08:10otras cosas que la restablecerán por completo. Y esto viene directamente de la documentación de Cloud Code.
00:08:14Si cambias de modelo, ya sabes, estás en Fable y cambias a Opus y llevas 500,000 tokens,
00:08:20eso se pierde. La caché se reinicia. Nivel de esfuerzo, si vas a cambiarlo. Modo rápido, conectar o desconectar
00:08:26un servidor MCP, plugins, denegar herramientas, compactar la conversación o simplemente actualizar Cloud Code en
00:08:32general. Cualquiera de estas cosas restablecerá la caché y tu próximo mensaje será 20 veces más caro
00:08:38de lo necesario. Dicho todo esto, ¿qué puedes hacer realmente con esta información?
00:08:42¿Qué haces cuando te encuentras en una posición en la que necesitas alejarte de una conversación
00:08:46que tiene mucha información importante, pero vas a estar ausente por más de una hora,
00:08:50o te alejaste por más de una hora y simplemente regresas dándote cuenta de que, rayos, como
00:08:54que no pensé en esto de antemano. Bueno, de eso hablaremos en el consejo número dos.
00:08:59Pero primero, unas breves palabras del patrocinador de hoy, yo mismo. Así que esta semana voy a lanzar una versión completamente actualizada
00:09:06de mi Cloud Code Masterclass dentro de Chase AI+. Un montón ha cambiado desde que salí por primera vez
00:09:12con esto. Lo actualizo todo el tiempo. Pero fundamentalmente, hemos recorrido un largo camino desde marzo cuando publiqué
00:09:19esta cosa. Así que si eres alguien que está intentando mejorar su nivel con la IA, alguien que definitivamente
00:09:24no proviene de un entorno técnico y quieres una hoja de ruta para saber realmente cómo usar esta herramienta
00:09:28desde cero y algo que se centre en casos de uso reales, entonces esto es para ti. Está dentro
00:09:33de Chase AI+. Hay un enlace en el comentario fijado. Ahora, el consejo número dos se trata de tus
00:09:37opciones cuando perdemos la caché. Nos hemos alejado por demasiado tiempo. Tenemos una conversación que tiene dos,
00:09:42tres, cuatro, quinientos mil tokens de longitud. Y queremos saber cuál debería ser el siguiente paso
00:09:47en lugar de pagar esos costos exorbitantes. Y depende un poco de cuál sea tu situación.
00:09:52Ahora bien, nuestra primera opción es algo así como la opción nuclear, y consiste simplemente en usar la barra diagonal clear.
00:09:58Forward slash clear va a borrar todo el historial de la conversación. Y esto no siempre es algo
00:10:04De hecho, si estás trabajando en algún tipo de código base, algún tipo de proyecto con
00:10:10un montón de archivos y mucho contexto, probablemente solo quieras usar la barra diagonal clear.
00:10:15Lo que sea en lo que estuvieras trabajando, de lo que estuvieras hablando, es muy probable que haya rastros en el propio proyecto
00:10:20como referencia de lo que ha sucedido. Cloud Code puede echarle un vistazo a eso. Y cuando inicias una nueva conversación
00:10:25desde cero, puede retomar los cabos sueltos y devolverte al punto en el que estabas. No necesitas ser esclavo
00:10:31de la conversación anterior. Ahora, tu segunda opción es usar la compactación. Hay una función de compactación automática
00:10:38dentro de Cloud Code una vez que alcanzas cierta cantidad de tokens. Sugiero no esperar a llegar
00:10:42a ese punto porque cuando trabajamos en el rango de los seiscientos, setecientos u ochocientos mil tokens, empezamos
00:10:47a lidiar con la degradación del contexto. Sigue siendo un problema con estos modelos más grandes y potentes,
00:10:51pero podemos usar la barra diagonal compact en cualquier momento. Y lo que eso hará por nosotros es crear un
00:10:57resumen de lo que hemos hablado. Y luego, a todos los efectos prácticos, aplicará la barra diagonal
00:11:03clear, pero iniciará una nueva conversación con ese resumen, un poco como si estuviera en la memoria. Así que
00:11:10si tenías cosas importantes en esa conversación y crees que lo que está en el código base no va a ser
00:11:15suficiente para que lo entienda, entonces simplemente haz una compactación con la barra diagonal compact. Iniciará una nueva
00:11:20conversación con ese resumen. Y ese resumen simplemente vive en el historial de mensajes. Ahora bien, tu tercera opción
00:11:26es muy similar a la compactación y consiste en utilizar algún tipo de herramienta de transferencia personalizada. Hay un montón de habilidades
00:11:32de transferencia personalizadas por ahí. Yo mismo tengo una. Puedes conseguirla dentro de mi comunidad gratuita. Y la diferencia
00:11:38entre la transferencia y la compactación es dónde vive ese resumen. Así que si estoy usando la transferencia, lo que va a hacer
00:11:46es guardarlo directamente en mi disco. Va a crear un archivo Markdown real con el resumen y con
00:11:51lo que yo quiera que contenga. Y luego puedo iniciar una nueva conversación y decir: Oye, Claude Code, echa un vistazo
00:11:59a ese documento de transferencia en el disco para que te pongas al día con lo que necesitas saber. En contraste con la compactación,
00:12:04no crea ningún tipo de archivo. Es solo un mensaje en el historial de mensajes de esa conversación
00:12:10en particular; hay una diferencia sutil. Pero para algunas personas, tener algún tipo de archivo en el
00:12:15disco es importante. Y a menudo es un documento vivo que se actualiza constantemente.
00:12:20Así que estas son realmente tus tres opciones. ¿Quieres simplemente borrar todo y empezar desde cero?
00:12:26A menudo, esto está perfectamente bien. ¿Quieres usar la función nativa de Claude y compactarlo para
00:12:31que el resumen se inyecte directamente? ¿O prefieres que el resumen sea un documento real que Claude pueda consultar?
00:12:37En ese caso, usa la transferencia. Esas son tus tres opciones. Y a menudo son mejores que simplemente
00:12:42enviando un mensaje nuevo porque, por lo general, realmente no deberías operar en rangos de 400, 500 o 600 000
00:12:48tokens de todos modos. Ahora bien, el consejo número tres trata sobre el enrutamiento de modelos. ¿Cómo elegimos el modelo correcto
00:12:53para el trabajo? Así no usamos siempre a Fable para todo. ¿Podemos usar un modelo más pequeño, más barato y menos inteligente
00:12:59para las tareas más simples? La respuesta es sí. Y podemos abordar esto de diferentes maneras.
00:13:04Podemos usar modelos externos. Podríamos recurrir a GPT, Sol. Podríamos recurrir a GPT, Luna y Terra, que acaban de volverse
00:13:10súper baratos. Podemos usar modelos locales, o tenemos opciones si queremos quedarnos en el ecosistema de Anthropic.
00:13:16Y la forma más fácil de hacer esto, creo, es el modo asesor. Ahora bien, lo que ves aquí es de la publicación de blog
00:13:22original
00:13:29del asesor que salió hace varios meses. Y muestra a Opus y Sonnet, pero el mismo sistema
00:13:37se mantiene con modelos como Fable. Y la idea es que tenemos un modelo inteligente como Fable o incluso Opus asesorando a
00:13:43un modelo más pequeño como Sonnet cuando se trata de ejecutar tareas. Así que el modelo grande elabora un plan, el
00:13:50modelo pequeño lo ejecuta, y el modelo pequeño puede compartir su contexto con el modelo más grande cada vez
00:13:54que surgen problemas. Y este modelo ha presumido de mejores resultados a menores costos. Y para retomar nuestra
00:14:01discusión anterior sobre el almacenamiento en caché de prompts, tanto el asesor como el ejecutor tienen su propio caché de prompts
00:14:06funcionando al mismo tiempo. Ahora bien, tu segunda opción es delegar tareas a modelos fuera de Claude
00:14:12Code. Una opción fácil de usar es Codex. Hay un plugin de Codex para Claude Code, lo que hace muy sencillo
00:14:18recurrir a Codex desde la interfaz de Claude Code. Así que podrías tener a Fable haciendo esencialmente ese mismo
00:14:24tipo de modo asesor, pero en lugar de recurrir a Opus o Sonnet, recurre a los modelos GPT. Hay
00:14:31otros repositorios como este asesor de Fable que hacen exactamente eso. Y en última instancia, es bastante trivial configurar tu
00:14:36propia habilidad que haga precisamente esto. Y si estás buscando esos modelos más baratos, de nuevo, sugiero encarecidamente
00:14:41echarle un vistazo a los de GPT, específicamente Luna y Terra, porque A, sus costos se redujeron significativamente,
00:14:48y B, realmente no hay ningún modelo en la familia de Anthropic que haga lo que ellos hacen
00:14:53a ese precio. Incluso puedes dar un paso más e incorporar algunos modelos locales si las
00:14:57tareas lo ameritan. Ahora bien, el consejo número cuatro trata sobre tu higiene con Claude. Puede que hayas visto
00:15:01recientemente este video circulando de Boris Cherney, el creador de Claude Code, diciendo:
00:15:07necesitas eliminar tu archivo Claude.md. Bueno, ¿necesitas realmente eliminar ese archivo Claude.md? En realidad,
00:15:12no necesariamente, pero lo que sí debes hacer, y esto ha tenido algunos cambios recientes en las últimas
00:15:18semanas, es ejecutar el comando barra diagonal doctor. ¿Y qué tiene esto que ver con los tokens?
00:15:23Bueno, primero que nada, lo que este comando va a hacer, entre otras cosas, aunque mantenemos esto relacionado con los tokens,
00:15:30es revisar tu archivo Claude.md y recortarlo.
00:15:36La forma en que funcionan estos modelos, especialmente estos modelos de la serie five, es que no necesitan tantas
00:15:42instrucciones. Si miras lo que la gente creaba para los archivos Claude.md hace tres, seis o nueve meses,
00:15:46eran muy prescriptivos y extremadamente detallados. Y tal vez en ese momento se podría argumentar que lo necesitaban.
00:15:53Ese ya no es el caso. Y por lo tanto, un Claude.md saturado no solo lo hace más lento, sino que literalmente te está costando tokens.
00:15:59Y la barra diagonal doctor va a revisar eso y eliminar las cosas de tu Claude.md que simplemente no necesitan estar ahí. En segundo lugar,
00:16:04va a revisar aquellas cosas que están perjudicando tu contexto o saturando tu ventana de contexto.
00:16:10Porque incluso cuando inicias una nueva conversación y ejecutas la barra diagonal context, hay elementos
00:16:15que lo están llenando. Ahora bien, recientemente ejecuté la barra diagonal doctor, así que me deshice de gran parte de la saturación,
00:16:20pero así es como se ve mi ventana de contexto justo al principio de una conversación sin que se haya enviado ningún mensaje.
00:16:25Ya hemos usado 40,000 tokens. ¿Y qué es lo que está consumiendo gran parte de esto? Bueno, una parte proviene de
00:16:31cosas como las habilidades, como puedes ver aquí. Otra parte incluye elementos como el prompt del sistema, así como
00:16:36archivos de memoria. Lo que la barra diagonal doctor va a hacer es revisar cosas como tus
00:16:41habilidades y tus MCPs, y comenzar a recortar aquellos que simplemente no has estado usando. ¿Es esto un ahorro masivo de tokens?
00:16:47No, pero es algo, es un pequeño detalle y es una solución muy sencilla. No hay razón
00:16:53para no hacerlo, especialmente si eres alguien que se ha dedicado a acumular 10 millones de habilidades durante
00:16:58los últimos seis meses y en realidad no te has tomado el tiempo de revisarlas y empezar a eliminarlas, ya que hacer esto
00:17:03también hará que tus habilidades se activen de manera más efectiva. Y Claude no tendrá ninguna confusión sobre
00:17:08qué habilidad necesita invocar. Apuesto a que probablemente tienes unas 10 habilidades por ahí que tienen que ver
00:17:12con el diseño frontend y no necesitas todas ellas. Así que este consejo tan simple y fácil de ejecutar
00:17:17en lo que respecta a tu higiene con Claude es uno que no debes dejar pasar. Solo ejecuta doctor. Y eso
00:17:22nos lleva a nuestro consejo final, que creo que es el menos efectivo de todos estos hoy en día, pero se trata
00:17:28de las habilidades adicionales y el andamiaje que ves por todas partes.
00:17:33El más popular hoy en día es ponytail y básicamente reduce la cantidad de código
00:17:38que Claude escribe mientras mantiene su efectividad y, por lo tanto, lo hace más barato y rápido. Ahora bien,
00:17:44hice un video sobre esto comparando estos números con lo que realmente sucede en la realidad, porque el repositorio
00:17:51de GitHub solo muestra haiku 4.5, lo cual obviamente está muy desactualizado. Cuando ejecuté esto usando Fable, los números
00:17:56se mantuvieron. De hecho, los números se ven aún mejores con mejores modelos. Usé los puntos de referencia que se
00:18:01proporcionaban con este repositorio de GitHub. Lo que te funcione en la realidad puede ser un poco diferente dependiendo de la
00:18:06complejidad de tu proyecto. Pero esto es algo que puedes añadir a todo lo que hemos comentado hasta
00:18:11ahora si quieres seguir reduciendo tu consumo de tokens. Otro que verás mucho es Caveman,
00:18:18el cual hoy en día afirma que reduce tus tokens de salida en un 65%. Hay muchas personas por ahí
00:18:25que también hablan de usar simplemente oraciones de una sola línea en Claude MD, algo tan simple como decir sé breve,
00:18:30lo cual también reducirá tus tokens de salida. Pero recuerda, los tokens de salida son solo una parte del rompecabezas.
00:18:36Y ese rompecabezas, para volver a nuestra discusión original, está dominado por el almacenamiento en caché de prompts. Así que
00:18:41si no obtuviste nada más de este video, espero que hayas podido llevártelo, porque ahí es donde
00:18:46vamos a terminar hoy. Así que, como siempre, háganme saber qué opinan. Asegúrense de revisar
00:18:50ChaseAI Plus si quieren tener en sus manos la Masterclass de Claude Code. Nuevamente, lanzando una gran
00:18:55actualización de eso esta semana. Y aparte de eso, nos vemos luego.