Esta nueva habilidad por fin resuelve el pensamiento en los agentes de IA

AAI LABS
Computing/SoftwareInternet Technology

Transcript

00:00:00Claude Code, Codex y prácticamente cualquier otro agente que uses tienen un grave problema, y te topas con él en cuanto necesitas que alguno tome una decisión real.
00:00:08Estos modelos pueden analizar un problema a fondo, pero nunca proponen nada nuevo.
00:00:12Y no importa cuál estés usando, porque todos se quedan cortos en cuanto necesitas algo creativo.
00:00:17Así que cuando acudes a ellos en busca de ideas, lo que recibes es la respuesta segura y terminas pidiendo una y otra vez los enfoques que debieron haber encontrado solos.
00:00:24Hasta que tú mismo no les das esos enfoques, no piensan de forma creativa en absoluto.
00:00:28Pero la solución para esto, por raro que parezca, es en realidad el TDAH, que es cuando la atención de una persona salta de un lado a otro en lugar de quedarse en una sola cosa.
00:00:35Y resulta que el TDAH se convierte en un superpoder cuando eres un agente de IA, y eso es básicamente lo que les estamos dando ahora.
00:00:41Hay una herramienta en tendencia en estos días que hace exactamente eso.
00:00:44Y si es tu primera vez aquí, somos una empresa de software y este es nuestro canal AI Labs, donde te mostramos cómo optimizar tus procesos con IA tal como hemos optimizado los nuestros.
00:00:54Así que en este video, vamos a ver cómo darle TDAH a tu agente realmente ayuda.
00:00:59Ahora, antes de entrar en la herramienta, necesitas saber por qué la necesitas en primer lugar.
00:01:03Si has trabajado con Claude Code, Codex o cualquier otro agente, ya sabes que son buenos dividiendo las grandes tareas que les das en fragmentos pequeños.
00:01:10Le entregan esos fragmentos a subagentes para que cada uno trabaje en su propia ventana de contexto sin llenar la sesión principal.
00:01:16Ni siquiera tienes que pedírselo.
00:01:18Crean listas de tareas y las delegan donde pueden para que el trabajo se ejecute en paralelo.
00:01:22Pero toda esa división solo ocurre para el trabajo en sí.
00:01:26Nada de esto sucede cuando les pides idear, y si has intentado hacer lluvia de ideas de distintos ángulos con alguno de ellos, ya sabrás lo frustrante que es.
00:01:34Pides variaciones y lo que devuelven suena distinto al leerlo, pero todas son la misma idea redactada de otra forma.
00:01:40Así que la ideación es lo más difícil de delegar, porque encontrar direcciones genuinamente diferentes no es algo en lo que los agentes sean buenos.
00:01:47Básicamente, todo se reduce a cómo se entrenan estos modelos.
00:01:50Un agente recurre al patrón que apareció con más frecuencia en sus datos de entrenamiento, porque ver repetida esa respuesta fue lo que le enseñó que es buena.
00:01:59Eso no hace que sus respuestas sean incorrectas y lo que obtienes suele estar bien, pero hay otros ángulos del problema que ni siquiera mira, lo cual arruina el propósito de hacer lluvia de ideas.
00:02:08Y los patrones seguros son solo la mitad, porque tampoco evalúa nunca cada idea por su cuenta.
00:02:13Cada posibilidad se analiza dentro de la misma ventana de contexto, por lo que las ideas se mezclan y el contexto se llena de ruido.
00:02:20El razonamiento empeora en lugar de mejorar; por eso no puede evaluar nada con claridad y termina dándote la misma idea con otra redacción.
00:02:28La habilidad TDAH salió hace poco y acumuló muchísimas estrellas en GitHub en cuestión de días.
00:02:33Y el nombre encaja porque, al igual que en el TDAH real donde los pensamientos están dispersos por todas partes, dispersa el razonamiento en lugar de llevarlo en línea recta.
00:02:42Así que toma la ideación o cualquier tarea con múltiples direcciones posibles y la divide entre agentes separados como un árbol de pensamiento.
00:02:49Un árbol de pensamiento es básicamente una estructura donde múltiples ramas de subagentes trabajan aisladas en ideas diferentes, tal como se dividen las ramas de un árbol.
00:02:58Luego, al final, una vez que cada rama se ha decidido por una posibilidad, reúne todas esas ideas y las combina en la respuesta final.
00:03:06Así que despliega múltiples agentes que piensan en sus propias ventanas de contexto y cada uno recibe un enmarque distinto del mismo problema.
00:03:12Están aislados, por lo que comparten cero contexto y ninguno sabe en qué están trabajando los demás.
00:03:17Pero el aislamiento aquí no se trata de dividir el trabajo, sino de mantener cada idea separada para que no se influyan entre sí.
00:03:24La forma en que los mantiene separados es mediante marcos, que son básicamente distintas lentes para observar el problema.
00:03:29Tiene toda una biblioteca de marcos en su interior que guarda las diferentes direcciones en las que pueden ir los agentes, y cada agente elige el marco con el que trabajará.
00:03:37Así que recibe esa instrucción de marcos junto con la instrucción del sistema y el problema en sí.
00:03:41Luego, un agente crítico evalúa todo lo que regresa, porque alguien tiene que decidir cuáles de estas ideas vale la pena conservar.
00:03:48Califica cada idea en función de tres aspectos.
00:03:50Originalidad, que es qué tan nueva y creativa es realmente la idea.
00:03:54Viabilidad, que es si realistamente podrías construirla.
00:03:57Y encaje, que es qué tan bien se adapta al problema que intentas resolver.
00:04:01Esta calificación ocurre en su propio agente, el cual ejecuta un prompt que le indica actuar como un ingeniero sénior escéptico.
00:04:07Así que todo su trabajo es ser duro con todo lo que lee.
00:04:10Y basándose en la puntuación, decide si una idea sobrevive o se descarta.
00:04:15Al final, la habilidad selecciona las ideas más sólidas y revisa la lista de trampas, que son básicamente los problemas que cada idea podría causar si decidieras usarla.
00:04:23Luego prioriza aquellas ideas que fueron marcadas como poco obvias.
00:04:26Antes de mostrarles formas interesantes en que esta habilidad realmente ayuda, sería genial si se suscriben al canal y le dan al botón de me gusta.
00:04:33Este pequeño gesto de apoyo significa mucho para nosotros.
00:04:36Eso es lo que está haciendo internamente.
00:04:38Ahora vamos a instalarla.
00:04:40Encontrarás el comando para eso en el repositorio de GitHub del proyecto.
00:04:43Así que lo copias, abres la terminal en el proyecto en el que estés trabajando y lo ejecutas.
00:04:47Luego te pregunta para qué agente de programación con IA quieres instalarlo, y es compatible con más de 45 de ellos.
00:04:53Así que simplemente puedes elegir el que uses.
00:04:55Después de eso, pregunta si debería estar disponible solo dentro del proyecto actual (Project Scope) o desde cualquier lugar, sin importar en qué proyecto estés.
00:05:03Si solo lo necesitas en un lugar, Project Scope es la opción a elegir.
00:05:06Pero una vez hecho esto, la habilidad se guarda en una carpeta llamada .agents.
00:05:10Eso es lo que usan muchos otros agentes como Codex para guardar su configuración, pero Claude Code solo reconoce la carpeta .claude de forma predeterminada.
00:05:18Así que si ese es el que estás usando, cambias el nombre de esa carpeta a .claude y la detecta.
00:05:22Cuando la abres, verás la habilidad allí dentro.
00:05:25Y es solo un archivo skill.md que maneja todo por sí solo, sin archivos de referencia ni dependencias a su lado.
00:05:31Las instrucciones también exigen bastante al agente para que vaya más allá de sus primeras tres respuestas.
00:05:36El archivo dice directamente que esas primeras tres son las respuestas más comunes en los datos de los que aprendieron estos modelos,
00:05:41y también son las que cualquier agente sénior podría proponer inmediatamente.
00:05:44Lo más interesante que un agente sénior es capaz de hacer solo comienza después de esas tres.
00:05:50Pero desplegar tantos agentes consume muchos tokens,
00:05:52por lo que hay un paso de verificación previa que decide si esta habilidad debe ejecutarse o no.
00:05:56Si la llamas con el comando de barra diagonal o la pides directamente, se activa de inmediato.
00:06:01Si no la mencionaste en tu prompt para llamarla de forma directa,
00:06:04y tu agente decide invocar la habilidad automáticamente,
00:06:07entonces evalúa el problema con tres preguntas que componen el paso de verificación previa.
00:06:11La primera es si el problema es de respuesta abierta,
00:06:14lo que básicamente significa si alguien con experiencia tendría varias respuestas diferentes que funcionen,
00:06:19o solo una respuesta correcta.
00:06:20Si solo hay una respuesta correcta,
00:06:22pensar desde múltiples ángulos no tiene sentido y solo desperdicia tokens,
00:06:26así que se detiene ahí.
00:06:27La segunda es si lo que está en juego es realmente importante,
00:06:29es decir, si genuinamente te costaría algo si la respuesta obvia resultara ser la incorrecta.
00:06:34Y la tercera es cómo hiciste la consulta.
00:06:36Si usaste palabras como "rápido" o "estándar",
00:06:38queda claro que buscas la respuesta directa,
00:06:40así que se detiene allí en lugar de usar la habilidad.
00:06:43Aparte del paso previo,
00:06:44tienes todas las fases del ciclo junto con la tabla de marcos, que se convierten en las diferentes direcciones que se asignan a cada agente.
00:06:50También enumera los patrones que se les indica explícitamente a los agentes que eviten.
00:06:54Pero antes de profundizar en las formas interesantes en que puedes usarla, unas palabras de nuestro patrocinador.
00:06:59Top View.
00:06:59Si haces videos con IA, ya conoces la molestia.
00:07:02Cada modelo está en una plataforma diferente y generas un clip a la vez.
00:07:05Top View soluciona eso.
00:07:06Es la primera habilidad de video con IA todo en uno del mundo y vive dentro de tu agente de programación.
00:07:11Claude Code, Cursor, Codex.
00:07:13Reúne los mejores modelos en un solo lugar.
00:07:16Veo, Kling, SeaDance, Nano Banana y más.
00:07:19Sin cambiar de plataforma ni hacer malabares con suscripciones.
00:07:22Así que lo probamos.
00:07:23Le dimos a nuestro agente un solo comando:
00:07:25“Genera 10 variaciones de un anuncio de TikTok de 15 segundos a partir de esta imagen de producto”.
00:07:29Segundos después, teníamos 10 anuncios terminados listos para publicar.
00:07:32Este es el verdadero cambio.
00:07:34Top View convierte a tu agente en una línea de producción de video.
00:07:36Describes lo que quieres una vez y genera por lotes docenas de videos con diferentes modelos, estilos y relaciones de aspecto en una sola sesión.
00:07:44Incluso selecciona automáticamente el modelo adecuado para el trabajo.
00:07:47Pasas de una línea de texto a videos terminados sin salir nunca de tu agente.
00:07:51Prueba la habilidad de Top View en el enlace de la descripción.
00:07:54Esa es la configuración.
00:07:54Ahora veamos dónde rinde frutos todo esto.
00:07:57Un lugar donde realmente da frutos es en el desarrollo guiado por pruebas o TDD, donde el agente escribe primero las pruebas.
00:08:03Luego construye la aplicación pieza por pieza hasta que todas esas pruebas pasen.
00:08:07Y escribir las pruebas antes del código importa, como hemos hablado en videos anteriores,
00:08:12porque cuando todos tus requisitos están escritos estrictamente como código, cualquier cambio que arruine la aplicación es detectado por las pruebas.
00:08:18El agente se ve obligado a cumplirlas.
00:08:20Y escribir pruebas es un excelente problema para esta habilidad, porque es exactamente donde los agentes se descuidan.
00:08:26No cubren todos los casos que deberían porque, como dijimos, recurren a las mismas respuestas comunes y solo crean pruebas para ellas.
00:08:33Nunca miran las otras rutas que un usuario podría tomar en la app, las cuales también deben cubrirse.
00:08:37Puedes darle un prompt detallado sobre cómo escribir pruebas y crear un agente especializado en autoría de pruebas cuyo único trabajo sea escribirlas.
00:08:45Pero aun así vuelven a caer en los mismos patrones.
00:08:47Sin embargo, antes de ejecutarlo, el agente necesita saber qué estás construyendo antes de escribir algo.
00:08:51Para eso, debes redactar lo que se necesita construir, como un PRD, que es el documento que establece lo que la app debe hacer, el problema que resuelve, los objetivos a alcanzar y a quién va dirigida.
00:09:03Junto con eso, también deberías darle un documento de especificaciones técnicas, el cual fija los detalles técnicos para que no tengas que repetirle qué herramientas usar.
00:09:11Enlazas ambos dentro de tu archivo claude.md, para que capte ese contexto desde el principio.
00:09:16Luego invocas la habilidad con su comando de barra diagonal, le das un prompt describiendo la app que construyes y le pides redactar casos de prueba usando TDD.
00:09:25Como la llamaste explícitamente, omite la verificación previa y despliega cinco agentes de inmediato.
00:09:30Cada uno toma su propia dirección de razonamiento usando el marco que mejor se adapta al problema, y regresan con diferentes enfoques para escribir las pruebas.
00:09:38Luego califica cada uno según los criterios que vimos antes, elige los tres mejores y los explora más a fondo.
00:09:44Y una vez que todos esos agentes han terminado, obtienes un informe detallado de las direcciones de prueba junto con sus calificaciones.
00:09:50Las puntuaciones están abreviadas: O9 significa que la idea obtuvo un 9 en originalidad, V8 un 8 en viabilidad y E10 un puntaje perfecto en encaje.
00:10:00Cada idea también incluye un bosquejo de cómo se construiría, los riesgos involucrados y los primeros pasos para comenzar.
00:10:07Pero las ideas devueltas no se parecen en nada a un conjunto de pruebas normal.
00:10:11Por lo general, las pruebas que escribe un agente solo verifican que la app funcione correctamente.
00:10:15Sin embargo, las ideas de la habilidad abarcaron muchos más casos límite y también detectan problemas de rendimiento.
00:10:21Así terminas con una suite de pruebas mucho más sólida, dividida en tres ramas analizadas a fondo, probando cada una un camino diferente de la aplicación.
00:10:30Una cosa a tener clara aquí es que la habilidad planifica las pruebas, no las escribe realmente.
00:10:34Lo que recibes es la estrategia, así que desde ahí solo le indicas al agente qué dirección deseas y procede a implementarla.
00:10:40Puedes tomar una sola dirección si es todo lo que necesitas, o hacer que implemente las tres.
00:10:44Si el rendimiento es crítico para tu proyecto, querrás las tres, aunque lleva tiempo porque el agente debe procesar las rutas una por una.
00:10:52Una vez terminado, verás claramente que las pruebas son mucho más detalladas de lo que habrían sido de otra manera,
00:10:57porque toda la estrategia de pruebas se planificó en detalle antes de escribir una sola prueba.
00:11:02Esto funciona muy bien antes de empezar a construir, ya que cubre la mayor parte del terreno de entrada y reduce las posibilidades de romper la app más adelante.
00:11:09Pero eso es todo para el paso previo al desarrollo.
00:11:11La otra forma de usarlo es como una etapa justo antes del lanzamiento.
00:11:14Ejecutas la habilidad en la app que estás por lanzar y le pides que evalúe la experiencia de usuario.
00:11:18Luego señala cualquier cosa que pueda hacer tropezar a las personas mientras navegan por el sitio o usan el producto,
00:11:23así como cualquier detalle que pueda llevarlas al abandono, que es cuando la gente deja de usar tu producto tras haber empezado.
00:11:29Y el abandono ocurre mucho cuando tu sitio ya está público con usuarios reales, especialmente si es de pago.
00:11:34Les gusta al principio pero luego se van porque una función no operó como esperaban,
00:11:38así que solicitan un reembolso.
00:11:40Y muchas veces se trata de un detalle mínimo que se pasó por alto al construir la aplicación,
00:11:44llegó a la versión en vivo y causó inconvenientes con el tiempo.
00:11:48Ejecutamos esto en nuestro sitio web de la comunidad cuando estábamos en medio del lanzamiento de una nueva función.
00:11:53Ya tenemos muchos miembros allí, por lo que cualquier novedad debe revisarse minuciosamente,
00:11:57porque no queremos publicar algo que arruine la experiencia de quienes ya están dentro.
00:12:01Así que la invocamos con el comando de barra diagonal, le dimos la función y le pedimos identificar
00:12:05dónde la gente podría abandonar y qué podría causarles una mala experiencia.
00:12:09Comenzó analizando la aplicación a fondo para recopilar contexto,
00:12:12luego desplegó sus agentes del mismo modo y propuso alrededor de 30 ideas distintas.
00:12:17De esas, seleccionó las tres mejores y las analizó en profundidad.
00:12:20Y al terminar, nos entregó cada hallazgo calificado en originalidad, viabilidad y encaje.
00:12:25Además, detectó vacíos que habían pasado completamente inadvertidos,
00:12:28como funciones prometidas en el PRD que nunca se construyeron,
00:12:32por lo que habríamos lanzado algo que no coincidía con lo prometido,
00:12:35junto con varios hallazgos más.
00:12:37Y para cada uno, sugirió una solución y detalló las trampas y riesgos asociados.
00:12:42Y funciona de la misma manera que con las pruebas.
00:12:44No soluciona nada por sí misma, así que le devuelves los hallazgos deseados al agente,
00:12:48y este procede a implementarlos.
00:12:50De este modo, resuelves todo eso antes del lanzamiento en lugar de después,
00:12:53lo que deja a tu app en un estado mucho mejor para cuando llegue al público.
00:12:57Todas las habilidades, flujos de trabajo y recursos que mostramos en nuestros videos
00:13:01están disponibles en AI Labs Pro, nuestra comunidad.
00:13:04Si encuentras valor en lo que hacemos y quieres apoyar al canal,
00:13:07esta es la mejor manera de hacerlo.
00:13:09El enlace está en la descripción.
00:13:10Eso nos lleva al final de este video.
00:13:12Si deseas apoyar al canal y ayudarnos a seguir creando videos como este,
00:13:16puedes hacerlo mediante el botón de Super Gracias aquí abajo.
00:13:18Como siempre, gracias por ver el video y nos vemos en el próximo.

Key Takeaway

La habilidad de TDAH para agentes de IA supera la monotonía del razonamiento lineal al aislar subagentes en un árbol de pensamiento y filtrar las mejores propuestas mediante una evaluación escéptica de originalidad, viabilidad y encaje.

Highlights

  • Los agentes de IA generativa fallan en la ideación creativa debido a que recurren de forma predeterminada a los tres patrones más comunes de sus datos de entrenamiento.

  • La habilidad de TDAH para agentes de IA estructura la resolución de problemas mediante un árbol de pensamiento que ejecuta múltiples subagentes en ventanas de contexto aisladas.

  • Un agente crítico escéptico evalúa de forma independiente cada idea basándose en tres métricas: originalidad, viabilidad y encaje con el problema.

  • El paso de verificación previa del sistema analiza la apertura del problema, el riesgo implicado y el vocabulario de la consulta para evitar el consumo innecesario de tokens.

  • La integración de esta habilidad en flujos de TDD permite diseñar estrategias de pruebas avanzadas que detectan casos límite y cuellos de botella de rendimiento antes de escribir código.

Timeline

El límite de la creatividad en los agentes de IA

  • Los agentes de IA actuales devuelven respuestas redundantes cuando se les solicita generar ideas creativas desde distintos ángulos.
  • El entrenamiento basado en frecuencias impulsa a los modelos a seleccionar las respuestas más comunes de sus datos de origen.
  • Analizar múltiples opciones dentro de una misma ventana de contexto degrada la calidad del razonamiento por saturación de información.

Herramientas como Claude Code o Codex dividen tareas complejas en subagentes paralelos durante la ejecución del trabajo, pero carecen de esta capacidad en la etapa de diseño o lluvia de ideas. Al evaluar múltiples posibilidades en una sola sesión, las ideas se mezclan y pierden claridad. Este comportamiento limita a los agentes a entregar únicamente variaciones superficiales de una misma respuesta segura.

Mecánica del razonamiento disperso mediante el árbol de pensamiento

  • La habilidad de TDAH distribuye la ideación entre subagentes aislados utilizando un marco de trabajo de árbol de pensamiento.
  • Cada subagente opera con una perspectiva o lente distinta sin compartir el contexto de las demás ramas.
  • Un agente crítico que simula a un ingeniero sénior escéptico descarta opciones débiles usando calificaciones de originalidad, viabilidad y encaje.

Para evitar la influencia mutua entre conceptos, el sistema asigna marcos de análisis diferentes a cada subagente dentro de entornos de ejecución independientes. Posteriormente, las propuestas consolidadas pasan por un filtro riguroso conducido por un agente crítico. Este evalúa cada idea, señala los riesgos asociados y prioriza los enfoques poco obvios que superan la barrera del filtrado.

Instalación, estructura de archivos y filtro de tokens

  • La habilidad se compone de un archivo individual denominado skill.md compatible con más de 45 agentes de programación.
  • Un paso de verificación previa de tres preguntas detiene la ejecución si el problema carece de múltiples soluciones válidas o si la consulta exige una respuesta rápida.
  • Claude Code requiere renombrar la carpeta contenedora .agents a .claude para reconocer la habilidad de forma nativa.

El archivo skill.md opera de forma autónoma sin dependencias externas. Para mitigar el consumo elevado de tokens derivado de desplegar múltiples agentes, el sistema evalúa previamente si el problema es de respuesta abierta, si las consecuencias de un error son elevadas y si el prompt contiene términos como 'rápido' o 'estándar'. Si el problema solo admite una respuesta correcta, la habilidad se desactiva inmediatamente.

Aplicación de la habilidad en desarrollo guiado por pruebas (TDD)

  • El sistema genera estrategias de prueba basadas en especificaciones técnicas (PRD) antes de la fase de codificación.
  • El despliegue de cinco agentes paralelos devuelve casos de prueba avanzados enfocados en rutas no convencionales y métricas de rendimiento.
  • Las calificaciones abreviadas como O9, V8 y E10 identifican la originalidad, viabilidad y encaje de cada arquitectura de prueba.

Los agentes convencionales suelen limitarse a redactar pruebas para los flujos principales de una aplicación. Al integrar la habilidad de TDAH con la documentación técnica del proyecto, el sistema explora múltiples rutas de usuario y escenarios límite. La herramienta entrega un plan de pruebas estructurado en tres ramas analizadas al detalle para que el agente principal proceda con su implementación.

Evaluación de experiencia de usuario y prevención de abandono previo al lanzamiento

  • El análisis previo a la publicación identifica fricciones de interfaz y funcionalidades omitidas que causan el abandono de usuarios.
  • La ejecución de la habilidad sobre nuevas funciones genera cerca de 30 ideas iniciales reducidas a las tres mejores soluciones prácticas.
  • Las correcciones sugeridas se aplican directamente en el código para prevenir solicitudes de reembolso y errores en producción.

Utilizar la habilidad en etapas cercanas al lanzamiento permite auditar el producto bajo decenas de perspectivas simultáneas. El proceso detecta inconsistencias entre los requerimientos originales del proyecto y el código construido. Tras revisar las sugerencias del agente crítico, las correcciones recomendadas se reasignan al agente de programación para resolver los fallos antes de exponer la aplicación a usuarios reales.

Community Posts

View all posts