Tus agentes carecen de contexto: Así es como se soluciona "¡Tienes toda la razón!" — Brandon Waselnuk, Unblocked
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00Buenas tardes. Espero que estén pasando un día maravilloso aquí en AIE. Hemos tenido un clima
00:00:17estupendo, aunque los rayos UV han estado como en nueve, así que espero que se hayan puesto protector solar
00:00:20y se estén comportando como adultos responsables. Estoy aquí para hablarles sobre ingeniería
00:00:24de contextos, y tengo la buena fortuna de seguir a AJ de LinkedIn, porque él
00:00:27habló mucho sobre el sistema que realmente diseñamos y vendemos a otras
00:00:29soluciones, y les voy a dar un montón de herramientas de código abierto; así que si vieron
00:00:33esa última charla justo antes de mí, van a obtener un conjunto de cadenas de herramientas con las que
00:00:36pueden experimentar por su cuenta, y hoy les enseñaré varias técnicas. El objetivo,
00:00:39por supuesto, es arreglar: tienes toda la razón. Creo que ya han quitado eso de
00:00:44las indicaciones ahora, así que solo dice tienes razón u otras cosas, pero estoy seguro de que
00:00:47todos han pasado por eso. Así que soy Brandon, trabajo en Unblocked, sí, tengo un coco, hemos estado
00:00:53regalando estos para tener contexto fresco, cocos frescos, pero de lo que quiero
00:00:57hablarles es de que con estos modelos, especialmente con los modelos Claude,
00:01:01creo que Claude 3.5 Sonnet está regresando hoy, así que dicen que puedes ver la grabación de mi llamada de Grain
00:01:05e intentar reservar esto, lo ignoraremos. Pero lo que quiero que hagan es que piensen
00:01:11en el hecho de que, con estas herramientas, el código generado por IA debería sentirse como si hubiera
00:01:15sido escrito por alguien que lleva años en su equipo. Entonces, para ponerse en la mentalidad correcta de
00:01:23años, deben considerar que ustedes han sido el motor de contexto. ¿Cómo hicieron eso?
00:01:27Construyeron contexto yendo a trabajar y haciendo preguntas, enviando solicitudes de incorporación de cambios y
00:01:34viendo cómo las rechazaban, asistiendo a reuniones, y todo esto poco a poco con el tiempo construyó el
00:01:39motor que es su cerebro. Entienden cómo funciona esto aquí, saben cómo se envían
00:01:42las cosas, estuvieron de guardia esa noche cuando tiraron producción y por qué ocurrió eso. El
00:01:48problema es que estos agentes tienen exactamente este mismo problema: cada vez que crean
00:01:53una nueva sesión de terminal con un agente dentro, este es muy inteligente, pero no
00:01:57tiene ningún contexto sobre cómo opera su empresa, por lo que necesita obtenerlo de alguna manera. El
00:02:02problema es que a medida que aumentan la escala de estos agentes, ese costo se agrava si se equivocan
00:02:07al principio. El apalancamiento a partir del contexto y el contenido. Vamos a arreglar esto
00:02:13porque creo que la gente quiere tomar algunas fotos. Perfecto. Ese problema de contexto se
00:02:20va a agravar. Así que, en el extremo izquierdo, todos recordamos la época ancestral de hace
00:02:25dos años en la que teníamos modelos de autocompletado con tabulador que eran bastante geniales. Lo que pasaba es que
00:02:29aparecían y decían, oye, ¿quieres tabular esto? Y rápidamente en tu cabeza con tu
00:02:32contexto decías: no, eso es malo. O pensabas: ¡ah, qué bien!, y presionabas la pestaña. Genial. A medida que
00:02:37avanzamos en la curva de adopción de agentes, lo que ocurre es que se están moviendo hacia
00:02:41más situaciones en las que tienen agentes ejecutándose sin un humano en el ciclo o, al
00:02:46menos, desearían no tener que estar en el ciclo. Lo que necesitan es alguna forma de poder
00:02:50hacer las preguntas que necesitan cuando chocan con obstáculos para poder escribir código o
00:02:54resolver o básicamente solucionar el problema y, en última instancia, producir código que se pueda fusionar
00:02:58en su base de código, especialmente considerando que muchas personas aquí trabajan realmente en bases de código
00:03:02heredadas (“brownfield”) que han existido durante mucho tiempo y que generan ingresos reales
00:03:06a través de ellas, no solo proyectos divertidos desde cero (“greenfield”). Por lo tanto, ese costo de un mal contexto que se agrava al
00:03:12principio es económico si piensas en desplazar hacia la izquierda (“shift left”): encontrar un defecto o un error, querrás
00:03:17encontrarlo lo antes posible. Ocurre lo mismo con el contexto, porque a medida que avanzas,
00:03:22entras en bucles sin salida (“doom loops”); por lo general, le pides a tu agente que haga algo y te responde:
00:03:26oye, ya lo hice, y tú dices: no, amigo, y luego corriges, corriges y corriges.
00:03:29Eso es un desperdicio de tokens de búsqueda, también es un desperdicio de tiempo de reescritura, y eso no es
00:03:34aceptable con la economía de tokens que se avecina; y luego, a medida que avanzas hacia agentes
00:03:39paralelos, etc., comienzas a enfrentar un impuesto de revisión. Por lo tanto, estos revisores de código de IA que
00:03:43intentamos usar, de nuevo, requieren un contexto clave importante para que esas revisiones de código puedan
00:03:48básicamente comprender cómo funcionan las operaciones del negocio, para conocer la
00:03:52lógica empresarial y más; y luego, finalmente, si tu esperanza es salir por completo
00:03:57del ciclo y decir: agentes en segundo plano, háganlo sin cometer errores, realmente necesitas
00:04:02asegurarte de tener un motor de contexto para que esos agentes puedan consultarlo y obtener
00:04:05todas las respuestas que necesitan y seguir operando de manera eficaz.
00:04:08Hay algunos enfoques comunes que no funcionan, son básicamente un máximo local. Dos de los que
00:04:16más vemos con nuestros cientos de clientes empresariales y negocios de tamaño mediano son la
00:04:21trampa del contexto curado. Si alguna vez te has sentado y has tomado un sistema de archivos virtual o quizás un sistema de archivos
00:04:26local, has puesto algunos archivos Markdown en él y has dicho: aquí está todo el contexto de este proyecto, así es como
00:04:30funciona; luego le permites a tu agente buscar (“grep”) en eso, obtiene un montón de buenos datos y entonces rinde mejor.
00:04:35El problema es que, primero, ahora tienes que distribuir eso, tal vez subirlo a GitHub para que tu equipo pueda tomarlo; pero lo siguiente es que ese repositorio se va a deteriorar, al igual que el resto de la documentación que escribiste, y entonces, ¿quién en tu organización es el omnipotente que tiene el criterio para curar este archivo o repositorio para literalmente todos en la organización?
00:04:52Así que empiezas a tropezar con estos problemas. Lo siguiente es la meseta de MCP; esto es bastante claro, tenemos los servidores MCP, son geniales, se los puedes dar a tu agente y ahora puede obtener información de otro sistema fuente. El problema es que, por supuesto, dependiendo de cómo escribas la descripción del servidor y las descripciones de las herramientas, es posible que tu agente nunca lo llame aunque debería haberlo hecho, o si lo hace, existe un sesgo conocido llamado sesgo de satisfacción de búsqueda. Lo que esto significa es que cuando el agente encuentra
00:05:22la primera información que cree que es correcta, dice: oh, ya tengo lo que necesito, y continúa. En la mayoría de las organizaciones hay una conversación de Slack de anoche que dice que deberías estar haciendo A en lugar de B, y el agente nunca la encontrará si encontró primero un registro de arquitectura, por lo que en realidad no considera todo el contexto.
00:05:40El problema aquí es que el acceso a la información no es comprensión; por lo tanto, para brindarle comprensión a un modelo, debes aplicar otras técnicas. Lo que básicamente intento decir es que lo que tu agente no puede ver es todo lo que está bajo el agua. Puede obtener al cien por cien código que compila, pero ese código que compila tira abajo la producción y tienes un P0 a la una de la mañana porque pasó por alto el hecho de que tienes un cierto procedimiento de despliegue, se supone que debes desactivar una bandera de características, o lo que sea que
00:06:10sea. Así que tu equipo necesita un motor de contexto, porque lo que debe hacer es comprender quién eres y dónde trabajas en una organización; de modo que si le digo a alguien que quiero configurar la autenticación, sabe dónde trabajo, sabe dónde están mis confirmaciones (“commits”) de Git, sabe quién revisa esas confirmaciones y comprende mi contexto, puede enfocarme y luego usar eso como un punto de activación para encontrar el resto de la información.
00:06:33Resuelve conflictos: como se mencionó, un diagrama de arquitectura viejo y la charla de Slack de anoche con el CTO, ¿cuál de los dos tiene la razón? Necesitas usar un conjunto de técnicas para determinarlo.
00:06:44Respeta los permisos y la gobernanza: por supuesto, MCP nos permite usar OAuth y otros ámbitos y SSO, pero si alguien hace una pregunta por aquí y no se supone que deba saber sobre el proyecto secreto A, debes asegurarte de que eso no se filtre en la respuesta.
00:06:58Y finalmente, entregar el contexto correcto en el momento adecuado al modelo de una manera optimizada para tokens.
00:07:03Tenemos múltiples superficies porque los ingenieros humanos todavía hablan con Unblocked todo el tiempo para obtener la información que necesitan en Slack o de otra manera.
00:07:09Pero luego quieres respuestas optimizadas para tokens si solo estás hablando de máquina a máquina para no desperdiciar un montón de clases negritas en tu gasto de tokens.
00:07:17Así es como funciona un motor. Seré breve en esto, pero básicamente en el lado izquierdo ves todas las fuentes de datos que ingresan.
00:07:26Para nosotros, nos enfocamos en los equipos de ingeniería y esos son quienes nos usan, así como en los equipos con menor perfil técnico a su alrededor, como soporte, ventas y demás.
00:07:34Ingieres todos esos datos, obtienes datos en tiempo real de herramientas como tu cadena de herramientas de gestión de incidentes.
00:07:39Entran al motor donde está ese motor, piensa en la parte inferior, ampliaré esa diapositiva en un momento.
00:07:45Pero básicamente utiliza estas seis características clave y luego a la derecha emites el contexto hacia el flujo de trabajo exacto de la manera en que se necesita.
00:07:53Esos seis puntos clave, como se mencionó, el contexto unificado del sistema, tienes que abarcarlo todo.
00:08:01En grandes organizaciones, empresas a la escala de LinkedIn, Workday, General Motors, lo que sea, necesitan este tipo de datos.
00:08:08Necesitan comprender todo lo que está sucediendo.
00:08:10Y Tharik esta mañana, hablando en realidad sobre el lanzamiento potencial de Fable más tarde hoy.
00:08:15Mencionó que en realidad se necesita proporcionar un mapa y luego dejar que Fable descubra el territorio.
00:08:21La forma de ayudar a acotar eso es asegurarse de que estos modelos tengan acceso a todo el contexto, porque encontrarán tus incógnitas desconocidas.
00:08:29Definitivamente hay cosas sucediendo en tu empresa de las que simplemente no eres consciente pero que serían muy útiles para la tarea que intentas realizar.
00:08:35Eso hará que avancemos más rápido.
00:08:37Pero la recuperación dirigida: deberías poder, si proporcionas un enlace rápidamente, desplegarlo, recuperar ese documento y seguir adelante.
00:08:43Así que dos tareas: investigación profunda, ir a fondo, eso está bien.
00:08:46Pero también necesitas velocidad cuando la velocidad es necesaria.
00:08:49Resolución de conflictos, ya hablamos de eso.
00:08:51Pero una cosa dice haz A, otra cosa dice haz B, quién tiene la razón.
00:08:55Relevancia personalizada: quién soy, dónde trabajo, en qué estoy trabajando.
00:08:59Esa optimización de tokens: asegurarse de que la respuesta sea buena y eficaz y no sature la ventana.
00:09:04Y luego el cumplimiento de permisos, por supuesto, OAuth: si no debes verlo, no debes verlo.
00:09:10Lo que hicimos con algunas pruebas fue ejecutar exactamente la misma instrucción (“prompt”) en el mismo modelo, una con contexto y otra sin él.
00:09:17Este es el ahorro de tiempo de reloj de pared y luego dos horas, lo cual es genial.
00:09:21Y luego el ahorro de tokens.
00:09:23Así que fue una tarea considerable.
00:09:25Tomó alrededor de 21 millones de tokens sin él y luego 18, o perdón, 10.8 millones de tokens con él.
00:09:31Este es el tipo de experiencia que normalmente ves cuando usas un motor de contexto, porque la mayoría de esos tokens de búsqueda desperdiciados, donde tiene que buscar al principio de cada sesión para entender y descubrir cosas, ya no están allí cuando se hidrata con contexto.
00:09:45Hidratado.
00:09:47Y luego, a medida que avanzas, obtienes este tipo de resultados.
00:09:5050% menos de tokens, un triaje más rápido y la calidad de las respuestas es en realidad mejor porque sabía lo que estaba pasando dentro de la empresa.
00:09:57Ahora, para esta siguiente parte, probablemente querrán una foto.
00:10:01Si no lo saben, pueden tomar una foto de un código QR y luego, más tarde en fotos, tocarlo y cargar el enlace para que no tengan que quedarse flotando aquí, porque les voy a dar tres códigos QR.
00:10:09Este primero es para la red social de comentarios.
00:10:12Lo mostraré para que puedan tomar una foto.
00:10:14Pero esta es una herramienta de código abierto que tenemos que, utilizando programación totalmente determinista, revisa tu GitHub y comprende quién trabaja en tu equipo.
00:10:22Este es mi equipo real.
00:10:23Llamamos a Rasheen “la máquina” porque programa como loco.
00:10:26Pero a la derecha, puedes ver a quién hace commits, dónde los hace, quién revisa su trabajo.
00:10:30Y luego en esas pestañas, puedes encontrar un grafo de expertos destilado.
00:10:33Obtienes una cobertura completa de lo que pasa en tu empresa.
00:10:35Y si opcionalmente añades una de las claves API de OpenAI o Anthropic, determinará cuáles son tus equipos etiquetándolos por ti.
00:10:44Es una herramienta genial para entender dónde trabaja tu equipo y conseguir esa red social para enfocar un motor de contexto si vas a crear estas herramientas tú mismo.
00:10:52La siguiente se llama el agente de reglas de repositorio.
00:10:55Este es un ejemplo de nuestra base de código real.
00:10:57Voy a ponerlo de todas formas, así que no necesitas hablar con el aparato.
00:11:00Pero en resumen, lo que hace es descubrir todos los lugares donde tu equipo ha escrito archivos de reglas, los revisa todos y te dice qué gravedades has asignado, qué otras cosas has indicado.
00:11:11¿Debería simplemente cambiarme a esto?
00:11:13Te dice qué... oh, hola.
00:11:15Es un placer conocerlos a todos.
00:11:17Básicamente, encontrará todas las reglas que hay dentro de tu repositorio y luego te dirá si tienes problemas duplicados u otros fallos.
00:11:24Y luego puedes buscar con grep sobre él como un índice.
00:11:26Así que ese índice se puede llamar y puedes eliminar duplicados, lo que ayudará a mejorar tu recuperación de contexto.
00:11:32Y finalmente, el lunes impartimos este taller, que iba más allá de RAG, y enseñaba cómo construir un motor de contexto relacional desde cero.
00:11:40Así que si escaneas eso, obtendrás el libro de trabajo completo.
00:11:43Tiene seis PRs apilados que te enseñan paso a paso cómo hacer esto.
00:11:46Pero en resumen, RAG es una técnica increíble, y la quieres.
00:11:49Pero la otra mitad del problema es lo que la gente realmente pregunta:
00:11:53¿cuáles son las PRs abiertas en las que trabajé la semana pasada con autenticación?
00:11:57RAG no puede responder a esa pregunta por sí solo.
00:12:00Necesitas consultas.
00:12:01Así que esto te muestra cómo hacer una búsqueda básicamente sin esquema que le permite al agente descubrir un esquema,
00:12:08y luego escribir consultas contra él de forma determinista para extraer ese tipo de datos relacionales.
00:12:13Una técnica muy útil.
00:12:15Los casos de uso de un motor de contexto, por supuesto, van más allá de la generación de código.
00:12:21Aquí es donde vivimos mucho.
00:12:22Muchos de nuestros clientes pasan su tiempo.
00:12:24Pero es increíble ver lo que pasa cuando otra gente de la empresa empieza a usar estas herramientas.
00:12:30Personal de éxito de clientes resolviendo tickets justo en el momento en que un cliente los envía.
00:12:35Tenemos comerciales cerrando tratos antes en su trimestre porque pueden simplemente consultar el motor de contexto unblocked sobre la marcha mientras están en el campo.
00:12:44Y muchos más.
00:12:45Lo que también puedes hacer es, si viste ese gráfico de curvas antes donde hablé de los niveles,
00:12:51hemos creado una pequeña herramienta divertida donde básicamente un LLM te evalúa y te pregunta qué está pasando,
00:12:55y luego te sitúa exactamente en el punto donde estás y te da algunas técnicas sobre cómo avanzar a través de eso
00:13:01si buscas esencialmente multiplicar tus capacidades y enviar a producción con herramientas de IA a escala.
00:13:07Es readiness.getunblocked.com.
00:13:11La brecha ya no es la inteligencia.
00:13:13Es el contexto.
00:13:14Seguiremos obteniendo modelos increíbles como Mythos a medida que Anthropic lo ha ido desarrollando,
00:13:19y estoy seguro de que Sol, una vez que me dejen verlo, lo tendré.
00:13:22Feliz Día de Canadá, por cierto.
00:13:24Pero lo que ocurre es que se trata del contexto con el que rodeas a estos modelos para que sean eficaces
00:13:30y eficientes en el uso de tokens dentro de tu organización.
00:13:35Así que tengo una diapositiva de preguntas, pero no estoy seguro de que se me permita.
00:13:40No.
00:13:41Así que lo que harán es venir a verme al puesto P16.
00:13:44Pueden buscar el coco.
00:13:46Sería genial pasar el rato con todos ustedes y entrar en detalles aquí si lo necesitan.
00:13:49Gracias por su tiempo.
00:14:00Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기