¿Cuánto tiempo pueden durar tus habilidades antes de que tu agente olvide lo que le dijiste? — Laurie Voss, Arize AI
AAI Engineer
컴퓨터/소프트웨어AI/미래기술
스크립트
00:00:00-
00:00:12- Muy bien, hola a todos.
00:00:15Gracias por venir a esta charla maravillosamente ñoña.
00:00:20Esta charla tiene un título muy largo,
00:00:22así que les daré la versión corta de entrada.
00:00:23Escribes archivos de habilidades y los llenas de instrucciones.
00:00:27En algún momento, el modelo deja de llevar la cuenta de todas.
00:00:31La pregunta es, ¿dónde está ese punto?
00:00:33¿En qué momento has puesto demasiadas instrucciones
00:00:35en tus archivos de habilidades?
00:00:36Y la respuesta ha cambiado mucho en el último año.
00:00:40Soy Laurie, jefa de relaciones con desarrolladores en Arise AI.
00:00:44En otra vida, cofundé NPM Inc.
00:00:46Así que algunos tal vez me conozcan de los días de JavaScript.
00:00:48Hoy en día, paso mucho tiempo pensando en la inteligencia artificial
00:00:50y en cómo probarla.
00:00:53Hace unos meses, fui a una conferencia de IA en Miami,
00:00:55la cual estuvo muy bien.
00:00:57Y estaba viendo una charla de Dexter Horthy.
00:00:59Fue una buena charla.
00:01:00No trataba sobre este tema en absoluto.
00:01:02Pero mientras daba esa charla,
00:01:04mencionó, como un comentario al margen,
00:01:06que un agente puede seguir hasta unas 200 instrucciones
00:01:10antes de empezar a olvidar esas instrucciones.
00:01:13Y luego siguió con su charla,
00:01:15y fue completamente un comentario al margen.
00:01:17Mencionó que esa cifra es de 2025,
00:01:20así que las cosas podrían estar mejor ahora.
00:01:22Y dejé de escuchar por un segundo
00:01:25porque pensé: 200 instrucciones
00:01:27no son casi ninguna instrucción, ¿verdad?
00:01:31Un archivo de habilidades decente supera las 200 instrucciones
00:01:33casi de inmediato.
00:01:35Si el usuario dice X, haz Y,
00:01:37incluye siempre una sección sobre Z,
00:01:39nunca uses la frase W,
00:01:40cada una de esas es una instrucción independiente.
00:01:42Y si el modelo deja de seguirlas silenciosamente después de 200,
00:01:45eso es un límite muy duro
00:01:47sobre la complejidad de lo que puedes construir.
00:01:49Así que quería saber de dónde sacó ese número primero,
00:01:52y quería saber si era verdad.
00:01:55Así que ya conocen la sensación de la que hablo.
00:01:57Escribes este archivo de habilidades grande y hermoso,
00:01:58páginas de reglas, casos límite, tono, formato.
00:02:00Se lo das al agente.
00:02:01Hace lo suyo.
00:02:03Y miras el resultado y piensas:
00:02:05¿prestó atención realmente?
00:02:07¿Siguió de verdad todas estas reglas?
00:02:09¿O simplemente hizo un poco lo que le dio la gana
00:02:11y me dio algo parecido
00:02:14a lo que esperaba?
00:02:16No se puede saber con certeza, ¿o sí?
00:02:18Hablaremos de eso más tarde.
00:02:20Y así vives con esta ligera ansiedad
00:02:23cada vez que le das a ejecutar.
00:02:24Y de ese sentimiento trata esta investigación
00:02:27y de lo que intentamos averiguar si podemos evitar.
00:02:30Así que esta es mi promesa para sus próximos 18 minutos.
00:02:33Les voy a mostrar de dónde salió ese número 200,
00:02:36si sigue siendo verdad,
00:02:37y cuál es el número real hoy en día,
00:02:39porque se ha movido un orden de magnitud.
00:02:41Y luego hablaremos de lo que eso significa
00:02:44para que se lleven a casa.
00:02:46Qué tan largos pueden ser realmente sus habilidades y mensajes,
00:02:49y qué cambios deberían hacer
00:02:51en su flujo de trabajo como resultado.
00:02:54Así que el número 200 no es una leyenda urbana.
00:02:57Proviene de un punto de referencia real llamado IfScale,
00:02:59de un artículo de este tipo cuyo nombre voy a pronunciar mal,
00:03:03Jaroslawicz, y sus coautores el año pasado.
00:03:06Y la prueba es maravillosamente simple.
00:03:10Así es como funciona IfScale.
00:03:12Le pides al modelo que escriba un informe comercial,
00:03:14y le das una lista de palabras específicas
00:03:16que debe incluir exactamente en el informe.
00:03:19Incluye la palabra exact cliente,
00:03:20incluye la palabra exacta ingresos,
00:03:22y así sucesivamente con tantas palabras como quieras.
00:03:24Cada una de esas es una instrucción que debe seguir.
00:03:27Y luego cuentas cuántas de esas palabras exactas aparecieron.
00:03:32Así que, como la prueba es muy simple,
00:03:34solo tienes que tener dos números en la cabeza.
00:03:36Uno es la densidad, que llamamos n.
00:03:38Eso es de cuántas reglas estamos hablando a la vez.
00:03:41Y el segundo es la precisión,
00:03:42que es el porcentaje de esas reglas
00:03:43que fue capaz de seguir realmente.
00:03:46Ahora podrías decir que incluir palabras aleatorias en un informe
00:03:50no es lo mismo que seguir instrucciones reales,
00:03:52y es comprensible, y vamos a hablar de eso.
00:03:55Pero las palabras clave son un indicador.
00:03:57Incluir la palabra ingresos tiene la misma forma de tarea
00:04:01que incluir una sección sobre precios, ¿verdad?
00:04:02O nunca uses esta frase.
00:04:04Es una restricción discreta y nombrada
00:04:06que le has dicho al agente que debe seguir.
00:04:09Si un modelo no puede rastrear 200 palabras en un solo mensaje,
00:04:11definitivamente va a tener problemas
00:04:13con 200 instrucciones más complicadas.
00:04:16Así que, en todo caso, lo va a hacer peor.
00:04:20Por lo tanto, este número es un límite.
00:04:22Este número es lo más alto que puedes llegar.
00:04:23Si le das instrucciones más complicadas,
00:04:25es probable que el número baje.
00:04:27Y 200 es un límite realmente bajo.
00:04:30Así que antes de ir tras nuevos modelos,
00:04:32hay que hacer buena ciencia,
00:04:33lo que significa que debes replicar el resultado anterior
00:04:36y asegurarte de que el límite de 200 sea real.
00:04:39Así que volví a ejecutar la prueba original.
00:04:42El artículo original probó todo un lote de modelos,
00:04:45y los modelos nacen y mueren muy rápido.
00:04:47Así que para cuando me puse a hacer estas pruebas,
00:04:50solo tres de los modelos del conjunto original
00:04:52de 10 modelos que usaron
00:04:54seguían estando disponibles a través de algún tipo de API.
00:04:57Esos eran GPT 4.1, Claude Sonnet 4
00:04:59y Gemini 2.5 Pro.
00:05:01Esos eran los modelos disponibles hace 12 meses,
00:05:03que todavía están disponibles ahora.
00:05:05Y por eso probamos esos tres,
00:05:07porque era lo que quedaba.
00:05:08Y desde que publiqué esta investigación por primera vez
00:05:11hace un par de semanas,
00:05:12uno de esos tres modelos ha sido retirado.
00:05:14Así que este era el último momento posible
00:05:16en el que podría haber hecho esta prueba.
00:05:17Así que de esa alineación, ya nos quedan dos.
00:05:20Así que no se apeguen a sus modelos.
00:05:22Estos son los resultados que obtuvimos al replicar
00:05:25el descubrimiento original de if scale.
00:05:27Esta es la precisión en el eje vertical.
00:05:29Empieza en el 100% y comienza a decaer.
00:05:32Y luego el número de reglas aumenta en la parte inferior
00:05:35en escala logarítmica.
00:05:36Así que cada vez que llega a la mitad,
00:05:37ha duplicado el número de reglas con las que está tratando.
00:05:42Así que con 500 reglas, estás perdiendo el 30, 40, 50% de ellas.
00:05:46Nuestras curvas coincidieron con los resultados del artículo original
00:05:49dentro del margen de ruido, así que el hallazgo era real.
00:05:52Hace un año, entre 200 y 300 reglas más o menos,
00:05:55los modelos de vanguardia empezaban a fallar.
00:05:57Ese es un límite muy bajo.
00:06:00Así que esa es nuestra base, y ahora viene la parte divertida
00:06:03en la que tomamos exactamente la misma prueba
00:06:05y la aplicamos a la vanguardia actual,
00:06:07o más bien, a lo que era la vanguardia actual
00:06:09cuando ejecuté esta prueba.
00:06:10Así que probé GPT 5.5, Claude Opus 4.7,
00:06:13porque el 4.8 salió una semana después de que hice esta prueba,
00:06:17Gemini 3.1 Pro y Deep Seek V4 Pro.
00:06:20Así que les di el mismo mensaje, las mismas palabras,
00:06:22exactamente todo igual, y me encontré con un problema de inmediato,
00:06:25y es que lo bordaron.
00:06:27Todos obtuvieron un 100% de inmediato en esta prueba,
00:06:30absolutamente ningún fallo.
00:06:34Así que habíamos creado una prueba para encontrar el límite,
00:06:36y los modelos habían atravesado el límite
00:06:37sin darse cuenta de que el límite estaba ahí.
00:06:40Y eso era un problema, porque el punto de referencia
00:06:42se había escrito para llegar a un tope de 500 palabras,
00:06:43así que tuve que cambiar la prueba
00:06:45para poder encontrar el nuevo límite.
00:06:47Así que moví las meta, les di más palabras que incluir.
00:06:50Lo dupliqué de 500 a 1000,
00:06:52lo volví a duplicar de 1000 a 2000,
00:06:55y seguí haciéndolo hasta alcanzar un vocabulario
00:06:56de 10 000 palabras, y ahí es donde comencé a encontrar el límite
00:07:00de lo que los modelos pueden hacer hoy en día.
00:07:03Así que déjenme mostrarles la diapositiva clave, estos son los resultados.
00:07:06Estos son los resultados.
00:07:07Recuerden, escala logarítmica en el eje x.
00:07:12Va de 500 a 1000, 5000 y 10 000.
00:07:16Parece que esa escala cae por un precipicio,
00:07:18y en realidad ocurre a lo largo de unas 1000 cifras.
00:07:20Pero miren qué tan a la derecha llegan estas nuevas curvas
00:07:25antes de doblarse.
00:07:26Hace un año, empezaban a fallar entre 200 y 300 instrucciones,
00:07:29y ahora, según el modelo, el límite está más cerca de 2000,
00:07:32y para los mejores, llega hasta las 5000 instrucciones
00:07:36antes de empezar a caer por un precipicio.
00:07:38Así que en unos 12 meses, los modelos de vanguardia mejoraron
00:07:41casi 10 veces en seguir instrucciones simultáneamente.
00:07:44Ese es el titular principal, y hay muchos matices
00:07:47en los que debemos profundizar.
00:07:49La capacidad de rastrear 2000 restricciones nombradas en un solo mensaje
00:07:53está ahí.
00:07:55Y eso es muy interesante porque creo,
00:07:57no sé si los demás se sienten así,
00:07:59pero a mí me pareció que el salto de, ya sabes,
00:08:04GPT 5.1 a GPT 5.5 fue algo incremental, ¿verdad?
00:08:07No parecía que hubiéramos mejorado 10 veces,
00:08:09pero esta es una prueba que importa mucho para algo muy práctico,
00:08:14como cuánto puede durar mi archivo de habilidades.
00:08:17Y en el transcurso de un año, mejoramos 10 veces.
00:08:21Y lo que me llama la atención es que este punto de referencia
00:08:23apenas tiene un año.
00:08:25Un año después, 500 es un error de redondeo,
00:08:27y esto sigue moviéndose bajo mis pies.
00:08:29Probé el 4.7, y el Opus 4.8 es aún mejor.
00:08:35Así que este gráfico ya está un poco desactualizado,
00:08:36lo cual es un poco el objetivo.
00:08:37Si estableciste tus suposiciones de ingeniería
00:08:39sobre cómo deberían funcionar los archivos de habilidades,
00:08:41sobre qué tan largo puede ser tu mensaje,
00:08:44y hiciste eso hace más de seis meses,
00:08:46ahora estás equivocado,
00:08:48y probablemente deberías reestructurar cómo haces las cosas.
00:08:52Pero hay más en esta historia
00:08:54porque la forma en que fallaron los modelos
00:08:59cambió radicalmente
00:09:00y la forma en que fallaron es muy importante.
00:09:02Esta parte fue un hallazgo completamente inesperado
00:09:06cuando comencé a ejecutar el experimento.
00:09:07Y arruinó por completo mi prueba al principio
00:09:10porque el viejo modo de fallo era aburrido.
00:09:13Simplemente olvidaban las instrucciones
00:09:14y yo podía medir cuántas instrucciones
00:09:16habían recordado u olvidado.
00:09:17Pero los nuevos colapsan a su manera extraña
00:09:20y muy característica.
00:09:22Así que déjenme presentarles cómo fallan estos cuatro modelos.
00:09:26Deep Seek 4 es un modelo tradicional.
00:09:29Simplemente olvida las cosas.
00:09:30No hay ningún drama.
00:09:31Empieza a olvidar instrucciones alrededor de las 750 reglas,
00:09:35y para cuando llega a 2000, descarta casi la mitad.
00:09:38Así que simplemente olvida, lo cual francamente es el modo de fallo
00:09:41en el que más confío porque es predecible.
00:09:43Es muy fácil de medir.
00:09:44Y los otros modelos no fueron ni mucho menos tan cooperativos.
00:09:48Opus 4.7 decidía repetidamente
00:09:52que la prueba era peligrosa.
00:09:54Y lo que hacía era negarse
00:09:57a nivel de API a completar la prueba.
00:09:59No sabía que había una respuesta de API
00:10:01que podías recibir de Claude en la que decía:
00:10:03no, podría hacer esto, pero no voy a hacerlo.
00:10:06Pero esa es totalmente una respuesta a nivel de API
00:10:09que Claude admite porque se preocupan
00:10:10tanto por la seguridad, y empecé a recibir eso
00:10:13todo el tiempo.
00:10:15Y la razón por la que eso sucedía
00:10:16es porque Claude tiene un clasificador de seguridad muy sensible.
00:10:19Y si introduces ciertas combinaciones de palabras,
00:10:22como digamos ántrax y cianuro,
00:10:24decide que toda la solicitud es peligrosa
00:10:26y se retira.
00:10:27Y si recuerdan lo que hace mi prueba,
00:10:29mi prueba consiste en arrojar de 5000 a 10 000 palabras aleatorias
00:10:33en un archivo de instrucciones.
00:10:35Y por lo tanto, mis palabras seleccionadas al azar contenían
00:10:38todo tipo de cosas que parecían peligrosas
00:10:39en combinación para el filtro de seguridad.
00:10:41Y por eso seguía retirándose diciendo que le estaba pidiendo
00:10:43que hiciera una bomba o algo así.
00:10:47Así que tuvimos que, para lograr que Claude cooperara,
00:10:52tuve que tomar todas mis palabras
00:10:54y pasarlas por el filtro de seguridad de OpenAI
00:10:56y filtrar todas las palabras que parecían problemáticas
00:10:58para que pudiera avanzar a alguna parte.
00:10:59Una vez que le di eso, Claude lo hizo muy bien.
00:11:03Pero el modo de fallo es que Claude tiene más probabilidades
00:11:05de decidir que lo que estás haciendo es peligroso muy pronto,
00:11:08ya sabes, incluso con doscientas o trescientas instrucciones
00:11:11si lo que estás haciendo, ya sabes,
00:11:13contiene algo relacionado con consejos médicos
00:11:15porque los temas médicos suelen tener un doble propósito.
00:11:17Pueden ser peligrosos, pueden ser seguros.
00:11:20Así que el tercer modo de fallo fue Gemini 3.1 Pro.
00:11:24Gemini es totalmente sólido hasta las 5000 instrucciones.
00:11:28Lo hace extremadamente bien.
00:11:30Sinceramente, uno de los mejores de la gráfica.
00:11:32Y luego, más allá de eso, se pone raro.
00:11:35No olvida las instrucciones.
00:11:37Se siente abrumado por las instrucciones.
00:11:39Lo que intenta hacer es utilizar tokens de razonamiento
00:11:44para asegurarse de que está siguiendo
00:11:45todas las instrucciones a la vez.
00:11:46Y cuando la cantidad de instrucciones es muy alta,
00:11:48utiliza todos sus tokens de pensamiento.
00:11:50Utiliza todo su presupuesto de tokens pensando
00:11:53y luego no da ninguna respuesta.
00:11:55Llega a unos nueve, ya sabes,
00:11:57si le has dado el equivalente a 10.000 tokens,
00:11:59gastará el equivalente a 9.500 tokens en pensar
00:12:02y luego te dará una respuesta de 500 palabras,
00:12:04que no contiene ninguno de los tokens.
00:12:07Así que piensa hasta meterse en un callejón sin salida
00:12:09y se queda sin espacio para responder de verdad,
00:12:10lo cual es muy costoso y totalmente inútil,
00:12:13lo cual es muy típico de ellos, ¿verdad?
00:12:19Lo cual, ya sabes, nunca diría en voz alta.
00:12:23Y por último llega el ganador, que es GPT 5.5.
00:12:26GPT 5.5 es el mejor del grupo, con un 99% de precisión,
00:12:29llegando hasta las 5.000 reglas.
00:12:32Pero si lo llevas demasiado al límite,
00:12:33es, con diferencia, el más extraño de todos.
00:12:35Porque no se niega rotundamente,
00:12:37ni se olvida en silencio.
00:12:38En su lugar, lo que hace es frustrarse
00:12:41y decirte que la prueba es estúpida.
00:12:45Empieza el informe, hace unas cuantas,
00:12:47o sea, esa es la cuestión,
00:12:48no empieza diciendo simplemente que no.
00:12:50Empieza el informe,
00:12:51empieza a redactar el informe,
00:12:52y como a las 500 palabras del informe,
00:12:54dice: no, esto es una tontería.
00:12:55No voy a hacer esto.
00:12:56Y luego te dice amablemente que esto es una tontería.
00:12:58Ya no voy a seguir haciendo esto.
00:13:00Esa es la respuesta real que me dio.
00:13:02Pero eso fue como a las 5.000 palabras de este informe comercial
00:13:05que le pedí que generara.
00:13:08Así que no le falta razón, ¿verdad?
00:13:10Le estaba pidiendo un informe comercial coherente
00:13:12sobre ningún tema en particular
00:13:14que contenga 5.000 palabras aleatorias.
00:13:17Tienes razón, GPT.
00:13:19Es una estupidez pedir algo así.
00:13:23Lo cual es una petición profundamente irrazonable,
00:13:25y GPT se lo recriminó.
00:13:27Pero aun así cuenta como un fallo en la prueba.
00:13:29Porque el informe a medias que te entrega
00:13:31carece de la mayoría de las palabras clave,
00:13:32y además es el más difícil de detectar.
00:13:35Porque Claude se retira de inmediato.
00:13:36Claude dice: no,
00:13:37no voy a hacer esto.
00:13:39Deep Seek hace lo que puede.
00:13:41Pero GPT hace lo que parece un buen trabajo,
00:13:44a menos que leas hasta el final del informe,
00:13:46donde dice: no, en realidad,
00:13:47me voy a plantar porque esto es una estupidez.
00:13:51Así que, si das un paso atrás y miras los cuatro juntos,
00:13:53Deep Seek se olvida silenciosamente.
00:13:54Claude se asusta y se niega.
00:13:56Gemini piensa tanto que se queda en silencio.
00:13:58Y GPT 5.5 termina la mitad del trabajo
00:14:00y te dice que el resto está por debajo de su nivel.
00:14:04Y el punto no es cuál de ellos resulta más gracioso.
00:14:07Aunque la verdad es que tiene su gracia.
00:14:09La cuestión es que lo de ¿siguió mis instrucciones?
00:14:12ya no tiene un solo modo de fallo.
00:14:14Tiene cuatro formas distintas de fallar.
00:14:16Y no puedes reconocer ese fallo a menos que sepas
00:14:19con qué modelo estás tratando y cuál va a ser su patrón de fallo.
00:14:23Así que los modelos han mejorado diez veces.
00:14:27Fallan de maneras curiosas.
00:14:29¿Por qué debería importarte cuando vuelvas a tu mesa?
00:14:31Porque han cambiado tres cosas en tu flujo de trabajo.
00:14:34La primera es que hace un año, lo más inteligente era mantener cada archivo de habilidades muy, muy corto.
00:14:39Menos de 200 instrucciones, y luego derivar a subhabilidades y a todo un laberinto bizantino de archivos de habilidades adicionales, subarchivos y cosas por el estilo.
00:14:50Y tenías que comprimir tus instrucciones para que cupieran en un espacio disponible muy pequeño, y ya no necesitas hacer eso.
00:14:57Tus archivos de habilidades pueden ser muy largos.
00:14:59La segunda es que si tu caso de uso necesita cien reglas específicas o trescientas, puedes simplemente ponerlas todas en el prompt.
00:15:06No tienes que pasar desvelado preguntándote cuáles ignoró el modelo en silencio.
00:15:12Y si has estado reflexionando sobre tu propia experiencia con el uso de modelos, probablemente te des cuenta de esto.
00:15:21Has descubierto que te preocupa menos lo largo que pueda llegar a ser tu mensaje, porque los modelos han mejorado genuinamente diez veces al seguir tus instrucciones.
00:15:32¿2.000 restricciones nombradas son toda una guía de estilo, verdad?
00:15:35Es cada regla de marca, cada descargo de responsabilidad legal.
00:15:38Hace un año, habrías tenido que fragmentar eso entre una docena de agentes especializados y esperar que se pasaran la batuta entre ellos de forma limpia.
00:15:46Pero ahora puedes olvidarte de eso.
00:15:48Pero la tercera cosa es la más importante.
00:15:50La pregunta solía ser: ¿puede el modelo hacer esto?
00:15:53Y ahora la respuesta es rotundamente sí.
00:15:55Bueno, razonablemente rotunda.
00:15:58La nueva pregunta es si vale la pena el coste.
00:16:01Porque puedes incluir 10.000 palabras de —perdón, 10.000 instrucciones diferentes en tu mensaje, pero va a ser un mensaje enorme.
00:16:07Va a ser un mensaje muy caro.
00:16:09Va a ser un mensaje muy lento.
00:16:10Así que lo que antes era un muro infranqueable con el que chocabas ahora se ha convertido en un compromiso flexible sobre si vale la pena añadir tantas instrucciones adicionales si me va a suponer más coste y más latencia.
00:16:19Y ahora, algunas advertencias para anticiparnos a las preguntas.
00:16:25Primero y más importante, lo mencioné antes, esta es una tarea provisional; incluir palabras aleatorias en un informe comercial falso demuestra que un archivo de habilidades largo funciona.
00:16:38No es lo mismo que una prueba de que un archivo de habilidades largo funcione.
00:16:41Además, los modelos chocan contra el muro en puntos muy distintos, desde 750 hasta más de 9.000, así que tienes que elegir tu modelo con mucho cuidado.
00:16:49Lo que nuestra prueba no hace es medir si el modelo razonó con claridad ante un mensaje gigantesco.
00:16:57Así que la buena noticia es que, desde que hice mi investigación hace varias semanas, mucha gente se ha sumado a esto y ahora hay buenos estudios.
00:17:05Científicos de verdad se han involucrado y han hecho... Chroma ha realizado trabajos sobre la descomposición del contexto en 18 modelos, demostrando que la precisión en entradas largas puede caer entre un 30 y un 50 por ciento mucho antes de alcanzar el límite de la ventana de contexto.
00:17:21Y lo curioso de su hallazgo fue que un texto coherente y bien estructurado es más propenso a sufrir ese fallo que si simplemente pones tus instrucciones en orden aleatorio y las barajas.
00:17:33No sé por qué ocurre eso, tendría que leer su informe.
00:17:37Así que el modelo puede seguir 2.000, 5.000, posiblemente 10.000 instrucciones, pero no necesariamente va a razonar con claridad sobre ellas.
00:17:46No necesariamente —si esas instrucciones entran en conflicto, si hay tensión entre ellas— va a acertar del todo.
00:17:53Y luego está el otro asunto que mencioné brevemente.
00:17:56Las negativas de Claude son molestas, pero son evidentes.
00:18:00Obtienes un error, sabes que ha fallado.
00:18:02El informe educado a medias de GPT es mucho más peligroso porque parece una respuesta real.
00:18:07Tienes que leerlo por completo para notar que se rindió en silencio a mitad de camino, lo que significa que no puedes confiar en el resultado.
00:18:13Significa que tienes que leer el resultado cada vez para asegurarte de si está funcionando o no.
00:18:17Así que el modelo aceptará tus 2.000 reglas y te devolverá algo que parece, al menos al principio, seguro y pulido, pero que podría estar abandonando a mitad de camino.
00:18:30Así que, como paréntesis, la gente siempre me pregunta cuánto me costó todo esto.
00:18:34Me costó 209 dólares ejecutar todas estas consultas.
00:18:372.300 llamadas a través de siete modelos sumaron 209 dólares.
00:18:43Resulta que la investigación original no cuesta mucho.
00:18:46Y esta es la parte de la charla en la que decía que tienes que comprobar estas cosas en producción porque no puedes confiar en que tu modelo no falle en silencio.
00:18:55Así que ya sabías que iba a mencionar las evaluaciones tarde o temprano porque trabajo en Arise y para eso estoy aquí.
00:19:01Pero ya hay suficientes anuncios sobre Arise.
00:19:03Así que solo diré una verdad: si estás construyendo una aplicación de IA real y le das tareas verdaderamente complicadas,
00:19:10te vas a topar con uno o más de estos modos de fallo con un modelo de vanguardia.
00:19:14Y a menos que sea Claude diciéndote que te vayas a la mierda a nivel de API, la única forma de saber que algo salió mal es supervisar tus resultados con otro LLM.
00:19:23Eso es una evaluación, eso es lo que hace Arise y lo dejaré ahí.
00:19:27Ya mencioné que ha habido nueva investigación desde que hicimos la nuestra.
00:19:30Aquí tienes otra importante.
00:19:31Se publicó un artículo en el que se evaluaban 46 modelos titulado «Revisiting the Reliability of Language Models in Instruction Following»,
00:19:37lo que puedes apostar que hizo que se me pararan las antenas después de haber hecho esa investigación yo mismo.
00:19:41Y descubrieron algo incómodo: que un modelo puede destacar en una prueba como la nuestra y aun así ser sumamente poco fiable.
00:19:47Porque si reformulas la misma instrucción de una manera ligeramente diferente, puede marcar una diferencia radical en lo bien que sigue esas instrucciones.
00:19:56Así que el modelo puede seguir 2.000 instrucciones y hacerlo realmente bien.
00:20:00Pero si pones las mismas instrucciones, las mismas 2.000 instrucciones, en un orden diferente, de repente el modelo puede volverse mucho peor al seguirlas.
00:20:08Y cómo hacer eso exactamente, cuál es el orden correcto de las instrucciones para darle a tu modelo de modo que las siga a la perfección en lugar de confundirse, sigue siendo objeto de investigación.
00:20:19Así que la capacidad aumentó, pero la fiabilidad sigue siendo un problema.
00:20:24Y esto es solo un pequeño alarde porque me alegró, como que no soy científico, hice un poco de investigación.
00:20:31Y luego un montón de científicos de verdad se sumaron e hicieron ciencia real sobre la misma pregunta.
00:20:36Ahora han surgido un montón de pruebas comparativas para medir esta misma cuestión.
00:20:40Firebench, CCRbench, Guidebench intentan medir lo mismo.
00:20:44Lo bien que los modelos siguen un montón de restricciones reales y complejas a la vez.
00:20:49Y ahora todo el campo lo está investigando, así que si quieres una ciencia mejor que mis, ya sabes, 10.000 palabras aleatorias, la ciencia de verdad ya existe.
00:20:58Así que con eso llego al punto donde los dejo.
00:21:00Hace un año, la parte difícil de escribir una habilidad era encajar todo sin que el modelo perdiera el hilo.
00:21:05Eso era un problema de compresión y el problema de compresión ha desaparecido.
00:21:08El modelo retendrá tus 2.000 instrucciones sin problema.
00:21:11La nueva parte difícil es saber si realmente hizo lo que dijiste, y eso es un problema de verificación.
00:21:16Un problema de verificación no se soluciona escribiendo un mejor mensaje.
00:21:20Se soluciona comprobando el resultado cada vez, de la misma manera que probarías cualquier otro código, es decir, mediante una evaluación.
00:21:26El límite se multiplicó por diez en un año.
00:21:29Así que vuelve atrás y revisa las suposiciones que hiciste hace seis meses sobre lo grandes que debían ser tus mensajes y lo grandes que pueden llegar a ser tus instrucciones, porque puede que ya sean incorrectas.
00:21:41Así que esa es la charla.
00:21:42Si quieres todo el código y todos los datos, están en esta URL de GitHub.
00:21:48Y este otro código QR es algo que marketing me obligó a poner.
00:21:51Esta noche a las 5:00 p.m. tenemos una fiesta para ver el Mundial.
00:21:55Puedes venir a nuestra fiesta.
00:21:56Ese enlace es al Luma que te permitirá entrar a la fiesta.
00:22:01Espero que esta charla les haya aportado información novedosa o al menos un par de risas, y muchas gracias por su tiempo y atención.
00:22:07Gracias.
00:22:08Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기