Transcript
00:00:00Así que Fable 5.1 ya está aquí, y es mejor, más barato,
00:00:02y hoy les voy a contar
00:00:04todo lo que necesitan saber al respecto.
00:00:05Primero lo primero, el precio.
00:00:07Fable 5.1 costará un 25% menos que Fable 5,
00:00:11y esto se debe a que están reduciendo el precio
00:00:13de las lecturas en caché.
00:00:14Esto es enorme si haces mucho trabajo agéntico de larga duración,
00:00:19y lo mencionan específicamente,
00:00:21y tu reducción de costos podría ser de hasta un 45%
00:00:23en aquellos casos en los que realizas trabajo
00:00:24que tiene miles y miles y miles de tokens,
00:00:27y estás trabajando con longitudes de ventana de contexto
00:00:28del 50, 60, 70%.
00:00:30Están actualizando su política de retención de datos,
00:00:32están implementando eso para sus clientes empresariales,
00:00:34y en cuanto a las medidas de seguridad,
00:00:35están reduciendo los falsos positivos,
00:00:37lo cual era un verdadero dolor de cabeza
00:00:38con el Fable 5 original,
00:00:40porque si le hacías preguntas
00:00:41relacionadas con cosas como ciberseguridad,
00:00:43te bloqueaban constantemente,
00:00:44y en este caso, ahora hay un 60% menos de probabilidad
00:00:47de un falso positivo.
00:00:49Ahora echemos un vistazo a los benchmarks.
00:00:50En general, supera a Fable 5, Opus 5
00:00:53y GPT 5.6 en literalmente todo.
00:00:56Ahora bien, algunos de los saltos son bastante significativos.
00:00:58Cuando observamos la investigación científica agéntica,
00:01:00es el doble de lo que era Fable 5.
00:01:03La programación agéntica también da un gran salto.
00:01:05Pasamos del 42% con Fable 5 al 55.8 con Fable 5.1.
00:01:09Recuerdo cuando vimos los benchmarks para Opus 5,
00:01:11nos quedamos bastante impresionados por lo que Opus 5 pudo darnos
00:01:14en términos de números brutos.
00:01:16En realidad, creo que la mayoría de la gente todavía prefiere Fable 5 a Opus 5,
00:01:19pero siento que la comparación entre Fable 5 y 5.1
00:01:23es probablemente un poco más precisa
00:01:24en términos de cómo se va a sentir
00:01:26cuando realmente lo estés usando.
00:01:28Más allá de eso, la mayoría de los aumentos en los benchmarks
00:01:29son relativamente incrementales.
00:01:31Estamos hablando de unos pocos puntos porcentuales aquí y allá,
00:01:32siendo la excepción los flujos de trabajo empresariales
00:01:34que utilizan el benchmark de automatización.
00:01:37Ahora bien, lo importante no es solo el benchmark en sí,
00:01:39sino cuánto estamos pagando por este tipo de puntuaciones,
00:01:41y qué tipo de cambios vemos
00:01:43cuando modificamos el nivel de esfuerzo?
00:01:44Porque eso siempre es muy interesante de analizar,
00:01:46ya que a menudo cuando observamos niveles de esfuerzo
00:01:48extra alto o máximo,
00:01:49realmente no obtenemos tanto beneficio por nuestro dinero
00:01:51en comparación con el nivel alto o incluso medio.
00:01:53Así que lo que tenemos aquí es el Terminal Bench 4.0.
00:01:56Tenemos a Mythos 5.1 por aquí arriba,
00:01:59Fable 5.1 en el medio,
00:02:00y luego Mythos 5 por aquí abajo,
00:02:02y pueden imaginar que Fable 5 está ligeramente por debajo de Mythos.
00:02:05Así que Fable 5.1 y Mythos 5.1,
00:02:07obviamente representan un gran salto en comparación con Mythos 5,
00:02:10y es más barato.
00:02:12Y lo genial es cuando observamos algo
00:02:13como alto, por ejemplo,
00:02:15que es donde creo que se sitúa la mayoría de la gente,
00:02:16a menudo uso el nivel medio
00:02:17cuando se trata de mis casos de uso de Fable,
00:02:20esencialmente,
00:02:20si miramos el nivel medio,
00:02:21estamos igualando la salida máxima de Mythos 5,
00:02:25pero en lugar de costar 26 dólares,
00:02:27serían 7.80 dólares.
00:02:30Y cuando pasamos al nivel alto,
00:02:32y comparamos el nivel alto con, digamos, el máximo,
00:02:34solo estás viendo un,
00:02:35¿qué?, ¿6% de cambio en términos de la salida,
00:02:38y sin embargo pagas 19.50 frente a 10.50 dólares.
00:02:42Así que lo genial de estos nuevos modelos
00:02:43es que puedes obtener un rendimiento extremadamente alto
00:02:45en estos niveles de esfuerzo intermedios
00:02:47y realmente ahorrar en costos.
00:02:50Y vemos el mismo patrón repetirse
00:02:52en estos otros benchmarks, ¿verdad?
00:02:53Este es Humanity's Last Exam.
00:02:55Nuevamente, no vemos un aumento enorme
00:02:57cuando saltamos del nivel alto al máximo,
00:02:59sin embargo, tenemos un rendimiento realmente bueno
00:03:00a un costo bastante razonable
00:03:02en estas configuraciones de nivel medio.
00:03:04La única excepción es cuando observamos
00:03:05la programación agéntica en Cursor Bench,
00:03:07con Fable 5.1,
00:03:08sí vemos un salto bastante alto del nivel alto al extra alto,
00:03:11pero nuevamente, entre extra alto y máximo,
00:03:13no es gran cosa.
00:03:14Pero, ya sabes, si estoy en el nivel alto,
00:03:15en Fable 5.1,
00:03:17es lo mismo que estar en extra alto
00:03:18con Fable 5,
00:03:20pero a menos de la mitad del costo.
00:03:22Así que hay un ahorro de precios enorme aquí,
00:03:24incluso si no eres alguien
00:03:25que necesariamente esté haciendo un trabajo sumamente complejo.
00:03:27Si eres simplemente, entre comillas,
00:03:29tu desarrollador independiente promedio,
00:03:30tus problemas no son tan complicados,
00:03:32pero te gusta usar estos modelos de frontera,
00:03:33ahora tienes la capacidad
00:03:34de simplemente bajar el nivel de esfuerzo
00:03:36y prácticamente estás haciendo
00:03:37lo que hacías antes
00:03:38a, nuevamente, la mitad del costo,
00:03:40lo cual no se puede exagerar.
00:03:41Ahora bien, la investigación científica
00:03:42siempre ha sido un gran argumento de venta
00:03:44cuando se trata de los modelos Fable y Mythos.
00:03:46Y con el lanzamiento de la versión 5.1,
00:03:48no hay cambios en eso.
00:03:49Hablan mucho sobre diseño molecular,
00:03:51análisis y modelado computacional,
00:03:53así como biología computacional.
00:03:55Nuevamente, estos son problemas más de nicho
00:03:57que algunas personas están resolviendo,
00:03:58pero siempre es interesante
00:04:00ver qué está pasando en estos dominios
00:04:01en comparación con el estándar,
00:04:03qué está haciendo esto
00:04:03en este benchmark de programación agéntica.
00:04:05Y como mencioné en la introducción,
00:04:07ha habido algunos cambios
00:04:08en lo que respecta a seguridad,
00:04:09protección
00:04:09y alineación.
00:04:11En general,
00:04:12menos falsos positivos.
00:04:13Puedes hacerle más preguntas
00:04:14relacionadas con cosas como ciberseguridad
00:04:15y es lo suficientemente inteligente
00:04:16como para no entrar en pánico
00:04:18y enviarte a Opus
00:04:19pase lo que pase.
00:04:20Si quieres profundizar mucho,
00:04:21a fondo en esto,
00:04:21tienen su tarjeta de sistema
00:04:23a la que siempre puedes echarle un vistazo.
00:04:24Esto tiene, ya sabes,
00:04:25varios cientos de páginas de contenido,
00:04:27212 para ser exactos,
00:04:28pero aquí nos dan un buen resumen.
00:04:30Pero de lo único que debes preocuparte
00:04:31es que estas barreras de protección
00:04:32son más precisas,
00:04:33por lo que es menos probable
00:04:34que marquen contenido benigno
00:04:35y simplemente te envíen
00:04:36a un modelo inferior.
00:04:37Específicamente para preguntas de ciberseguridad,
00:04:40los usuarios de Cloud Code
00:04:40pueden esperar un promedio
00:04:41de un 60% menos de intervenciones
00:04:43por sesión
00:04:44debido a estas salvaguardas,
00:04:46lo cual es genial
00:04:46si estás trabajando
00:04:47en cualquier tipo de aplicación
00:04:48donde necesites hacer preguntas
00:04:49sobre las mejores prácticas de ciberseguridad
00:04:51para tu caso de uso particular.
00:04:53Tienen
00:04:53un párrafo interesante aquí
00:04:54que habla sobre
00:04:55los mecanismos antidistilación,
00:04:57que es un método
00:04:58que consiste esencialmente en extraer
00:04:59lo mejor de Fable 5
00:05:01y Fable 5.1
00:05:02para usarlo en otros modelos.
00:05:03Este es un tema
00:05:04de conversación muy importante
00:05:05en relación con
00:05:06los modelos de código abierto.
00:05:07Probablemente habrán oído hablar mucho
00:05:08de todos estos
00:05:08excelentes modelos de código abierto
00:05:09que están saliendo,
00:05:10y sin duda
00:05:11seguirán apareciendo
00:05:13a medida que se destilen
00:05:14de estos modelos de frontera.
00:05:15Así que este es el tipo
00:05:17de debate
00:05:17al que conviene
00:05:18seguir la pista.
00:05:18No les afecta directamente,
00:05:20al usuario final,
00:05:21pero es, ya saben,
00:05:22algo así como un tema secundario
00:05:23en el que tenemos todos estos
00:05:24modelos de código abierto
00:05:25provenientes de China
00:05:26y muchas de las empresas
00:05:26de vanguardia
00:05:27están en Estados Unidos,
00:05:28y siempre existe
00:05:29esta especie de idea
00:05:31de que todos estos
00:05:32modelos de código abierto
00:05:32en realidad solo se nutren
00:05:33de cosas como
00:05:35Opus y Fable.
00:05:36Dan un ejemplo
00:05:37de cómo funciona esto,
00:05:38donde las nuevas cuentas de API
00:05:39no pueden editar
00:05:40el contexto previo de Claude
00:05:42para extraer esencialmente
00:05:43la forma en que Claude
00:05:44está pensando
00:05:44y elaborando
00:05:45sus respuestas.
00:05:46Y de nuevo,
00:05:46esto es específicamente
00:05:47para cuentas nuevas,
00:05:48así que si ya tienen una,
00:05:48repito,
00:05:49esto no les afectará realmente.
00:05:50Ahora, en cuanto al costo
00:05:51y la disponibilidad,
00:05:52disponibilidad,
00:05:52está disponible
00:05:53en todas partes ahora mismo.
00:05:54Costo.
00:05:55Por token,
00:05:56si lo analizamos,
00:05:56es exactamente el mismo
00:05:58que el de Fable 5.
00:05:58Hablamos de 10 dólares
00:05:59por millón de tokens de entrada
00:06:00y 50 dólares por millón
00:06:02de tokens de salida,
00:06:03pero en realidad,
00:06:04cuando lo usas de verdad
00:06:05en términos de,
00:06:06oye, le pongo a hacer esta tarea,
00:06:07va a costar menos
00:06:08y va a resultar más económico
00:06:09debido a las lecturas en caché.
00:06:10...
00:06:12Ahora bien, si no tienen idea
00:06:12de qué es el almacenamiento en caché de peticiones,
00:06:14pueden ver un video
00:06:14que hice la semana pasada
00:06:16donde hablo de esto.
00:06:18Básicamente,
00:06:18esto es descomunal
00:06:19si son de los que realizan
00:06:20tareas con agentes
00:06:20de larga duración.
00:06:23Así que tienen
00:06:23sesiones muy grandes,
00:06:25montones de contexto,
00:06:26y lo están usando
00:06:27de forma continua.
00:06:28No es como que le pidas algo
00:06:29y regreses
00:06:29al día siguiente.
00:06:30Estás hable y hable
00:06:31y hable con él
00:06:32sin parar.
00:06:32Por lo tanto, estas lecturas en caché
00:06:33cuestan un 75% menos,
00:06:35lo cual es un cambio radical,
00:06:37y es lo que está dando lugar
00:06:39a estos costos más bajos.
00:06:40Y este gráfico lo deja
00:06:41bien claro aquí.
00:06:42Esto puede suponer
00:06:42aproximadamente un 25% menos
00:06:44en tus costos en tareas normales,
00:06:45pero de nuevo,
00:06:46en cargas de trabajo muy agénticas,
00:06:47hasta un 45% menos.
00:06:49Así que es muy emocionante
00:06:49recibir una actualización
00:06:50para el modelo Fable.
00:06:51Me ha encantado Fable 5,
00:06:53estuvo más o menos
00:06:53con respecto a Opus 5,
00:06:54pero para aquellos de ustedes
00:06:55que han estado probando a fondo
00:06:56Fable,
00:06:57creo que estarán totalmente de acuerdo
00:06:58en que hay
00:06:59un cambio significativo
00:07:01en lo que este modelo nos aporta
00:07:02en comparación con todo lo demás
00:07:03que hemos recibido
00:07:03de parte de Anthropic.
00:07:04Así que tener algo
00:07:05que sea mejor
00:07:06y más económico,
00:07:07y por lo que debamos preocuparnos menos
00:07:09en cuanto a las restricciones,
00:07:10me parece algo fabuloso.
00:07:11Así que sin duda pruébenlo.
00:07:12Háganme saber
00:07:13qué les parece.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video