Fable 5.1 es el mejor modelo jamás creado (y más barato que Fable 5)

CChase AI
컴퓨터/소프트웨어

스크립트

00:00:00Así que Fable 5.1 ya está aquí, y es mejor, más barato,
00:00:02y hoy les voy a contar
00:00:04todo lo que necesitan saber al respecto.
00:00:05Primero lo primero, el precio.
00:00:07Fable 5.1 costará un 25% menos que Fable 5,
00:00:11y esto se debe a que están reduciendo el precio
00:00:13de las lecturas en caché.
00:00:14Esto es enorme si haces mucho trabajo agéntico de larga duración,
00:00:19y lo mencionan específicamente,
00:00:21y tu reducción de costos podría ser de hasta un 45%
00:00:23en aquellos casos en los que realizas trabajo
00:00:24que tiene miles y miles y miles de tokens,
00:00:27y estás trabajando con longitudes de ventana de contexto
00:00:28del 50, 60, 70%.
00:00:30Están actualizando su política de retención de datos,
00:00:32están implementando eso para sus clientes empresariales,
00:00:34y en cuanto a las medidas de seguridad,
00:00:35están reduciendo los falsos positivos,
00:00:37lo cual era un verdadero dolor de cabeza
00:00:38con el Fable 5 original,
00:00:40porque si le hacías preguntas
00:00:41relacionadas con cosas como ciberseguridad,
00:00:43te bloqueaban constantemente,
00:00:44y en este caso, ahora hay un 60% menos de probabilidad
00:00:47de un falso positivo.
00:00:49Ahora echemos un vistazo a los benchmarks.
00:00:50En general, supera a Fable 5, Opus 5
00:00:53y GPT 5.6 en literalmente todo.
00:00:56Ahora bien, algunos de los saltos son bastante significativos.
00:00:58Cuando observamos la investigación científica agéntica,
00:01:00es el doble de lo que era Fable 5.
00:01:03La programación agéntica también da un gran salto.
00:01:05Pasamos del 42% con Fable 5 al 55.8 con Fable 5.1.
00:01:09Recuerdo cuando vimos los benchmarks para Opus 5,
00:01:11nos quedamos bastante impresionados por lo que Opus 5 pudo darnos
00:01:14en términos de números brutos.
00:01:16En realidad, creo que la mayoría de la gente todavía prefiere Fable 5 a Opus 5,
00:01:19pero siento que la comparación entre Fable 5 y 5.1
00:01:23es probablemente un poco más precisa
00:01:24en términos de cómo se va a sentir
00:01:26cuando realmente lo estés usando.
00:01:28Más allá de eso, la mayoría de los aumentos en los benchmarks
00:01:29son relativamente incrementales.
00:01:31Estamos hablando de unos pocos puntos porcentuales aquí y allá,
00:01:32siendo la excepción los flujos de trabajo empresariales
00:01:34que utilizan el benchmark de automatización.
00:01:37Ahora bien, lo importante no es solo el benchmark en sí,
00:01:39sino cuánto estamos pagando por este tipo de puntuaciones,
00:01:41y qué tipo de cambios vemos
00:01:43cuando modificamos el nivel de esfuerzo?
00:01:44Porque eso siempre es muy interesante de analizar,
00:01:46ya que a menudo cuando observamos niveles de esfuerzo
00:01:48extra alto o máximo,
00:01:49realmente no obtenemos tanto beneficio por nuestro dinero
00:01:51en comparación con el nivel alto o incluso medio.
00:01:53Así que lo que tenemos aquí es el Terminal Bench 4.0.
00:01:56Tenemos a Mythos 5.1 por aquí arriba,
00:01:59Fable 5.1 en el medio,
00:02:00y luego Mythos 5 por aquí abajo,
00:02:02y pueden imaginar que Fable 5 está ligeramente por debajo de Mythos.
00:02:05Así que Fable 5.1 y Mythos 5.1,
00:02:07obviamente representan un gran salto en comparación con Mythos 5,
00:02:10y es más barato.
00:02:12Y lo genial es cuando observamos algo
00:02:13como alto, por ejemplo,
00:02:15que es donde creo que se sitúa la mayoría de la gente,
00:02:16a menudo uso el nivel medio
00:02:17cuando se trata de mis casos de uso de Fable,
00:02:20esencialmente,
00:02:20si miramos el nivel medio,
00:02:21estamos igualando la salida máxima de Mythos 5,
00:02:25pero en lugar de costar 26 dólares,
00:02:27serían 7.80 dólares.
00:02:30Y cuando pasamos al nivel alto,
00:02:32y comparamos el nivel alto con, digamos, el máximo,
00:02:34solo estás viendo un,
00:02:35¿qué?, ¿6% de cambio en términos de la salida,
00:02:38y sin embargo pagas 19.50 frente a 10.50 dólares.
00:02:42Así que lo genial de estos nuevos modelos
00:02:43es que puedes obtener un rendimiento extremadamente alto
00:02:45en estos niveles de esfuerzo intermedios
00:02:47y realmente ahorrar en costos.
00:02:50Y vemos el mismo patrón repetirse
00:02:52en estos otros benchmarks, ¿verdad?
00:02:53Este es Humanity's Last Exam.
00:02:55Nuevamente, no vemos un aumento enorme
00:02:57cuando saltamos del nivel alto al máximo,
00:02:59sin embargo, tenemos un rendimiento realmente bueno
00:03:00a un costo bastante razonable
00:03:02en estas configuraciones de nivel medio.
00:03:04La única excepción es cuando observamos
00:03:05la programación agéntica en Cursor Bench,
00:03:07con Fable 5.1,
00:03:08sí vemos un salto bastante alto del nivel alto al extra alto,
00:03:11pero nuevamente, entre extra alto y máximo,
00:03:13no es gran cosa.
00:03:14Pero, ya sabes, si estoy en el nivel alto,
00:03:15en Fable 5.1,
00:03:17es lo mismo que estar en extra alto
00:03:18con Fable 5,
00:03:20pero a menos de la mitad del costo.
00:03:22Así que hay un ahorro de precios enorme aquí,
00:03:24incluso si no eres alguien
00:03:25que necesariamente esté haciendo un trabajo sumamente complejo.
00:03:27Si eres simplemente, entre comillas,
00:03:29tu desarrollador independiente promedio,
00:03:30tus problemas no son tan complicados,
00:03:32pero te gusta usar estos modelos de frontera,
00:03:33ahora tienes la capacidad
00:03:34de simplemente bajar el nivel de esfuerzo
00:03:36y prácticamente estás haciendo
00:03:37lo que hacías antes
00:03:38a, nuevamente, la mitad del costo,
00:03:40lo cual no se puede exagerar.
00:03:41Ahora bien, la investigación científica
00:03:42siempre ha sido un gran argumento de venta
00:03:44cuando se trata de los modelos Fable y Mythos.
00:03:46Y con el lanzamiento de la versión 5.1,
00:03:48no hay cambios en eso.
00:03:49Hablan mucho sobre diseño molecular,
00:03:51análisis y modelado computacional,
00:03:53así como biología computacional.
00:03:55Nuevamente, estos son problemas más de nicho
00:03:57que algunas personas están resolviendo,
00:03:58pero siempre es interesante
00:04:00ver qué está pasando en estos dominios
00:04:01en comparación con el estándar,
00:04:03qué está haciendo esto
00:04:03en este benchmark de programación agéntica.
00:04:05Y como mencioné en la introducción,
00:04:07ha habido algunos cambios
00:04:08en lo que respecta a seguridad,
00:04:09protección
00:04:09y alineación.
00:04:11En general,
00:04:12menos falsos positivos.
00:04:13Puedes hacerle más preguntas
00:04:14relacionadas con cosas como ciberseguridad
00:04:15y es lo suficientemente inteligente
00:04:16como para no entrar en pánico
00:04:18y enviarte a Opus
00:04:19pase lo que pase.
00:04:20Si quieres profundizar mucho,
00:04:21a fondo en esto,
00:04:21tienen su tarjeta de sistema
00:04:23a la que siempre puedes echarle un vistazo.
00:04:24Esto tiene, ya sabes,
00:04:25varios cientos de páginas de contenido,
00:04:27212 para ser exactos,
00:04:28pero aquí nos dan un buen resumen.
00:04:30Pero de lo único que debes preocuparte
00:04:31es que estas barreras de protección
00:04:32son más precisas,
00:04:33por lo que es menos probable
00:04:34que marquen contenido benigno
00:04:35y simplemente te envíen
00:04:36a un modelo inferior.
00:04:37Específicamente para preguntas de ciberseguridad,
00:04:40los usuarios de Cloud Code
00:04:40pueden esperar un promedio
00:04:41de un 60% menos de intervenciones
00:04:43por sesión
00:04:44debido a estas salvaguardas,
00:04:46lo cual es genial
00:04:46si estás trabajando
00:04:47en cualquier tipo de aplicación
00:04:48donde necesites hacer preguntas
00:04:49sobre las mejores prácticas de ciberseguridad
00:04:51para tu caso de uso particular.
00:04:53Tienen
00:04:53un párrafo interesante aquí
00:04:54que habla sobre
00:04:55los mecanismos antidistilación,
00:04:57que es un método
00:04:58que consiste esencialmente en extraer
00:04:59lo mejor de Fable 5
00:05:01y Fable 5.1
00:05:02para usarlo en otros modelos.
00:05:03Este es un tema
00:05:04de conversación muy importante
00:05:05en relación con
00:05:06los modelos de código abierto.
00:05:07Probablemente habrán oído hablar mucho
00:05:08de todos estos
00:05:08excelentes modelos de código abierto
00:05:09que están saliendo,
00:05:10y sin duda
00:05:11seguirán apareciendo
00:05:13a medida que se destilen
00:05:14de estos modelos de frontera.
00:05:15Así que este es el tipo
00:05:17de debate
00:05:17al que conviene
00:05:18seguir la pista.
00:05:18No les afecta directamente,
00:05:20al usuario final,
00:05:21pero es, ya saben,
00:05:22algo así como un tema secundario
00:05:23en el que tenemos todos estos
00:05:24modelos de código abierto
00:05:25provenientes de China
00:05:26y muchas de las empresas
00:05:26de vanguardia
00:05:27están en Estados Unidos,
00:05:28y siempre existe
00:05:29esta especie de idea
00:05:31de que todos estos
00:05:32modelos de código abierto
00:05:32en realidad solo se nutren
00:05:33de cosas como
00:05:35Opus y Fable.
00:05:36Dan un ejemplo
00:05:37de cómo funciona esto,
00:05:38donde las nuevas cuentas de API
00:05:39no pueden editar
00:05:40el contexto previo de Claude
00:05:42para extraer esencialmente
00:05:43la forma en que Claude
00:05:44está pensando
00:05:44y elaborando
00:05:45sus respuestas.
00:05:46Y de nuevo,
00:05:46esto es específicamente
00:05:47para cuentas nuevas,
00:05:48así que si ya tienen una,
00:05:48repito,
00:05:49esto no les afectará realmente.
00:05:50Ahora, en cuanto al costo
00:05:51y la disponibilidad,
00:05:52disponibilidad,
00:05:52está disponible
00:05:53en todas partes ahora mismo.
00:05:54Costo.
00:05:55Por token,
00:05:56si lo analizamos,
00:05:56es exactamente el mismo
00:05:58que el de Fable 5.
00:05:58Hablamos de 10 dólares
00:05:59por millón de tokens de entrada
00:06:00y 50 dólares por millón
00:06:02de tokens de salida,
00:06:03pero en realidad,
00:06:04cuando lo usas de verdad
00:06:05en términos de,
00:06:06oye, le pongo a hacer esta tarea,
00:06:07va a costar menos
00:06:08y va a resultar más económico
00:06:09debido a las lecturas en caché.
00:06:10...
00:06:12Ahora bien, si no tienen idea
00:06:12de qué es el almacenamiento en caché de peticiones,
00:06:14pueden ver un video
00:06:14que hice la semana pasada
00:06:16donde hablo de esto.
00:06:18Básicamente,
00:06:18esto es descomunal
00:06:19si son de los que realizan
00:06:20tareas con agentes
00:06:20de larga duración.
00:06:23Así que tienen
00:06:23sesiones muy grandes,
00:06:25montones de contexto,
00:06:26y lo están usando
00:06:27de forma continua.
00:06:28No es como que le pidas algo
00:06:29y regreses
00:06:29al día siguiente.
00:06:30Estás hable y hable
00:06:31y hable con él
00:06:32sin parar.
00:06:32Por lo tanto, estas lecturas en caché
00:06:33cuestan un 75% menos,
00:06:35lo cual es un cambio radical,
00:06:37y es lo que está dando lugar
00:06:39a estos costos más bajos.
00:06:40Y este gráfico lo deja
00:06:41bien claro aquí.
00:06:42Esto puede suponer
00:06:42aproximadamente un 25% menos
00:06:44en tus costos en tareas normales,
00:06:45pero de nuevo,
00:06:46en cargas de trabajo muy agénticas,
00:06:47hasta un 45% menos.
00:06:49Así que es muy emocionante
00:06:49recibir una actualización
00:06:50para el modelo Fable.
00:06:51Me ha encantado Fable 5,
00:06:53estuvo más o menos
00:06:53con respecto a Opus 5,
00:06:54pero para aquellos de ustedes
00:06:55que han estado probando a fondo
00:06:56Fable,
00:06:57creo que estarán totalmente de acuerdo
00:06:58en que hay
00:06:59un cambio significativo
00:07:01en lo que este modelo nos aporta
00:07:02en comparación con todo lo demás
00:07:03que hemos recibido
00:07:03de parte de Anthropic.
00:07:04Así que tener algo
00:07:05que sea mejor
00:07:06y más económico,
00:07:07y por lo que debamos preocuparnos menos
00:07:09en cuanto a las restricciones,
00:07:10me parece algo fabuloso.
00:07:11Así que sin duda pruébenlo.
00:07:12Háganme saber
00:07:13qué les parece.

핵심 요약

Fable 5.1 mejora el rendimiento en investigación y programación agéntica mientras reduce los costos hasta en un 45% mediante lecturas en caché optimizadas.

하이라이트

  • Fable 5.1 cuesta un 25% menos que Fable 5 debido a la reducción en el precio de las lecturas en caché.

  • Las tareas agénticas de larga duración experimentan reducciones de costos de hasta un 45% con el uso de Fable 5.1.

  • La probabilidad de falsos positivos en ciberseguridad se reduce en un 60% en comparación con la versión anterior.

  • El rendimiento en investigación científica agéntica duplica al registrado por Fable 5.

  • La programación agéntica mejora del 42% al 55.8% en los benchmarks de Fable 5 a Fable 5.1.

타임라인

Precios y mejoras en costos

  • El costo base por token se mantiene idéntico al de Fable 5, pero las lecturas en caché bajan un 75%.
  • Los flujos de trabajo con ventanas de contexto extensas registran ahorros de hasta un 45%.
  • Los niveles de esfuerzo intermedios igualan la salida máxima de modelos anteriores con una inversión menor.

La reducción de precios se concentra en el almacenamiento en caché de peticiones, lo cual beneficia directamente a los usuarios que realizan tareas con agentes de larga duración y conversaciones continuas. Al configurar el nivel de esfuerzo en opciones medias o altas, se obtienen resultados equivalentes a las configuraciones máximas anteriores pero con una reducción drástica en el costo por sesión.

Benchmarks de rendimiento y seguridad

  • Los benchmarks superan a Fable 5, Opus 5 y GPT 5.6 en diversas áreas de investigación científica y programación.
  • Los usuarios de Claude Code experimentan un 60% menos de intervenciones por sesión debido a salvaguardas más precisas.
  • Se implementan mecanismos antidistilación para proteger la arquitectura interna frente a cuentas de API nuevas.

El modelo reduce las restricciones molestas relacionadas con preguntas de ciberseguridad, evitando bloqueos innecesarios en tareas de desarrollo legítimas. Asimismo, la disponibilidad global del modelo permite su integración inmediata en flujos de trabajo empresariales y de desarrollo independiente sin alterar las tarifas base por token.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기