GPT 6 Sol y Luna ya están aquí (¡y un 50 % más BARATO!)
CChase AI
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Hoy no solo tenemos un modelo nuevo.
00:00:02Tenemos tres.
00:00:03Hace una hora, Anthropic lanzó Claude Opus 5.5.
00:00:06Y ahora OpenAI nos trae GPT-6 Sol y GPT-6 Luna.
00:00:12Opus 5.5 tenía muy buena pinta
00:00:14en cuanto a pruebas de rendimiento y coste.
00:00:16Veamos qué ofrecen estos dos modelos.
00:00:19Empecemos por ver las pruebas de rendimiento.
00:00:21Recordemos que tenemos la familia GPT-6.
00:00:24En la cima está Astra, disponible hace unas semanas.
00:00:27Ese es el modelo principal.
00:00:28Por debajo de Astra, tenemos a Sol y a Luna.
00:00:32No están diseñados para ser mejores que Astra.
00:00:35Su objetivo es ofrecer capacidades muy similares
00:00:38y buen rendimiento, pero a un coste mucho menor.
00:00:40Si nos enfrentamos a problemas
00:00:43que no son tan complejos
00:00:44como los que le asignaríamos a Astra,
00:00:45ahí es donde entran estos dos modelos.
00:00:48No pienses al ver esto:
00:00:49“No es tan bueno como Astra, así que es malo”.
00:00:51Esa no es la comparación.
00:00:53En Frontier Code, al ver GPT-Astra,
00:00:55¿qué observamos?
00:00:56Vemos que alcanza un máximo de 53,3 %.
00:00:59Quiero que fijen su atención en el coste:
00:01:014,59 dólares.
00:01:03En el caso de Sol, el nivel siguiente,
00:01:06tenemos un 49,3 %, algo más bajo,
00:01:09pero el coste por tarea es de 2,14 dólares.
00:01:12Cuesta menos de la mitad,
00:01:13y la cifra solo cae de 53 a 49, lo cual es genial.
00:01:18Y cuando nos fijamos en Luna,
00:01:19que es el más económico de todos,
00:01:21bajamos al 42,4 %,
00:01:24pero nos cuesta 11 centavos por tarea.
00:01:27Y esto es en la prueba Frontier Code.
00:01:29En esa misma prueba,
00:01:31si miramos a Opus 5.5,
00:01:32obtenía un 54,4 % a 6,19 dólares.
00:01:36Un 54,4 % a 6,19 dólares.
00:01:38Si lo comparamos con Sol,
00:01:40cuesta cerca de un tercio
00:01:41con solo un 5 % menos en la puntuación.
00:01:44Sigue siendo un modelo increíble,
00:01:47aunque no alcance el nivel de Opus 5.5 o Astra 6.
00:01:50Además, al reducir los niveles de esfuerzo,
00:01:53al máximo estamos en un 49 %.
00:01:55Pero al pasar a medio, baja a un 46 %,
00:01:58pero con un coste de 80 centavos.
00:02:00Así que estos modelos, Sol y Luna,
00:02:03ofrecen ese equilibrio ideal
00:02:04que no siempre hallamos en los de Anthropic,
00:02:06donde tienes Opus y Fable,
00:02:09que son sumamente buenos,
00:02:10pero bastante caros.
00:02:11A Anthropic le cuesta ofrecer
00:02:13modelos baratos y muy eficientes
00:02:14para tareas sin tanta complejidad.
00:02:16Y ahora Luna y Sol vienen a cubrir ese vacío.
00:02:20Al analizar estas comparativas,
00:02:21donde comparamos las versiones de GPT-6
00:02:23con la versión 5.6,
00:02:24pasar de GPT-5.6 Sol a GPT-6 Sol
00:02:28supone una leve mejora en el rendimiento,
00:02:31pero un aumento significativo
00:02:33en la eficiencia de costes.
00:02:35Esto es muy notable al mirar a Luna.
00:02:37Al comparar 5.6 Luna con GPT-6 Luna,
00:02:40el rendimiento es prácticamente idéntico,
00:02:43pero la diferencia de coste es drástica.
00:02:46Hablamos de 15 centavos por tarea
00:02:48aquí en la versión 6,
00:02:50frente a los 2,57 dólares por tarea en la 5.6.
00:02:55Son modelos supereficientes.
00:02:57En ciertos casos, GPT-6
00:02:59supera a Claude Fable 5.1
00:03:01e incluso a GPT-6 Astra en nivel bajo.
00:03:05Gran parte de esto se debe a los precios.
00:03:07En general, al pasar de la serie 5.6 a la 6,
00:03:10vemos una reducción del 50 %
00:03:13en costes de entrada y salida.
00:03:15En Luna, la entrada cuesta 10 centavos
00:03:17y la salida 50 centavos, una locura.
00:03:20Otra gran mejora de estos modelos
00:03:21es la precisión fáctica.
00:03:24¿Con qué frecuencia da una respuesta errónea?
00:03:27En general, hay mejoras sólidas en todo.
00:03:30Con Luna en la versión 5.6,
00:03:32al nivel máximo de esfuerzo, daba respuestas
00:03:35con errores fácticos el 12 % de las veces.
00:03:39En GPT-6, solo ocurre el 7,6 % de las veces.
00:03:42Y si usabas Luna en nivel bajo,
00:03:44buscando la máxima economía y eficiencia,
00:03:46te daba una respuesta errónea
00:03:48el 36 % de las veces.
00:03:50Ahora es solo el 27 %.
00:03:51Con Sol, hemos pasado del 8,5 %
00:03:54a tener una respuesta con error fáctico
00:03:57solo el 4,6 % de las veces, algo muy cercano
00:04:00al 3,9 % que vemos en GPT-6 Astra.
00:04:03En cuanto a precisión, Sol al nivel de GPT-6
00:04:07está casi a la par con el mejor de todos,
00:04:10que es Astra.
00:04:11También mejoró el sistema de caché,
00:04:13lo cual es clave al hablar de costes.
00:04:15Si tengo una caché activa, es decir,
00:04:17una conversación fluida con mi agente de OpenAI
00:04:20sin haberme alejado del ordenador en una hora,
00:04:22lo mismo aplica para el lado de Anthropic.
00:04:24Al enviar mensajes, obtengo un 90 % de descuento.
00:04:29Si te ausentas durante un día,
00:04:30vuelves a la misma conversación
00:04:31y le envías un mensaje a Astra, Sol o Luna,
00:04:36se reenvía toda la conversación previa
00:04:38y se cobra la totalidad del coste de entrada,
00:04:41lo que puede resultar muy caro.
00:04:43Había otros factores que alteraban la caché.
00:04:44Si ajustabas el nivel de razonamiento,
00:04:46por ejemplo, si estabas en razonamiento bajo
00:04:48y querías subirlo a alto,
00:04:49eso también reiniciaba tu caché
00:04:51y generaba un cargo bastante elevado.
00:04:53Ese tipo de ajustes ya no reinicia la caché.
00:04:55Ajustar el esfuerzo de razonamiento mantiene la caché activa,
00:04:59lo que reducirá el consumo
00:05:01y te ahorrará dinero,
00:05:02sobre todo si usas la API.
00:05:03Añadieron un panel de control de caché
00:05:06y, si usas la API
00:05:08y quieres analizar hasta el más mínimo detalle,
00:05:10puedes optimizar los puntos de interrupción
00:05:13en relación con tu caché.
00:05:14Por último, sobre la disponibilidad,
00:05:15GPT-6 Sol y Luna están disponibles en casi todas partes.
00:05:19Lo interesante será ver
00:05:21si pronto vemos un GPT-6 Terra.
00:05:24Hay mucho que valorar
00:05:26en este lanzamiento de GPT-6 Sol y Luna.
00:05:29Sobre el papel parece que,
00:05:30quizá, esté un escalón por debajo de lo visto
00:05:32por parte de Anthropic con Opus 5.5,
00:05:35pero creo que buscan resolver problemas distintos.
00:05:38Luna no busca resolver los problemas de Fable u Opus,
00:05:41y en realidad tampoco Sol.
00:05:43Están pensados para abordar tareas
00:05:45de un nivel inferior,
00:05:45que es donde opera la mayoría de la gente,
00:05:47y de una forma mucho más eficiente.
00:05:50Y nunca debemos restar importancia
00:05:52al factor coste en estas ecuaciones.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video