bien hoy vamos a ver un nuevo modelo que están sacando es la versión tulu 3 que como veis ya es una versión post entrenamiento y lanzado por la empresa Pues a12 que como vemos aquí es una empresa situada en en seatel Estados Unidos Non profit y que fue fundada en 2014 por Paul Allen que si vemos aquí es una estuvo o es un fundador de Microsoft vale Así que está claro que era una persona que sabía falleció en el 2018 Pero bueno vamos a ver en en qué trata este nuevo modelo la versión 3 que
como veis pues mete el subtítulo a la versión deit v3 vale recordar que esta no es deit R1 de razonamiento sino la versión 3 de de diip Así que como veis pues está escalando es las recetas por entrenamiento de tulu 3 para superar en rendimiento a la versión de dsit v3 lo han lanzado el enero eh 30 y como vemos aquí lo vamos a poder utilizar vale en su playground vale llama tulu 3405 billones de parámetros pero vamos a ver un poquito qué es lo que nos cuentan vale tras el lanzamiento del tulu 3 en
noviembre nos complace lanzar esta versión de tulu 3405 billones de parámetros que es la primera aplicación post entrenamiento completamente abierta a los modelos de mayor peso Así que con este lanzamiento están demostrando la escalib bilidad y efectividad de su receta po entrenamiento ha explicado a modelos de 405 billones de parámetros Así que como se detalla a continuación Este modelo logra un rendimiento competitivo superior tanto a disit v3 vale como Tenemos aquí y supera eh También a gpt 4 superando a los modelos de Po entrenamiento de peso abiertos previos del mismo tamaño incluido a la versión
llama 3.1 vale se está comparando recordamos que ya está en la 3.3 y no germes 3 en este caso también de 405 billones en muchos puntos de referencia estándar y curiosamente han descubierto que su marco de aprendizaje por refuerzo a partir de recompensas verificables es decir el rlv mejoró el rendimiento en mat de manera significativa y también en comparación a los modelos con 70 y 8 billones así que de manera similar a los hallazgos que presentaron hace poco la gente de disit R1 Así que está bastante bien aquí podemos ver pues el típico benmar las
versiones de 405 con sft dpo y rlv vale veis que rvr supera en todas vale a sus compañeros Si lo haces a través de cft o dpo y Bueno aquí en negrita como siempre el modelo ganador ganador ganador ganador ganador bien más cositas que nos dicen Pues bueno aquí el objetivo principal de este lanzamiento básicamente fue someter a prueba Pues esta novedosa metodología y la infraestructura de entrenamiento y extender la receta de tulo 3 Así que con ello han conseguido entre estas cosas pues curaduría y síntesis cuidadosa de los datos dirigidos habilidades claves la acción
supervisada en su mezcla cuidadosamente seleccionada de indicios y completacion optimización directa de preferencias vale lo que es el dpo vale recordar que esto era estas versiones la de sft dpo y rlv que es estas de aquí y por último en rlv un nuevo método basado en rl para mejorar las habilidades específicas con recompensas variables Y por último Pues un conjunto de evaluaciones estandarizadas en las etapas de desarrollo Ya sabéis pues este es el modelo de rlv training Y por último pues vamos a ver qué Eh pues challenge en este caso desafíos técnicos requieren pues escalar
a 45 billones de parámetros requirió varios esfuerzos de ingeniería y presentó Pues que necesitarían requerimientos de computación el entrenamiento de 405 demandó 32 nodos de 256 gpu funcionando todas ellas en paralelo para la inferencia desplegaron un módulo vlm con paralelismo tensorial de 16 vías mientras que las 2 40 gpu restantes se utilizaron para el entrenamiento Así que bastante bien y bueno Y por último eh También aquí pues desafíos de sintonización de hiperparámetros que siguieron el principio de tasas de aprendizaje más baja para modelos más grandes consistente la práctica anterior con los modelos llama así que
bueno vamos a ver qué tal funciona que aquí como veis pues lo puedes utilizar en Google Cloud con subtes o simplemente nos vamos al playground seleccionamos el modelo que nos interesa vale Estas son las versiones Así que llam tulu el 405 Y si están a a la par de v3 que es tal y como dicen Pues vamos a ponerle eh PR complejos Pues el primero el de Marta ahí donde pone su en este caso la ropa de la colada vale buscará primero la lavadora ya que marco introdujo vale no os lo leo porque siempre el
mismo pron pero bueno le podéis echar un ojo aquí si queréis parar el vídeo y ya que marco introdujo toda la ropa en la cesta de la ropa sucia la lavadora después de que Marta dejara su pantalón rojo dado que han pasado 8 minutos desde que Marta dejó el pantalón y Marco Ya movió la ropa es muy probable que el pantalón y el billete estén dentro de la lavadora vale como veis Y esto es eh la complejidad de estos modelos es que parte del razonamiento es correcto es decir porque dado que han pasado 8 minutos
y es el tiempo que ha pasado y el evento que ha ocurrido que marco movió la ropa a la lavadora es todo correcto pero Marta nunca sabe o no debería saber que está en la lavadora ya que ella no dej ahí bueno vamos a ver son pron complicados el siguiente es el de los números pares voy a resetear todo esto para que no coja el histórico anterior y vayamos con uno limpio Bueno ese es el típico que le paso una lista de números pares y bueno La idea es si puede saber vale como veis está
utilizando utilízalo después bueno Esto también hay que tener una empresa de estas pueso o sea debería saber qué se empieza Vale veis ahora sí me han dado gpus vale suman 37 podemos considerando todas las vale va a hacer el típico Fuerza bruta vale como veis va un pelín lento Esto se debe al final que estás moviendo 405 millones de parámetros vale para generar Esa diferencia y bueno el objetivo como vemos es que va a utilizar la Fuerza bruta y va a llegar a la conclusión de que de que no está así que bueno también voy
a utilizar en este caso el prom que están fallando los modelos o3 vale los nuevos modelos o3 Así que sinceramente también espero que falle Bueno vamos voy a pararlo porque esto utilizando Fuerza bruta va a llegar a la conclusión que llegan todos Así que voy a resetearlo y este es el nuevo pron vale please Qué curioso que salte ese error yo creo que simplemente porque están s saturados porque no tiene nada inapropiado vale Y por favor cambia el PR yelo Bueno pues si vamos a ponerte algo más sencillo no sé por el de la página
del Bueno ya sabéis que estos todos estos modelos Pues están bastante capados si una camiseta tarda en secarse el tiempo que tardarán dependerá vale si las camisetas están todas al mismo tiempo y suponiendo que el proceso no afecta vale tardarán una hora como veis últimamente todos estos modelos no hacen más que escribir token aquí al final no Solo tienes que tener en cuenta que es costo vale es decir cada token tiene un precio al final si tienes un millón de usuarios utilizando esto pues cada token de más te va a costar una fortuna y luego
eh Más allá del coste también tienes el tiempo y el el tiempo de latencia me refiero y al final no vas a tener aplicaciones en tiempo real Pero bueno recordamos que es 405 billones vale son modelos grandes no esperamos que que generen los token eh muy rápidos pero sí está bien pues bueno que nuevas empresas eh saquen modelos training que hay avances y bueno como vemos pues ha sido una semanita bastante bastante interesante en cuanto a nuevos modelos y uno más que podéis utilizar a través del playground vale si