Petals: ejecuta LLMs de 405B con GPU de consumo
¿Qué es Petals y cómo funciona la inferencia distribuida? Petals permite ejecutar modelos de lenguaje de 405 mil millones de parámetros desde una GPU de consumo o Google Colab, usando una arquitectura distribuida estilo BitTorrent donde cada nodo mantiene solo una fracción del modelo. Esta aproximación elimina la necesidad de invertir en clusters de H100 …









