Destilación de LLMs: Multiverse Computing reduce memoria 15× con 1 GPU
La destilación de conocimiento se vuelve asequible: cómo reducir 15× el uso de memoria en LLMs Multiverse Computing ha publicado una investigación que reduce el uso de memoria en la destilación de modelos de lenguaje grandes (LLMs) en hasta 15.6×, permitiendo entrenar modelos comprimidos en un solo GPU H200 en lugar de cuatro nodos. El …









