MCTS + PPO para LLMs: distilacion de busqueda en arboles
Por que el razonamiento de los LLMs todavia tiene techo: el problema de fondoLos modelos de lenguaje han avanzado a pasos agigantados, pero hay un limite que muy pocas arquitecturas han logrado romper: razonar de forma robusta en problemas combinatoriales complejos. Mientras que sistemas como AlphaZero alcanzaron rendimiento sobrehumano en ajedrez y Go combinando politicas …









