Nuevo episodio del podcast Es la Hora de Aprender con Cristian Tala, Diego Arias y Rodrigo Rojo. La brecha entre los modelos abiertos y los de frontera llegó a cero, y con eso volvió la pregunta incómoda: ¿te conviene correr tu propia IA en casa o pagar los US$20 de siempre? Hardware real, precios reales y la recomendación honesta de los tres hosts.
Se cayó la grabación anterior, pasaron dos semanas y el mundo cambió lo suficiente como para que el capítulo perdido quedara obsoleto. En esas semanas los modelos de pesos abiertos alcanzaron a los de frontera, Estados Unidos empezó a frenar sus propios lanzamientos y China liberó los suyos. Con eso vuelve la pregunta que todos se hacen tarde o temprano: ¿me conviene correr mi propia IA en casa o seguir pagando US$20 al mes? Este episodio la responde con hardware, precios y una recomendación honesta.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidadLo que vas a aprender
- Entenderás por qué la brecha entre los modelos abiertos y los de frontera pasó de 17 puntos a cero, y qué cambia eso para ti
- Sabrás qué dos variables miran los que compran hardware para IA —RAM y bandwidth— y cuál limita qué
- Podrás calcular si te conviene un equipo local o una suscripción, con precios reales de 2026
- Aprenderás a probar modelos chinos por centavos en vez de suscribirte a ciegas
- Vas a distinguir cuándo el problema es el modelo y cuándo es el harness que lo envuelve
¿Los modelos abiertos ya alcanzaron a los de frontera?
Sí, y el dato es contundente: el año pasado había 17 puntos de diferencia entre los modelos de pesos abiertos y los de frontera. Hoy esa diferencia es cero. Kimi K3 liberó sus pesos y quedó jugando al nivel de los modelos cerrados de la generación inmediatamente anterior, con MiniMax pisándole los talones. Lo que antes eran seis u ocho meses de atraso estructural para el código abierto, hoy es un empate técnico en el ranking.
Las últimas semanas fueron una avalancha: Gemini Flash 3.6 —ligeramente mejor que la versión anterior y en la misma posición del ranking, según Rodrigo—, Opus 5 quedando mejor que Fable y más barato, OpenAI anunciando GPT 5.6 con sus modelos Sol, Terra y Luna, Meta de vuelta en la pelea y el laboratorio de Mira Murati debutando directo en el top 15. Cristian lo resume con una frase que dice mucho de la velocidad actual: ni su propio benchmark alcanza a estar al día.
La otra cara es la eficiencia. Hace poco era impensable correr un modelo de 200 mil millones de parámetros en 128 GB de RAM; hoy se puede y funciona bien. Parte del truco está en el mixture of experts: modelos grandes de los que solo se ejecuta el pedacito que corresponde al tipo de pregunta que estás haciendo.
“Ya hacíamos cosas increíbles con la IA el año pasado. Que hoy un modelo chino de código abierto esté jugando en las ligas mayores es brutal, yo estoy en shock.” — Rodrigo Rojo
¿Por qué Estados Unidos frena sus modelos y China regala los pesos?
Porque están jugando dos partidos distintos. En Estados Unidos, Meta sacó un modelo nuevo y lo frenaron por considerarlo demasiado poderoso; OpenAI anunció GPT 5.6 y dijo que todavía no podía publicarlo porque esperaba la validación del gobierno. Del otro lado llegó Kimi y entregó todo: mismo nivel de inteligencia, pesos liberados y una licencia que permite el uso propio y solo cobra si empaquetas el modelo para revenderlo como servicio.
La respuesta de la industria fue una carta. La partieron Jensen Huang —CEO de NVIDIA, que se creó cuenta en X para eso— y Satya Nadella, defendiendo la importancia de los pesos abiertos. Durante el fin de semana se sumaron Cloudflare, OpenAI, xAI, OpenClaw y Nous Research, entre otros. Anthropic, que viene advirtiendo sobre los riesgos de los modelos abiertos, no firmó. De ahí salió la Open Security Alliance, la alianza por una IA abierta y segura.
El argumento de fondo lo pone Cristian, y es económico antes que ideológico: si Estados Unidos bloquea sus modelos, el mundo entero se va a los chinos, esos modelos se entrenan con todo ese uso y terminan mejorando gracias al bloqueo. Al revés pasa lo mismo: a China tampoco le conviene cerrar, porque que el mundo use sus modelos le genera ingresos e independencia. Es la tesis que desarrollamos en el episodio 16 sobre el bloqueo como autogol.
“Que Estados Unidos bloquee para el resto del mundo los modelos que salen de Estados Unidos no tiene ningún sentido. Y lo mismo para China: sería dispararse en un pie.” — Cristian Tala
Diego trae la pregunta que aparece siempre en Latinoamérica: ¿no debería un país poner un modelo abierto a disposición de sus habitantes? La respuesta de Rodrigo es incómoda: en el mundo ideal sería excelente, pero llegamos tarde a esa conversación. Lo máximo viable es hacer fine-tuning sobre un modelo existente, como hizo LatamGPT sobre Llama 3.1 de 70 mil millones de parámetros. Entrenar es caro, mantener servidores lo es más y no hay hoy ningún laboratorio latinoamericano dando esa pelea. Europa al menos tiene a Mistral: no pelea el primer lugar, pero es competente, barato, entiende bien el español y —dato de Rodrigo— tiene el mejor OCR del mercado.
¿Se acabó la data con la que se entrenan los modelos?
La data humana disponible tocó techo. Un amigo de Diego que trabaja en el área de entrenamiento de una de las grandes cuenta que su desafío hoy es literalmente encontrar con qué entrenar. La salida obvia fue la data sintética: que la IA genere el material para entrenar a la próxima IA.
Rodrigo pone el matiz que importa: el problema no es la cantidad, es que nadie cura lo que entra. Robots escaneando videos, páginas públicas y bases propietarias, con información contradictoria y basura mezclada. Hacer curaduría real —construir una fuente de la verdad y entrenar con eso— rendiría más que seguir apilando terabytes. Cristian agrega el contrapunto: también hace falta data errónea, siempre que el modelo sepa que lo es.
De hecho, los saltos recientes vinieron menos de la data que de las técnicas de entrenamiento y del uso agéntico: conectar el modelo a herramientas y enseñarle a operarlas. La excepción que confirma la regla es Grok, que pasó de rondar el puesto 20 a pelear el top 3 cuando le metieron data de uso de Cursor en el post-entrenamiento. Vale recordar de dónde venimos: estos modelos se entrenaron con Stack Overflow —que hoy casi nadie visita— y con Reddit, donde conviven joyas y disparates. De ahí salían las respuestas del primer Bard recomendando ponerle pegamento a la pizza.
¿Por qué una IA más segura se siente más tonta?
Porque cada capa de restricción se paga en utilidad. Diego lo sufre con la generación de imágenes: quiere editar una foto suya con su hijo para agregarle un dinosaurio al lado, en un juego educativo, y la herramienta se niega. La intención de la política es correcta —proteger a los niños—, pero el resultado práctico es que un uso legítimo queda bloqueado y el usuario termina discutiendo con la máquina para demostrar que no está haciendo nada ilegal.
Cristian pone el caso propio y caro: estaba editando los videos de su serie de build in public con Fable y el modelo le rompió el pipeline completo. No publicó episodios nuevos no por falta de grabación, sino porque tiene que rehacer el trabajo. Su lectura es que en el afán de hacer los modelos más seguros se mandaron varios errores y quedaron menos usables: hoy pelea más con la IA de lo que avanza, incluso con prompts afinados. El precedente que todos recuerdan es OpenClaw.
“En el momento en que lo hicieron un poco más seguro, perdió mucha utilidad.” — Rodrigo Rojo
Ahí aparece un matiz técnico que conviene tener claro antes de cambiarte de modelo: buena parte de lo que atribuimos al modelo es del harness. Cristian sospecha que quienes dicen que Kimi K3 es muy bueno lo están probando con Kimi Code, que funciona notablemente bien; con otro harness el mismo modelo podría rendir distinto. Es la misma discusión del episodio 15 sobre qué modelo usar para cada tarea. La demanda por esa combinación fue tal que Moonshot cerró las suscripciones nuevas para no degradar el servicio a quienes ya pagaban, y separó el plan de chat del de código. DeepSeek, en cambio, quedó trabado por otra razón: sin acceso a chips no puede entrenar modelos mejores.
¿Cuánto cuesta de verdad tener tu propia IA corriendo en casa?
Entre US$3.000 y US$4.000 si quieres un equipo que sirva de verdad, y hoy además con meses de espera. Antes de mirar precios hay que entender las dos variables que mandan. La RAM define qué tamaño de modelo entra en el equipo. El bandwidth —el ancho de banda por el que pasa la información— define a qué velocidad te responde. Una tarjeta de video tiene bandwidth enorme pero RAM limitada: modelos chicos volando a 300 tokens por segundo. Un DGX Spark tiene 128 GB de RAM pero un bandwidth de alrededor de 250: modelos grandes, velocidad menor.
Ese equilibrio explica por qué los Mac se volvieron la opción obvia, y no por el software de Apple: tienen memoria unificada rápida y suficiente ancho de banda, el punto intermedio entre la tarjeta de video y un equipo dedicado. Cristian agrega la letra chica que casi nadie mira: puedes comprar 128 GB unificados, pero si la memoria es lenta, los tokens también lo serán.
El progreso en optimización es real. Cuando a Cristian le llegó el Spark no existía la tecnología para sacarle 50 tokens por segundo a un modelo; hoy corre Qwen 3.6 a 80 tokens por segundo, que es respuesta inmediata: termina de teclear y el modelo ya está contestando. También hay un carril mucho más barato: los modelos chicos especializados. Rodrigo usa Handy para dictado local con Nemotron Streaming 3.5, un modelo de 600 MB que transcribe en vivo y entiende bien el español chileno. Para esa tarea no necesitas nada de lo anterior.
Tabla comparativa
| Opción | Cuándo conviene | Costo aproximado |
|---|---|---|
| Suscripción ChatGPT o Claude | El 99,9% de los casos: quieres resultados, no administrar infraestructura | US$20/mes |
| OpenRouter (pago por uso) | Probar modelos chinos o comparar antes de casarte con un proveedor | Centavos por prueba |
| PC de escritorio con tarjeta usada (3090 o similar) | Entrada barata al local: modelos chicos pero muy rápidos | El más barato de los locales |
| MacBook Pro M5, 48-64 GB | Asistente local mientras trabajas en tu propio equipo | US$3.000 – US$4.000 |
| Mac Studio 128 GB | Dejar un equipo prendido sirviendo modelos grandes con buena velocidad | Más que el MacBook |
| DGX Spark o Strix Halo | Mucha RAM para modelos grandes, asumiendo menos velocidad | Equipo dedicado |
| Servidor corporativo interno | Empresa que necesita que su data nunca salga de casa | ~US$500.000 |
Ese último número parece una broma hasta que lo miras como empresa. Rodrigo mencionó que con medio millón de dólares podrías correr localmente lo mejor que existe, y Cristian lo aterrizó: para una corporación que hoy paga licencias por toda su gente, ese hardware se paga el primer mes y deja de depender de un servidor externo.
Entonces, ¿local o los US$20 de la suscripción?
Para casi todos, la suscripción. Los tres coinciden: los modelos de frontera van un poco más adelante y, sobre todo, traen los conectores, las skills y las aplicaciones que les sacan provecho. Si estás muy metido en el ecosistema de Google y tienes todo en Drive, Gemini. Si te gusta experimentar, OpenRouter por centavos. Y si quieres la configuración soberana completa, un equipo con 128 GB de memoria unificada, OpenCode y modelos locales.
Entre ChatGPT y Claude, Rodrigo hace una distinción útil: ChatGPT te da más margen de uso —Claude es más hambriento en tokens—, pero la calidad de los modelos de Claude sigue siendo algo mejor. Cualquiera de los dos sirve. La otra distinción es de perfil: ChatGPT Work y Claude Cowork son para quien no programa; Codex y Claude Code, para quien vive en la terminal. Hacen cosas equivalentes, pero el vocabulario de repositorios y diffs confunde a quien solo quiere que un agente le lea los informes de los analistas y le ayude con la conciliación bancaria.
“Si lo vas a usar poco, gastarte US$4.000 en un computador jamás va a ser rentable.” — Cristian Tala
Los dos casos con los que cierran valen más que cualquier especificación. Rodrigo dejó a un agente convirtiendo un libro escaneado en PDF a EPUB mientras paseaba al perro, y ahora lo tiene revisando página por página la calidad de la conversión: una pega que nunca habría hecho a mano. Cristian tomó un Galaxy viejo con la pantalla rota, lo dejó sin Google Play y sin correo, y con OpenCode y MiniMax le configuró tres aplicaciones —dibujar, cámara y fotos— para su hijo de un año, sabiendo que el celular iba a terminar en el suelo igual. Ninguno de los dos necesitó medio millón de dólares.
“Hoy puedes pasarle a la IA un celular viejo y utilizarlo para algo. El desafío al final está en tu imaginación.” — Rodrigo Rojo
Capítulos del episodio
- 00:00 — El episodio que se perdió y por qué igual quedó obsoleto
- 01:21 — Avalancha de modelos: Gemini Flash 3.6, Opus 5, Kimi, Qwen
- 03:19 — De 17 puntos de brecha a cero entre abiertos y frontera
- 06:23 — Estados Unidos frena, China libera: la pelea geopolítica
- 09:03 — La carta de Jensen Huang y Satya Nadella por los pesos abiertos
- 12:13 — Por qué bloquear modelos es dispararse en el pie
- 13:09 — Se acabó la data humana: sintética, curada y el salto de Grok
- 19:51 — Modelos más seguros que sirven menos: el caso de Diego
- 24:54 — El harness importa tanto como el modelo: Kimi Code vs Claude Code
- 28:09 — Eficiencia: 200 mil millones de parámetros en 128 GB de RAM
- 30:26 — IA soberana en Latinoamérica: llegamos tarde a esa conversación
- 35:34 — Qwen 3.6 a 80 tokens por segundo en el DGX Spark de Cristian
- 38:14 — RAM vs bandwidth: por qué el Mac gana el punto intermedio
- 40:25 — Qué comprar si quieres correr modelos locales, y cuánto cuesta
- 43:56 — OpenRouter y OpenCode: probar sin comprometerse
- 52:29 — La recomendación honesta para quien no es técnico
- 57:05 — Casos reales: un libro escaneado a EPUB y un celular viejo reciclado
Preguntas frecuentes
¿Cuánta RAM necesito para correr un modelo de IA en local?
Para un asistente de uso diario necesitas al menos una tarjeta de video de 24 GB, o un equipo con memoria unificada de 64 GB en adelante. Con 128 GB ya puedes correr modelos de 200 mil millones de parámetros. Pero la RAM sola no basta: también manda el bandwidth, porque define la velocidad de respuesta. Mucha RAM con poco ancho de banda te da modelos grandes y lentos.
¿Cuánto cuesta un computador para correr modelos de IA locales?
Un MacBook Pro M5 con 48 a 64 GB de RAM cuesta entre US$3.000 y US$4.000. Un Mac Studio con 128 GB, la recomendación de Rodrigo si vas a dejar el equipo prendido trabajando, cuesta más. La opción barata es un computador de escritorio con una tarjeta de video usada tipo 3090: modelos más chicos, pero rápidos. Ojo con los plazos: hoy hay escasez y un Mac Studio puede tardar cuatro meses.
¿Conviene tener una IA local o pagar una suscripción?
Para el 99,9% de las personas conviene la suscripción de US$20 en ChatGPT o Claude: son modelos un poco más adelantados y traen los conectores, las skills y las aplicaciones que les sacan provecho. El local se justifica si te importa la gobernanza, si manejas datos sensibles o si quieres aprender. Si lo vas a usar poco, gastar US$4.000 en un computador nunca va a ser rentable.
¿Cómo pruebo modelos chinos como Kimi o MiniMax sin pagar una suscripción?
Con OpenRouter. Te da acceso por API a modelos de casi todas las compañías pagando por uso, así que probar te cuesta centavos en vez de una suscripción mensual completa. Es más técnico que entrar a una página y chatear, pero es el camino barato para comparar antes de casarte con un proveedor. También puedes conectarlo a agentes como Hermes en su versión de escritorio.
¿Es cierto que los modelos abiertos ya alcanzaron a los de frontera?
En ranking, sí. El año pasado había 17 puntos de diferencia entre los modelos de pesos abiertos y los de frontera; hoy esa diferencia es cero. Modelos como Kimi K3 o MiniMax están al nivel de los cerrados de la generación anterior inmediata. La diferencia real hoy no está tanto en el modelo como en el harness: las herramientas, conectores y flujos que lo rodean.
¿Puede Latinoamérica tener su propia IA soberana?
En el mundo ideal sí, pero según Rodrigo llegamos tarde a esa conversación. Entrenar es caro, mantener servidores lo es más y hoy hay escasez mundial de chips. Lo más viable es hacer fine-tuning sobre un modelo existente, como hizo LatamGPT sobre Llama 3.1 de 70 mil millones de parámetros. En Latinoamérica no hay hoy un laboratorio dando esa pelea.
Recursos mencionados
Para probar sin comprar nada
- OpenRouter — Modelos de casi todas las compañías pagando por uso. La forma barata de probar los chinos.
- OpenCode — La alternativa abierta a los agentes de código de terminal; funciona con modelos locales.
- Hermes, de Nous Research — Ahora con versión de escritorio y conexión directa a OpenRouter.
Modelos mencionados
- Qwen — Qwen 3.6 es el que corre a 80 tokens por segundo en el Spark de Cristian.
- Kimi — De Moonshot AI: liberó pesos abiertos y cerró suscripciones nuevas por exceso de demanda.
- MiniMax — El modelo con el que Cristian configuró un celular completo usando OpenCode.
- Mistral AI — El laboratorio europeo: buen español y el mejor OCR según Rodrigo.
Hardware y utilidades locales
- NVIDIA DGX Spark — 128 GB de memoria unificada: mucha RAM, bandwidth limitado.
- Handy — Dictado local con modelos de menos de 1 GB, como Nemotron Streaming 3.5.
- SuperWhisper y Wispr Flow — Alternativas de dictado; la segunda formatea según dónde escribes.
- SearXNG — Búsqueda local sin depender de un servicio externo.
Episodios relacionados
- EP17 — Dejé de usar la IA como herramienta y la contraté
- EP16 — Estados Unidos vs China: el bloqueo que es un autogol
- EP15 — Qué modelo de IA usar para cada tarea
- EP08 — Crisis de Anthropic: modelos alternativos e IA local
Escucha el episodio completo
eslahoradeaprender.com/episodios/18
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad














