Por qué Ollama deja de cobrar por GPU y pasa a cobrar por token
Ollama, la plataforma que usan 8,9 millones de desarrolladores al mes para correr modelos abiertos en local, publicó el 31 de agosto de 2026 un nuevo esquema de precios para sus planes Pro, Max y Team que abandona el cobro por tiempo de cómputo y adopta tarifas por token transparentes, similares a las del resto del mercado de inferencia.
Cada plan incluye ahora una bolsa mensual de créditos de uso que se renueva automáticamente, publicada en la página de precios y en la ficha de cada modelo. Cuando se agota la bolsa, se sigue facturando a la misma tarifa por token, sin «service fees» ni límites de 5 horas o semanales como tenía la versión anterior.
- Pro: US$20/mes, incluye US$60 de uso mensual.
- Max: US$100/mes, incluye US$300 de uso mensual.
- Team: US$500/mes, con US$1.000 de uso compartido entre usuarios ilimitados.
- Free: pasa a incluir una cantidad mensual pequeña para un set de modelos starter, con opción de pagar por uso.
El cambio llega por una queja recurrente de los clientes: «Recibimos feedback de que el cobro por tiempo de GPU era difícil de predecir, sobre todo ahora que los modelos abiertos son mucho más grandes —Kimi K3 tiene 2,8 billones de parámetros», explicó la compañía en su comunicado. Por eso, el nuevo modelo usa tarifas por token estándar de la industria.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadQué cambia respecto al esquema anterior
Hasta ahora, Ollama facturaba el cloud por tiempo de GPU, una métrica técnica que funcionaba razonablemente cuando los modelos eran chicos, pero se volvía opaca con la llegada de modelos de cientos de miles de millones de parámetros. La consecuencia: sesiones largas con agentes de código o tareas agentivas disparaban facturas difíciles de presupuestar.
Con el nuevo modelo, el cálculo se simplifica: pagas por lo que sale del modelo, no por cuánto tarda la GPU. Los créditos no usados no se acumulan al mes siguiente — se reinician en la fecha original de suscripción. Y los suscriptores actuales conservan su plan viejo si quieren, con migración opcional desde account settings.
Ollama confirma además tres cosas que importan a equipos legales y de seguridad:
- Zero data retention: no se loguean prompts ni se entrena con tus datos.
- Infraestructura dedicada en EE. UU. y Europa, con Singapur disponible para un set limitado de modelos Qwen.
- Compatibilidad con Claude Code y Codex, los dos coding agents más usados del momento, además de una API propia.
El contexto de fondo: 2026 es el año de la guerra de precios por token
El movimiento de Ollama no llega en el vacío. Forbes reportó el 31 de julio de 2026 que OpenAI recortó hasta un 80% el precio de GPT-5.6 Luna, dejándolo en US$0,20 por millón de tokens de entrada y US$1,20 por millón de salida. En paralelo, Kimi K3 de Moonshot se ofrece a US$3 por millón de tokens de entrada, frente a los US$10 de Claude Fable 5 de Anthropic.
La consecuencia: el costo de inferencia de frontera dejó de ser el cuello de botella para construir productos de IA, y la pregunta ahora es cómo enrutar cada tarea al modelo más barato que la resuelva bien.
Según TechRepublic, los precios de los modelos chinos ya están en otro orden de magnitud: DeepSeek V4 Flash cuesta US$0,14 por millón de tokens de entrada y US$0,28 por millón de salida; DeepSeek V4 Pro, US$0,435 y US$0,87 respectivamente. Baidu, según Bloomberg, recortó el precio de su API hasta un 99% en 2026, una presión que el analista Robert Lee compara con el colapso de márgenes del sector solar.
Ollama frente a sus competidores de inferencia
Según SiliconANGLE, Ollama compite en el segmento developer-centric con Together AI, Fireworks AI y Groq. La diferenciación histórica era «un solo comando, mismo binario, local o cloud». La nueva pricing transparente acerca a Ollama al modelo mental que ya tienen los desarrolladores cuando usan esas otras plataformas.
En la práctica, un founder latinoamericano que hoy gasta, por ejemplo, US$100 al mes en inferencia vía una API propietaria para un agente de coding interno, puede evaluar ahora si mover ese workload a Ollama Cloud le entrega la misma calidad de respuesta (DeepSeek, GLM, Nemotron, Kimi o MiniMax según su catálogo) por un costo predecible y dentro de la bolsa mensual de US$300 del plan Max.
El TechCrunch del 9 de julio de 2026 añade un dato clave: el cloud de Ollama duplica su volumen de tokens cada mes desde enero de 2026, cuando los modelos abiertos empezaron a resolver tareas agentivas. Esa es la misma ventana en la que aparecen los coding agents como categoría mainstream y en la que el cobro por GPU deja de tener sentido para el cliente final.
Por qué importa a una startup que opera con presupuesto ajustado
La diferencia entre «X dólares por hora de GPU» y «X dólares por millón de tokens» no es un cambio cosmético. Es un cambio de cómo se modela el costo:
- Un agente que hace 500 llamadas de 2.000 tokens cada una en una sesión larga genera 1 millón de tokens. Con tarifas abiertas, eso entra en presupuesto.
- La misma sesión bajo el esquema anterior dependía de la duración real de cada llamada, que varía según latencia, hardware y carga.
Para una startup hispanohablante que construye un producto SaaS con IA, esto significa tres cosas:
- Coste por usuario predecible. Si sabes que tu usuario promedio consume N tokens por mes, puedes multiplicar por la tarifa pública y construir un plan de pricing defendible ante un inversor.
- Migración menos dolorosa. Cambiar de proveedor ya no requiere recalcular infraestructura: las tarifas están en la misma unidad que las de Anthropic, OpenAI, Together, Fireworks o Groq.
- Mejor arbitraje de modelos. Si Kimi K3, DeepSeek o GLM rinden bien para tu caso, los puedes correr en Ollama Cloud a la tarifa publicada y dejar Claude o GPT solo para los flujos donde la frontera realmente suma.
¿Qué significa esto para tu startup?
Si hoy estás pagando APIs cerradas por tareas que modelos abiertos ya resuelven bien, este cambio te da una palanca concreta para renegociar tu mix de inferencia sin reescribir tu código.
Dos acciones que puedes implementar esta semana:
- Audita tus logs de inferencia durante 7 días. Identifica qué porcentaje de tus tokens corresponden a tareas commodity (resúmenes, clasificación, extracción, traducciones, código boilerplate) versus las que realmente requieren un modelo frontera. Lo primero es candidato directo a Ollama Cloud o a un modelo open weight equivalente.
- Calcula el ahorro en tu plan de pricing. Compara la tarifa pública por token de los modelos que uses (los publica Ollama en cada ficha de modelo) contra lo que pagas hoy. Si el plan Pro de US$20 ya cubre tus necesidades básicas y el resto entra como pay-as-you-go, tu runway puede extenderse varios meses sin tocar producto.
Riesgo a vigilar: Ollama sigue siendo una empresa con US$88 millones levantados (Serie B de US$65M liderada por Theory Ventures en julio de 2026) y solo 14 empleados. Como recuerda TechTimes, ya hubo roces con la comunidad en 2025 por el giro cloud y la app de escritorio sin licencia open source (corregido después). Para uso en producción crítico, conviene mantener siempre una ruta de salida a llama.cpp directo o vLLM si tus compromisos arquitectónicos cambian.
Fuentes
- Ollama’s transparent pricing
- Popular open source AI developer tool Ollama raises $65M, grows to nearly 9M users — TechCrunch
- Open-source AI developer tool Ollama raises $65M to grow its platform — SiliconANGLE
- Ollama Closes $65M Series B, Reaches 8.9M Developers — TechTimes
- Why OpenAI’s 80% Price Cut Could Trigger A Race To The Bottom In AI — Forbes
- Chinese AI Models Challenge OpenAI and Anthropic on Cost and Enterprise Risk — TechRepublic
- Steve Eisman: Cheap Chinese AI Models Could Wreck OpenAI and Anthropic’s Valuations — 24/7 Wall St
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













