Servidor IA casero con 4 GPUs AMD V620: cómo construir infraestructura local en 2026

Construir un servidor de IA casero con hardware reciclado: el proyecto que demuestra que no necesitas nubes caras

Un desarrollador de software ha construido un servidor de IA local con cuatro GPUs AMD V620 de 32GB recicladas de la era del cloud gaming, demostrando que es posible crear infraestructura de inferencia de alta capacidad sin depender de servicios cloud costosos. El proyecto, documentado el 13 de agosto de 2026, utiliza componentes de segunda mano de eBay y hardware reciclado para montar un sistema capaz de ejecutar modelos como Deepseek V4 Flash, uno de los modelos de lenguaje más avanzados del momento.

Según el desarrollador, el impulso detrás del proyecto es la desconfianza hacia los servicios cloud: "Solo puedo confiar en una tecnología si puedo desarmarla y armarla en mi garaje. Conectar a un servicio y usar un agente de codificación bajo el control de otra persona me molesta; hay demasiadas formas en que esto puede salir mal".

Las GPUs AMD V620: el secreto del bajo costo

Las AMD Radeon PRO V620 son el componente clave del sistema. Estas tarjetas fueron diseñadas originalmente para cloud gaming en 2022, pero nunca se vendieron al público. Según HardwareHQ, cada GPU cuenta con 32GB de VRAM, 512 GB/s de ancho de banda de memoria y 40,550 TFLOPS en precisión FP16. AMD sobreprodujo estas unidades cuando el cloud gaming no despegó debido a problemas de latencia, lo que las hace relativamente baratas en el mercado de hardware de servidor usado.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El desarrollador adquirió cuatro de estas tarjetas en eBay, cada una con 32GB de VRAM, creando un total de 128GB de VRAM disponible para modelos de IA. Aunque estas GPUs no están diseñadas específicamente para cargas de trabajo de IA y el soporte de software de AMD tiene mala reputación, su precio las hace atractivas para proyectos experimentales.

El resto del hardware: reciclaje inteligente

El sistema completo está construido con componentes reciclados y de segunda mano:

  • Placa base X299 de 2017: con cuatro ranuras PCIe x16 para acomodar las cuatro GPUs
  • CPU Intel Core i9 10900X: considerado el peor procesador de Intel de los últimos veinte años, pero barato ahora
  • Memoria RAM y SSD: reciclados de otras computadoras de la casa
  • Fuente de alimentación de 1600W: más barata que una de 1200W en eBay
  • Caja nueva y ventiladores: la única inversión significativa en componentes nuevos

El mayor desafío técnico fue el enfriamiento. Las GPUs de servidor no incluyen ventiladores, por lo que el desarrollador diseñó e imprimió en 3D una carcasa especial que monta dos ventiladores de 80mm de 10,000 RPM sobre cada par de tarjetas. Los ventiladores resultaron extremadamente ruidosos, requiriendo el uso de protección auditiva durante la configuración inicial.

Software: Ubuntu 24.04 y llama.cpp

El sistema ejecuta Ubuntu 24.04 con llama.cpp, el popular servidor de inferencia de código abierto. El desarrollador compiló una versión personalizada y probó con éxito el modelo Gemma4, que cabe cómodamente en una sola GPU, y Deepseek V4 Flash, el objetivo principal de la construcción.

Deepseek V4 Flash es un modelo Mixture-of-Experts (MoE) de 284 mil millones de parámetros con 13 mil millones activados por token, según la documentación oficial en Hugging Face. El modelo soporta un contexto de un millón de tokens y utiliza arquitectura híbrida de atención para mejorar la eficiencia en contextos largos.

Control de ventiladores con IA: el toque metarrecursivo

Uno de los aspectos más interesantes del proyecto es cómo resolvió el problema del control de ventiladores. En lugar de escribir manualmente el script de control, hizo que Deepseek V4 Flash escribiera su propio script de control de ventiladores. El modelo, ejecutándose en el mismo servidor que necesitaba controlar, generó código Python para leer temperaturas de las GPUs y escalar la velocidad de los ventiladores apropiadamente.

El desarrollador relata un momento divertido: "Le dije que pensara en algo para calentar las GPUs para probar el script, y comenzó a escribir un script PyTorch para hacer multiplicación de matrices. Le dije 'no, estás ejecutándote en estas tarjetas, existes en una instancia de llama.cpp en esta computadora, simplemente decir cualquier cosa cargará las tarjetas' y tuvo una breve crisis existencial. ¡Adorable!"

¿Qué significa esto para tu startup?

Este proyecto demuestra que la infraestructura de IA de alta gama ya no está reservada exclusivamente para grandes empresas con presupuestos multimillonarios. Para founders tecnológicos, esto tiene implicaciones concretas:

1. Reducción de costos operativos drástica

Un servidor como este, con 128GB de VRAM, puede ejecutar modelos avanzados como Deepseek V4 Flash localmente, eliminando costos recurrentes de API. Según ComputingForGeeks, la API de Deepseek cobra $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida. Para una startup que procesa regularmente grandes volúmenes de datos, los ahorros pueden ser significativos.

2. Control total sobre datos y privacidad

Al ejecutar modelos localmente, mantienes todos tus datos dentro de tu infraestructura. Esto es crítico para startups que trabajan con información sensible de clientes, propiedad intelectual o datos regulados. No hay riesgo de fugas de datos a través de APIs de terceros.

3. Independencia de proveedores cloud

La dependencia de un solo proveedor cloud crea riesgo operacional. Este enfoque de "IA en casa" te da flexibilidad para escalar según necesidades específicas sin quedar atrapado en ecosistemas cerrados.

Acciones concretas que puedes implementar hoy

1. Evalúa tu caso de uso específico

No todas las startups necesitan infraestructura local. Analiza:

  • Volumen de tokens que procesas mensualmente
  • Sensibilidad de tus datos
  • Requisitos de latencia
  • Presupuesto disponible para inversión inicial

2. Comienza con hardware modesto

No necesitas cuatro GPUs de 32GB para empezar. Una sola GPU usada de 24GB (como una RTX 3090) puede ejecutar modelos más pequeños como Llama 3.1 8B o Mistral 7B, que son suficientes para muchas aplicaciones empresariales.

3. Aprende las herramientas básicas

Familiarízate con:

  • llama.cpp: el estándar de facto para inferencia local
  • Ollama: más fácil para comenzar, aunque menos flexible
  • Docker containers para empaquetar modelos y dependencias

4. Considera modelos cuantizados

Los modelos cuantizados reducen significativamente los requisitos de memoria. Según benchmarks de ComputingForGeeks, Deepseek V4 Flash en cuantización UD-IQ3_XXS ocupa 104GB en lugar de los 284GB completos, con una pérdida mínima de calidad.

5. Planifica para el crecimiento

Si tu uso de IA escalará, diseña tu infraestructura pensando en:

  • Espacio físico para servidores
  • Requerimientos de energía y enfriamiento
  • Redundancia y backups
  • Monitoreo y mantenimiento

El futuro de la IA local para emprendedores

Este proyecto no es solo un ejercicio técnico; es una señal del cambio hacia la democratización de la infraestructura de IA. A medida que el hardware se abarata y el software open source mejora, más startups podrán ejecutar modelos avanzados localmente.

La combinación de hardware reciclado, software open source y modelos cada vez más eficientes está creando oportunidades para emprendedores que antes no podían acceder a capacidades de IA de nivel empresarial. La clave está en comenzar pequeño, aprender iterativamente y escalar según las necesidades reales del negocio.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...