LLMs locales, entrenamiento y fine tuning

PC para inteligencia artificial

En inteligencia artificial hay una regla que manda sobre todas las demas: la memoria de la grafica define que puedes correr. No que tan rapido, sino si arranca o no. Un modelo que no cabe en la VRAM simplemente no se ejecuta, o se parte entre grafica y RAM y pasa a ser diez veces mas lento. Por eso esta workstation se arma desde la grafica hacia atras.

Desde$12.859.900hasta $26.094.000
Gabinete ASUS TUF Gaming GT302 ARGB negro con el flujo de aire entrando por la malla frontal, el chasis de la workstation para inteligencia artificial de Raven Gaming Store
ASUS TUF Gaming GT302 ARGB, el gabinete de esta workstation. Foto del fabricante.

Configuraciones disponibles

Misma base, distinta gráfica. Los precios se recalculan a diario con el costo real de cada componente.

GráficaPara qué rindePrecio de referencia
RTX 5080 16GBIA / ML · CUDA · LLMs$12.859.900
RTX 5090 32GBIA / ML · CUDA · LLMs$26.094.000

Qué lleva por dentro

Piezas iguales en todas las configuraciones de esta gama.

Procesador
AMD RYZEN 9 9900X
Board
MOTHERBOARD MSI PRO B850-S WIFI DDR5
Memoria
MEMORIA RAM DDR5 64GB (2x32)
Almacenamiento
PATRIOT M.2 NVMe 2TB GEN4
Fuente
FUENTE 1000W FULL MODULAR 80+ GOLD
Refrigeración
THERMALRIGHT FROZEN EDGE 360 ARGB
Gabinete
GABINETE AIRFLOW PREMIUM

Cuanta VRAM necesitas de verdad

Como regla practica, un modelo de lenguaje cuantizado a 4 bits necesita aproximadamente la mitad de gigas de VRAM que miles de millones de parametros tiene. Un modelo de 14B corre comodo en 16 GB. Uno de 32B ya pide 24 GB o mas. Con los 32 GB de la RTX 5090 entran modelos grandes con contexto amplio, y queda margen para hacer fine tuning con LoRA sin quedarse sin memoria a mitad del entrenamiento. La RTX 5080 de 16 GB es la opcion de entrada, suficiente para inferencia de modelos medianos.

CUDA no es negociable

PyTorch, TensorFlow, vLLM, ComfyUI y practicamente todo el ecosistema se desarrolla primero sobre CUDA. Las alternativas de AMD han mejorado, pero seguiras encontrando repositorios que no arrancan, versiones que no compilan y horas perdidas en configurar lo que en NVIDIA funciona de una. Para trabajar, no para experimentar con el driver, va NVIDIA.

RAM y disco: lo que casi nadie dimensiona

64 GB de RAM como minimo, porque cargar un dataset y preprocesarlo ocurre en memoria del sistema antes de llegar a la grafica. Y 2 TB NVMe Gen4 o Gen5, porque los pesos de los modelos ocupan decenas de gigas cada uno y un disco lleno detiene un entrenamiento a mitad. Fuente de 1000W o mas: la 5090 tiene picos de consumo cortos y muy altos que una fuente justa no aguanta.

Para quién es

  • Corres modelos de lenguaje en local, sin pagar API
  • Haces fine tuning o entrenas modelos propios
  • Trabajas con generacion de imagen o video
  • Manejas datos que no pueden salir a un servicio en la nube

Cuándo no te sirve

Si solo consumes ChatGPT o Claude por internet, no necesitas esto. Esta workstation se justifica cuando el modelo corre en tu maquina, por costo, por privacidad o porque necesitas modificarlo.

Preguntas frecuentes

¿Dos graficas rinden el doble?

Para entrenar, ayuda y se puede montar. Para inferencia de un solo modelo, casi nunca compensa: es mas simple y mas rapido una grafica con mas memoria que dos con poca. Si tu caso pide multi GPU, lo hablamos y armamos sobre una board con las lineas PCIe necesarias.

¿Puedo empezar con la RTX 5080 y subir despues?

Si, y es una ruta razonable. La fuente, la board y la RAM ya quedan dimensionadas para recibir una 5090 mas adelante sin cambiar nada mas.

¿Viene con el entorno instalado?

Podemos entregarlo con drivers CUDA, Python y el entorno base listo para trabajar. Dinos con que trabajas y lo dejamos configurado.

¿Es esta la tuya?

Te confirmamos precio en firme, disponibilidad real de cada pieza y fecha de entrega. Armado y probado en Manizales.

¿Prefieres elegir pieza por pieza? Arma tu build en el configurador.

Otras builds