Guía de despliegue

Cómo alojar LocalAI en un VPS

Desplegar en un VPS Cloud →

Tutorial

Cómo alojar LocalAI en un VPS

Inteligencia Artificial3 min de lectura6 pasos

LocalAI es un reemplazo de código abierto y compatible con la API de OpenAI: chat, embeddings, generación de imágenes y audio, todo ejecutado localmente. En su VPS se convierte en una API de IA polivalente y privada, que sus aplicaciones consumen sin cambiar su código. Le explicamos cómo ponerlo en marcha.

Contenido· Por qué autoalojar LocalAI en un VPS1/5
  1. 01Por qué autoalojar LocalAI en un VPS
  2. 02Los beneficios concretos de un LocalAI autoalojado
  3. 03Requisitos de hardware y software
  4. 04Desplegar LocalAI con Docker y HTTPS
  5. 05LocalAI frente a Ollama: ¿qué servidor LLM local elegir?

Por qué autoalojar LocalAI en un VPS

Mientras Ollama se centra en el texto, LocalAI apunta a una compatibilidad amplia con la API de OpenAI: expone /v1/chat/completions, /v1/embeddings, /v1/images/generations e incluso la transcripción de audio, en una sola API. Para un equipo que ya tiene código escrito contra el SDK de OpenAI, LocalAI es un reemplazo casi transparente: cambia la URL base y la clave, y el resto funciona. En un VPS obtiene esa polivalencia sin dependencia externa ni coste por llamada. Resulta especialmente pertinente cuando necesita a la vez generación de texto, vectores para RAG y, puntualmente, imágenes, sin multiplicar proveedores ni claves.

Los beneficios concretos de un LocalAI autoalojado

  • Reemplazo directo de la API de OpenAI: ninguna reescritura del código cliente.
  • Una sola API para el chat, los embeddings, las imágenes y el audio.
  • Soporte de múltiples backends (llama.cpp, diffusers, whisper) bajo una interfaz unificada.
  • Formatos de modelos abiertos (GGUF) descargables e intercambiables.
  • Sin facturación por uso: un coste VPS fijo para todos los tipos de generación.
  • Datos y generaciones conservados íntegramente en su servidor.

Requisitos de hardware y software

Como LocalAI es polivalente, sus necesidades dependen de las funciones activadas. Para chat 7B y embeddings en CPU, apunte a 8 GB de RAM y 4 vCPU. Si activa la generación de imágenes (Stable Diffusion) o el audio, la carga sube notablemente y un VPS con GPU pasa a ser muy recomendable. El disco es un punto clave: los modelos GGUF y de difusión pesan mucho, prevea de 30 a 50 GB. Se requieren Docker y Docker Compose, además de un subdominio (p. ej. ia.su-dominio.com) y el puerto 443. Prepare la lista de modelos que va a cargar según sus usos.

Desplegar LocalAI con Docker y HTTPS

  1. Preparar la carpeta de modelos

    Por SSH: mkdir -p /opt/localai/models && cd /opt/localai. Esta carpeta models se montará en el contenedor y contendrá sus archivos GGUF y configuraciones YAML.

  2. Lanzar el contenedor LocalAI

    Utilice la imagen oficial, por ejemplo docker run -d -p 127.0.0.1:8080:8080 -v $PWD/models:/models --name localai localai/localai. Elija la etiqueta correspondiente a su hardware (CPU o GPU).

  3. Instalar un modelo desde la galería

    LocalAI ofrece una galería: curl http://127.0.0.1:8080/models/apply -d '{"id":"..."}', o deposite manualmente un GGUF en models/ con su YAML de configuración. Después liste con curl http://127.0.0.1:8080/v1/models.

  4. Probar la compatibilidad con OpenAI

    Valide con una llamada de chat: curl http://127.0.0.1:8080/v1/chat/completions -d '{"model":"...","messages":[{"role":"user","content":"test"}]}'. Pruebe también /v1/embeddings si prevé usar RAG.

  5. Configurar el reverse proxy y el SSL

    Enrute ia.su-dominio.com hacia localhost:8080 mediante Caddy o Nginx, con Let's Encrypt. Añada una protección por token, ya que LocalAI no impone ninguna clave por defecto en un despliegue desnudo.

  6. Migrar sus aplicaciones

    En sus clientes OpenAI, cambie la URL base por https://ia.su-dominio.com/v1 y la clave por su token. Las llamadas de chat, embeddings e imágenes pasan a su infraestructura.

Active solo los backends que necesite. Cargar a la vez un modelo de chat, un modelo de embeddings y Stable Diffusion en un VPS CPU satura la RAM y hunde el rendimiento. Defina SINGLE_ACTIVE_BACKEND=true para mantener un único backend residente a la vez, y reserve la generación de imágenes a un VPS GPU si se convierte en un uso habitual.

LocalAI frente a Ollama: ¿qué servidor LLM local elegir?

Desplace la tabla

LocalAIOllama
GPU requeridaNo (solo CPU por defecto)No (solo CPU por defecto)
API compatible con OpenAISí (parcial)
Generación de imágenesSí (Stable Diffusion)No
Reconocimiento de vozSí (Whisper)No
Biblioteca de modelosMás de 200 modelos GGUFLista de modelos seleccionados
RAM (modelo 3B)~2 GB~2 GB
LicenciaMITMIT

Una API de IA completa y privada en un VPS Cloud ServOrbit

Con un VPS Cloud de ServOrbit y Docker preconfigurado, despliegue LocalAI como alternativa privada a la API de OpenAI. Elija una configuración CPU o GPU según sus necesidades de chat, embeddings o imágenes.

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva